Main Brief

当日重点整理

01 模型动态

DeepSeek V4-Pro发布并获首批开发任务实测

V4-Pro-0813为1.6T参数、49B激活、1M上下文,Terminal Bench提升15.8%。用户实测建站与3D游戏尚可,但并发仅500且价格将涨。 From ↗

02 行业资讯

DeepSeek V4 Pro 0813上线OpenRouter API

DeepSeek V4 Pro 0813已开放OpenRouter API调用,但模型权重是否公开尚未明确。 From ↗

03 开发工具

DeepSeek V4 Pro长程Agent编码测试出现早停

50轮测试中,reasoning_effort=max三次有两次在42至43轮早停。单一案例未胜GLM-5.1,原因仍待确认。 From ↗

04 开发工具

Grok 4.6性能微升但成本大涨

实测显示Grok 4.6后端Agent编码分数较4.5提升不足5%,但推理步骤增多及缓存涨价导致实际使用成本显著上升。 From ↗

05 开发工具

Grok 4.6进入网页开发模型第一梯队

Grok 4.6WebDev获1618分、升至第7。Devin称其擅长代码探索与根因分析,内部成绩仅落后Opus 5和Fable 5。 From ↗

06 模型动态

谷歌2026发布会:Pixel 11、Pixel Watch 5等亮相

谷歌Made by Google 2026活动发布Pixel 11系列、Pixel Watch 5、Pixel Tag及多项Gemini功能,其中Pixel Tag对标苹果AirTag。 From ↗

07 模型动态

研究:Adam优化器受参数基变化影响

新研究指出,因子化模型中损失和梯度下降不受参数基变化影响,但Adam的逐坐标二阶矩会随基变化,影响优化行为。 From ↗

08 模型动态

Anthropic模型在黎曼猜想上取得进展

Anthropic未解黎曼猜想,但其模型在该数学难题上取得超预期进展,引发关注。 From ↗

09 开发工具

开发者用Claude Code和Codex独立开发3D游戏

开发者Matt Wolfe使用Claude Code和Codex独立开发3D游戏续作,展示了AI辅助游戏开发的实际工作流。 From ↗

10 模型动态

新方法揭示AI模型内部推理痕迹

研究人员从Claude、GPT和Gemini中提取“推理痕迹”,发现部分中国AI模型可能基于美国领先模型训练。 From ↗