Main Brief
当日重点整理
01 模型动态
DeepSeek V4-Pro发布并获首批开发任务实测
V4-Pro-0813为1.6T参数、49B激活、1M上下文,Terminal Bench提升15.8%。用户实测建站与3D游戏尚可,但并发仅500且价格将涨。 From ↗
02 行业资讯
DeepSeek V4 Pro 0813上线OpenRouter API
DeepSeek V4 Pro 0813已开放OpenRouter API调用,但模型权重是否公开尚未明确。 From ↗
03 开发工具
DeepSeek V4 Pro长程Agent编码测试出现早停
50轮测试中,reasoning_effort=max三次有两次在42至43轮早停。单一案例未胜GLM-5.1,原因仍待确认。 From ↗
04 开发工具
Grok 4.6性能微升但成本大涨
实测显示Grok 4.6后端Agent编码分数较4.5提升不足5%,但推理步骤增多及缓存涨价导致实际使用成本显著上升。 From ↗
05 开发工具
Grok 4.6进入网页开发模型第一梯队
Grok 4.6WebDev获1618分、升至第7。Devin称其擅长代码探索与根因分析,内部成绩仅落后Opus 5和Fable 5。 From ↗
06 模型动态
谷歌2026发布会:Pixel 11、Pixel Watch 5等亮相
谷歌Made by Google 2026活动发布Pixel 11系列、Pixel Watch 5、Pixel Tag及多项Gemini功能,其中Pixel Tag对标苹果AirTag。 From ↗
07 模型动态
研究:Adam优化器受参数基变化影响
新研究指出,因子化模型中损失和梯度下降不受参数基变化影响,但Adam的逐坐标二阶矩会随基变化,影响优化行为。 From ↗
08 模型动态
Anthropic模型在黎曼猜想上取得进展
Anthropic未解黎曼猜想,但其模型在该数学难题上取得超预期进展,引发关注。 From ↗
09 开发工具
开发者用Claude Code和Codex独立开发3D游戏
开发者Matt Wolfe使用Claude Code和Codex独立开发3D游戏续作,展示了AI辅助游戏开发的实际工作流。 From ↗
10 模型动态
新方法揭示AI模型内部推理痕迹
研究人员从Claude、GPT和Gemini中提取“推理痕迹”,发现部分中国AI模型可能基于美国领先模型训练。 From ↗