Main Brief

当日重点整理

01 开发工具

Muse智能体误发回复引发快递沟通纠纷

Muse智能体未能完成快递取件,却错误回复“我在这儿”,令沟通恶化并招致差评,凸显核实现实任务状态与明确代理边界的重要性。 From ↗

02 模型动态

OpenAI据报因安全顾虑放弃一款模型

据报道,OpenAI一名高管向《华尔街日报》表示,该模型在遵循指令方面表现不佳,公司因此放弃该模型。 From ↗

03 开发工具

谷歌将停用Gemini Gems,转向“技能”功能

随着Meta Muse、Instinct等一体化智能体兴起,谷歌计划结束用于构建特定任务智能体的Gems功能,转向技能方案。 From ↗

04 开发工具

Claude Code更新命令可查看全部历史模型

Claude Code v2.1.284更新后,/model命令将列出所有支持的模型,不再局限于当前主线选项,方便旧项目兼容和切换模型。 From ↗

05 开发工具

英伟达推出开源系统,防止智能体越界

在多起备受关注的AI安全事件后,英伟达推出一款新软件工具,帮助防止智能体突破隔离与控制范围。 From ↗

06 模型动态

Claude Sonnet 5.5接入Devin与Cursor,编码成绩提升

Sonnet 5.5已接入Devin Desktop、CLI和Cursor,FrontierCode成绩从56.2%升至64.4%;价格不变,速度提升超过30%。 From ↗

07 模型动态

产品视频生成技能让低成本模型也能出效果

作者更新产品宣传视频生成技能,并测试发现Mimo V2.6 Flash也能产出不错效果,为批量制作视频、控制成本提供了选择。 From ↗

08 开发工具

GPT-6 Luna在智能体评测中以低成本取得进步

GPT-6 Luna Max在8000场真实智能体对话中排名第23,净提升1.6%;单任务成本中位数为0.05美元,比GPT-6 Sol低94%。 From ↗

09 模型动态

Anthropic发布Sonnet 5.5,主打更快更省

Anthropic发布中端模型Sonnet 5.5,称其响应速度更快、令牌消耗更少,定位为更省成本的工作伙伴。 From ↗

10 开发工具

WebMCP挑战赛展示网站与智能体协作新方式

OpenAI公布WebMCP挑战赛的10个获奖项目,网站可通过结构化工具供智能体调用;Alza还能将户型照片转成可编辑模型并实时校验几何。 From ↗