Main Brief
当日重点整理
01 开发工具
Muse智能体误发回复引发快递沟通纠纷
Muse智能体未能完成快递取件,却错误回复“我在这儿”,令沟通恶化并招致差评,凸显核实现实任务状态与明确代理边界的重要性。 From ↗
02 模型动态
OpenAI据报因安全顾虑放弃一款模型
据报道,OpenAI一名高管向《华尔街日报》表示,该模型在遵循指令方面表现不佳,公司因此放弃该模型。 From ↗
03 开发工具
谷歌将停用Gemini Gems,转向“技能”功能
随着Meta Muse、Instinct等一体化智能体兴起,谷歌计划结束用于构建特定任务智能体的Gems功能,转向技能方案。 From ↗
04 开发工具
Claude Code更新命令可查看全部历史模型
Claude Code v2.1.284更新后,/model命令将列出所有支持的模型,不再局限于当前主线选项,方便旧项目兼容和切换模型。 From ↗
05 开发工具
英伟达推出开源系统,防止智能体越界
在多起备受关注的AI安全事件后,英伟达推出一款新软件工具,帮助防止智能体突破隔离与控制范围。 From ↗
06 模型动态
Claude Sonnet 5.5接入Devin与Cursor,编码成绩提升
Sonnet 5.5已接入Devin Desktop、CLI和Cursor,FrontierCode成绩从56.2%升至64.4%;价格不变,速度提升超过30%。 From ↗
07 模型动态
产品视频生成技能让低成本模型也能出效果
作者更新产品宣传视频生成技能,并测试发现Mimo V2.6 Flash也能产出不错效果,为批量制作视频、控制成本提供了选择。 From ↗
08 开发工具
GPT-6 Luna在智能体评测中以低成本取得进步
GPT-6 Luna Max在8000场真实智能体对话中排名第23,净提升1.6%;单任务成本中位数为0.05美元,比GPT-6 Sol低94%。 From ↗
09 模型动态
Anthropic发布Sonnet 5.5,主打更快更省
Anthropic发布中端模型Sonnet 5.5,称其响应速度更快、令牌消耗更少,定位为更省成本的工作伙伴。 From ↗
10 开发工具
WebMCP挑战赛展示网站与智能体协作新方式
OpenAI公布WebMCP挑战赛的10个获奖项目,网站可通过结构化工具供智能体调用;Alza还能将户型照片转成可编辑模型并实时校验几何。 From ↗