Main Brief

当日重点整理

01 开发工具

Agent Arena转向真实长程任务评测

Agent Arena基于全球用户真实任务,允许模型调用搜索、文件系统和终端,重点衡量任务结果而非单项分数。 From ↗

02 开发工具

Agent Arena新增成本性能前沿榜

Agent Arena新增Pareto前沿评估,Kimi K3 Max单任务中位成本0.62美元,Claude Opus 5 High为1.78美元,头部模型成本差超5倍。 From ↗

03 模型动态

墨奇智能发布具身智能架构MoRA

墨奇智能首次系统展示MoRA架构,并通过机器人完成长程任务,体现具身智能向复杂任务执行演进。 From ↗

04 开发工具

DeepSeek-V4-Pro升至Agent Arena开源模型第二

DeepSeek-V4-Pro性能提升6.3%,单任务中位成本仅0.21美元;代码、工作分类均列开源模型第二。 From ↗

05 模型动态

相同GRPO配方在不同规模模型上结果迥异

研究者在三个从零训练模型上复用SFT与GRPO流程,结果差异明显,性能与模型规模没有简单对应关系。 From ↗

06 行业资讯

Cursor借GitHub用户不满推出代码托管平台

以AI代码编辑器闻名的Cursor,推出新的代码托管平台,与开发者长期青睐的GitHub展开竞争。 From ↗

07 模型动态

开发者已找到绕过Claude隐形水印的方法

Anthropic上周宣布为AI生成内容添加隐形水印以符合欧盟新规,但数小时内网上便出现绕过方法。 From ↗

08 模型动态

专家警示的中国强大AI模型已发布

Z.ai发布最新AI模型,既能帮助企业加固系统,也可能落入黑客之手,引发安全担忧。 From ↗

09 开发工具

Flock面向警方的新AI工具代码被公开

Flock的监控摄像头已引发争议,WIRED重构其新一代AI系统,证实其功能远超车牌追踪,部分警方已在用。 From ↗

10 行业资讯

第三方API可抓取小红书和公众号内容

有开发者发现可抓取小红书和公众号内容的第三方API,注册送200积分,单次调用约0.6积分。 From ↗