当日重点整理
DeepSWE新基准:GPT-5.5以70%击败Opus 54%
DeepSWE 基准测试发布,91个代码库真实多步修改任务。 GPT-5.5 得分70%, Opus 4.7 54%,Sonnet 4.6仅32%。比SWEbench更贴合真实体验。 [9] From ↗
歸藏发布小红书图片生成器Skill,支持28版式和多主题
歸藏 发布新版小红书图片生成器Skill,内置【2套主题、28个版式、9套配色】,适配8大小红书内容类别,可自动美化图片并避免AI标记。 [3] From ↗
Krasis v1.0发布,高性能运行Qwen3.6-35B-A3B等模型
Krasis LLM运行时v1.0纯Rust执行,支持Ampere显卡。RTX 5090上跑 Qwen3.6-35B-A3B 达124.9 t/s解码,RTX 3070亦可用。支持HQQ混合精度KV缓存。项目地址:https://github.com/brontoguana/krasis [8] [9] From ↗
藏师傅PPT和小红书排版Skill开放商用授权
藏师傅 的 PPT Skills 和 小红书图文排版Skill 已证明巨大商业价值,现开放商用授权和集成合作。 [1] From ↗
推特上线全量自动翻译功能
X(推特)已全面实装【自动翻译】,所有推文和回复根据用户语言自动显示对应译文,用户反馈 效果不错 。 [2] [3] From ↗
Claude Code使用限制引发用户热议
用户讨论 Claude Code $100/$200订阅的5小时窗口,有人称很快碰限,有人觉得够用。争议在于是否值得投资、能否从零构建应用。 [10] From ↗
95%的AI Agent死于基础设施而非模型
作者总结Agent生产环境三大死因: 遗忘 重启丢失记忆、【自杀循环】反复调用工具烧钱、【无黑盒】无法解释行为。指出模型正商品化,真正的护城河在【可靠性基础设施】。 [7] From ↗
构建MCP服务器的真实体验:简单但局限
用户花周末搭了连接Obsidian、日历和Todoist的 MCP服务器 ,代码几乎由Claude生成。但 仅限桌面App 使用,且Claude不总是自动调用工具,演示与实际有差距。 [11] From ↗
ElevenLabs与希腊政府合作推广语音AI
ElevenLabs 与希腊政府签署MOU,将用 语音AI 改善公共服务、促进旅游业、保护希腊语言遗产。详情:elevenlabs.io/blog/voice-ai-… [4] [5] From ↗
OpenClaw AI Agent平台爆发严重安全危机
开源Agent平台 OpenClaw (34.6万星)曝出4个链式CVE(最高CVSS 9.6),超24.5万实例暴露公网,1184个恶意Skill上架。攻击链可绕过沙箱窃取凭证、提权、植入后门。 [6] From ↗