Main Brief
当日重点整理
01 模型动态
社区实测Qwen3.8 Flash-Next量化推理表现
社区在相同平台、提示词和真实负载下对比NVFP4量化与FP8版本,为本地部署和单GPU配置选择提供参考。 From ↗
02 模型动态
Qwen3.8-Flash-Next实现手机与多GPU本地运行
社区称该模型在4张R9700上达80至120 tokens/s,并在中端安卓手机上以约3.5 tokens/s运行80GB量化模型。 From ↗
03 模型动态
双DGX Spark运行Qwen3.8-Flash-Next达50 tokens/s
在双DGX Spark、NVFP4与多步预测配置下,Qwen3.8-Flash-Next解码约50 tokens/s,预填充约2900 tokens/s。 From ↗
04 开发工具
社区汇总编程基准并提出Agentic Coding Index
作者汇总SWE-bench Pro、Terminal-Bench等基准,提出Agentic Coding Index衡量代码代理能力与参数效率,但指标仍待验证。 From ↗
05 模型动态
用户借助Grok优化三端网络配置提升Hysteria2性能
用户让Grok协助调优macOS、OpenWrt与VPS配置,称Hysteria2节点性能翻倍;稳定性仍需后续验证。 From ↗
06 模型动态
Vercel AI Gateway接入MiniMax H3与H3 Max
Vercel AI Gateway新增MiniMax H3/H3 Max调用支持,并提供限时五折优惠,方便开发者接入视频生成模型。 From ↗
07 模型动态
Sori-1B从零训练音频语言模型不依赖文本预训练
Sori-1B采用音频配对文本从零训练,未使用纯文本预训练或语言模型初始化,为音频语言模型提供新范式。 From ↗
08 开发工具
社区筹建大模型渗透测试能力基准
社区计划建立LLM渗透测试基准,认为CyberGym等现有评测覆盖不足;当前仍是提案,关注AI智能体网络安全能力。 From ↗
09 开发工具
本地CLI统计Claude Code等工具的Token用量与费用
一款纯本地CLI解析Claude Code、Codex、Gemini CLI会话日志,按模型、项目和日期统计Token用量与花费。 From ↗
10 模型动态
ninfer与vLLM在RTX 5090上的Qwen部署对比
社区比较ninfer和vLLM运行Qwen 3.8 27B的体验,重点关注NVFP4量化与超长上下文支持。 From ↗