Main Brief

当日重点整理

01 模型动态

社区实测Qwen3.8 Flash-Next量化推理表现

社区在相同平台、提示词和真实负载下对比NVFP4量化与FP8版本,为本地部署和单GPU配置选择提供参考。 From ↗

02 模型动态

Qwen3.8-Flash-Next实现手机与多GPU本地运行

社区称该模型在4张R9700上达80至120 tokens/s,并在中端安卓手机上以约3.5 tokens/s运行80GB量化模型。 From ↗

03 模型动态

双DGX Spark运行Qwen3.8-Flash-Next达50 tokens/s

在双DGX Spark、NVFP4与多步预测配置下,Qwen3.8-Flash-Next解码约50 tokens/s,预填充约2900 tokens/s。 From ↗

04 开发工具

社区汇总编程基准并提出Agentic Coding Index

作者汇总SWE-bench Pro、Terminal-Bench等基准,提出Agentic Coding Index衡量代码代理能力与参数效率,但指标仍待验证。 From ↗

05 模型动态

用户借助Grok优化三端网络配置提升Hysteria2性能

用户让Grok协助调优macOS、OpenWrt与VPS配置,称Hysteria2节点性能翻倍;稳定性仍需后续验证。 From ↗

06 模型动态

Vercel AI Gateway接入MiniMax H3与H3 Max

Vercel AI Gateway新增MiniMax H3/H3 Max调用支持,并提供限时五折优惠,方便开发者接入视频生成模型。 From ↗

07 模型动态

Sori-1B从零训练音频语言模型不依赖文本预训练

Sori-1B采用音频配对文本从零训练,未使用纯文本预训练或语言模型初始化,为音频语言模型提供新范式。 From ↗

08 开发工具

社区筹建大模型渗透测试能力基准

社区计划建立LLM渗透测试基准,认为CyberGym等现有评测覆盖不足;当前仍是提案,关注AI智能体网络安全能力。 From ↗

09 开发工具

本地CLI统计Claude Code等工具的Token用量与费用

一款纯本地CLI解析Claude Code、Codex、Gemini CLI会话日志,按模型、项目和日期统计Token用量与花费。 From ↗

10 模型动态

ninfer与vLLM在RTX 5090上的Qwen部署对比

社区比较ninfer和vLLM运行Qwen 3.8 27B的体验,重点关注NVFP4量化与超长上下文支持。 From ↗