本期覆盖 13 个主流模型 · 6 个能力维度 · 5 个评测基准体系 · 数据综合自 LLM-Stats / SWE-bench / GPQA / OpenRouter / AIME 等
| # | 模型 | 厂商 | 综合分 | 一句话定位 |
|---|---|---|---|---|
| 🥇 | Claude Fable 5 | Anthropic | 67.9 | Mythos 公开安全版 · DeepSWE 70% · 长时间自主任务最强 |
| 🥈 | Claude Opus 5NEW | Anthropic | ~66 | 7月24日发布 · 日常专业工作首选 · 价格为 Fable 5 一半 |
| 🥉 | GPT-5.5 | OpenAI | 63.1 | 最均衡的全能选手 · AIME 满分 · 唯一原生出图 |
| 4 | Gemini 3.1 Pro | 56.4 | 多模态 & 长上下文最强 · GPQA 94.3% | |
| 5 | Kimi K3NEW | 月之暗面 | ~60 | 2.8T 参数开源 · SWE Marathon #1 · 首个对标闭源顶级的开放模型 |
| 6 | Claude Opus 4.8 | Anthropic | 67.9* | SWE-bench Verified 88.6% 编程之王 · 已广泛部署 |
| 7 | Grok 4.3 | xAI | 55.1 | 2M 上下文 · GPQA 88.9% · 硬推理强 |
| 8 | GLM-5.2 | 智谱 AI | ~59 | 国产综合最强 · GPQA 91.2% · 开源推理之王 |
| 9 | DeepSeek V4-Pro | 深度求索 | 55.8 | 极致性价比 · Codeforces Elo 3206 · OpenRouter 双模型入前五 |
| 10 | Qwen 3.7 Max | 阿里 | 54.6 | 系列累计下载 10 亿+ · 全球最大开源模型家族 |
| 赛道 | 🥇 冠军 | 得分 | 🥈 亚军 | 🥉 季军 |
|---|---|---|---|---|
| SWE-bench Verified真实工程修复 | Claude Opus 4.8 | 88.6% | Claude Opus 4.7 (87.6%) | Claude Opus 4.6 (80.8%) |
| DeepSWE深层工程问题 | GPT-5.6 Sol | 73.0% | Claude Fable 5 (70.0%) | Kimi K3 (67.5%) |
| SWE-bench Multilingual多语言工程 | Claude Opus 4.8 | 84.4% | GLM-5.2 (83.0%) | — |
| SWE-bench Pro复杂工程 | Claude Opus 4.8 | 69.2% | Kimi K3 (63.4%) | GLM-5.2 (62.1%) |
| Terminal-Bench 2.1终端 Agent | GPT-5.6 Sol | 88.8% | Kimi K3 (88.3%) | Claude Fable 5 (84.6%) |
| SWE Marathon马拉松级工程 | Kimi K3 | 42.0 | GPT-5.6 Sol (39.0) | Claude Fable 5 (35.0) |
| Program Bench综合编程 | Kimi K3 | 77.8% | GPT-5.6 Sol (77.6%) | Claude Fable 5 (76.8%) |
| Codeforces Elo竞赛编程 | DeepSeek V4-Pro | 3206 | 竞赛编程特化型选手 | |
编程赛道 8 月最大的变化是 Kimi K3 的出现。它在 SWE Marathon 和 Program Bench 上拿到双料第一,Terminal-Bench 仅差 GPT-5.6 Sol 0.5 个百分点——而且这只是它的首发版本。作为开源模型,社区微调后在特定语言和框架上的表现很可能反超闭源模型。
Claude 系的统治力依然稳固:SWE-bench Verified 前三名都是 Claude(Opus 4.8 / 4.7 / 4.6),总分 88.6% 目前无人能破。但 GPT-5.6 Sol 在 DeepSWE 和 Terminal-Bench 上反超,说明 OpenAI 在"深层推理+工具使用"这个组合上找到了突破口。Claude Opus 5 虽然基准数据尚不完整,但其 3D 代码生成能力(文本→可玩 3D 游戏)是编程+创意的新维度。
| 模型 | GPQA Diamond | AIME 2026 | IMO 2026 | 特点 |
|---|---|---|---|---|
| GPT-5.2 Thinking | 92.4% | 100% 🏆 | — | 数学推理绝对王者 |
| GPT-5.6 Sol | 94.1% | — | 42/42 🏆 | IMO 满分 · 深度推理 |
| Claude Fable 5 | 92.6% | — | 42/42 🏆 | IMO 满分 · 科学推理 |
| Kimi K3 | 93.5% | 96.7% | 42/42 🏆 | IMO 满分 · 开源最强数学 |
| Gemini 3.1 Pro | 94.3% | 94.2% | — | GPQA 仅次于最高分 |
| Claude Opus 4.8 | 93.6% | — | — | 与 GPT-5.5 持平 |
| Grok 4 Heavy | — | 100% | — | AIME 满分 |
| GLM-5.2 | 91.2% | — | — | 开源推理之王 |
| DeepSeek V4-Pro | ~72% | — | — | MATH-500 96.8% |
8 月数学赛道迎来里程碑事件:IMO 2026(国际数学奥林匹克)有三款模型同获满分 42/42——Kimi K3、Claude Fable 5、GPT-5.6 Sol。IMO 此前一直被认为是 AI 最难攻克的数学考试之一(需要创造性思维而非计算能力),三款模型同时满分说明 2026 年的推理能力确实上了一个台阶。
Kimi K3 的表现尤其值得书写:首轮得分 36/42,经过反馈修正后达到满分,其中第 6 题的解答使用了一个原创的紧论证(compactness argument),被独立审查认可。这不再是"背诵答案",而是真正的数学创造。GPT-5.2 Thinking 在 AIME 2026 上拿到满分,Grok 4 Heavy 同样满分,封闭式数学考试正在趋近饱和。
GPQA Diamond(研究生级科学推理)仍然是区分度最高的数学/推理基准:GPT-5.6 Sol 94.1%、Gemini 3.1 Pro 94.3%、Kimi K3 93.5%、Claude Opus 4.8 93.6%,顶部差距极小,中位数稳固提高。
| 赛道 | 🥇 冠军 | 特点 |
|---|---|---|
| 英文写作(自然度/风格) | Claude Opus 5 / Fable 5 | 长文档/专业写作公认最强,逻辑严谨,风格多样 |
| 英文写作(用户偏好评分) | Claude Opus 4.7 (thinking) | LMArena 文本榜前三,用户盲测偏好最高 |
| 中文写作(自然流畅度) | DeepSeek V4 / Kimi K3 | Kimi K3 中文语境理解优秀 · DeepSeek 综合 94.25% |
| 中文综合能力 | Qwen 3.7 Max | 多语言支持广度最强,中文生态完善 |
| 通用写作(稳健) | GPT-5.5 | 多语言均衡,生态最完善,可出图 |
| 创意 / 幽默写作 | Grok 4 | 实时资讯融入,风格独特有网感 |
| 前端设计 / 设计竞技场 | Kimi K3 | Design Arena #1 · 前端设计代码生成顶尖 |
写作维度的变化相对温和。Claude 系在英文写作上仍然最自然,而新发布的 Opus 5 大概率继承了这一优势——虽然目前写作专项评测不多,但 Anthropic 的"安全+自然"基因一以贯之。Kimi K3 在中文写作和前端设计上表现亮眼,Design Arena #1 的成绩说明它在"写代码来呈现设计"这个维度上有独特优势。
一个值得关注的变化是写作评测的多样化:除了传统的文章质量盲测,越来越多的关注点放在 Agent 写作(指令遵循、结构化输出、多轮一致性)、设计代码生成(Design Arena)和创意跨模态(Claude Opus 5 的 3D 生成)上。纯文字写作的竞争已经接近天花板。
| 场景 | 🥇 最佳选择 | 原因 |
|---|---|---|
| 文本 → 图像生成 | GPT-5.5 | 唯一支持原生图像生成的大语言模型 |
| 文本 → 3D 可玩世界 | Claude Opus 5 | NEW · 一句话生成可交互 3D 游戏场景 |
| 视频理解 / 分析 | Gemini 3.1 Pro | 原生视频/音频/图像多模态最强 |
| 物理世界推理 | Claude Opus 5 / GPT-5.6 Sol | Opus 5 在 3D 物理真实性上领先 |
| 视觉 Agent(看网页/操作 GUI) | Claude Opus 4.8 | 视觉 Agent 能力领先,1M 上下文 |
| 科学论文图表理解 | Gemini 3.1 Pro | EESE 科学推理并列最高 0.381 |
| C 端多模态交互 | 豆包 Seed 2.0 Pro | 日均 120 万亿 token,体验打磨最好 |
多模态赛道 8 月出现了全新品类——Claude Opus 5 的文本→3D 世界生成。这不是传统意义上的"多模态理解",而是 AI 从文字描述直接生成可玩的 3D 游戏世界(Three.js/HTML),包含几何体、纹理、物理和音乐。社区测试显示它在 3D 物理真实感和机械复杂性上优于 GPT-5.6 Sol 和 Kimi K3。
GPT-5.5 的原生图像生成仍是独门绝技。在多模态这个品类下,目前最实用的差异化能力就是"出图"和"看视频"——GPT 负责前者,Gemini 负责后者,分工明确。Kimi K3 作为文本模型没有原生多模态能力,但通过工具调用可以弥补。
以下价格均为输出价格(百万 tokens),按成本从低到高排列。上下文窗口统一为 1M 量级已成为标配。
成本端的格局变化不大,但出现了一个有趣的新趋势:"中间档"正在填充。Claude Opus 5(约 $12/M tok)恰好填补了 Sonnet 4.6($4.33)和 Opus 4.8($25)之间的空档——能力接近顶级但价格可接受。同时 Kimi K3(约 $3.50/M tok)作为开源模型,比闭源的 Gemini 3.1 Pro($12)便宜得多,在能力接近的情况下,价格优势明显。
一个需要关注的是 MiMo-V2.5 的崛起:它以极低的价格在 OpenRouter 上做到周调用量 10.5 万亿 Tokens,说明在真实市场中,低成本模型的用量正在碾压高价模型。虽然它不是能力最强的,但"够用+极便宜"这个组合正在主导开发者市场。
8 月的选型策略可以用一个词概括:"分层订阅"。模型市场已经形成了清晰的三个层次:
第一层(前沿探索):Claude Fable 5 / GPT-5.6 Sol / Kimi K3。用于最难的任务——极限工程、IMO 级数学、长时间自主 Agent。
第二层(日常专业):Claude Opus 5 / Opus 4.8 / GPT-5.5 / Gemini 3.1 Pro。用于 80% 的实际工作——日常编程、写作、多模态分析。
第三层(规模化低成本):DeepSeek V4-Flash / MiMo-V2.5 / Qwen 3.7。用于高吞吐、对延迟和成本敏感的场景。
对于大多数 AI 从业者来说,"一个第二层主力 + 一个第一层专攻 + 一个第三层量产"的三件套是最优策略。8 月的新变量是——第一层现在有了开源选项(Kimi K3),这意味着你可以在自己的硬件上跑一个真正具备前沿能力的模型。
| # | 模型 | 厂商 | 周调用量 | 趋势 |
|---|---|---|---|---|
| 🥇 | MiMo-V2.5 | 小米 | 10.5 万亿 | 环比 +12% · 两月增长 6 倍 |
| 🥈 | DeepSeek V4-Pro | 深度求索 | — | 唯一双模型入前五 |
| 🥉 | 腾讯混元 Hy3 | 腾讯 | — | 环比 +999% · 7月6日开源 |
| 4 | 中国模型 | — | — | 包揽前五 · 全部来自中国 |
| 5 | DeepSeek (轻量版) | 深度求索 | — | 高低搭配覆盖不同需求 |
这是 8 月最重要的市场信号。OpenRouter 统计的是全球独立开发者和中小团队的真实付费 API 调用量,不考虑企业内部私有部署和美国厂商直连流量。即便如此,前五全部是中国模型这个事实仍然令人震惊。
MiMo-V2.5 的成功配方很简单:极低推理成本 + 稳定的 Agent 性能 + 全系列开源。它在两个月内从 1.5 万亿 tokens/周增长到 10.5 万亿,说明独立开发者市场正在用脚投票。腾讯混元 Hy3 的 +999% 周环比则证明"刚开源就爆火"在这个市场不是偶然。
但需要冷静看待:这不代表美国闭源模型的没落。OpenAI、Anthropic 的主要客户是企业而非独立开发者,它们走的是高客单价路线(Claude Opus 4.8 以 22.5% 的支出份额占据 Vercel AI Gateway 的最高消费模型)。两条路都在走通。
声明:所有数据均来自公开评测基准,评测分数受测试集、评测方法、模型版本等因素影响,仅供参考。不同评测体系的分数不可直接横向比较。编者每月更新时会注明数据截至时间。本期数据截至 2026 年 8 月 3 日。
8 月最值得关注的三个事件:Kimi K3 的开源发布、Claude Opus 5 亮相、以及 中国模型包揽 OpenRouter 全球调用量前五。这三件事指向同一个趋势——模型能力正在从"谁能做最难的题"转向"谁能在真实使用场景中创造最大价值"。
Kimi K3 是第一个真正对标闭源顶级的开放权重模型。2.8T 参数、SWE Marathon #1、IMO 满分,它在"最大"这个维度上暂时无人能敌。但注意其许可证限制——推理服务商需要签约,并非完全开放的 MIT 协议。Claude Opus 5 则代表了另一种策略:不做最强,但做最具性价比的专业模型。价格为 Fable 5 一半,3D 世界生成能力亮眼,但用户体验评价两极分化——能力确实强,但"感觉不太对"的抱怨也不少。
一个不容忽视的市场信号是 OpenRouter 周榜:前五全部是中国模型。虽然这不代表美国闭源模型不行(OpenAI 的直接 API 不经过 OpenRouter),但它确实说明了一点:在独立开发者和小团队这个群体中,性价比和开源可控已经成为比峰值性能更重要的选型因素。