全部期次

2026年8月 · SOTA模型榜单

本期覆盖 13 个主流模型 · 6 个能力维度 · 5 个评测基准体系 · 数据综合自 LLM-Stats / SWE-bench / GPQA / OpenRouter / AIME 等

📌
本期关键变化
NEW 月之暗面发布 Kimi K3——2.8T 参数开源模型,首个对标闭源顶级的开放权重模型,SWE Marathon #1
NEW Anthropic 发布 Claude Opus 5——定位日常专业工作,价格为 Fable 5 一半,支持文本→3D 世界生成
🔥 OpenRouter 周榜:中国模型包揽前五,MiMo-V2.5 以 10.5 万亿 Tokens/周登顶
UP 阿里千问系列累计下载量突破 10 亿次,成为全球下载量最大的开源模型家族
UP IMO 2026:Kimi K3 / Claude Fable 5 / GPT-5.6 Sol 同获满分 42/42
1
综合实力总榜
AA Intelligence Index / LLM Stats
# 模型 厂商 综合分 一句话定位
🥇 Claude Fable 5 Anthropic 67.9 Mythos 公开安全版 · DeepSWE 70% · 长时间自主任务最强
🥈 Claude Opus 5NEW Anthropic ~66 7月24日发布 · 日常专业工作首选 · 价格为 Fable 5 一半
🥉 GPT-5.5 OpenAI 63.1 最均衡的全能选手 · AIME 满分 · 唯一原生出图
4 Gemini 3.1 Pro Google 56.4 多模态 & 长上下文最强 · GPQA 94.3%
5 Kimi K3NEW 月之暗面 ~60 2.8T 参数开源 · SWE Marathon #1 · 首个对标闭源顶级的开放模型
6 Claude Opus 4.8 Anthropic 67.9* SWE-bench Verified 88.6% 编程之王 · 已广泛部署
7 Grok 4.3 xAI 55.1 2M 上下文 · GPQA 88.9% · 硬推理强
8 GLM-5.2 智谱 AI ~59 国产综合最强 · GPQA 91.2% · 开源推理之王
9 DeepSeek V4-Pro 深度求索 55.8 极致性价比 · Codeforces Elo 3206 · OpenRouter 双模型入前五
10 Qwen 3.7 Max 阿里 54.6 系列累计下载 10 亿+ · 全球最大开源模型家族
📝 编者评述

8 月最值得关注的三个事件:Kimi K3 的开源发布Claude Opus 5 亮相、以及 中国模型包揽 OpenRouter 全球调用量前五。这三件事指向同一个趋势——模型能力正在从"谁能做最难的题"转向"谁能在真实使用场景中创造最大价值"。

Kimi K3 是第一个真正对标闭源顶级的开放权重模型。2.8T 参数、SWE Marathon #1、IMO 满分,它在"最大"这个维度上暂时无人能敌。但注意其许可证限制——推理服务商需要签约,并非完全开放的 MIT 协议。Claude Opus 5 则代表了另一种策略:不做最强,但做最具性价比的专业模型。价格为 Fable 5 一半,3D 世界生成能力亮眼,但用户体验评价两极分化——能力确实强,但"感觉不太对"的抱怨也不少。

一个不容忽视的市场信号是 OpenRouter 周榜:前五全部是中国模型。虽然这不代表美国闭源模型不行(OpenAI 的直接 API 不经过 OpenRouter),但它确实说明了一点:在独立开发者和小团队这个群体中,性价比和开源可控已经成为比峰值性能更重要的选型因素。

2
编程能力 · 多赛道对比
SWE-bench / DeepSWE / Terminal-Bench / Codeforces
赛道 🥇 冠军 得分 🥈 亚军 🥉 季军
SWE-bench Verified真实工程修复 Claude Opus 4.8 88.6% Claude Opus 4.7 (87.6%) Claude Opus 4.6 (80.8%)
DeepSWE深层工程问题 GPT-5.6 Sol 73.0% Claude Fable 5 (70.0%) Kimi K3 (67.5%)
SWE-bench Multilingual多语言工程 Claude Opus 4.8 84.4% GLM-5.2 (83.0%)
SWE-bench Pro复杂工程 Claude Opus 4.8 69.2% Kimi K3 (63.4%) GLM-5.2 (62.1%)
Terminal-Bench 2.1终端 Agent GPT-5.6 Sol 88.8% Kimi K3 (88.3%) Claude Fable 5 (84.6%)
SWE Marathon马拉松级工程 Kimi K3 42.0 GPT-5.6 Sol (39.0) Claude Fable 5 (35.0)
Program Bench综合编程 Kimi K3 77.8% GPT-5.6 Sol (77.6%) Claude Fable 5 (76.8%)
Codeforces Elo竞赛编程 DeepSeek V4-Pro 3206 竞赛编程特化型选手
💻 日常写代码 Claude Opus 5 / Claude Opus 4.8
🔧 工程极限难题 Claude Fable 5 / GPT-5.6 Sol
🤖 Agent 自动化编程 Claude Sonnet 4.6 (thinking)
📦 开源可自部署 Kimi K3 / DeepSeek V4-Pro
🏅 编程竞赛 DeepSeek V4-Pro
💰 预算有限但要好代码 DeepSeek V4 / GLM-5.2
📝 编者评述

编程赛道 8 月最大的变化是 Kimi K3 的出现。它在 SWE Marathon 和 Program Bench 上拿到双料第一,Terminal-Bench 仅差 GPT-5.6 Sol 0.5 个百分点——而且这只是它的首发版本。作为开源模型,社区微调后在特定语言和框架上的表现很可能反超闭源模型。

Claude 系的统治力依然稳固:SWE-bench Verified 前三名都是 Claude(Opus 4.8 / 4.7 / 4.6),总分 88.6% 目前无人能破。但 GPT-5.6 Sol 在 DeepSWE 和 Terminal-Bench 上反超,说明 OpenAI 在"深层推理+工具使用"这个组合上找到了突破口。Claude Opus 5 虽然基准数据尚不完整,但其 3D 代码生成能力(文本→可玩 3D 游戏)是编程+创意的新维度。

3
数学与推理
GPQA Diamond / AIME 2026 / IMO 2026 / MathArena
模型 GPQA Diamond AIME 2026 IMO 2026 特点
GPT-5.2 Thinking 92.4% 100% 🏆 数学推理绝对王者
GPT-5.6 Sol 94.1% 42/42 🏆 IMO 满分 · 深度推理
Claude Fable 5 92.6% 42/42 🏆 IMO 满分 · 科学推理
Kimi K3 93.5% 96.7% 42/42 🏆 IMO 满分 · 开源最强数学
Gemini 3.1 Pro 94.3% 94.2% GPQA 仅次于最高分
Claude Opus 4.8 93.6% 与 GPT-5.5 持平
Grok 4 Heavy 100% AIME 满分
GLM-5.2 91.2% 开源推理之王
DeepSeek V4-Pro ~72% MATH-500 96.8%
📝 编者评述

8 月数学赛道迎来里程碑事件:IMO 2026(国际数学奥林匹克)有三款模型同获满分 42/42——Kimi K3、Claude Fable 5、GPT-5.6 Sol。IMO 此前一直被认为是 AI 最难攻克的数学考试之一(需要创造性思维而非计算能力),三款模型同时满分说明 2026 年的推理能力确实上了一个台阶。

Kimi K3 的表现尤其值得书写:首轮得分 36/42,经过反馈修正后达到满分,其中第 6 题的解答使用了一个原创的紧论证(compactness argument),被独立审查认可。这不再是"背诵答案",而是真正的数学创造。GPT-5.2 Thinking 在 AIME 2026 上拿到满分,Grok 4 Heavy 同样满分,封闭式数学考试正在趋近饱和。

GPQA Diamond(研究生级科学推理)仍然是区分度最高的数学/推理基准:GPT-5.6 Sol 94.1%、Gemini 3.1 Pro 94.3%、Kimi K3 93.5%、Claude Opus 4.8 93.6%,顶部差距极小,中位数稳固提高。

4
写作与内容创作
中文 / 英文 / 创意写作
赛道 🥇 冠军 特点
英文写作(自然度/风格) Claude Opus 5 / Fable 5 长文档/专业写作公认最强,逻辑严谨,风格多样
英文写作(用户偏好评分) Claude Opus 4.7 (thinking) LMArena 文本榜前三,用户盲测偏好最高
中文写作(自然流畅度) DeepSeek V4 / Kimi K3 Kimi K3 中文语境理解优秀 · DeepSeek 综合 94.25%
中文综合能力 Qwen 3.7 Max 多语言支持广度最强,中文生态完善
通用写作(稳健) GPT-5.5 多语言均衡,生态最完善,可出图
创意 / 幽默写作 Grok 4 实时资讯融入,风格独特有网感
前端设计 / 设计竞技场 Kimi K3 Design Arena #1 · 前端设计代码生成顶尖
📝 编者评述

写作维度的变化相对温和。Claude 系在英文写作上仍然最自然,而新发布的 Opus 5 大概率继承了这一优势——虽然目前写作专项评测不多,但 Anthropic 的"安全+自然"基因一以贯之。Kimi K3 在中文写作和前端设计上表现亮眼,Design Arena #1 的成绩说明它在"写代码来呈现设计"这个维度上有独特优势。

一个值得关注的变化是写作评测的多样化:除了传统的文章质量盲测,越来越多的关注点放在 Agent 写作(指令遵循、结构化输出、多轮一致性)、设计代码生成(Design Arena)和创意跨模态(Claude Opus 5 的 3D 生成)上。纯文字写作的竞争已经接近天花板。

5
多模态 / 作图
图像生成 · 视频理解 · 3D 世界 · Agent 视觉
场景 🥇 最佳选择 原因
文本 → 图像生成 GPT-5.5 唯一支持原生图像生成的大语言模型
文本 → 3D 可玩世界 Claude Opus 5 NEW · 一句话生成可交互 3D 游戏场景
视频理解 / 分析 Gemini 3.1 Pro 原生视频/音频/图像多模态最强
物理世界推理 Claude Opus 5 / GPT-5.6 Sol Opus 5 在 3D 物理真实性上领先
视觉 Agent(看网页/操作 GUI) Claude Opus 4.8 视觉 Agent 能力领先,1M 上下文
科学论文图表理解 Gemini 3.1 Pro EESE 科学推理并列最高 0.381
C 端多模态交互 豆包 Seed 2.0 Pro 日均 120 万亿 token,体验打磨最好
📝 编者评述

多模态赛道 8 月出现了全新品类——Claude Opus 5 的文本→3D 世界生成。这不是传统意义上的"多模态理解",而是 AI 从文字描述直接生成可玩的 3D 游戏世界(Three.js/HTML),包含几何体、纹理、物理和音乐。社区测试显示它在 3D 物理真实感和机械复杂性上优于 GPT-5.6 Sol 和 Kimi K3。

GPT-5.5 的原生图像生成仍是独门绝技。在多模态这个品类下,目前最实用的差异化能力就是"出图"和"看视频"——GPT 负责前者,Gemini 负责后者,分工明确。Kimi K3 作为文本模型没有原生多模态能力,但通过工具调用可以弥补。

6
速度 & 成本速查
$/M tokens · tok/s · 上下文窗口

以下价格均为输出价格(百万 tokens),按成本从低到高排列。上下文窗口统一为 1M 量级已成为标配。

DeepSeek V4-Flash ~200 tok/s 1M ctx
$0.07 极致廉价
Gemini 3.1 Flash 极快 1M ctx
$0.40 Flash 性价比
DeepSeek V4-Pro ~150 tok/s 1M ctx
$0.87 性价比之王
Qwen 3.7 Max 62 tok/s 1M ctx
$1.25 最便宜 Top10
Grok 4 Fast 306 tok/s 🚀 2M ctx
$2.22 速度王
Kimi K3 1M ctx
~$3.50 开源旗舰
Claude Sonnet 4.6 334 tok/s 🚀 1M ctx
$4.33 速度最快的 Sonnet
Claude Opus 5 1M ctx
~$12 NEW · Fable 5 半价
Gemini 3.1 Pro 265 tok/s 1M ctx
$12 多模态标杆
Claude Opus 4.8 52 tok/s 1M ctx
~$25 最强但最贵
GPT-5.5 131 tok/s 1.1M ctx
$10–30 均衡但昂贵
腾讯混元 Hy3 正式版 256K ctx
¥1/¥4 国产低价 · OpenRouter 第三
MiMo-V2.5
极低 OpenRouter 调用量第一
📝 编者评述

成本端的格局变化不大,但出现了一个有趣的新趋势:"中间档"正在填充。Claude Opus 5(约 $12/M tok)恰好填补了 Sonnet 4.6($4.33)和 Opus 4.8($25)之间的空档——能力接近顶级但价格可接受。同时 Kimi K3(约 $3.50/M tok)作为开源模型,比闭源的 Gemini 3.1 Pro($12)便宜得多,在能力接近的情况下,价格优势明显。

一个需要关注的是 MiMo-V2.5 的崛起:它以极低的价格在 OpenRouter 上做到周调用量 10.5 万亿 Tokens,说明在真实市场中,低成本模型的用量正在碾压高价模型。虽然它不是能力最强的,但"够用+极便宜"这个组合正在主导开发者市场。

7
选型建议 · 按场景推荐
实用导向
编程
日常开发
Claude Opus 5 / Opus 4.8
SWE-bench 88.6% 编程之王
Opus 5 性价比更高
编程
极限工程 + Agent
Claude Fable 5 / GPT-5.6 Sol
DeepSWE 70%+
长时间自主任务
编程
开源可自部署
Kimi K3 / DeepSeek V4-Pro
K3 SWE Marathon #1
DeepSeek 极致性价比
数学
科研 / 竞赛
GPT-5.6 Sol / GPT-5.2 Thinking
IMO 满分 · AIME 满分
数学推理断层领先
写作
中文内容创作
Kimi K3 / DeepSeek V4
K3 中文语境优秀
DeepSeek 综合 94.25%
多模态
出图 / 视频 / 3D
GPT-5.5 / Gemini 3.1 / Opus 5
GPT 唯一原生出图
Opus 5 文本→3D 世界
成本
高吞吐 / 预算有限
DeepSeek V4-Flash / MiMo-V2.5
仅 $0.07/M tok
MiMo 调用量全球第一
长上下文
大文档 / 代码库
Grok 4.3 / Claude Opus 5
Grok 2M ctx 最大
Claude 1M ctx 最稳
📝 编者评述

8 月的选型策略可以用一个词概括:"分层订阅"。模型市场已经形成了清晰的三个层次:

第一层(前沿探索):Claude Fable 5 / GPT-5.6 Sol / Kimi K3。用于最难的任务——极限工程、IMO 级数学、长时间自主 Agent。
第二层(日常专业):Claude Opus 5 / Opus 4.8 / GPT-5.5 / Gemini 3.1 Pro。用于 80% 的实际工作——日常编程、写作、多模态分析。
第三层(规模化低成本):DeepSeek V4-Flash / MiMo-V2.5 / Qwen 3.7。用于高吞吐、对延迟和成本敏感的场景。

对于大多数 AI 从业者来说,"一个第二层主力 + 一个第一层专攻 + 一个第三层量产"的三件套是最优策略。8 月的新变量是——第一层现在有了开源选项(Kimi K3),这意味着你可以在自己的硬件上跑一个真正具备前沿能力的模型。

🌍
特别专题:OpenRouter 全球调用量周榜(2026年8月2日)
真实 API 调用量 · 非基准跑分
# 模型 厂商 周调用量 趋势
🥇 MiMo-V2.5 小米 10.5 万亿 环比 +12% · 两月增长 6 倍
🥈 DeepSeek V4-Pro 深度求索 唯一双模型入前五
🥉 腾讯混元 Hy3 腾讯 环比 +999% · 7月6日开源
4 中国模型 包揽前五 · 全部来自中国
5 DeepSeek (轻量版) 深度求索 高低搭配覆盖不同需求
📝 编者评述

这是 8 月最重要的市场信号。OpenRouter 统计的是全球独立开发者和中小团队的真实付费 API 调用量,不考虑企业内部私有部署和美国厂商直连流量。即便如此,前五全部是中国模型这个事实仍然令人震惊。

MiMo-V2.5 的成功配方很简单:极低推理成本 + 稳定的 Agent 性能 + 全系列开源。它在两个月内从 1.5 万亿 tokens/周增长到 10.5 万亿,说明独立开发者市场正在用脚投票。腾讯混元 Hy3 的 +999% 周环比则证明"刚开源就爆火"在这个市场不是偶然。

但需要冷静看待:这不代表美国闭源模型的没落。OpenAI、Anthropic 的主要客户是企业而非独立开发者,它们走的是高客单价路线(Claude Opus 4.8 以 22.5% 的支出份额占据 Vercel AI Gateway 的最高消费模型)。两条路都在走通。