本期覆盖 13 个主流模型 · 6 个能力维度 · 6 个评测基准体系 · 数据综合自 LLM-Stats / Artificial Analysis / SWE-bench / GPQA / OpenRouter 等
| # | 模型 | 厂商 | AA 指数 | 一句话定位 |
|---|---|---|---|---|
| 🥇 | Claude Fable 5.1NEW | Anthropic | 66 | SWE-bench 95% · AA 独立指数全球第一 · 编码/知识工作 |
| 🥈 | GPT-6 AstraNEW | OpenAI | 61 | GPQA 96% · FrontierMath 97.6% · 105 万上下文 |
| 🥉 | Muse Spark 1.3NEW | Meta | 61 | AIHOT 榜第一 · DeepSWE 75.4 · 性价比惊人 |
| 4 | Claude Opus 5 | Anthropic | 63 | 日常专业工作首选 · 价格亲民 |
| 5 | GPT-5.6 Sol | OpenAI | 62 | DeepSWE 72.7% · 深度推理稳居前列 |
| 6 | Kimi K3 | 月之暗面 | 60 | 国产第一 · 2.8T 参数开源 · 1M 上下文 |
| 7 | GLM-5.3NEW | 智谱 Z.ai | 60 | SWE-bench 86.2% · 131 万上下文全榜最大 |
| 8 | Grok 4.6 | xAI | 61 | 2M 上下文 · 硬推理 · 实时资讯 |
| 9 | Qwen 3.8 Max | 阿里 | 58 | $2/$6 性价比 · 中文生态完善 |
| 10 | DeepSeek V4-Pro | 深度求索 | ~57 | Codeforces Elo 3206 · 竞赛级推理 |
| 11 | 腾讯混元 Hy4NEW | 腾讯 | — | OpenRouter 调用量第一 · 14.7 万亿 token/周 |
| 12 | Gemini 3.8 Flash | — | 生态整合最强 · 多模态 + 低价 |
| 赛道 | 🥇 冠军 | 得分 | 🥈 亚军 | 🥉 季军 |
|---|---|---|---|---|
| SWE-bench Verified真实工程修复 | Claude Fable 5.1 | 95.0% | Claude Opus 4.8 (88.6%) | Claude Opus 4.7 (87.6%) |
| DeepSWE v1.1深层工程问题 | Muse Spark 1.3 (max) | 75.4 | GPT-6 Astra (74.1%) | GPT-5.6 Sol (72.7%) |
| SWE-bench Pro复杂工程 | Claude Fable 5.1 | 80.0% | Claude Opus 4.8 (69.2%) | Kimi K3 (63.4%) |
| Terminal-Bench 4.0终端 Agent | GPT-6 Astra | 57.9% | Claude Fable 5.1 (55.8%) | GPT-5.6 Sol (37.3%) |
| Terminal-Bench 2.1终端 Agent(旧版) | Muse Spark 1.3 | 88.8% | Kimi K3 (88.3%) | GPT-5.6 Sol (88.8%) |
| LiveCodeBench实时编程 | Claude Fable 5.1 | 90.52% | — | |
| CursorBenchIDE 集成 | Claude Fable 5.1 | 73.4% | 该基准最高分 | |
| Codeforces Elo竞赛编程 | DeepSeek V4-Pro | 3206 | 竞赛编程特化型选手 | |
编程赛道 9 月的故事是 Claude Fable 5.1 的统治级表现。SWE-bench Verified 从 Opus 4.8 的 88.6% 直接跳到 95.0%,SWE-bench Pro 80.0%,LiveCodeBench 90.52%,CursorBench 73.4%——多个基准上都是断层第一。Anthropic 把 Fable 5.1 定位为"编码和知识工作专家",目前看名副其实。
但 GPT-6 Astra 在 Terminal-Bench 4.0(终端 Agent)上以 57.9% 反超,且比 GPT-5.6 Sol 的 37.3% 提升了 20 个百分点——这是 OpenAI 在 Agent 能力上的一次大跃进。OpenAI 总裁宣称"AGI 时代到来",虽然夸张,但 Astra 在计算机使用、网络安全(ExploitBench 100%)上的提升是实打实的。
Meta Muse Spark 1.3 是最大黑马。DeepSWE 75.4(max 配置)超过 Astra,Terminal-Bench 2.1 88.8% 与 GPT-5.6 Sol 并列第一,而价格只有 GPT-6 Astra 的 1/8。唯一的问题是 max 配置最初未开放,可部署的 xhigh 版本能力有折扣。
| 模型 | GPQA Diamond | FrontierMath T4 | AIME 2026 | 特点 |
|---|---|---|---|---|
| GPT-6 Astra | 96.0% 🥇 | 97.6% 🥇 | — | 数学/科学推理断层领先 |
| Claude Fable 5.1 | 94.6% | — | — | ProofBench 100% · 形式化证明 |
| Claude Opus 4.8 | 93.6% | — | — | 稳定优秀 |
| GLM-5.3 | 93.9% | — | — | 开源模型数学最强 |
| Kimi K3 | 93.5% | — | 96.7% | IMO 满分 · 开源旗舰 |
| GPT-5.2 Thinking | 92.4% | — | 100% 🏆 | AIME 满分 |
| Gemini 3.1 Pro | 94.3% | — | 94.2% | GPQA 接近满分 |
| DeepSeek V4-Pro | ~72% | — | — | MATH-500 96.8% |
数学与推理是 GPT-6 Astra 的主场。GPQA Diamond 96.0%、FrontierMath Tier4 v2 97.6%,两项都刷新纪录。尤其 FrontierMath 的 97.6% 接近饱和,说明顶尖数学推理基准正在失去区分度。Claude Fable 5.1 则选择了另一个方向——ProofBench v1.1 满分(形式化数学证明),这比"算出答案"更难,需要生成可被机器验证的严谨证明。
国产模型这边,GLM-5.3 的 GPQA 93.9% 已经超过 Kimi K3(93.5%)和 Claude Opus 4.8(93.6%),是开源模型里数学最强的。这说明智谱在推理能力上的投入见效了。
一个值得警惕的信号:OpenAI 的 ARC-AGI-3 分数存在巨大争议——官方宣称 99.9%,但 ARC Prize 标准 harness 独立复测仅 62.7%。这不是说 Astra 不强,而是提醒我们:当厂商开始用"自己的评测框架"替代公开基准时,数字的可信度就要打折。
| 赛道 | 🥇 冠军 | 特点 |
|---|---|---|
| 英文写作(自然度/风格) | Claude Fable 5.1 / Opus 5 | 长文档/专业写作公认最强,逻辑严谨,风格多样 |
| 英文写作(用户偏好评分) | Claude Fable 5.1 | LMArena 文本榜前列,盲测偏好最高 |
| 中文写作(自然流畅度) | Kimi K3 / DeepSeek V4 | 中文语境理解优秀 · 综合 94.25% |
| 中文综合能力 | Qwen 3.8 Max | 多语言支持广度最强,中文生态完善 |
| 通用写作(稳健) | GPT-6 Astra / GPT-5.5 | 多语言均衡,生态最完善 |
| 创意 / 幽默写作 | Grok 4.6 | 实时资讯融入,风格独特有网感 |
| 前端设计 / 设计竞技场 | Kimi K3 | Design Arena #1 · 前端设计代码生成顶尖 |
写作维度 9 月没有剧烈变化,Claude 系依然是最自然的选择,尤其 Fable 5.1 在英文长文和专业写作上进一步巩固了优势。GPT-6 Astra 作为旗舰,写作能力自然不弱,但 OpenAI 这次的宣传重心放在 Agent 和数学上,写作反而不是主打。
中文写作方面格局稳定:Kimi K3、DeepSeek V4、Qwen 3.8 Max 三强各有所长。Kimi K3 语境理解细腻,DeepSeek 综合分高,Qwen 生态最广。对于中文用户来说,这三款任选其一都能满足大部分需求,差距主要在细节打磨而非根本能力。
| 场景 | 🥇 最佳选择 | 原因 |
|---|---|---|
| 文本 → 图像生成 | GPT-5.5 | 唯一支持原生图像生成的大语言模型 |
| 文本 → 3D 可玩世界 | Claude Opus 5 | 一句话生成可交互 3D 游戏场景 |
| 视频理解 / 分析 | Gemini 3.8 Flash | 原生视频/音频/图像多模态 + 低价 |
| 视觉 Agent(看网页/操作 GUI) | GPT-6 Astra | OSWorld 2.0 72.6% · 计算机使用领先 |
| 科学论文图表理解 | Gemini 3.8 Flash | EESE 科学推理领先 |
| C 端多模态交互 | 豆包 Seed 2.0 Pro | 日均 120 万亿 token,体验打磨最好 |
多模态赛道 9 月的最大变化是 GPT-6 Astra 的视觉 Agent 能力。OSWorld 2.0(真实计算机操作)72.6% 是目前最高分,配合 ExploitBench 100% 的网络安全能力,Astra 在"AI 操作真实系统"这条路上走得最远。这不是传统的"看图说话",而是真正的"看屏幕+动手操作"。
Gemini 3.8 Flash 取代 3.1 Pro 成为多模态新标杆——Flash 版本价格更低,但多模态能力依然第一梯队,Google 用"低价 Flash"策略在生态上继续渗透。Claude Opus 5 的 3D 世界生成仍是独门能力,虽然尚未被其他厂商跟进。
以下价格为输出价(百万 tokens),按成本从低到高排列。9 月国产模型迎来集体涨价,Flash 低价版成为新战场。
9 月成本端最大的事件是 国产大模型集体涨价。DeepSeek V4 输出价涨了 350%,GLM 一年内三轮涨价累计 83%。"百模大战"的烧钱补贴阶段正在结束,厂商开始追求盈利。这对用户的影响是:Flash 低价版成为新的性价比锚点——GLM-5.3-Flash 只要旗舰价的 1/20,DeepSeek V4-Flash 涨价后依然是全场最便宜的可用模型之一。
海外这边,Meta Muse Spark 1.3 的定价策略最具侵略性:标准版 $4.25 的输出价,在旗舰级能力下几乎是最便宜的,contributor 版更是低到 $0.20(代价是允许 Meta 用你的数据训练)。相比之下,GPT-6 Astra 和 Claude Fable 5.1 的 $50 输出价是 Muse Spark 的 12 倍。Anthropic 的应对是缓存读降价 75%——虽然单价没降,但 Agent 场景的实际成本能省 25-45%。
9 月的选型策略比之前更清晰,因为三款新旗舰各自主攻一个方向:
Claude Fable 5.1 → 编程和知识工作。如果你 80% 的时间在写代码、写文档、做分析,它是目前综合最强且最可靠的选择。
GPT-6 Astra → 数学、Agent、安全。如果你需要极致的数学推理、让 AI 操作真实系统、或者做安全研究,Astra 是首选。
Muse Spark 1.3 → 性价比编程。如果你的预算有限但需要旗舰级编程能力,它是目前最划算的选择。
一个实用提醒:9 月国产模型涨价后,之前的"省钱配方"要重新算账了。DeepSeek V4-Pro 涨价 350% 后,它的性价比优势相对 Muse Spark 1.3 已经不那么明显。如果你对数据隐私不敏感,Muse Spark 的 contributor 版($0.20 输出价)可能是新的性价比之王。
| 模型 | 厂商宣称 | 独立复测结果 |
|---|---|---|
| GPT-6 Astra | ARC-AGI-3 99.9% | ARC Prize 标准 harness 仅 62.7% |
| Muse Spark 1.3 | DeepSWE 75.4(max 配置) | 可部署的 xhigh 版本 OSWorld 仅 57.2 |
| Claude Fable 5.1 | 缓存读降价 75% | 实际任务成本反升($3.69 vs $3.14) |
9 月最大的隐忧不是某个模型变强了,而是评测数字正在失去可信度。三家厂商各自用"最有利于自己"的评测口径发布成绩单,导致同一个模型在不同榜单上名次天差地别。
作为读者,我建议记住三条判断标准:① 看独立评测(如 Artificial Analysis)而非厂商自报;② 看可部署版本而非"预览/max 配置";③ 看实际任务成本而非单一单价。当厂商开始用"自己的 harness"替代公开基准时,谨慎一点总没错。
声明:所有数据均来自公开评测基准,评测分数受测试集、评测方法、模型版本、harness 配置等因素影响,仅供参考。不同评测体系的分数不可直接横向比较,厂商自报数据与独立复测数据可能存在显著差异。编者每月更新时会注明数据截至时间。本期数据截至 2026 年 9 月 7 日。
9 月是今年模型格局变动最剧烈的一个月——三天之内三款旗舰连发:Anthropic 的 Fable 5.1(9月1日)、Meta 的 Muse Spark 1.3(9月2日)、OpenAI 的 GPT-6 Astra(9月3-4日)。而且三款模型各自主张自己"最强",用的却是不同的榜单和 harness。
这里必须提醒一个关键问题:各家都在用自己的评测口径。OpenAI 说 Astra 的 ARC-AGI-3 是 99.9%,但 ARC Prize 用标准 harness 独立复测只有 62.7%;Meta 的 Muse Spark 1.3 靠 max 配置(最初未开放)拿到 75.4 的 DeepSWE,可部署的 xhigh 版本只有 57.2 的 OSWorld。真正值得参考的是 Artificial Analysis 独立智能指数——它把 Fable 5.1 排第一(66),Astra 和 Muse Spark 并列(61)。
所以 9 月最诚实的结论是:Fable 5.1 是综合最强,Astra 是单项(数学/安全)最强,Muse Spark 1.3 是性价比黑马。三者的差距比各自宣传的要小得多。