全部期次

2026年9月 · SOTA模型榜单

本期覆盖 13 个主流模型 · 6 个能力维度 · 6 个评测基准体系 · 数据综合自 LLM-Stats / Artificial Analysis / SWE-bench / GPQA / OpenRouter 等

📌
本期关键变化
NEW OpenAI 发布 GPT-6 Astra——GPQA 96.0%、FrontierMath 97.6%,总裁宣称"AGI 时代到来"
NEW Anthropic 发布 Claude Fable 5.1——SWE-bench Verified 95.0%,AA 独立智能指数全球第一
NEW Meta Muse Spark 1.3 意外登顶 AIHOT 榜,DeepSWE 75.4,输入仅 $1.25/M
UP GLM-5.3 发布:SWE-bench 86.2%,131 万 token 上下文全榜最大
🔥 国产模型集体涨价:DeepSeek 输出价涨 350%,"百模大战"熄火
1
综合实力总榜
AA Intelligence Index v4.2 / AIHOT
# 模型 厂商 AA 指数 一句话定位
🥇 Claude Fable 5.1NEW Anthropic 66 SWE-bench 95% · AA 独立指数全球第一 · 编码/知识工作
🥈 GPT-6 AstraNEW OpenAI 61 GPQA 96% · FrontierMath 97.6% · 105 万上下文
🥉 Muse Spark 1.3NEW Meta 61 AIHOT 榜第一 · DeepSWE 75.4 · 性价比惊人
4 Claude Opus 5 Anthropic 63 日常专业工作首选 · 价格亲民
5 GPT-5.6 Sol OpenAI 62 DeepSWE 72.7% · 深度推理稳居前列
6 Kimi K3 月之暗面 60 国产第一 · 2.8T 参数开源 · 1M 上下文
7 GLM-5.3NEW 智谱 Z.ai 60 SWE-bench 86.2% · 131 万上下文全榜最大
8 Grok 4.6 xAI 61 2M 上下文 · 硬推理 · 实时资讯
9 Qwen 3.8 Max 阿里 58 $2/$6 性价比 · 中文生态完善
10 DeepSeek V4-Pro 深度求索 ~57 Codeforces Elo 3206 · 竞赛级推理
11 腾讯混元 Hy4NEW 腾讯 OpenRouter 调用量第一 · 14.7 万亿 token/周
12 Gemini 3.8 Flash Google 生态整合最强 · 多模态 + 低价
📝 编者评述

9 月是今年模型格局变动最剧烈的一个月——三天之内三款旗舰连发:Anthropic 的 Fable 5.1(9月1日)、Meta 的 Muse Spark 1.3(9月2日)、OpenAI 的 GPT-6 Astra(9月3-4日)。而且三款模型各自主张自己"最强",用的却是不同的榜单和 harness。

这里必须提醒一个关键问题:各家都在用自己的评测口径。OpenAI 说 Astra 的 ARC-AGI-3 是 99.9%,但 ARC Prize 用标准 harness 独立复测只有 62.7%;Meta 的 Muse Spark 1.3 靠 max 配置(最初未开放)拿到 75.4 的 DeepSWE,可部署的 xhigh 版本只有 57.2 的 OSWorld。真正值得参考的是 Artificial Analysis 独立智能指数——它把 Fable 5.1 排第一(66),Astra 和 Muse Spark 并列(61)。

所以 9 月最诚实的结论是:Fable 5.1 是综合最强,Astra 是单项(数学/安全)最强,Muse Spark 1.3 是性价比黑马。三者的差距比各自宣传的要小得多。

2
编程能力 · 多赛道对比
SWE-bench / DeepSWE / Terminal-Bench / Codeforces
赛道 🥇 冠军 得分 🥈 亚军 🥉 季军
SWE-bench Verified真实工程修复 Claude Fable 5.1 95.0% Claude Opus 4.8 (88.6%) Claude Opus 4.7 (87.6%)
DeepSWE v1.1深层工程问题 Muse Spark 1.3 (max) 75.4 GPT-6 Astra (74.1%) GPT-5.6 Sol (72.7%)
SWE-bench Pro复杂工程 Claude Fable 5.1 80.0% Claude Opus 4.8 (69.2%) Kimi K3 (63.4%)
Terminal-Bench 4.0终端 Agent GPT-6 Astra 57.9% Claude Fable 5.1 (55.8%) GPT-5.6 Sol (37.3%)
Terminal-Bench 2.1终端 Agent(旧版) Muse Spark 1.3 88.8% Kimi K3 (88.3%) GPT-5.6 Sol (88.8%)
LiveCodeBench实时编程 Claude Fable 5.1 90.52%
CursorBenchIDE 集成 Claude Fable 5.1 73.4% 该基准最高分
Codeforces Elo竞赛编程 DeepSeek V4-Pro 3206 竞赛编程特化型选手
💻 日常写代码 Claude Fable 5.1 / Claude Opus 5
🔧 工程极限难题 Claude Fable 5.1 / GPT-6 Astra
🤖 Agent 自动化编程 Muse Spark 1.3 / GPT-6 Astra
📦 开源可自部署 Kimi K3 / GLM-5.3
🏅 编程竞赛 DeepSeek V4-Pro
💰 预算有限但要好代码 Muse Spark 1.3 / GLM-5.3
📝 编者评述

编程赛道 9 月的故事是 Claude Fable 5.1 的统治级表现。SWE-bench Verified 从 Opus 4.8 的 88.6% 直接跳到 95.0%,SWE-bench Pro 80.0%,LiveCodeBench 90.52%,CursorBench 73.4%——多个基准上都是断层第一。Anthropic 把 Fable 5.1 定位为"编码和知识工作专家",目前看名副其实。

GPT-6 Astra 在 Terminal-Bench 4.0(终端 Agent)上以 57.9% 反超,且比 GPT-5.6 Sol 的 37.3% 提升了 20 个百分点——这是 OpenAI 在 Agent 能力上的一次大跃进。OpenAI 总裁宣称"AGI 时代到来",虽然夸张,但 Astra 在计算机使用、网络安全(ExploitBench 100%)上的提升是实打实的。

Meta Muse Spark 1.3 是最大黑马。DeepSWE 75.4(max 配置)超过 Astra,Terminal-Bench 2.1 88.8% 与 GPT-5.6 Sol 并列第一,而价格只有 GPT-6 Astra 的 1/8。唯一的问题是 max 配置最初未开放,可部署的 xhigh 版本能力有折扣。

3
数学与推理
GPQA Diamond / FrontierMath / AIME / ARC-AGI
模型 GPQA Diamond FrontierMath T4 AIME 2026 特点
GPT-6 Astra 96.0% 🥇 97.6% 🥇 数学/科学推理断层领先
Claude Fable 5.1 94.6% ProofBench 100% · 形式化证明
Claude Opus 4.8 93.6% 稳定优秀
GLM-5.3 93.9% 开源模型数学最强
Kimi K3 93.5% 96.7% IMO 满分 · 开源旗舰
GPT-5.2 Thinking 92.4% 100% 🏆 AIME 满分
Gemini 3.1 Pro 94.3% 94.2% GPQA 接近满分
DeepSeek V4-Pro ~72% MATH-500 96.8%
📝 编者评述

数学与推理是 GPT-6 Astra 的主场。GPQA Diamond 96.0%、FrontierMath Tier4 v2 97.6%,两项都刷新纪录。尤其 FrontierMath 的 97.6% 接近饱和,说明顶尖数学推理基准正在失去区分度。Claude Fable 5.1 则选择了另一个方向——ProofBench v1.1 满分(形式化数学证明),这比"算出答案"更难,需要生成可被机器验证的严谨证明。

国产模型这边,GLM-5.3 的 GPQA 93.9% 已经超过 Kimi K3(93.5%)和 Claude Opus 4.8(93.6%),是开源模型里数学最强的。这说明智谱在推理能力上的投入见效了。

一个值得警惕的信号:OpenAI 的 ARC-AGI-3 分数存在巨大争议——官方宣称 99.9%,但 ARC Prize 标准 harness 独立复测仅 62.7%。这不是说 Astra 不强,而是提醒我们:当厂商开始用"自己的评测框架"替代公开基准时,数字的可信度就要打折。

4
写作与内容创作
中文 / 英文 / 创意写作
赛道 🥇 冠军 特点
英文写作(自然度/风格) Claude Fable 5.1 / Opus 5 长文档/专业写作公认最强,逻辑严谨,风格多样
英文写作(用户偏好评分) Claude Fable 5.1 LMArena 文本榜前列,盲测偏好最高
中文写作(自然流畅度) Kimi K3 / DeepSeek V4 中文语境理解优秀 · 综合 94.25%
中文综合能力 Qwen 3.8 Max 多语言支持广度最强,中文生态完善
通用写作(稳健) GPT-6 Astra / GPT-5.5 多语言均衡,生态最完善
创意 / 幽默写作 Grok 4.6 实时资讯融入,风格独特有网感
前端设计 / 设计竞技场 Kimi K3 Design Arena #1 · 前端设计代码生成顶尖
📝 编者评述

写作维度 9 月没有剧烈变化,Claude 系依然是最自然的选择,尤其 Fable 5.1 在英文长文和专业写作上进一步巩固了优势。GPT-6 Astra 作为旗舰,写作能力自然不弱,但 OpenAI 这次的宣传重心放在 Agent 和数学上,写作反而不是主打。

中文写作方面格局稳定:Kimi K3、DeepSeek V4、Qwen 3.8 Max 三强各有所长。Kimi K3 语境理解细腻,DeepSeek 综合分高,Qwen 生态最广。对于中文用户来说,这三款任选其一都能满足大部分需求,差距主要在细节打磨而非根本能力。

5
多模态 / 作图
图像生成 · 视频理解 · 3D 世界 · 视觉 Agent
场景 🥇 最佳选择 原因
文本 → 图像生成 GPT-5.5 唯一支持原生图像生成的大语言模型
文本 → 3D 可玩世界 Claude Opus 5 一句话生成可交互 3D 游戏场景
视频理解 / 分析 Gemini 3.8 Flash 原生视频/音频/图像多模态 + 低价
视觉 Agent(看网页/操作 GUI) GPT-6 Astra OSWorld 2.0 72.6% · 计算机使用领先
科学论文图表理解 Gemini 3.8 Flash EESE 科学推理领先
C 端多模态交互 豆包 Seed 2.0 Pro 日均 120 万亿 token,体验打磨最好
📝 编者评述

多模态赛道 9 月的最大变化是 GPT-6 Astra 的视觉 Agent 能力。OSWorld 2.0(真实计算机操作)72.6% 是目前最高分,配合 ExploitBench 100% 的网络安全能力,Astra 在"AI 操作真实系统"这条路上走得最远。这不是传统的"看图说话",而是真正的"看屏幕+动手操作"。

Gemini 3.8 Flash 取代 3.1 Pro 成为多模态新标杆——Flash 版本价格更低,但多模态能力依然第一梯队,Google 用"低价 Flash"策略在生态上继续渗透。Claude Opus 5 的 3D 世界生成仍是独门能力,虽然尚未被其他厂商跟进。

6
速度 & 成本速查
$/M tokens · tok/s · 上下文窗口

以下价格为输出价(百万 tokens),按成本从低到高排列。9 月国产模型迎来集体涨价,Flash 低价版成为新战场。

Muse Spark 1.3 (contributor) 104 万 ctx
$0.20 允许训练数据 · 白菜价
DeepSeek V4-Flash ~200 tok/s 1M ctx
$0.28 极致廉价 · 涨价后仍最便宜
GLM-5.3-Flash
$0.19 限时折扣 · 约旗舰 1/20
Muse Spark 1.3 (standard) 104 万 ctx
$4.25 旗舰级性价比
DeepSeek V4-Pro ~150 tok/s 1M ctx
$3.48 涨价 350% 后 · 分时定价
Qwen 3.8 Max 62 tok/s 1M ctx
$6 国产居中
Kimi K3 1M ctx
~$3.50 开源旗舰
Claude Sonnet 4.6 334 tok/s 🚀 1M ctx
$4.33 速度最快的 Sonnet
Claude Opus 5 1M ctx
~$12 日常专业性价比
GLM-5.3 131 万 ctx
$17.60 国产最贵 · 编程分项最高
Claude Fable 5.1 1M ctx
$50 缓存读降价 75% · 综合最强
GPT-6 Astra 105 万 ctx
$50 与 Fable 5.1 同价
腾讯混元 Hy4 (preview)
低价 OpenRouter 调用量第一
📝 编者评述

9 月成本端最大的事件是 国产大模型集体涨价。DeepSeek V4 输出价涨了 350%,GLM 一年内三轮涨价累计 83%。"百模大战"的烧钱补贴阶段正在结束,厂商开始追求盈利。这对用户的影响是:Flash 低价版成为新的性价比锚点——GLM-5.3-Flash 只要旗舰价的 1/20,DeepSeek V4-Flash 涨价后依然是全场最便宜的可用模型之一。

海外这边,Meta Muse Spark 1.3 的定价策略最具侵略性:标准版 $4.25 的输出价,在旗舰级能力下几乎是最便宜的,contributor 版更是低到 $0.20(代价是允许 Meta 用你的数据训练)。相比之下,GPT-6 Astra 和 Claude Fable 5.1 的 $50 输出价是 Muse Spark 的 12 倍。Anthropic 的应对是缓存读降价 75%——虽然单价没降,但 Agent 场景的实际成本能省 25-45%。

7
选型建议 · 按场景推荐
实用导向
编程
日常开发 + 极限工程
Claude Fable 5.1
SWE-bench 95% 断层第一
LiveCodeBench 90.52%
编程
Agent 自动化 + 计算机使用
GPT-6 Astra
Terminal-Bench 4.0 57.9%
OSWorld 2.0 72.6%
编程
预算有限的旗舰编程
Muse Spark 1.3
DeepSWE 75.4 · $4.25 输出
性价比黑马
数学
科研 / 竞赛
GPT-6 Astra
GPQA 96% · FrontierMath 97.6%
数学断层领先
写作
中文内容创作
Kimi K3 / Qwen 3.8 Max
中文语境最优
生态完善
多模态
视频 / 视觉 Agent
Gemini 3.8 Flash / GPT-6 Astra
Gemini 多模态低价
Astra 视觉操作最强
成本
高吞吐 / 预算有限
Muse Spark / DeepSeek Flash
$0.20-$0.28 输出价
规模化场景首选
长上下文
大文档 / 代码库
GLM-5.3 / Grok 4.6
GLM 131 万 ctx 最大
Grok 2M ctx
📝 编者评述

9 月的选型策略比之前更清晰,因为三款新旗舰各自主攻一个方向:

Claude Fable 5.1 → 编程和知识工作。如果你 80% 的时间在写代码、写文档、做分析,它是目前综合最强且最可靠的选择。
GPT-6 Astra → 数学、Agent、安全。如果你需要极致的数学推理、让 AI 操作真实系统、或者做安全研究,Astra 是首选。
Muse Spark 1.3 → 性价比编程。如果你的预算有限但需要旗舰级编程能力,它是目前最划算的选择。

一个实用提醒:9 月国产模型涨价后,之前的"省钱配方"要重新算账了。DeepSeek V4-Pro 涨价 350% 后,它的性价比优势相对 Muse Spark 1.3 已经不那么明显。如果你对数据隐私不敏感,Muse Spark 的 contributor 版($0.20 输出价)可能是新的性价比之王。

⚠️
特别专题:当"最强"取决于谁在评测
9 月最值得警惕的趋势
模型 厂商宣称 独立复测结果
GPT-6 Astra ARC-AGI-3 99.9% ARC Prize 标准 harness 仅 62.7%
Muse Spark 1.3 DeepSWE 75.4(max 配置) 可部署的 xhigh 版本 OSWorld 仅 57.2
Claude Fable 5.1 缓存读降价 75% 实际任务成本反升($3.69 vs $3.14)
📝 编者评述

9 月最大的隐忧不是某个模型变强了,而是评测数字正在失去可信度。三家厂商各自用"最有利于自己"的评测口径发布成绩单,导致同一个模型在不同榜单上名次天差地别。

作为读者,我建议记住三条判断标准:① 看独立评测(如 Artificial Analysis)而非厂商自报;② 看可部署版本而非"预览/max 配置";③ 看实际任务成本而非单一单价。当厂商开始用"自己的 harness"替代公开基准时,谨慎一点总没错。

📚
数据来源与说明

声明:所有数据均来自公开评测基准,评测分数受测试集、评测方法、模型版本、harness 配置等因素影响,仅供参考。不同评测体系的分数不可直接横向比较,厂商自报数据与独立复测数据可能存在显著差异。编者每月更新时会注明数据截至时间。本期数据截至 2026 年 9 月 7 日。