近 30 天 · 大模型对比报告 · 2026-07-09 → 08-15 | 08-15 更新:GLM-5.3 接替 5.2 · V4 Pro 正式版 · Grok 4.6

「斩杀线」之下
Kimi K3 · GLM-5.3 · 千问 3.8 Max
+ V4 Pro · Grok 4.6

网传「除 GPT、Claude 外全部进入 DeepSeek V4 Flash 斩杀线」——我们用有出处的公开数据重画这张图: 斩杀线在性价比维度成立,但三个国产新旗舰的绝对能力反而全部略高于 V4 Flash

DATA: OFFICIAL PRICING + SWE-BENCH VERIFIED + AA INTELLIGENCE INDEX | AS OF 2026-08-15 · 新格局见第 04 节

0×
千问 3.8 Max 输出价相对 V4 Flash 的倍数($5.76 vs $0.42 / 百万 tokens)
0%
千问 3.8 Max 的 SWE-bench Verified——本文六款模型中的国产最高分
0
GLM-5.3 的 Terminal-Bench 2.1 得分(5.2 为 81.0)——08-14 发布即开源 SOTA
01

最近 30 天发生了什么

三个模型在 10 天内接连发布,「Token 战争」开打;两周后,「斩杀线」图刷屏。

07-17
Kimi K3 发布
1T/35B MoE,2M 上下文,开源。K2 流量单日暴跌 60%,「Token 战争」成话题。
07-22
GLM-5.2 发布
主打 Agentic Engineering;「高达测评泄露」事件称其真实任务首胜 Claude。(08-14 被 GLM-5.3 接替)
07-26
千问 3.8 Max 发布
SWE-bench 82.3%、Terminal-Bench 2.3 67.5%;发布当日阿里股价涨 6.8%。
07-31
DeepSeek 注水争议
被曝 API 对话默认注入 Codex 环境上下文,benchmark 口径引讨论。
08-03
「斩杀线」图刷屏
多个 AI 生成变体流传:「除 GPT/Claude 外,全部进入 V4 Flash 斩杀线」。
08-06
涨价公告 · Pro 临近
DeepSeek 官宣 API 大幅涨价;灰度中的 V4 Pro 正式版预计 8 月内发布。
08-12
Grok 4.6 发布
xAI 新旗舰:AA 指数 61 追平 Claude Opus 5,每任务成本仅 $0.65,溢出区首次出现价格挑战者。
08-13
V4 Pro 正式版发布
deepseek-v4-pro:输出 $0.87/M,AA 指数 58 / 每任务 $0.06。斩杀线从 50 分抬到 58 分,绿色预测成为现实。
08-14
GLM-5.3 发布(接替 5.2)
同 5.2 基座 + 长任务 RL 后训练:Terminal-Bench 2.1 81.0→88.2、DeepSWE 46.2→66.9;开源权重约 8 月底放出,AA 指数/API 定价未公布。
02

网传原图(高清版),以及它的三个问题

「斩杀线」叙事的数据原型是 Artificial Analysis Intelligence Index 散点图(下为 2048×1008 官方高清版,点击可放大拖动、逐一看清模型名);自媒体刷屏的「斩杀线」图是它的 AI 改写示意(见下方存档)。

Artificial Analysis Intelligence Index v4.1 高清原图
高清原图 · Artificial Analysis Intelligence Index v4.1(2026-07-31 提取)· 网传斩杀线图的数据原型点击放大
DeepSeek is back amongst the frontier 高清图
同系列精简版:「DeepSeek is back amongst the frontier」(2400×1123)点击放大
自媒体斩杀线示意图
自媒体 AI 示意图(低清存档)· 新浪新闻配图 2026-08-03 · 横轴「加权分」无出处
自媒体变体一
示意图变体 ①
自媒体变体二
示意图变体 ②(千问 3.8 Max 压线版)
自媒体变体三
示意图变体 ③(条形图版)
问题 01
它不是官方榜单
多个 AI 生成变体彼此矛盾:V4 Flash 输入价有的写 $0.28、有的写 $0.14;横轴「综合能力加权分」没有任何出处
问题 02
SKU 对不上
图里放的是 Kimi K3 Pro、GLM-5.2 Air、千问 3.7 Max——全是各家族另一档。你关心的 K3 / 5.3 / 3.8 Max 是更新的旗舰档,需要重新放点。
问题 03
「斩杀」被误读
斩杀的准确含义是「同能力下价格被碾压」,不是「能力被淘汰」。几乎所有标题都不讲这一点。
03

同一坐标系,换真实数据重画

横轴换成有出处的 SWE-bench Verified,纵轴为官方输出刊例价(对数刻度)。红色虚线是过 V4 Flash 的「L 形斩杀边界」;绿色虚线是 V4 Pro 正式版的预测斩杀边界(灰度爆料 + 8/6 涨价公告推演,官方数据未发布)——注意左上方两块斩杀区:红色经典斩杀区在真实数据下是空的,而绿色预测区会装下三旗舰和 GPT-5.5

能力 × 价格:六个模型的真实落点
X: SWE-BENCH VERIFIED (%) | Y: OUTPUT PRICE $/M TOKENS (LOG) | GPT-5.5 / CLAUDE 为官方口径约数 | 绿色 = V4 PRO 正式版预测层
0.2 0.5 1 2 5 10 20 78 80 82 84 86 88 90 能力 →(SWE-bench Verified,%) 输出价格($/百万 tokens,对数) 经典斩杀区(红) 能力 ≤ V4 Flash 且更贵 真实数据下:空的 斩杀边界(过 V4 Flash) V4 Pro 正式版·预测斩杀区(绿) 若爆料成立:三旗舰 + GPT-5.5 全部进线,仅剩 Opus 级能力溢出 预测区间:能力 85–88 · 输出 $1.5–4 能力溢出区 贵,但有只有它们能做的事 国产三旗舰:能力 +0.8 ~ +1.7 分 但价格贵 6.1 – 13.7 倍 → 性价比被斩杀 DeepSeek V4 Flash 80.6 / $0.42 · 斩杀线本体 GLM-5.3 81.4 / $2.56 Kimi K3 81.5 / $4.00 千问 3.8 Max 82.3 / $5.76 GPT-5.5(约) ~85 / $8.00 Claude Opus 4.6(约) ~88 / $15.00 DeepSeek V4 Pro 正式版(预测) ~86.5 / ~$2.5 · 涨价后预估
斩杀线本体 GLM-5.3 Kimi K3 千问 3.8 Max 海外旗舰(官方口径约数) V4 Pro 正式版·预测斩杀区(绿)
反转点网传图里「V4 Flash 58 分、别人 50 分」的排布与公开基准不符:真实数据里三家国产新旗舰能力全部略高,但都站在红色斩杀边界的右上方——能力略高、价格贵一个数量级。被斩杀的是性价比,不是能力。
绿色叠层 · ✅ 08-13 已验证这是 08-08 基于灰度爆料与涨价公告的预测层(当时口径:能力 ~86.5 SWE / 输出 ~$2.5)。08-13 V4 Pro 正式版已发布:实测斩杀位置为 AA 指数 58 分 / 每任务 $0.06(输出 $0.87/M)——斩杀方向完全命中,但实际价格比预测下限还低一半以上,斩杀线比预测更陡。真值重画见第 04 节「新格局」
04

08-13 新格局:斩杀线抬升 + 溢出区价格战

两天内两颗炸弹:08-12 Grok 4.6(AA 61 追平 Claude Opus 5,每任务成本仅 $0.65)、08-13 DeepSeek V4 Pro 正式版(AA 58,每任务 $0.06,输出 $0.87/M)。03 节的绿色预测层成为现实——而且实际价格比预测下限还低一半以上。

08-14 跟进:GLM-5.3 发布接替 5.2(同基座 + 长任务 RL,TB 2.1 81.0→88.2);AA 指数与 API 定价未公布,本页散点/条形图中沿用 5.2 的 51 分 / $0.30 口径并标注。另注意:xAI 内部的 Grok Build 编码 harness(SWE 79.3)显示 Grok 4.6 的编程上限高于当前 API 公开基准——基准数字只是下限。

AA Intelligence Index v4.1 全量 128 模型散点(2026-08-13)
最新全量图 · Artificial Analysis Intelligence Index v4.1(2026-08-13,128 个模型)· 左上蓝点 = V4 Pro,顶部紫点 = Grok 4.6点击放大
08-13 实测重画:九个关键落点(AA 口径)
X: COST PER TASK USD (LOG) | Y: AA INTELLIGENCE INDEX | 数据源:AA V4.1 全量 CSV(08-13)+ 官方定价
45 50 55 60 63 0.02 0.05 0.1 0.2 0.5 1 2 每任务成本 →(USD,对数刻度) AA 智能指数 → 新斩杀区:能力 ≤58 且每任务成本 ≥ $0.06 Kimi K3 (max) · GLM-5.3(暂无 AA 分,沿用 5.2 口径) · Grok 4.5 · Claude Opus 5 (medium) 全部进线 斩杀线抬升:50 → 58 分 能力溢出区(≥60) Grok 4.6 把入场价打到 $0.65 DeepSeek V4 Flash 0731 50 / $0.028 · 旧斩杀线 DeepSeek V4 Pro(正式版) 58 / $0.06 · 新斩杀线本体 GLM-5.3(暂无 AA 分,沿用 5.2 口径) 51 / $0.30 Kimi K3 (max) 57.5 / $0.55 · 压线被斩 Grok 4.5 (high) 52.5 / $0.45 Claude Opus 5 (medium) 55.5 / $0.42 · 首次进线 GPT-5.6 Sol (max) 59 / $1.50 · 仅 1 分豁免 Claude Opus 5 (max) 61 / $1.60 Grok 4.6 (high) 61 / $0.65 · 溢出区价格挑战者
旧斩杀线(Flash) 新斩杀线(V4 Pro) GLM-5.3 Kimi K3 Grok 4.6 Claude Opus 5 GPT-5.6 Sol
新格局三句话斩杀线抬升:从 50 分/$0.028 抬到 58 分/$0.06——Kimi K3 (max) 57.5 分第一次连「能力略高」的辩解都失效,国产旗舰 max 档全灭。② 溢出区价格战:Grok 4.6 与 Claude Opus 5 (max) 同分 61,成本 $0.65 vs $1.60——「能力溢出豁免」第一次出现廉价替代。③ 中间被两头挤:GPT-5.6 Sol (max) 仅以 1 分豁免,Opus 5 (medium)、Grok 4.5 直接进线。
预测 vs 实测08-08 预测:V4 Pro 正式版「能力微微落后 Opus、输出 $1.5–4/M」。实测:AA 58 分(比当时预测的位置更靠左上)、输出 $0.87/M、每任务 $0.06——斩杀方向命中,斩杀力度远超预测。注意口径:58 分是 AA 综合指数,V4 Pro 的 SWE-bench 官方复测尚未发布(~81% 为 Preview/Max 档旧口径),两组分数不可混用。
新口径性价比指数:AA 指数 ÷ 每任务成本(V4 Flash = 100)
V4 Flash 0731$0.028 / 50 分
100
V4 Pro$0.06 / 58 分
54.1
GLM-5.3(暂无 AA 分,沿用 5.2 口径)$0.30 / 51 分
9.5
Kimi K3 (max)$0.55 / 57.5 分
5.9
Grok 4.6 (high)$0.65 / 61 分
5.3
GPT-5.6 Sol (max)$1.50 / 59 分
2.2
Claude Opus 5 (max)$1.60 / 61 分
2.1
讲法纯性价比 V4 Flash 仍是王(100),V4 Pro 次之(54.1)——但 Pro 把「能买到的最高能力」从 50 分抬到 58 分,只贵 2.1 倍。Grok 4.6(5.3)的性价比是 Claude Opus 5(2.1)的 2.5 倍,顶部不再是「贵也得买」。两个新主角的完整优劣势见第 06 节。
05

斩杀线的量化:性价比指数

性价比指数 = SWE-bench 分数 ÷ 输出价,以 V4 Flash = 100 归一化。注意:按这个口径,连 GPT-5.5 和 Claude 也在线内——它们靠「能力溢出」豁免,而非性价比。

DeepSeek V4 Flash$0.42 / 80.6 分
100
V4 Pro(新)$0.87 / ~81 分(SWE 为旧口径)
48.5
GLM-5.3沿用 5.2 口径:$2.56 / 81.4 分
16.6
Kimi K3$4.00 / 81.5 分
10.6
千问 3.8 Max$5.76 / 82.3 分
7.4
GPT-5.5(约)$8.00 / ~85 分
5.5
Claude Opus 4.6(约)$15.00 / ~88 分
3.1
讲法每 1 美元买到的能力分:V4 Flash 是 Kimi K3 的 9.4 倍、千问 3.8 Max 的 13.4 倍、Claude Opus 4.6 的 32.8 倍。08-13 新增的 V4 Pro 以 48.5 排在第二(SWE 分为 Preview/Max 档旧口径,正式版复测未发布);Grok 4.6 未公布 SWE-bench,无法放入本表,其 AA 口径性价比见第 04 节。批量 API 场景选谁,一目了然;但「只有它能做的题」不在这张表的度量范围内。
06

六个主角,各自的优劣势

没有「最好的模型」,只有「某个场景下性价比最高的模型」。08-13 起新增两位:V4 Pro(新斩杀线本体)与 Grok 4.6(溢出区价格挑战者)。

Kimi K307-17 · 开源
审美与长上下文的内容旗舰 · 月之暗面
输出 $4.00/M上下文 2MSWE 81.5%速度 48–62 t/s
  • 前端/网页审美全场第一档,官方主打 high-aesthetic webdev
  • 2M 上下文四家最长;支持视觉多模态
  • 开源可自部署;订阅套餐额度慷慨
  • :48–62 tok/s,官方定位「慢而省」,约为 GLM-5.3 一半
  • 输出价在国产三家里偏贵,是 V4 Flash 的 9.5 倍
适合日常内容创作 / 前端页面 / 长文档 —— 你已有套餐,继续当主力
GLM-5.308-14 · 开源
Coding Agent 性价比之王(接替 5.2)· 智谱
输出 未公布(5.2 为 $2.56/M)上下文 1M(Coding Plan)TB 2.1 88.2DeepSWE 66.9
  • 同 5.2 基座 + 长任务 RL 后训练:Terminal-Bench 2.1 从 81.0 跳到 88.2,DeepSWE 46.2→66.9,发布即开源 SOTA
  • 长任务 token 效率大幅提升(官方 Code Bench 内部提升约 50%),Agent 项目更省 token
  • Coding Plan 约 ¥20/月起不变:3 倍 Claude Pro 用量、1/7 价格
  • AA 指数与正式 API 定价尚未公布(目前仅 Coding Plan 可用),本页沿用 5.2 的 51 分 / $0.30 口径
  • 开源权重约 8 月底放出;内容创作与审美口碑仍弱于 K3
适合编程 Agent / 自动化脚本 —— 5.3 把「最划算编程订阅」的门槛又抬高了
千问 3.8 Max07-26 · 闭源
推理与知识准确性的闭源旗舰 · 阿里
输出 $5.76/M(国际刊例)上下文 256KSWE 82.3%AIME 95.8
  • 数学/复杂推理全场最强:AIME 26 95.8(第一)、HLE 53.6(最高)、GPQA 89.4
  • 幻觉最少:AA omniscience 指数 12,知识型回答最可靠
  • SWE-bench 82.3% 代码第一梯队;阿里云企业级生态与 SLA
  • 闭源:不能本地部署、不能私有微调(其余三家全开源)
  • 上下文 256K 最短(K3 的 1/8);国产阵营 API 最贵
  • C 端通义 App 体验平庸——但免费额度够你试
适合数学/推理/知识密集型内容、阿里云生态团队、To B 交付
DeepSeek V4 Flash2026-05 · 开源
斩杀线本体 · 深度求索
输出 $0.42/M上下文 1MSWE 80.6%速度 69–112 t/s
  • 价格屠夫:输出 $0.42/M,缓存命中输入仅 $0.028/M
  • 开源 + 1M 上下文 + 速度不慢;数学意外不错(AIME 93.5)
  • 绝对能力比三家新旗舰低 0.8–1.7 SWE 分,复杂 Agent 任务翻车率更高
  • 7 月底「默认注入 Codex 上下文」争议,部分复测分数低于官方口径
适合批量 API / 成本敏感的后台任务 —— $0.42 的斩杀线本体
DeepSeek V4 Pro08-13 · 开源
新斩杀线本体 · 深度求索
输出 $0.87/M上下文 1MAA 58每任务 $0.06
  • 斩杀线从 50 分抬到 58 分:能买到的最高 AA 能力 +8 分,每任务成本仅 2.1 倍
  • 长文写作/知识综合的低价首选:AA 58 分档 + 1M 上下文 + 384K 最大输出,批量内容流水线成本无敌
  • 开源权重;支持 high / xhigh 推理档;缓存命中价极低
  • 正式版 SWE-bench 官方复测未发布(~81% 为 Preview/Max 档旧口径),编程定位待复测确认
  • 官方已预告后续涨价——$0.87 是窗口期价格
适合批量 API / 长上下文 Agent / 成本敏感的写作流水线 —— 中档定价锚点被它重置
Grok 4.608-12 · 闭源
溢出区价格挑战者 · xAI
输出 $6.00/M输入 $2.00/MAA 61速度 68 t/s
  • 知识型写作/研究当前最强档:GDPVal-AA 1753 第一(知识工作任务),AA 61 追平 Claude Opus 5
  • 编辑器编程第一:CursorBench 69.9%;同能力下每任务成本只有 Opus 5 (max) 的 40%
  • 缓存输入 $0.50/M,长上下文重复调用成本可控
  • Agentic 编程仍非最强:DeepSWE 65.9、Terminal-Bench 58.3,落后 GPT-5.6 Sol(71.7 / 66.5)——但 xAI 内部 Grok Build 编码 harness 的 SWE 高达 79.3,公开基准可能只是下限
  • 首 token 延迟 ~42s 偏慢,交互式写作体感一般;闭源
适合深度研究 / 知识写作 / 分析 —— 顶部第一次有「不买 Claude 也行」的选择
「Harness 溢价」:同一模型,不同 harness 跑出不同分数
官方内部 harness 结果 = 能力上限,公开 API 基准 = 能力下限 | 来源:DeepSeek / xAI 官方披露
DeepSeek Harness官方内测的长时间编码 harness 中,DeepSeek 模型跑通「24h+ 连续编码、百万行级交付」——斩杀线的含义从「单次问答便宜」升级为「跑得起长 Agent 项目」。这解释了为什么 V4 Pro 的 SWE 旧口径(~81%)与 AA 指数(58)观感不一致:harness 内表现 ≠ 单次基准。
Grok BuildxAI 内部的编码 harness:Grok 4.6 在其中跑出 SWE 79.3,远高于公开 API 基准(DeepSWE 65.9 / TB 58.3)。含义:① 编程场景「模型分」越来越依赖 harness 工程;② 对比时不要跨 harness 口径直接比——GLM-5.3 的 TB 2.1 88.2 与 Grok Build 的 SWE 79.3 不是同一套题。
维度V4 FlashV4 ProKimi K3GLM-5.3千问 3.8 MaxGrok 4.6
写作 / 内容中规中矩,胜在便宜长文 + 低价首选,批量写作流水线中文内容第一档:审美 + 2M 长文 + 套餐慷慨内容/审美口碑弱于 K3知识型内容最稳(幻觉最少,AA omniscience 12)知识型写作/研究最强档:GDPVal-AA 1753 第一
前端 / 审美一般一般(未单独标注)公认第一档(官方主打 high-aesthetic webdev)一般中上未单独标注
编程(SWE-bench)80.6%~81%(Preview/Max 旧口径,正式版未复测)81.5%未公布(5.2 为 81.4%)82.3%未公布;Grok Build 内部 SWE 79.3;编辑器场景 CursorBench 69.9% 第一
Agentic 编程TB 2.3:58.1;官方 Harness 跑通 24h+ 连续编码未复测;Harness 内百万行级交付~64(版本口径存疑)TB 2.1:88.2(接替 5.2 的 81.0),DeepSWE 66.9TB 2.3:67.5TB 58.3、DeepSWE 65.9,落后 GPT-5.6 Sol(66.5 / 71.7)
数学 / 推理AIME 93.5(意外不错)未公布(AA 58 档)第一梯队第一梯队全场最强:AIME 95.8、HLE 53.6、GPQA 89.4AA 61 档,推理第一梯队
速度69–112 t/s未公布48–62 t/s(慢而省)~115 t/s(官方归一化口径)未公布68 t/s,但 TTFT ~42s 偏慢
上下文1M1M(最大输出 384K)2M,最长1M(Coding Plan 路由)256K未公布
输出价 $/M0.420.874.00未公布(5.2 为 2.56)5.766.00(缓存输入 0.50)
开源
07

你的体感 × 公开数据对照

你的三条 Kimi K3 体感,全部被公开数据印证;千问 3.8 Max「贵不贵」要分场景回答。

你的体感 / 问题
公开数据验证
结论
K3 套餐用量完全够用
Kimi 订阅额度在同档产品中偏慷慨;K3 开源 + 2M 上下文
✓ 成立
K3 响应非常慢
实测 48–62 tok/s,官方定位「慢而省」,约为 GLM-5.3 的一半
✓ 成立 · 是设计取向
K3 前端审美不错
官方主打 high-aesthetic frontend/webdev,多篇第三方实测认可
✓ 成立
千问 3.8 Max 是不是很贵?
API 国产最贵($5.76/M),但只是 Claude 的 38%;C 端通义 App 免费额度可用
分场景 · 先用免费额度
08

给学员的讲解要点

五条,可直接照讲。

1
先讲概念
斩杀线 = 「同等能力下,价格被碾压即死亡」的性价比线,不是能力线。自媒体标题几乎都不讲这个区别。
2
再讲反转
近 30 天的真实数据里,国产三个新旗舰能力全部略高于 V4 Flash,但价格贵 6–14 倍——所以它们在性价比维度确实「进线」了。
3
GPT/Claude 为什么例外
不是性价比高(按口径它们更差),而是能力溢出:仍存在只有它们能完成的任务。这是「按值论价」,不是「按价论价」。
4
顺手讲媒介素养
网传图是 AI 生成的自媒体示意图:多个版本数据互相矛盾、坐标轴无出处。看到刷屏结论,先问一句「数据口径是什么」
5
最后讲怎么选
内容/审美/长文档 → Kimi K3;编程 Agent → GLM-5.3(接替 5.2,TB 2.1 88.2);数学推理/知识准确 → 千问 3.8 Max;批量 API/长文写作流水线 → V4 Flash 或 V4 Pro(能力更高、仍极便宜);深度研究/知识写作 → Grok 4.6(不买 Claude 也行的顶部选择)。按场景分工,而不是二选一。
6
08-13 补充:格局已刷新
斩杀线从 V4 Flash 的 50 分抬到 V4 Pro 的 58 分(每任务 $0.06),国产旗舰 max 档第一次连能力都低于线;同时 Grok 4.6 以 61 分 / $0.65 把「能力溢出区」的入场价打低 60%——底部抬线、顶部压价,中间档两头受挤。预测层(绿色)兑现为现实,且比预测更陡。