网传「除 GPT、Claude 外全部进入 DeepSeek V4 Flash 斩杀线」——我们用有出处的公开数据重画这张图: 斩杀线在性价比维度成立,但三个国产新旗舰的绝对能力反而全部略高于 V4 Flash。
三个模型在 10 天内接连发布,「Token 战争」开打;两周后,「斩杀线」图刷屏。
「斩杀线」叙事的数据原型是 Artificial Analysis Intelligence Index 散点图(下为 2048×1008 官方高清版,点击可放大拖动、逐一看清模型名);自媒体刷屏的「斩杀线」图是它的 AI 改写示意(见下方存档)。
横轴换成有出处的 SWE-bench Verified,纵轴为官方输出刊例价(对数刻度)。红色虚线是过 V4 Flash 的「L 形斩杀边界」;绿色虚线是 V4 Pro 正式版的预测斩杀边界(灰度爆料 + 8/6 涨价公告推演,官方数据未发布)——注意左上方两块斩杀区:红色经典斩杀区在真实数据下是空的,而绿色预测区会装下三旗舰和 GPT-5.5。
两天内两颗炸弹:08-12 Grok 4.6(AA 61 追平 Claude Opus 5,每任务成本仅 $0.65)、08-13 DeepSeek V4 Pro 正式版(AA 58,每任务 $0.06,输出 $0.87/M)。03 节的绿色预测层成为现实——而且实际价格比预测下限还低一半以上。
08-14 跟进:GLM-5.3 发布接替 5.2(同基座 + 长任务 RL,TB 2.1 81.0→88.2);AA 指数与 API 定价未公布,本页散点/条形图中沿用 5.2 的 51 分 / $0.30 口径并标注。另注意:xAI 内部的 Grok Build 编码 harness(SWE 79.3)显示 Grok 4.6 的编程上限高于当前 API 公开基准——基准数字只是下限。
性价比指数 = SWE-bench 分数 ÷ 输出价,以 V4 Flash = 100 归一化。注意:按这个口径,连 GPT-5.5 和 Claude 也在线内——它们靠「能力溢出」豁免,而非性价比。
没有「最好的模型」,只有「某个场景下性价比最高的模型」。08-13 起新增两位:V4 Pro(新斩杀线本体)与 Grok 4.6(溢出区价格挑战者)。
| 维度 | V4 Flash | V4 Pro | Kimi K3 | GLM-5.3 | 千问 3.8 Max | Grok 4.6 |
|---|---|---|---|---|---|---|
| 写作 / 内容 | 中规中矩,胜在便宜 | 长文 + 低价首选,批量写作流水线 | 中文内容第一档:审美 + 2M 长文 + 套餐慷慨 | 内容/审美口碑弱于 K3 | 知识型内容最稳(幻觉最少,AA omniscience 12) | 知识型写作/研究最强档:GDPVal-AA 1753 第一 |
| 前端 / 审美 | 一般 | 一般(未单独标注) | 公认第一档(官方主打 high-aesthetic webdev) | 一般 | 中上 | 未单独标注 |
| 编程(SWE-bench) | 80.6% | ~81%(Preview/Max 旧口径,正式版未复测) | 81.5% | 未公布(5.2 为 81.4%) | 82.3% | 未公布;Grok Build 内部 SWE 79.3;编辑器场景 CursorBench 69.9% 第一 |
| Agentic 编程 | TB 2.3:58.1;官方 Harness 跑通 24h+ 连续编码 | 未复测;Harness 内百万行级交付 | ~64(版本口径存疑) | TB 2.1:88.2(接替 5.2 的 81.0),DeepSWE 66.9 | TB 2.3:67.5 | TB 58.3、DeepSWE 65.9,落后 GPT-5.6 Sol(66.5 / 71.7) |
| 数学 / 推理 | AIME 93.5(意外不错) | 未公布(AA 58 档) | 第一梯队 | 第一梯队 | 全场最强:AIME 95.8、HLE 53.6、GPQA 89.4 | AA 61 档,推理第一梯队 |
| 速度 | 69–112 t/s | 未公布 | 48–62 t/s(慢而省) | ~115 t/s(官方归一化口径) | 未公布 | 68 t/s,但 TTFT ~42s 偏慢 |
| 上下文 | 1M | 1M(最大输出 384K) | 2M,最长 | 1M(Coding Plan 路由) | 256K | 未公布 |
| 输出价 $/M | 0.42 | 0.87 | 4.00 | 未公布(5.2 为 2.56) | 5.76 | 6.00(缓存输入 0.50) |
| 开源 | ✅ | ✅ | ✅ | ✅ | ❌ | ❌ |
你的三条 Kimi K3 体感,全部被公开数据印证;千问 3.8 Max「贵不贵」要分场景回答。
五条,可直接照讲。