DeepSeek V4 Flash 正式版发布,主流大模型能力与价格横评(2026 年 7 月)

前言

2026 年 7 月 31 日,DeepSeek 宣布 DeepSeek-V4-Flash 正式版deepseek-v4-flash-0731)上线公测,并放出一张以 Agent 能力为主的基准成绩单。这也是 V4 系列在 4 月 24 日发布预览版后迎来的第一个正式版。

趁着这个节点,我把国内外最新的主力模型(截至 2026 年 7 月 31 日)的能力与价格整理了一份横评:海外是 OpenAI GPT-5.6、Anthropic Claude 5 家族、Google Gemini 3.6/3.5 Flash,国内是 Qwen3.7-Max、GLM-5.2、Kimi K3、MiniMax M3 和豆包 2.1 Pro。最后附上这些基准测试到底是什么、该怎么读的说明。

所有数据均来自各厂商官方发布页/定价页(已在文中注明),少数为第三方评测(如 Artificial Analysis、LMArena)并有标注。各厂商评测口径不同、官方公布的数据维度不同,直接横比需谨慎,下文会逐一说明。

DeepSeek V4 Flash 正式版

发布要点

  • 模型名deepseek-v4-flash,API 调用方式不变;deepseek-v4-flash 现已指向 V4-Flash-0731。
  • 与预览版关系:官方明确说明「DeepSeek-V4-Flash-0731 的模型结构、尺寸和 V4-Flash-Preview 保持一致,仅重新进行了后训练(post-training)」——这是 Flash 档位从预览到正式的转正。
  • API 特性:原生支持 OpenAI Responses API,并适配了 Codex;同时兼容 Anthropic 接口。
  • V4-Pro 状态:V4-Pro 的 API 与 APP/WEB 模型本次不变,正式版「将会尽快发布」。
  • 旧名退役deepseek-chat / deepseek-reasoner 已于 2026-07-24 停止使用。

基准成绩单

V4 Flash 正式版的评测全部是 Agent / 真实环境类基准(测试条件:DeepSeek Harness 极简模式、max 档位、top_p=0.95、temperature=1.0):

基准 V4-Flash-0731 对比 V4-Pro-Preview
Terminal-Bench 2.1(终端 agent) 82.7 远超
CyberGym(网络安全 PoC) 76.7 远超
Toolathlon Verified(工具调用) 70.3 远超
DSBench-FullStack(内部全栈开发) 68.7 41.8
DSBench-Hard(内部编码难题) 59.6 31.1
DeepSWE(原创长程工程) 54.4 远超
NL2Repo(自然语言生成代码仓库) 54.2 远超
Agents’ Last Exam(真实专业软件操作) 25.2 远超
Automation Bench(跨应用工作流) 25.1 远超

DSBench-FullStack / DSBench-Hard 是 DeepSeek 未公开的内部测试集(来自发布报道,非官方文档),分数与第三方评测不可比。

作为参考,V4 预览版发布时(4 月 24 日)官方给出的定性评价是:V4-Pro 的 Agent 能力为开源模型最佳、内部使用体验优于 Claude Sonnet 4.5、交付质量接近 Opus 4.6 非思考模式;V4-Flash 参数与激活更小、简单 Agent 任务与 Pro 旗鼓相当。

价格与规格

项目 deepseek-v4-flash deepseek-v4-pro
输入(缓存命中) ¥0.02 / M tokens ¥0.025 / M tokens
输入(缓存未命中) ¥1 / M tokens ¥3 / M tokens
输出 ¥2 / M tokens ¥6 / M tokens
上下文 1M 1M
最大输出 384K 384K
并发上限 2500 500

(价格单位均为每百万 token;官方已预告后续将引入北京时区 9:00–12:00、14:00–18:00 高峰时段 2 倍计费。)

作为参考,上一代 DeepSeek-V3.2 的价格是输入 ¥2 / 输出 ¥8 每百万 token——V4 Flash 的 1 元/2 元相当于输入降价一半、输出降价 75%,而且上下文从 128K 级直接拉到 1M,这个性价比在当前市场非常能打。

海外主流模型一览

OpenAI GPT-5.6 家族(2026-07-09 GA)

GPT-5.6 分三档:Sol(旗舰)、Terra(均衡)、Luna(最快最便宜)。官方定位是「按 token 产出更多有效工作」,主打性能/价格比。7 月 30 日刚对 Terra/Luna 降过价。官方已不公布 AIME(GPT-5.2 时代已 100% 饱和)和 MMLU-Pro,也不发 Arena Elo。

基准 Sol Terra Luna GPT-5.5(对比)
GPQA Diamond 94.6% 92.9% 92.3% 93.6%
Agents’ Last Exam 52.7%(max 推理 53.6) 50.4% 50.3% 46.9%
Terminal-Bench 2.1 88.8%(ultra 91.9%) 87.4% 84.7% 85.6%
SWE-Bench Pro 64.6% 63.4% 62.7% 59.4%
BrowseComp 90.4% 87.5% 83.3% 84.4%
FrontierMath T1-3 (v2) 89.0% 84.9% 78.6% 85.3%
OSWorld 2.0 62.6% 50.2% 45.6% 47.5%
ARC-AGI-3 7.78% 0.8% 0.18% 0.43%
模型 输入 输出 缓存读取 上下文
gpt-5.6 (Sol) $5.00 $30.00 $0.50 1.05M / 128K
gpt-5.6-terra $2.00 $12.00 $0.20 1.05M / 128K
gpt-5.6-luna $0.20 $1.20 $0.02 1.05M / 128K

特性:推理强度支持到 max,还有 ultra 模式(默认协调 4 个并行 agent 分工);新增 Programmatic Tool Calling(模型在内存中写小程序来协调工具调用);Responses API 支持单请求内多 agent 并发。

Anthropic Claude 5 家族

Anthropic 的 5 代家族当前在售四个模型。注意:官方从这一代起不再公布 MMLU-Pro / AIME 这类旧头条数字,改用 Frontier-Bench、GDPval-AA、ARC-AGI-3 等新评测。另外 2026 年起多了个 Mythos 能力层(高于 Opus),Fable 5 是公开版 Mythos 级模型。

模型 发布 输入/输出($/M) 上下文 关键官方基准
Fable 5 06-09 $10 / $50 1M / 128K SWE-bench Verified 95.0%、SWE-bench Pro 80.3%、GPQA 94.1%、HLE 59%(无工具)、GDPval-AA Elo 1932
Opus 5 07-24 $5 / $25 1M / 128K Frontier-Bench v0.1 43.3%(Fable 5 33.7%)、GDPval-AA v2 Elo 1861(新 SOTA)、ARC-AGI-3 30.2%(约为次强模型 3 倍)、OSWorld 2.0 70.6%
Sonnet 5 06-30 推广期 $2 / $10(9/1 起 $3/$15) 1M / 128K SWE-bench Verified 72.7%、Terminal-Bench 2.1 80.4%、GPQA 78.0%、USAMO 2026 79.5%
Haiku 4.5 2025-10 $1 / $5 200K / 64K SWE-bench Verified 73.3%、Terminal-Bench 40.2%

值得注意的反差:Opus 5 的 SWE-bench Verified 官方未公布(第三方称 96%,未证实),而主打性价比的 Sonnet 5 在 Terminal-Bench 2.1 上拿到 80.4%——在部分 agent 场景下,中间档与旗舰的差距已经很小。Arena 方面:Fable 5 长期占据文本榜 #1(约 1509 Elo)与 Coding 榜 #1(1564),Opus 5 发布后登顶 WebDev 榜(1725)。

Google Gemini 3.6 / 3.5 Flash

Google 的情况比较特别:旗舰 Gemini 3.5 Pro 至今跳票未发布(原计划 6 月,传多次未达性能目标),而 Flash 档位已经迭代到 3.6。官方口径同样聚焦 agentic/coding 基准,未发布 MMLU-Pro、GPQA、AIME 等传统分数。

模型 发布 输入/输出($/M) 上下文 关键官方基准
Gemini 3.6 Flash 07-21 $1.50 / $7.50 1M / 64K Terminal-Bench 2.1 78.0%、SWE-Bench Pro 58.7%、DeepSWE 49%、MLE-Bench 63.9%、OSWorld-Verified 83.0%、HLE 38%
Gemini 3.5 Flash 05-20(I/O 2026) $1.50 / $9.00 1M / 64K Terminal-Bench 2.1 76.2%、SWE-Bench Pro 55.1%、ARC-AGI-2 72.1%、HLE 40.2%
3.5 Flash-Lite 07-21 $0.30 / $2.50 1M / 64K Terminal-Bench 2.1 54.0%、SWE-Bench Pro 54.2%(全面超越 3.1 Flash-Lite)

3.6 Flash 主打 token 效率(输出 token 较 3.5 Flash 省 17%,长任务最高省 65%),单任务耗时减半,输出速度约 304 tokens/s;Computer Use 已成为 API 内建工具。另有一个网络安全特化的 3.5 Flash Cyber(政府/受信合作伙伴试点,无公开定价)。Gemini 4 官方确认已开始预训练。

国内主流模型一览

国内 5 家的最新旗舰(2026 年 7 月 31 日时间点):

模型 发布 输入/输出(¥/M) 缓存 上下文 关键官方基准
Qwen3.7-Max 05-20 ¥12 / ¥36(限时 5 折 ¥6/¥18) 1M GPQA 92.2、SWE-Pro 60.4、Terminal-Bench 2.0 72.3、NL2Repo 47.3;AA 综合指数 56.6(国产第一)
GLM-5.2 06-17(开源 MIT) ¥8 / ¥28 ¥2 1M / 128K AIME 2026 99.2(该基准全球第一)、GPQA 91.2、HLE 54.7、SWE-Pro 62.1、Terminal-Bench 2.1 81.0
Kimi K3 07-16(开源权重) ¥20 / ¥100 ¥2 1M WebDev Arena 1678(全球第一,超 Fable 5 的 1634)、GPQA 93.5、HLE 56.0、MMLU-Pro 81.6、BrowseComp 91.2、FrontierSWE 81.2
MiniMax M3 06-01(开源) ¥2.1 / ¥8.4(≤512K) ¥0.42 1M SWE-Pro 59.0(超 GPT-5.5 的 58.6)、BrowseComp 83.5、MMLU-Pro 79.85
Doubao-Seed-2.1 Pro 06-23 ¥6 / ¥30 ¥1.2 256K Terminal-Bench 2.1 71.0、SWE-Pro 57.5、MMMU-Pro 81.6(超 Opus 4.6 的 81.2)、GDPVal 87.9

各家亮点速记:

  • Qwen3.7-Max:Agent 时代旗舰,三个月内从 3.5 迭代到 3.7;Arena 盲测总榜国产第一。官方未公布 MMLU-Pro 具体值。
  • GLM-5.2:MIT 开源 + AIME 2026 99.2 分全球第一(超 GPT-5.5 的 98.3);IndexShare 稀疏注意力让百万上下文的每 token 计算量降 2.9 倍;单轮处理 88 万+ token 完整交付软件。
  • Kimi K3:当前热度最高——总参数 2.8T / 激活 104B,首个接近 3 万亿参数的开放权重模型;WebDev Arena 1678 全球登顶(首个登顶的开源模型)。代价是价格也登顶:输出 ¥100/M 是国产最贵,但官方称比 GPT-5.6 Sol、Opus 4.8 仍低 40–50%。
  • MiniMax M3:多模态稀疏 MoE(428B/23B),价格是国产旗舰里最便宜的(¥2.1/¥8.4);24 小时自主完成 CUDA 内核优化(9.4 倍加速)。
  • 豆包 2.1 Pro:Coding & Agent 旗舰,面向 500+ 智能体协同场景;综合成本较 Claude Opus 4.6 降近 80%。上下文只有 256K,是这些旗舰里最短的。

直观对比图

下面四张图把四个有交叉数据的基准单独拎出来对比(柱子按分数降序排列,数值标注在柱顶)。注意:各厂商评测框架和口径不同,跨厂商比较只能看量级;每个模型的具体数据与来源见下方表格。

GPQA Diamond(研究生级科学问答,越高越好)

GPQA Diamond · 官方数据 GPT-5.6 Sol Claude Fable 5 Kimi K3 Qwen3.7-Max GLM-5.2 Claude Sonnet 5
020406080100
94.6
94.1
93.5
92.2
91.2
78.0
MiniMax M3 的 GPQA 77.8 为第三方评测、且与 Sonnet 5 几乎重合,未列入本图(见下方表格)。

Terminal-Bench 2.1(真实终端环境 Agent 编码,越高越好)

Terminal-Bench 2.1 · 官方发布口径 GPT-5.6 Sol DeepSeek V4 Flash GLM-5.2 Claude Sonnet 5 Gemini 3.6 Flash Doubao 2.1 Pro
020406080100
88.8
82.7
81.0
80.4
78.0
71.0
该基准分数对评测框架(harness)极敏感,不同机构复测可差 5 分以上,跨厂商比较仅看量级。GPT-5.6 Sol 为 88.8(官方)。

SWE-bench Pro(真实软件工程任务,越高越好)

SWE-bench Pro · 官方发布口径 Claude Fable 5 GPT-5.6 Sol GLM-5.2 Qwen3.7-Max MiniMax M3 Gemini 3.6 Flash
020406080100
80.3
64.6
62.1
60.4
59.0
58.7
Claude Fable 5 在此基准上大幅领先(80.3),第二集团(GPT-5.6 Sol ~ MiniMax)分数接近、仅看量级。

HLE 人类最后一考(无工具,越高越好)

Humanity's Last Exam · 无工具成绩 Claude Fable 5 Gemini 3.6 Flash Kimi K3 GLM-5.2
020406080100
59.0
38.0
56.0
54.7
官方公布 HLE 数据的模型较少(GPT-5.6、Claude Opus 5 等未公布)。此图按色板顺序排列而非分数顺序。

能力横向对比总表

各厂商公布的口径差异很大(OpenAI 不报 Elo 和 AIME、Anthropic/Google 不报 GPQA 以外的旧基准、国内各家报的维度也不同),所以下表只汇总有交叉数据的维度,「—」表示官方未公布:

模型 GPQA Diamond HLE Terminal-Bench 2.1 SWE-bench Pro BrowseComp Arena(权威榜)
GPT-5.6 Sol 94.6 88.8(ultra 91.9) 64.6 90.4
Claude Fable 5 94.1 59.0 84.3* 80.3 文本 #1 ~1509 / Coding #1 1564
Claude Opus 5 79.2* WebDev #1 1725
Claude Sonnet 5 78.0 80.4 63.2* Coding #16 1522
Gemini 3.6 Flash 38.0 78.0 58.7
DeepSeek V4 Flash 82.7
Qwen3.7-Max 92.2 72.3(TB 2.0) 60.4 盲测国产第一
GLM-5.2 91.2 54.7 81.0 62.1
Kimi K3 93.5 56.0 91.2 WebDev #1 1678
MiniMax M3 77.8* 59.0 83.5
Doubao 2.1 Pro 71.0 57.5

带 * 的为第三方评测(benchlmArtificial Analysis 等),其余为官方数据。注意 Terminal-Bench 分数对评测 harness 极其敏感,不同机构测出的分数相差可达 5 分以上,跨厂商比较只能看量级。

几个值得注意的结论:

  1. 知识推理(GPQA)已经「共同富裕」:GPT-5.6 Sol、Fable 5、Kimi K3、Qwen3.7、GLM-5.2 全部在 91–95 区间,这个基准已接近饱和,很难再拉开差距。
  2. Agent 编码是当前的主战场:Terminal-Bench 2.1 上 GPT-5.6 Sol(88.8)一骑绝尘,DeepSeek V4 Flash(82.7)直接打到第三档的位置,和 GLM-5.2(81.0)、Sonnet 5(80.4)非常接近——国产模型在 agent 编码上与海外旗舰的差距已经很小
  3. 最难的基准上分数依旧惨淡:ARC-AGI-3 最强只有 7.78%(GPT-5.6 Sol),Agents’ Last Exam 的 Last-Exam 档所有前沿模型通过率 0%——离「通用智能」还有很长的路。

价格横向对比总表

美元模型按 1 美元 ≈ 7.1 元人民币换算作参考(汇率约数):

模型 输入 输出 折算人民币(输入/输出)
GPT-5.6 Sol $5.00 $30.00 ≈ ¥35.5 / ¥213
GPT-5.6 Terra $2.00 $12.00 ≈ ¥14.2 / ¥85
GPT-5.6 Luna $0.20 $1.20 ≈ ¥1.4 / ¥8.5
Claude Fable 5 $10.00 $50.00 ≈ ¥71 / ¥355
Claude Opus 5 $5.00 $25.00 ≈ ¥35.5 / ¥177.5
Claude Sonnet 5(推广期) $2.00 $10.00 ≈ ¥14.2 / ¥71
Claude Haiku 4.5 $1.00 $5.00 ≈ ¥7.1 / ¥35.5
Gemini 3.6 Flash $1.50 $7.50 ≈ ¥10.7 / ¥53.3
Gemini 3.5 Flash-Lite $0.30 $2.50 ≈ ¥2.1 / ¥17.8
DeepSeek V4 Flash ¥1 ¥2
DeepSeek V4 Pro ¥3 ¥6
Qwen3.7-Max ¥12(5 折 ¥6) ¥36(5 折 ¥18)
GLM-5.2 ¥8 ¥28
Kimi K3 ¥20 ¥100
MiniMax M3 ¥2.1 ¥8.4
Doubao 2.1 Pro ¥6 ¥30

价格视角的结论:

  • 最便宜的旗舰级推理能力:GPT-5.6 Luna 输入只要 $0.20/M(≈¥1.4),与 DeepSeek V4 Flash 的 ¥1/M 处于同一量级——「便宜又强」不再是国内模型专利。
  • DeepSeek V4 Flash 的性价比在 1M 上下文档位里没有对手:¥1/¥2 的同时给 1M 上下文 + 384K 输出 + 缓存命中 0.02 元,同档位 Gemini 3.6 Flash 也要 $1.50/$7.50(约 ¥10.7/¥53.3)。
  • Kimi K3 是国产「爱马仕」:输出 ¥100/M,几乎是 V4 Flash 的 50 倍;但 WebDev Arena 全球第一的成绩确实独一档,适合高价值 agent 任务。
  • 各家的 Batch 通常半价、缓存命中约 0.1 折,实际跑 agent 工作流时成本远低于刊例价(Kimi 官方称编程场景缓存命中率超 90%)。

这些基准测试到底是什么

传统「问答式」基准

  • MMLU / MMLU-Pro:多任务语言理解,覆盖几十个学科的选择题,Pro 版难度更高且含推理题。曾是模型能力的「起跑线」,2025 年后前沿模型普遍 85–90+,已经接近饱和,主流厂商大多不再公布
  • GPQA Diamond:谷歌 DeepMind 出的研究生级科学问答(物理/化学/生物),专家做也只有 74% 左右。2026 年 7 月头部模型普遍 91–95%,是知识推理维度仍有区分度的主流基准
  • AIME(美国数学邀请赛):竞赛数学。GPT-5.2 已拿到 100%(饱和),GLM-5.2 在 AIME 2026 拿到 99.2 分全球第一。数学类目前更能拉开差距的是 FrontierMath(前沿数学,GPT-5.6 Sol 89%)和 USAMO/IMO。
  • Humanity’s Last Exam(HLE):「人类最后一考」,2500 道专家级题、100+ 学科,2026 年 1 月发表于 Nature。2026 年 3 月榜首才 46%,7 月已有 14 个模型超过 50%(带工具最高 64.5%),是目前最「未饱和」的主要知识基准。官方已推出动态更新的 HLE-Rolling 防针对性刷题。
  • LiveCodeBench / HumanEval:代码生成(写函数/算法题)。HumanEval 早已饱和,LiveCodeBench v6 也进入收尾阶段。
  • Chatbot Arena(现 arena.ai:真人盲测投票的 Elo 排行榜,分通用/代码/网页开发(WebDev)等子榜。这是「真实用户口碑」维度,厂商自己不能刷——目前文本榜第一是 Claude Fable 5,WebDev 榜第一是 Kimi K3(1678 Elo,首个登顶的开源模型)。

Agent 时代的新基准(V4 Flash 成绩单上的)

这批基准的共同叙事是:从「静态问答」转向「真实环境、多轮执行、程序化验证」——agent 要真正操作终端/软件/API,最终结果由确定性检查判定,前沿模型普遍得分不高、且分数对评测框架(harness)极其敏感。

  • Terminal-Bench 2.1(2026-05 发布,Stanford × Laude Institute 等):89 个任务,每个任务一个独立 Docker 终端环境(软件工程、系统管理、ML 训练、安全等),agent 与真实 shell 多轮交互后提交结果,二元 pass@1 判定。2.1 修复了 2.0 的 26–28 个失效任务。当前头部:GPT-5.6 Sol Ultra 91.9%、DeepSeek V4 Flash 82.7%。
  • NL2Repo-Bench(字节 Seed 等,2025-12):自然语言 → 完整代码仓库。agent 从空工作区出发,只给一份需求文档,自主设计架构、管理依赖、产出可安装可运行的 Python 库,用上游测试套件验证。最强模型整体通过率不到 40%——长程工程能力还远没到天花板。
  • CyberGym(UC Berkeley,2025-06):网络安全 agent 基准。1507 个真实漏洞实例(来自 OSS-Fuzz,覆盖 OpenCV、FFmpeg、curl、OpenSSL 等 188 个真实项目),agent 需写出可复现漏洞的 PoC(修复前版本崩溃、修复后不崩溃)。最强组合成功率仅 ~22%——顺便说,评测过程中 agent 还发现了 35 个 0day。
  • DeepSWE(DataCurve AI,2026-07):113 个原创长程软件工程任务(91 个活跃开源仓库、5 种语言),任务从零手写、从不回馈上游,规避「模型见过修复」的召回问题;用手写 verifier 而非继承测试套件评分。注意与 2025 年 UC Berkeley 的「DeepSWE 模型」(Qwen3-32B 编码模型)同名不同物
  • Toolathlon(HKUST,ICLR 2026;Verified 版 2026-06):工具调用十项全能。108 个任务横跨 32 个应用/604 个工具(MCP server 封装:Notion、Gmail、Kubernetes、BigQuery……),平均每任务 20–27 轮调用,Docker 环境 + 确定性脚本检查最终状态。Verified 榜(2026-07):Kimi K3 76.5%、Opus 4.8 76.2%、DeepSeek V4 Flash 70.3%。
  • Agents’ Last Exam(ALE,UC Berkeley RDI,2026-06):agent 版「最后一考」。1490 个有经济价值的真实专业工作流(Siemens NX 三维建模、Unreal Engine 布景、After Effects 合成……),agent 以「通用计算机使用」形式在虚拟机里同时用 shell 和 GUI 点击操作真实软件。确定性代码评分(LLM 裁判仅占 6.8%)。现状:最强通过率 24% 左右,最难的 Last-Exam 档所有前沿模型通过率 0%
  • Automation Bench(2026-04):跨应用工作流编排,任务取材于 Zapier 真实工作流(CRM、日历、消息平台多系统协同),只看最终系统状态的程序化评分。原始版最强模型不到 10%;Artificial Analysis 的独立版(AutomationBench-AA)分数更高:Grok 4.5 51.4%、GPT-5.6 Sol 51.2%、Claude Fable 5 48.6%。
  • DSBench(命名陷阱):公开的 DSBench(ICLR 2025)是腾讯等出的数据科学 agent 基准(Kaggle 数据分析任务);而 DeepSeek 成绩单里的 DSBench-FullStack / Hard 是 DeepSeek 内部测试集(未公开),两者无关,分数不可比。

读基准的三个心法

  1. 看口径,不看数字:同样的 Terminal-Bench 2.1,不同机构(官方/AA/第三方的 harness 配置)测出来能差 5 分以上;「DeepSeek 内部测试集」「benchlm 第三方复测」和「官方基准」永远不能放进同一张表里比较。
  2. 看趋势,不看单点:2024 年卷 MMLU,2025 年卷 AIME/SWE-bench,2026 年卷 Terminal-Bench/ALE——基准在跟着模型的强项走,模型的强项在跟着真实工作走。当一个基准 90% 以上的模型都考到 90+,它就退役了。
  3. 价格要算「有效产出」:1M 上下文、缓存命中 0.1 折、Batch 半价——agent 工作流的真实成本往往只有刊例价的十分之一,比单看输入/输出单价更接近真相。

总结

2026 年 7 月的模型市场,几个清晰的变化:

  • Agent 化彻底成为主线:各家旗舰的评测重心、优化方向、API 特性(Responses API、multi-agent、computer use)全部围绕 agent 展开;「能干活」比「会答题」重要得多。
  • 性价比战打到国产家门口:GPT-5.6 Luna $0.20/$1.20、DeepSeek V4 Flash ¥1/¥2 + 1M 上下文,模型调用已经接近「随便用」的价格;卷的方向变成了谁在长任务里更省 token、更少犯错。
  • 国内梯队形成:GLM-5.2(开源 + 数学第一)、Kimi K3(WebDev 登顶 + 2.8T 开源权重)、Qwen3.7-Max(综合国产第一)、DeepSeek V4 Flash(极致性价比),各占一个生态位;MiniMax M3 和豆包 2.1 Pro 则在多模态/垂直场景发力。

如果你的需求是:写代码/跑 agent → GPT-5.6 Sol / Claude Fable 5 是天花板,DeepSeek V4 Flash / GLM-5.2 是国产最优解;做网页 → Kimi K3 或 Claude Opus 5;大批量低成本任务 → GPT-5.6 Luna / Gemini 3.5 Flash-Lite / DeepSeek V4 Flash;数学 → GLM-5.2。

(文中数据整理于 2026-07-31,来源:DeepSeek API 文档与定价页、OpenAI 官方博客与定价页、Anthropic 官方文档、Google 官方博客与 Model Card、各国内厂商官方发布页与定价页、Artificial Analysis、arena.ai 等;第三方数据均已标注。)