DeepSeek V4 Flash 正式版发布,主流大模型能力与价格横评(2026 年 7 月)
DeepSeek V4 Flash 正式版发布,主流大模型能力与价格横评(2026 年 7 月)
前言
2026 年 7 月 31 日,DeepSeek 宣布 DeepSeek-V4-Flash 正式版(deepseek-v4-flash-0731)上线公测,并放出一张以 Agent 能力为主的基准成绩单。这也是 V4 系列在 4 月 24 日发布预览版后迎来的第一个正式版。
趁着这个节点,我把国内外最新的主力模型(截至 2026 年 7 月 31 日)的能力与价格整理了一份横评:海外是 OpenAI GPT-5.6、Anthropic Claude 5 家族、Google Gemini 3.6/3.5 Flash,国内是 Qwen3.7-Max、GLM-5.2、Kimi K3、MiniMax M3 和豆包 2.1 Pro。最后附上这些基准测试到底是什么、该怎么读的说明。
所有数据均来自各厂商官方发布页/定价页(已在文中注明),少数为第三方评测(如 Artificial Analysis、LMArena)并有标注。各厂商评测口径不同、官方公布的数据维度不同,直接横比需谨慎,下文会逐一说明。
DeepSeek V4 Flash 正式版
发布要点
- 模型名:
deepseek-v4-flash,API 调用方式不变;deepseek-v4-flash现已指向 V4-Flash-0731。 - 与预览版关系:官方明确说明「DeepSeek-V4-Flash-0731 的模型结构、尺寸和 V4-Flash-Preview 保持一致,仅重新进行了后训练(post-training)」——这是 Flash 档位从预览到正式的转正。
- API 特性:原生支持 OpenAI Responses API,并适配了 Codex;同时兼容 Anthropic 接口。
- V4-Pro 状态:V4-Pro 的 API 与 APP/WEB 模型本次不变,正式版「将会尽快发布」。
- 旧名退役:
deepseek-chat/deepseek-reasoner已于 2026-07-24 停止使用。
基准成绩单
V4 Flash 正式版的评测全部是 Agent / 真实环境类基准(测试条件:DeepSeek Harness 极简模式、max 档位、top_p=0.95、temperature=1.0):
| 基准 | V4-Flash-0731 | 对比 V4-Pro-Preview |
|---|---|---|
| Terminal-Bench 2.1(终端 agent) | 82.7 | 远超 |
| CyberGym(网络安全 PoC) | 76.7 | 远超 |
| Toolathlon Verified(工具调用) | 70.3 | 远超 |
| DSBench-FullStack(内部全栈开发) | 68.7 | 41.8 |
| DSBench-Hard(内部编码难题) | 59.6 | 31.1 |
| DeepSWE(原创长程工程) | 54.4 | 远超 |
| NL2Repo(自然语言生成代码仓库) | 54.2 | 远超 |
| Agents’ Last Exam(真实专业软件操作) | 25.2 | 远超 |
| Automation Bench(跨应用工作流) | 25.1 | 远超 |
DSBench-FullStack / DSBench-Hard 是 DeepSeek 未公开的内部测试集(来自发布报道,非官方文档),分数与第三方评测不可比。
作为参考,V4 预览版发布时(4 月 24 日)官方给出的定性评价是:V4-Pro 的 Agent 能力为开源模型最佳、内部使用体验优于 Claude Sonnet 4.5、交付质量接近 Opus 4.6 非思考模式;V4-Flash 参数与激活更小、简单 Agent 任务与 Pro 旗鼓相当。
价格与规格
| 项目 | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| 输入(缓存命中) | ¥0.02 / M tokens | ¥0.025 / M tokens |
| 输入(缓存未命中) | ¥1 / M tokens | ¥3 / M tokens |
| 输出 | ¥2 / M tokens | ¥6 / M tokens |
| 上下文 | 1M | 1M |
| 最大输出 | 384K | 384K |
| 并发上限 | 2500 | 500 |
(价格单位均为每百万 token;官方已预告后续将引入北京时区 9:00–12:00、14:00–18:00 高峰时段 2 倍计费。)
作为参考,上一代 DeepSeek-V3.2 的价格是输入 ¥2 / 输出 ¥8 每百万 token——V4 Flash 的 1 元/2 元相当于输入降价一半、输出降价 75%,而且上下文从 128K 级直接拉到 1M,这个性价比在当前市场非常能打。
海外主流模型一览
OpenAI GPT-5.6 家族(2026-07-09 GA)
GPT-5.6 分三档:Sol(旗舰)、Terra(均衡)、Luna(最快最便宜)。官方定位是「按 token 产出更多有效工作」,主打性能/价格比。7 月 30 日刚对 Terra/Luna 降过价。官方已不公布 AIME(GPT-5.2 时代已 100% 饱和)和 MMLU-Pro,也不发 Arena Elo。
| 基准 | Sol | Terra | Luna | GPT-5.5(对比) |
|---|---|---|---|---|
| GPQA Diamond | 94.6% | 92.9% | 92.3% | 93.6% |
| Agents’ Last Exam | 52.7%(max 推理 53.6) | 50.4% | 50.3% | 46.9% |
| Terminal-Bench 2.1 | 88.8%(ultra 91.9%) | 87.4% | 84.7% | 85.6% |
| SWE-Bench Pro | 64.6% | 63.4% | 62.7% | 59.4% |
| BrowseComp | 90.4% | 87.5% | 83.3% | 84.4% |
| FrontierMath T1-3 (v2) | 89.0% | 84.9% | 78.6% | 85.3% |
| OSWorld 2.0 | 62.6% | 50.2% | 45.6% | 47.5% |
| ARC-AGI-3 | 7.78% | 0.8% | 0.18% | 0.43% |
| 模型 | 输入 | 输出 | 缓存读取 | 上下文 |
|---|---|---|---|---|
| gpt-5.6 (Sol) | $5.00 | $30.00 | $0.50 | 1.05M / 128K |
| gpt-5.6-terra | $2.00 | $12.00 | $0.20 | 1.05M / 128K |
| gpt-5.6-luna | $0.20 | $1.20 | $0.02 | 1.05M / 128K |
特性:推理强度支持到 max,还有 ultra 模式(默认协调 4 个并行 agent 分工);新增 Programmatic Tool Calling(模型在内存中写小程序来协调工具调用);Responses API 支持单请求内多 agent 并发。
Anthropic Claude 5 家族
Anthropic 的 5 代家族当前在售四个模型。注意:官方从这一代起不再公布 MMLU-Pro / AIME 这类旧头条数字,改用 Frontier-Bench、GDPval-AA、ARC-AGI-3 等新评测。另外 2026 年起多了个 Mythos 能力层(高于 Opus),Fable 5 是公开版 Mythos 级模型。
| 模型 | 发布 | 输入/输出($/M) | 上下文 | 关键官方基准 |
|---|---|---|---|---|
| Fable 5 | 06-09 | $10 / $50 | 1M / 128K | SWE-bench Verified 95.0%、SWE-bench Pro 80.3%、GPQA 94.1%、HLE 59%(无工具)、GDPval-AA Elo 1932 |
| Opus 5 | 07-24 | $5 / $25 | 1M / 128K | Frontier-Bench v0.1 43.3%(Fable 5 33.7%)、GDPval-AA v2 Elo 1861(新 SOTA)、ARC-AGI-3 30.2%(约为次强模型 3 倍)、OSWorld 2.0 70.6% |
| Sonnet 5 | 06-30 | 推广期 $2 / $10(9/1 起 $3/$15) | 1M / 128K | SWE-bench Verified 72.7%、Terminal-Bench 2.1 80.4%、GPQA 78.0%、USAMO 2026 79.5% |
| Haiku 4.5 | 2025-10 | $1 / $5 | 200K / 64K | SWE-bench Verified 73.3%、Terminal-Bench 40.2% |
值得注意的反差:Opus 5 的 SWE-bench Verified 官方未公布(第三方称 96%,未证实),而主打性价比的 Sonnet 5 在 Terminal-Bench 2.1 上拿到 80.4%——在部分 agent 场景下,中间档与旗舰的差距已经很小。Arena 方面:Fable 5 长期占据文本榜 #1(约 1509 Elo)与 Coding 榜 #1(1564),Opus 5 发布后登顶 WebDev 榜(1725)。
Google Gemini 3.6 / 3.5 Flash
Google 的情况比较特别:旗舰 Gemini 3.5 Pro 至今跳票未发布(原计划 6 月,传多次未达性能目标),而 Flash 档位已经迭代到 3.6。官方口径同样聚焦 agentic/coding 基准,未发布 MMLU-Pro、GPQA、AIME 等传统分数。
| 模型 | 发布 | 输入/输出($/M) | 上下文 | 关键官方基准 |
|---|---|---|---|---|
| Gemini 3.6 Flash | 07-21 | $1.50 / $7.50 | 1M / 64K | Terminal-Bench 2.1 78.0%、SWE-Bench Pro 58.7%、DeepSWE 49%、MLE-Bench 63.9%、OSWorld-Verified 83.0%、HLE 38% |
| Gemini 3.5 Flash | 05-20(I/O 2026) | $1.50 / $9.00 | 1M / 64K | Terminal-Bench 2.1 76.2%、SWE-Bench Pro 55.1%、ARC-AGI-2 72.1%、HLE 40.2% |
| 3.5 Flash-Lite | 07-21 | $0.30 / $2.50 | 1M / 64K | Terminal-Bench 2.1 54.0%、SWE-Bench Pro 54.2%(全面超越 3.1 Flash-Lite) |
3.6 Flash 主打 token 效率(输出 token 较 3.5 Flash 省 17%,长任务最高省 65%),单任务耗时减半,输出速度约 304 tokens/s;Computer Use 已成为 API 内建工具。另有一个网络安全特化的 3.5 Flash Cyber(政府/受信合作伙伴试点,无公开定价)。Gemini 4 官方确认已开始预训练。
国内主流模型一览
国内 5 家的最新旗舰(2026 年 7 月 31 日时间点):
| 模型 | 发布 | 输入/输出(¥/M) | 缓存 | 上下文 | 关键官方基准 |
|---|---|---|---|---|---|
| Qwen3.7-Max | 05-20 | ¥12 / ¥36(限时 5 折 ¥6/¥18) | — | 1M | GPQA 92.2、SWE-Pro 60.4、Terminal-Bench 2.0 72.3、NL2Repo 47.3;AA 综合指数 56.6(国产第一) |
| GLM-5.2 | 06-17(开源 MIT) | ¥8 / ¥28 | ¥2 | 1M / 128K | AIME 2026 99.2(该基准全球第一)、GPQA 91.2、HLE 54.7、SWE-Pro 62.1、Terminal-Bench 2.1 81.0 |
| Kimi K3 | 07-16(开源权重) | ¥20 / ¥100 | ¥2 | 1M | WebDev Arena 1678(全球第一,超 Fable 5 的 1634)、GPQA 93.5、HLE 56.0、MMLU-Pro 81.6、BrowseComp 91.2、FrontierSWE 81.2 |
| MiniMax M3 | 06-01(开源) | ¥2.1 / ¥8.4(≤512K) | ¥0.42 | 1M | SWE-Pro 59.0(超 GPT-5.5 的 58.6)、BrowseComp 83.5、MMLU-Pro 79.85 |
| Doubao-Seed-2.1 Pro | 06-23 | ¥6 / ¥30 | ¥1.2 | 256K | Terminal-Bench 2.1 71.0、SWE-Pro 57.5、MMMU-Pro 81.6(超 Opus 4.6 的 81.2)、GDPVal 87.9 |
各家亮点速记:
- Qwen3.7-Max:Agent 时代旗舰,三个月内从 3.5 迭代到 3.7;Arena 盲测总榜国产第一。官方未公布 MMLU-Pro 具体值。
- GLM-5.2:MIT 开源 + AIME 2026 99.2 分全球第一(超 GPT-5.5 的 98.3);IndexShare 稀疏注意力让百万上下文的每 token 计算量降 2.9 倍;单轮处理 88 万+ token 完整交付软件。
- Kimi K3:当前热度最高——总参数 2.8T / 激活 104B,首个接近 3 万亿参数的开放权重模型;WebDev Arena 1678 全球登顶(首个登顶的开源模型)。代价是价格也登顶:输出 ¥100/M 是国产最贵,但官方称比 GPT-5.6 Sol、Opus 4.8 仍低 40–50%。
- MiniMax M3:多模态稀疏 MoE(428B/23B),价格是国产旗舰里最便宜的(¥2.1/¥8.4);24 小时自主完成 CUDA 内核优化(9.4 倍加速)。
- 豆包 2.1 Pro:Coding & Agent 旗舰,面向 500+ 智能体协同场景;综合成本较 Claude Opus 4.6 降近 80%。上下文只有 256K,是这些旗舰里最短的。
直观对比图
下面四张图把四个有交叉数据的基准单独拎出来对比(柱子按分数降序排列,数值标注在柱顶)。注意:各厂商评测框架和口径不同,跨厂商比较只能看量级;每个模型的具体数据与来源见下方表格。
GPQA Diamond(研究生级科学问答,越高越好)
Terminal-Bench 2.1(真实终端环境 Agent 编码,越高越好)
SWE-bench Pro(真实软件工程任务,越高越好)
HLE 人类最后一考(无工具,越高越好)
能力横向对比总表
各厂商公布的口径差异很大(OpenAI 不报 Elo 和 AIME、Anthropic/Google 不报 GPQA 以外的旧基准、国内各家报的维度也不同),所以下表只汇总有交叉数据的维度,「—」表示官方未公布:
| 模型 | GPQA Diamond | HLE | Terminal-Bench 2.1 | SWE-bench Pro | BrowseComp | Arena(权威榜) |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol | 94.6 | — | 88.8(ultra 91.9) | 64.6 | 90.4 | — |
| Claude Fable 5 | 94.1 | 59.0 | 84.3* | 80.3 | — | 文本 #1 ~1509 / Coding #1 1564 |
| Claude Opus 5 | — | — | — | 79.2* | — | WebDev #1 1725 |
| Claude Sonnet 5 | 78.0 | — | 80.4 | 63.2* | — | Coding #16 1522 |
| Gemini 3.6 Flash | — | 38.0 | 78.0 | 58.7 | — | — |
| DeepSeek V4 Flash | — | — | 82.7 | — | — | — |
| Qwen3.7-Max | 92.2 | — | 72.3(TB 2.0) | 60.4 | — | 盲测国产第一 |
| GLM-5.2 | 91.2 | 54.7 | 81.0 | 62.1 | — | — |
| Kimi K3 | 93.5 | 56.0 | — | — | 91.2 | WebDev #1 1678 |
| MiniMax M3 | 77.8* | — | — | 59.0 | 83.5 | — |
| Doubao 2.1 Pro | — | — | 71.0 | 57.5 | — | — |
带 * 的为第三方评测(benchlm、Artificial Analysis 等),其余为官方数据。注意 Terminal-Bench 分数对评测 harness 极其敏感,不同机构测出的分数相差可达 5 分以上,跨厂商比较只能看量级。
几个值得注意的结论:
- 知识推理(GPQA)已经「共同富裕」:GPT-5.6 Sol、Fable 5、Kimi K3、Qwen3.7、GLM-5.2 全部在 91–95 区间,这个基准已接近饱和,很难再拉开差距。
- Agent 编码是当前的主战场:Terminal-Bench 2.1 上 GPT-5.6 Sol(88.8)一骑绝尘,DeepSeek V4 Flash(82.7)直接打到第三档的位置,和 GLM-5.2(81.0)、Sonnet 5(80.4)非常接近——国产模型在 agent 编码上与海外旗舰的差距已经很小。
- 最难的基准上分数依旧惨淡:ARC-AGI-3 最强只有 7.78%(GPT-5.6 Sol),Agents’ Last Exam 的 Last-Exam 档所有前沿模型通过率 0%——离「通用智能」还有很长的路。
价格横向对比总表
美元模型按 1 美元 ≈ 7.1 元人民币换算作参考(汇率约数):
| 模型 | 输入 | 输出 | 折算人民币(输入/输出) |
|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | ≈ ¥35.5 / ¥213 |
| GPT-5.6 Terra | $2.00 | $12.00 | ≈ ¥14.2 / ¥85 |
| GPT-5.6 Luna | $0.20 | $1.20 | ≈ ¥1.4 / ¥8.5 |
| Claude Fable 5 | $10.00 | $50.00 | ≈ ¥71 / ¥355 |
| Claude Opus 5 | $5.00 | $25.00 | ≈ ¥35.5 / ¥177.5 |
| Claude Sonnet 5(推广期) | $2.00 | $10.00 | ≈ ¥14.2 / ¥71 |
| Claude Haiku 4.5 | $1.00 | $5.00 | ≈ ¥7.1 / ¥35.5 |
| Gemini 3.6 Flash | $1.50 | $7.50 | ≈ ¥10.7 / ¥53.3 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | ≈ ¥2.1 / ¥17.8 |
| DeepSeek V4 Flash | ¥1 | ¥2 | — |
| DeepSeek V4 Pro | ¥3 | ¥6 | — |
| Qwen3.7-Max | ¥12(5 折 ¥6) | ¥36(5 折 ¥18) | — |
| GLM-5.2 | ¥8 | ¥28 | — |
| Kimi K3 | ¥20 | ¥100 | — |
| MiniMax M3 | ¥2.1 | ¥8.4 | — |
| Doubao 2.1 Pro | ¥6 | ¥30 | — |
价格视角的结论:
- 最便宜的旗舰级推理能力:GPT-5.6 Luna 输入只要 $0.20/M(≈¥1.4),与 DeepSeek V4 Flash 的 ¥1/M 处于同一量级——「便宜又强」不再是国内模型专利。
- DeepSeek V4 Flash 的性价比在 1M 上下文档位里没有对手:¥1/¥2 的同时给 1M 上下文 + 384K 输出 + 缓存命中 0.02 元,同档位 Gemini 3.6 Flash 也要 $1.50/$7.50(约 ¥10.7/¥53.3)。
- Kimi K3 是国产「爱马仕」:输出 ¥100/M,几乎是 V4 Flash 的 50 倍;但 WebDev Arena 全球第一的成绩确实独一档,适合高价值 agent 任务。
- 各家的 Batch 通常半价、缓存命中约 0.1 折,实际跑 agent 工作流时成本远低于刊例价(Kimi 官方称编程场景缓存命中率超 90%)。
这些基准测试到底是什么
传统「问答式」基准
- MMLU / MMLU-Pro:多任务语言理解,覆盖几十个学科的选择题,Pro 版难度更高且含推理题。曾是模型能力的「起跑线」,2025 年后前沿模型普遍 85–90+,已经接近饱和,主流厂商大多不再公布。
- GPQA Diamond:谷歌 DeepMind 出的研究生级科学问答(物理/化学/生物),专家做也只有 74% 左右。2026 年 7 月头部模型普遍 91–95%,是知识推理维度仍有区分度的主流基准。
- AIME(美国数学邀请赛):竞赛数学。GPT-5.2 已拿到 100%(饱和),GLM-5.2 在 AIME 2026 拿到 99.2 分全球第一。数学类目前更能拉开差距的是 FrontierMath(前沿数学,GPT-5.6 Sol 89%)和 USAMO/IMO。
- Humanity’s Last Exam(HLE):「人类最后一考」,2500 道专家级题、100+ 学科,2026 年 1 月发表于 Nature。2026 年 3 月榜首才 46%,7 月已有 14 个模型超过 50%(带工具最高 64.5%),是目前最「未饱和」的主要知识基准。官方已推出动态更新的 HLE-Rolling 防针对性刷题。
- LiveCodeBench / HumanEval:代码生成(写函数/算法题)。HumanEval 早已饱和,LiveCodeBench v6 也进入收尾阶段。
- Chatbot Arena(现 arena.ai):真人盲测投票的 Elo 排行榜,分通用/代码/网页开发(WebDev)等子榜。这是「真实用户口碑」维度,厂商自己不能刷——目前文本榜第一是 Claude Fable 5,WebDev 榜第一是 Kimi K3(1678 Elo,首个登顶的开源模型)。
Agent 时代的新基准(V4 Flash 成绩单上的)
这批基准的共同叙事是:从「静态问答」转向「真实环境、多轮执行、程序化验证」——agent 要真正操作终端/软件/API,最终结果由确定性检查判定,前沿模型普遍得分不高、且分数对评测框架(harness)极其敏感。
- Terminal-Bench 2.1(2026-05 发布,Stanford × Laude Institute 等):89 个任务,每个任务一个独立 Docker 终端环境(软件工程、系统管理、ML 训练、安全等),agent 与真实 shell 多轮交互后提交结果,二元 pass@1 判定。2.1 修复了 2.0 的 26–28 个失效任务。当前头部:GPT-5.6 Sol Ultra 91.9%、DeepSeek V4 Flash 82.7%。
- NL2Repo-Bench(字节 Seed 等,2025-12):自然语言 → 完整代码仓库。agent 从空工作区出发,只给一份需求文档,自主设计架构、管理依赖、产出可安装可运行的 Python 库,用上游测试套件验证。最强模型整体通过率不到 40%——长程工程能力还远没到天花板。
- CyberGym(UC Berkeley,2025-06):网络安全 agent 基准。1507 个真实漏洞实例(来自 OSS-Fuzz,覆盖 OpenCV、FFmpeg、curl、OpenSSL 等 188 个真实项目),agent 需写出可复现漏洞的 PoC(修复前版本崩溃、修复后不崩溃)。最强组合成功率仅 ~22%——顺便说,评测过程中 agent 还发现了 35 个 0day。
- DeepSWE(DataCurve AI,2026-07):113 个原创长程软件工程任务(91 个活跃开源仓库、5 种语言),任务从零手写、从不回馈上游,规避「模型见过修复」的召回问题;用手写 verifier 而非继承测试套件评分。注意与 2025 年 UC Berkeley 的「DeepSWE 模型」(Qwen3-32B 编码模型)同名不同物。
- Toolathlon(HKUST,ICLR 2026;Verified 版 2026-06):工具调用十项全能。108 个任务横跨 32 个应用/604 个工具(MCP server 封装:Notion、Gmail、Kubernetes、BigQuery……),平均每任务 20–27 轮调用,Docker 环境 + 确定性脚本检查最终状态。Verified 榜(2026-07):Kimi K3 76.5%、Opus 4.8 76.2%、DeepSeek V4 Flash 70.3%。
- Agents’ Last Exam(ALE,UC Berkeley RDI,2026-06):agent 版「最后一考」。1490 个有经济价值的真实专业工作流(Siemens NX 三维建模、Unreal Engine 布景、After Effects 合成……),agent 以「通用计算机使用」形式在虚拟机里同时用 shell 和 GUI 点击操作真实软件。确定性代码评分(LLM 裁判仅占 6.8%)。现状:最强通过率 24% 左右,最难的 Last-Exam 档所有前沿模型通过率 0%。
- Automation Bench(2026-04):跨应用工作流编排,任务取材于 Zapier 真实工作流(CRM、日历、消息平台多系统协同),只看最终系统状态的程序化评分。原始版最强模型不到 10%;Artificial Analysis 的独立版(AutomationBench-AA)分数更高:Grok 4.5 51.4%、GPT-5.6 Sol 51.2%、Claude Fable 5 48.6%。
- DSBench(命名陷阱):公开的 DSBench(ICLR 2025)是腾讯等出的数据科学 agent 基准(Kaggle 数据分析任务);而 DeepSeek 成绩单里的 DSBench-FullStack / Hard 是 DeepSeek 内部测试集(未公开),两者无关,分数不可比。
读基准的三个心法
- 看口径,不看数字:同样的 Terminal-Bench 2.1,不同机构(官方/AA/第三方的 harness 配置)测出来能差 5 分以上;「DeepSeek 内部测试集」「benchlm 第三方复测」和「官方基准」永远不能放进同一张表里比较。
- 看趋势,不看单点:2024 年卷 MMLU,2025 年卷 AIME/SWE-bench,2026 年卷 Terminal-Bench/ALE——基准在跟着模型的强项走,模型的强项在跟着真实工作走。当一个基准 90% 以上的模型都考到 90+,它就退役了。
- 价格要算「有效产出」:1M 上下文、缓存命中 0.1 折、Batch 半价——agent 工作流的真实成本往往只有刊例价的十分之一,比单看输入/输出单价更接近真相。
总结
2026 年 7 月的模型市场,几个清晰的变化:
- Agent 化彻底成为主线:各家旗舰的评测重心、优化方向、API 特性(Responses API、multi-agent、computer use)全部围绕 agent 展开;「能干活」比「会答题」重要得多。
- 性价比战打到国产家门口:GPT-5.6 Luna $0.20/$1.20、DeepSeek V4 Flash ¥1/¥2 + 1M 上下文,模型调用已经接近「随便用」的价格;卷的方向变成了谁在长任务里更省 token、更少犯错。
- 国内梯队形成:GLM-5.2(开源 + 数学第一)、Kimi K3(WebDev 登顶 + 2.8T 开源权重)、Qwen3.7-Max(综合国产第一)、DeepSeek V4 Flash(极致性价比),各占一个生态位;MiniMax M3 和豆包 2.1 Pro 则在多模态/垂直场景发力。
如果你的需求是:写代码/跑 agent → GPT-5.6 Sol / Claude Fable 5 是天花板,DeepSeek V4 Flash / GLM-5.2 是国产最优解;做网页 → Kimi K3 或 Claude Opus 5;大批量低成本任务 → GPT-5.6 Luna / Gemini 3.5 Flash-Lite / DeepSeek V4 Flash;数学 → GLM-5.2。
(文中数据整理于 2026-07-31,来源:DeepSeek API 文档与定价页、OpenAI 官方博客与定价页、Anthropic 官方文档、Google 官方博客与 Model Card、各国内厂商官方发布页与定价页、Artificial Analysis、arena.ai 等;第三方数据均已标注。)
