DeepSeek V4 Flash 正式版深度评测:Agent 能力暴涨,价格仅为 GPT-5.6 的 1/5
2026 年 7 月 30 日,DeepSeek 正式发布了 V4-Flash 正式版 API。这是继 4 月份预览版之后的重大升级——模型结构和参数规模未变,但经过重新后训练后,Agent 能力大幅增强,多项基准测试成绩远超 V4-Pro-Preview,性价比再次刷新行业认知。
更值得关注的是,DeepSeek 同步宣布自研的 DeepSeek Harness 即将开源,这是一套专为 Coding Agent 任务设计的评测框架,标志着 DeepSeek 正式从 "模型发布" 迈向 "工具生态"。
一、核心参数一览
| 项目 | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|
| 总参数量 | 2840 亿(284B) | 1.6 万亿(1.6T) |
| 激活参数量 | 130 亿(13B) | 490 亿(49B) |
| 上下文窗口 | 100 万 tokens | 100 万 tokens |
| 最大输出 | 384K tokens | 384K tokens |
| 输入价格(缓存未命中) | $0.14 / 百万 tokens | $0.435 / 百万 tokens |
| 输入价格(缓存命中) | $0.0028 / 百万 tokens | $0.003625 / 百万 tokens |
| 输出价格 | $0.28 / 百万 tokens | $0.87 / 百万 tokens |
| 国内价格(输入 / 输出) | 1 元 / 2 元(百万 tokens) | 约 3.1 元 / 6.3 元(百万 tokens) |
| 开源协议 | MIT | MIT |
| 推理模式 | 思考 / 非思考 | 思考 / 非思考 |
Flash 版本的定位非常明确:用极低的价格提供接近前沿模型的能力。每百万输出 token 仅需 $0.28(约 2 元人民币),即便 GPT-5.6 Luna 此前降价 80%,单价仍然高于 DeepSeek V4 Flash。
二、正式版 vs 预览版:升级了什么?
正式版的核心变化不是模型架构,而是 后训练(Post-Training)的质量提升:
- Agent 能力大幅增强:在 Coding Agent 任务中表现远超 V4-Pro-Preview,逼近 Claude Opus 4.8 水平
- 原生支持 Responses API:无需额外中转工具,一行命令即可完成 Codex 配置
- Codex 优化适配:针对 OpenAI Codex 进行了专项优化,开箱即用
- 自研 Harness 即将开源:DeepSeek 自研的 Coding Agent 评测框架,可实现训推一致
知乎答主「小小将」评价:正式版的表现已经超过 GLM-5.2,并进一步逼近 Claude Opus 4.8。你们真的错怪梁圣了。(以后求大家多给 DeepSeek 一点耐心)
三、基准测试成绩
3.1 学术基准
| 基准测试 | DeepSeek V3.2 | V4 Flash(Base) | V4 Pro(Base) |
|---|---|---|---|
| MMLU(EM) | 87.8 | 88.7 | 90.1 |
| MMLU-Pro(EM) | 65.5 | 68.3 | 73.5 |
| GSM8K(8-shot) | 91.1 | 90.8 | 92.6 |
| HumanEval(Pass@1) | 62.8 | 69.5 | 76.8 |
3.2 编程与 Agent 能力
| 基准测试 | DeepSeek V4 Flash | DeepSeek V4 Pro | 说明 |
|---|---|---|---|
| SWE-bench Verified | 79.0% | 80.6% | 真实软件工程任务 |
| Codeforces Rating | — | 3206 | 竞技编程评分 |
| Terminal-Bench 2 | — | 接近 GPT-5.4 水平 | 终端操作能力 |
| 长上下文检索(MRCR 1M) | — | 83.5 | 百万 token 检索准确率 |
3.3 Vals AI 评测亮点
评测平台 Vals AI 的结果尤为亮眼:
- DeepSeek V4 在其 Vibe Code Benchmark 中以 "压倒性优势" 成为开源权重模型第一
- 不仅超越第二名 Kimi K2.6,更击败了 Gemini 3.1 Pro 等闭源前沿模型
- V4 较上一代 V3.2 实现了约 10 倍性能跃升——"V3.2 在该基准上仅得 5 分,这不是笔误"
- 在 Vals 综合指数排名中,V4 以第 2 位收官,与榜首 Kimi K2.6 仅相差 0.07%
四、定价对比:碾压级性价比
| 模型 | 输入($/ 百万 tokens) | 输出($/ 百万 tokens) | 相对 Opus 4.6 价格 |
|---|---|---|---|
| DeepSeek V4 Flash | $0.14 | $0.28 | 约 1/90 |
| DeepSeek V4 Pro | $0.435 | $0.87 | 约 1/29 |
| GPT-5.6 Luna | $0.50 | $1.50 | 约 1/17 |
| GPT-5.4 | $2.50 | $15.00 | — |
| Gemini 3.1 Pro | $2.00 | $12.00 | — |
| Claude Opus 4.6 | $5.00 | $25.00 | 基准 |
用户 Ejaaz 在 X 上写道:"中国正在主导 AI,他们已经追上来了。DeepSeek V4 Flash 比 Opus 4.7 便宜 99%,每百万 token 仅需 0.28 美元,代码竞技场排名第一,这不是笔误。"
五、Codex 集成:终于支持了
正式版 V4 Flash 的一大亮点是 原生支持 Responses API,这意味着它可以直接在 Codex 中使用,无需额外的中转工具。配置过程非常简单:
设置环境变量后,一行命令即可完成 Codex 配置。这解决了预览版最大的痛点——此前用户需要通过第三方代理才能让 Codex 调用 DeepSeek 模型。
不过根据实测反馈,Flash 与 Codex 的适配仍存在一些磨合问题:
- 长代码生成耗时较长,单次任务可能需要 20-30 分钟
- 运行过程中偶尔出现断开重连的情况
- 重连后会额外触发代码自检流程,增加等待时间
- 3D 赛车等复杂项目成品效果优秀,但桌面系统等应用存在控件排版问题
六、Pro vs Flash:如何选择?
| 维度 | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|
| 定位 | 效率优先,高吞吐 | 推理优先,高准确 |
| 适合场景 | 结构化任务、摘要、重写、对话 | 复杂推理、调试、分析、Agent |
| 速度 | ⚡ 更快 | 🐢 较慢(深度推理) |
| 成本 | 💰 极低 | 💰💰 低 |
| 编码能力 | 强(性价比之王) | 更强(接近前沿) |
| Agent 能力 | 良好 | 优秀 |
选择建议:
- 日常对话、文本处理、简单编程 → Flash(省钱又快)
- 复杂项目开发、Agent 工作流、多步推理 → Pro(更稳定可靠)
- 大批量处理、API 集成 → Flash(吞吐量高,成本可控)
七、社区评价
正面声音
- 知乎「太易君子」(1002 赞):上调梁文峰评级为梁圣。OpenAI 刚降价完,结果降价后的 GPT-5.6 Luna 价格还是比人贵性能也比人差。
- 知乎「努力成仙的凡人」(661 赞):我信任 DS 的原因,就是他每次发布评测结果都极尽全力写明白所有参数。真实数据是不怕被复现检验的。
- X 用户 Sigrid Jin:GPT-5.5 对不起,DeepSeek V4 才是新的震撼时刻,它在代码竞技场中击败了 GPT-5.4 高强度模式。
中性 / 负面声音
- X 用户 Michael Anti:V4 Flash 的实际体验未能超越此前已相当成熟的 V3.2,对老用户而言升级体验令人失望。
- 部分开发者反馈:长代码生成耗时严重,Codex 集成存在磨合问题,前端界面输出风格偏旧。
- deepseek.ai 评测:V4 在公开编程排行榜上目前排在 GLM 5.1 和 Kimi K2.6 之后,感觉有些 "Benchmark Maxed"——标准测试强,实际使用不够稳定。
八、总结与展望
DeepSeek V4 Flash 正式版的核心价值可以用三个关键词概括:
- 极致性价比 — 输出 $0.28/ 百万 tokens,是同级别模型中价格最低的,没有之一
- Agent 能力飞跃 — 正式版后训练让 Agent 任务表现大幅提升,逼近 Claude Opus 4.8
- 生态开放 — MIT 协议 + 自研 Harness 即将开源 + 原生 Codex 支持
当然,它并非完美。在编程排行榜上仍落后于 GLM 5.1 和 Kimi K2.6,长代码生成效率有待优化,Codex 集成还需打磨。但考虑到价格只有竞品的 1/5 到 1/90,这些短板在很多场景下完全可以接受。
更重要的是,DeepSeek V4 Pro 正式版也即将发布。如果 Pro 版本能在 Agent 和编程能力上再上一个台阶,DeepSeek 很有可能在开源模型赛道上彻底拉开与对手的距离。
一句话总结:DeepSeek V4 Flash 正式版是一次 "加量不加价" 的诚意升级,它不一定是最强的,但它一定是最值的。
相关链接:
- DeepSeek 官网:https://www.deepseek.com
- API 文档:https://api.deepseek.com
- HuggingFace 开源:https://huggingface.co/deepseek-ai
- DeepSeek V4 Flash 在线体验:https://chat.deepseek.com
本文基于 DeepSeek 官方数据、知乎社区讨论、Vals AI 评测及多家媒体报道整理而成。数据截至 2026 年 7 月 31 日。