DeepSeek V4 Flash 正式版深度评测:Agent 能力暴涨,价格仅为 GPT-5.6 的 1/5

11 次浏览次阅读

DeepSeek V4 Flash 正式版深度评测:Agent 能力暴涨,价格仅为 GPT-5.6 的 1/5

2026 年 7 月 30 日,DeepSeek 正式发布了 V4-Flash 正式版 API。这是继 4 月份预览版之后的重大升级——模型结构和参数规模未变,但经过重新后训练后,Agent 能力大幅增强,多项基准测试成绩远超 V4-Pro-Preview,性价比再次刷新行业认知。

更值得关注的是,DeepSeek 同步宣布自研的 DeepSeek Harness 即将开源,这是一套专为 Coding Agent 任务设计的评测框架,标志着 DeepSeek 正式从 "模型发布" 迈向 "工具生态"。


一、核心参数一览

项目 DeepSeek V4 Flash DeepSeek V4 Pro
总参数量 2840 亿(284B) 1.6 万亿(1.6T)
激活参数量 130 亿(13B) 490 亿(49B)
上下文窗口 100 万 tokens 100 万 tokens
最大输出 384K tokens 384K tokens
输入价格(缓存未命中) $0.14 / 百万 tokens $0.435 / 百万 tokens
输入价格(缓存命中) $0.0028 / 百万 tokens $0.003625 / 百万 tokens
输出价格 $0.28 / 百万 tokens $0.87 / 百万 tokens
国内价格(输入 / 输出) 1 元 / 2 元(百万 tokens) 约 3.1 元 / 6.3 元(百万 tokens)
开源协议 MIT MIT
推理模式 思考 / 非思考 思考 / 非思考

Flash 版本的定位非常明确:用极低的价格提供接近前沿模型的能力。每百万输出 token 仅需 $0.28(约 2 元人民币),即便 GPT-5.6 Luna 此前降价 80%,单价仍然高于 DeepSeek V4 Flash。


二、正式版 vs 预览版:升级了什么?

正式版的核心变化不是模型架构,而是 后训练(Post-Training)的质量提升:

  • Agent 能力大幅增强:在 Coding Agent 任务中表现远超 V4-Pro-Preview,逼近 Claude Opus 4.8 水平
  • 原生支持 Responses API:无需额外中转工具,一行命令即可完成 Codex 配置
  • Codex 优化适配:针对 OpenAI Codex 进行了专项优化,开箱即用
  • 自研 Harness 即将开源:DeepSeek 自研的 Coding Agent 评测框架,可实现训推一致

知乎答主「小小将」评价:正式版的表现已经超过 GLM-5.2,并进一步逼近 Claude Opus 4.8。你们真的错怪梁圣了。(以后求大家多给 DeepSeek 一点耐心)


三、基准测试成绩

3.1 学术基准

基准测试 DeepSeek V3.2 V4 Flash(Base) V4 Pro(Base)
MMLU(EM) 87.8 88.7 90.1
MMLU-Pro(EM) 65.5 68.3 73.5
GSM8K(8-shot) 91.1 90.8 92.6
HumanEval(Pass@1) 62.8 69.5 76.8

3.2 编程与 Agent 能力

基准测试 DeepSeek V4 Flash DeepSeek V4 Pro 说明
SWE-bench Verified 79.0% 80.6% 真实软件工程任务
Codeforces Rating 3206 竞技编程评分
Terminal-Bench 2 接近 GPT-5.4 水平 终端操作能力
长上下文检索(MRCR 1M) 83.5 百万 token 检索准确率

3.3 Vals AI 评测亮点

评测平台 Vals AI 的结果尤为亮眼:

  • DeepSeek V4 在其 Vibe Code Benchmark 中以 "压倒性优势" 成为开源权重模型第一
  • 不仅超越第二名 Kimi K2.6,更击败了 Gemini 3.1 Pro 等闭源前沿模型
  • V4 较上一代 V3.2 实现了约 10 倍性能跃升——"V3.2 在该基准上仅得 5 分,这不是笔误"
  • 在 Vals 综合指数排名中,V4 以第 2 位收官,与榜首 Kimi K2.6 仅相差 0.07%

四、定价对比:碾压级性价比

模型 输入($/ 百万 tokens) 输出($/ 百万 tokens) 相对 Opus 4.6 价格
DeepSeek V4 Flash $0.14 $0.28 约 1/90
DeepSeek V4 Pro $0.435 $0.87 约 1/29
GPT-5.6 Luna $0.50 $1.50 约 1/17
GPT-5.4 $2.50 $15.00
Gemini 3.1 Pro $2.00 $12.00
Claude Opus 4.6 $5.00 $25.00 基准

用户 Ejaaz 在 X 上写道:"中国正在主导 AI,他们已经追上来了。DeepSeek V4 Flash 比 Opus 4.7 便宜 99%,每百万 token 仅需 0.28 美元,代码竞技场排名第一,这不是笔误。"


五、Codex 集成:终于支持了

正式版 V4 Flash 的一大亮点是 原生支持 Responses API,这意味着它可以直接在 Codex 中使用,无需额外的中转工具。配置过程非常简单:

设置环境变量后,一行命令即可完成 Codex 配置。这解决了预览版最大的痛点——此前用户需要通过第三方代理才能让 Codex 调用 DeepSeek 模型。

不过根据实测反馈,Flash 与 Codex 的适配仍存在一些磨合问题:

  • 长代码生成耗时较长,单次任务可能需要 20-30 分钟
  • 运行过程中偶尔出现断开重连的情况
  • 重连后会额外触发代码自检流程,增加等待时间
  • 3D 赛车等复杂项目成品效果优秀,但桌面系统等应用存在控件排版问题

六、Pro vs Flash:如何选择?

维度 DeepSeek V4 Flash DeepSeek V4 Pro
定位 效率优先,高吞吐 推理优先,高准确
适合场景 结构化任务、摘要、重写、对话 复杂推理、调试、分析、Agent
速度 ⚡ 更快 🐢 较慢(深度推理)
成本 💰 极低 💰💰 低
编码能力 强(性价比之王) 更强(接近前沿)
Agent 能力 良好 优秀

选择建议:

  • 日常对话、文本处理、简单编程 → Flash(省钱又快)
  • 复杂项目开发、Agent 工作流、多步推理 → Pro(更稳定可靠)
  • 大批量处理、API 集成 → Flash(吞吐量高,成本可控)

七、社区评价

正面声音

  • 知乎「太易君子」(1002 赞):上调梁文峰评级为梁圣。OpenAI 刚降价完,结果降价后的 GPT-5.6 Luna 价格还是比人贵性能也比人差。
  • 知乎「努力成仙的凡人」(661 赞):我信任 DS 的原因,就是他每次发布评测结果都极尽全力写明白所有参数。真实数据是不怕被复现检验的。
  • X 用户 Sigrid Jin:GPT-5.5 对不起,DeepSeek V4 才是新的震撼时刻,它在代码竞技场中击败了 GPT-5.4 高强度模式。

中性 / 负面声音

  • X 用户 Michael Anti:V4 Flash 的实际体验未能超越此前已相当成熟的 V3.2,对老用户而言升级体验令人失望。
  • 部分开发者反馈:长代码生成耗时严重,Codex 集成存在磨合问题,前端界面输出风格偏旧。
  • deepseek.ai 评测:V4 在公开编程排行榜上目前排在 GLM 5.1 和 Kimi K2.6 之后,感觉有些 "Benchmark Maxed"——标准测试强,实际使用不够稳定。

八、总结与展望

DeepSeek V4 Flash 正式版的核心价值可以用三个关键词概括:

  1. 极致性价比 — 输出 $0.28/ 百万 tokens,是同级别模型中价格最低的,没有之一
  2. Agent 能力飞跃 — 正式版后训练让 Agent 任务表现大幅提升,逼近 Claude Opus 4.8
  3. 生态开放 — MIT 协议 + 自研 Harness 即将开源 + 原生 Codex 支持

当然,它并非完美。在编程排行榜上仍落后于 GLM 5.1 和 Kimi K2.6,长代码生成效率有待优化,Codex 集成还需打磨。但考虑到价格只有竞品的 1/5 到 1/90,这些短板在很多场景下完全可以接受。

更重要的是,DeepSeek V4 Pro 正式版也即将发布。如果 Pro 版本能在 Agent 和编程能力上再上一个台阶,DeepSeek 很有可能在开源模型赛道上彻底拉开与对手的距离。

一句话总结:DeepSeek V4 Flash 正式版是一次 "加量不加价" 的诚意升级,它不一定是最强的,但它一定是最值的。


相关链接:

  • DeepSeek 官网:https://www.deepseek.com
  • API 文档:https://api.deepseek.com
  • HuggingFace 开源:https://huggingface.co/deepseek-ai
  • DeepSeek V4 Flash 在线体验:https://chat.deepseek.com

本文基于 DeepSeek 官方数据、知乎社区讨论、Vals AI 评测及多家媒体报道整理而成。数据截至 2026 年 7 月 31 日。

正文完
 0
yxsoft
版权声明:本站原创文章,由 yxsoft 于2026-08-01发表,共计3415字。
转载说明:除特殊说明外本站文章皆由YXSoft发布,转载请注明出处。