DeepSeek V4 Pro正式版突袭上线!自测性能逼近Claude Fable 5 输出价格不到其2%
A
Alice

2026-08-13 · 37 [[ $t('article.detail.read') ]]

DeepSeek V4 Pro正式版突袭上线!自测性能逼近Claude Fable 5  输出价格不到其2%

北京时间 8 月 12 日深夜,DeepSeek 毫无预告地上线了 V4 Pro 正式版,版本号为 DeepSeek-V4-Pro-0813。

公司没有发布公众号文章,没有技术博客,也没有发出一条推文。唯一的迹象是官网 API 定价页面上的一行字变了——「deepseek-v4-pro」后面的版本号,从预览版换成了正式版号。

这款旗舰模型自 2026 年 4 月起以预览版身份运行,至此正式转正。


模型规格

DeepSeek V4 Pro 采用混合专家(MoE)架构,总参数量 1.6 万亿,每处理一个 token 激活 490 亿参数,上下文窗口 100 万 token,最大输出长度 38.4 万 token。这套规格在 4 月的预览版阶段就已公开,正式版没有改动。

此前所有第三方测试跑的都是预览版。该预览版在 Hugging Face 上的下载量已超过 140 万次。


价格:输出每百万 token 0.87 美元

DeepSeek 官网定价页显示,正式版的价格与此前的非高峰时段价格一致,也就是 2026 年 5 月永久降价至原价四分之一后的标准价:

  • 输入:每百万 token 0.435 美元
  • 输出:每百万 token 0.87 美元
  • 缓存命中输入:每百万 token 0.003625 美元

Anthropic 官网列出的 Claude Fable 5 价格为每百万输入 10 美元、输出 50 美元。两者相差近两个数量级:DeepSeek V4 Pro 的输出价格约为 Fable 5 的 1.7%,输入价格约为 4.4%。

按完成单个任务的成本计算,差距在部分场景中更大。独立评测机构 Artificial Analysis 在 8 月 3 日公布的测量显示,跑完其 Intelligence Index 测试套件,Claude Fable 5 花费 3.15 美元,DeepSeek V4 Flash 只需约 3 美分,相差约 100 倍。

需要说明的是,这组数据对比的是 Fable 5 与 V4 Flash,而不是本次上线的 Pro 版本。Artificial Analysis 尚未公布 Pro 正式版的对应数据。


成本压缩来自架构

DeepSeek 把价格优势归因于架构设计。V4 Pro 使用了两种注意力变体:压缩稀疏注意力,以及重度压缩注意力。

按照公司的说法,这套架构把单 token 的推理计算量降至 V3.2 代的 27%,KV 缓存降至原来的 10%。对于 100 万 token 的上下文窗口来说,这两项优化节省的成本相当可观——推理效率提高,定价空间也就出来了。

这两项指标目前只有公司自述,没有第三方做过独立验证。


基准测试:数据来自 DeepSeek 自测

DeepSeek 公布了自行开展的基准测试,在 10 项智能体评测上与 Claude Fable 5 对比。剔除差距最大的 Humanity's Last Exam(V4 Pro 落后 10.6 个百分点)后,其余 9 项中 V4 Pro 平均落后 2.8%,其中 2 项领先。

这组数据有三处限制:测试由 DeepSeek 自行执行,使用的评测框架尚未对外开放,涉及的两个内部测试集也没有公开榜单可以核对。

多家第三方评测机构正在排队测试 DeepSeek-V4-Pro-0813。在结果公布之前,这款模型的真实表现无法独立验证。


API:三种推理模式,兼容两家生态

V4 Pro 在 API 中开放了普通、高推理、最高推理三种模式,其中最高模式会推高模型的推理能力边界。

API 同时支持 OpenAI 和 Anthropic 两种格式的接口,此前在这两个生态里做开发的团队无需改动代码就能切换过来,工具调用、结构化 JSON 输出等能力一并支持。

正式版上线后,V4 系列的分工变得清晰:Flash 承接高频、高并发的流量,主打价格;Pro 把算力集中在复杂推理、长上下文编码和智能体任务上。国内不少做 AI 开发的公司已经在搭配使用这两个版本。


定价页挂出「显著的价格调整」

DeepSeek 的定价页面上还有一行提示:近期将有一次「显著的价格调整」。

公司没有说明调整的方向、幅度和时间。当前这个价格窗口还能开多久,外界无从判断。


调用规模:OpenRouter 榜单上中国模型合计约 46%

聚合平台 OpenRouter 2026 年 7 月的调用数据显示,中国实验室的模型合计占据约 46% 的 token 调用份额,DeepSeek 位居前列;该平台前十名中,来自美国的只剩 Anthropic 一家。Vercel 的 AI Gateway 七月指数则显示,开放权重模型的调用量份额升至 29%。

这两组数据只覆盖各自平台的调用,不等于全球市场份额。调用量领先与收入领先也是两件事。

DeepSeek 迄今没有举办过大型媒体发布会,产品发布主要通过公众号官宣,有时附带一篇技术博客。这次连公众号都没发。


算力:约 2 万张 H100 等效

创始人梁文锋在 2026 年 7 月的一次投资人交流会上提到,DeepSeek 当时拥有约 2 万张 H100 等效算力。这个数字与海外头部大厂动辄数十万乃至上百万卡的集群相比,确实不在一个量级。此数字出自非公开场合的转述,公司没有发过正式公告。

梁文锋同时表示,这个数字处于动态变化中,公司一直在采购更多算力,打算「在合理价格内能买多少卡就买多少卡」。DeepSeek 还计划建设 GW 级别(相当于数十万张卡规模)的自建算力中心,此前为内蒙古数据中心招聘人员,被视为该计划推进的迹象。

此外,DeepSeek 与华为合作获得 16000 张昇腾 950 算力卡,用于软件生态验证与落地。已有第三方机构在昇腾 910C 集群上完成了 V4 Pro 的全参数后训练。


权重开放时间未定

DeepSeek 的模型权重仍采用 MIT 许可证,正式版权重何时放出尚未公布。参照 V4 Flash「API 先行、权重随后」的节奏,开放应该只是时间问题。

第三方评测机构的结果,将决定外界如何评价 DeepSeek 这一次的实际提升。


说明:本文中标注为 DeepSeek 自述的数据尚未经第三方验证;价格以各公司官网定价页为准;调用份额数据仅覆盖相应平台。本文不构成投资或采购建议。