北京时间 8 月 12 日深夜,DeepSeek 毫无预告地上线了 V4 Pro 正式版,版本号为 DeepSeek-V4-Pro-0813。
公司没有发布公众号文章,没有技术博客,也没有发出一条推文。唯一的迹象是官网 API 定价页面上的一行字变了——「deepseek-v4-pro」后面的版本号,从预览版换成了正式版号。
这款旗舰模型自 2026 年 4 月起以预览版身份运行,至此正式转正。
模型规格
DeepSeek V4 Pro 采用混合专家(MoE)架构,总参数量 1.6 万亿,每处理一个 token 激活 490 亿参数,上下文窗口 100 万 token,最大输出长度 38.4 万 token。这套规格在 4 月的预览版阶段就已公开,正式版没有改动。
此前所有第三方测试跑的都是预览版。该预览版在 Hugging Face 上的下载量已超过 140 万次。
价格:输出每百万 token 0.87 美元
DeepSeek 官网定价页显示,正式版的价格与此前的非高峰时段价格一致,也就是 2026 年 5 月永久降价至原价四分之一后的标准价:
- 输入:每百万 token 0.435 美元
- 输出:每百万 token 0.87 美元
- 缓存命中输入:每百万 token 0.003625 美元
Anthropic 官网列出的 Claude Fable 5 价格为每百万输入 10 美元、输出 50 美元。两者相差近两个数量级:DeepSeek V4 Pro 的输出价格约为 Fable 5 的 1.7%,输入价格约为 4.4%。
按完成单个任务的成本计算,差距在部分场景中更大。独立评测机构 Artificial Analysis 在 8 月 3 日公布的测量显示,跑完其 Intelligence Index 测试套件,Claude Fable 5 花费 3.15 美元,DeepSeek V4 Flash 只需约 3 美分,相差约 100 倍。
需要说明的是,这组数据对比的是 Fable 5 与 V4 Flash,而不是本次上线的 Pro 版本。Artificial Analysis 尚未公布 Pro 正式版的对应数据。
成本压缩来自架构
DeepSeek 把价格优势归因于架构设计。V4 Pro 使用了两种注意力变体:压缩稀疏注意力,以及重度压缩注意力。
按照公司的说法,这套架构把单 token 的推理计算量降至 V3.2 代的 27%,KV 缓存降至原来的 10%。对于 100 万 token 的上下文窗口来说,这两项优化节省的成本相当可观——推理效率提高,定价空间也就出来了。
这两项指标目前只有公司自述,没有第三方做过独立验证。
基准测试:数据来自 DeepSeek 自测
DeepSeek 公布了自行开展的基准测试,在 10 项智能体评测上与 Claude Fable 5 对比。剔除差距最大的 Humanity's Last Exam(V4 Pro 落后 10.6 个百分点)后,其余 9 项中 V4 Pro 平均落后 2.8%,其中 2 项领先。
这组数据有三处限制:测试由 DeepSeek 自行执行,使用的评测框架尚未对外开放,涉及的两个内部测试集也没有公开榜单可以核对。
多家第三方评测机构正在排队测试 DeepSeek-V4-Pro-0813。在结果公布之前,这款模型的真实表现无法独立验证。
API:三种推理模式,兼容两家生态
V4 Pro 在 API 中开放了普通、高推理、最高推理三种模式,其中最高模式会推高模型的推理能力边界。
API 同时支持 OpenAI 和 Anthropic 两种格式的接口,此前在这两个生态里做开发的团队无需改动代码就能切换过来,工具调用、结构化 JSON 输出等能力一并支持。
正式版上线后,V4 系列的分工变得清晰:Flash 承接高频、高并发的流量,主打价格;Pro 把算力集中在复杂推理、长上下文编码和智能体任务上。国内不少做 AI 开发的公司已经在搭配使用这两个版本。
定价页挂出「显著的价格调整」
DeepSeek 的定价页面上还有一行提示:近期将有一次「显著的价格调整」。
公司没有说明调整的方向、幅度和时间。当前这个价格窗口还能开多久,外界无从判断。
调用规模:OpenRouter 榜单上中国模型合计约 46%
聚合平台 OpenRouter 2026 年 7 月的调用数据显示,中国实验室的模型合计占据约 46% 的 token 调用份额,DeepSeek 位居前列;该平台前十名中,来自美国的只剩 Anthropic 一家。Vercel 的 AI Gateway 七月指数则显示,开放权重模型的调用量份额升至 29%。
这两组数据只覆盖各自平台的调用,不等于全球市场份额。调用量领先与收入领先也是两件事。
DeepSeek 迄今没有举办过大型媒体发布会,产品发布主要通过公众号官宣,有时附带一篇技术博客。这次连公众号都没发。
算力:约 2 万张 H100 等效
创始人梁文锋在 2026 年 7 月的一次投资人交流会上提到,DeepSeek 当时拥有约 2 万张 H100 等效算力。这个数字与海外头部大厂动辄数十万乃至上百万卡的集群相比,确实不在一个量级。此数字出自非公开场合的转述,公司没有发过正式公告。
梁文锋同时表示,这个数字处于动态变化中,公司一直在采购更多算力,打算「在合理价格内能买多少卡就买多少卡」。DeepSeek 还计划建设 GW 级别(相当于数十万张卡规模)的自建算力中心,此前为内蒙古数据中心招聘人员,被视为该计划推进的迹象。
此外,DeepSeek 与华为合作获得 16000 张昇腾 950 算力卡,用于软件生态验证与落地。已有第三方机构在昇腾 910C 集群上完成了 V4 Pro 的全参数后训练。
权重开放时间未定
DeepSeek 的模型权重仍采用 MIT 许可证,正式版权重何时放出尚未公布。参照 V4 Flash「API 先行、权重随后」的节奏,开放应该只是时间问题。
第三方评测机构的结果,将决定外界如何评价 DeepSeek 这一次的实际提升。
说明:本文中标注为 DeepSeek 自述的数据尚未经第三方验证;价格以各公司官网定价页为准;调用份额数据仅覆盖相应平台。本文不构成投资或采购建议。