官宣撤了!DeepSeek V4 Pro公告消失 DeepSeek Harness照常开源
A
Alice

2026-08-14 · 355 [[ $t('article.detail.read') ]]

官宣撤了!DeepSeek V4 Pro公告消失 DeepSeek Harness照常开源

DeepSeek V4 Pro 正式版上线不到一天,官网发布的信息悄然消失,与此同时,原本可能受到影响的 Harness 却仍按计划进入 Developer Preview。

8 月 12 日深夜,DeepSeek 悄然上线 V4 Pro 正式版,版本号为 DeepSeek-V4-Pro-0813。这次发布没有公众号推送,也没有技术博客,最早被外界注意到的信号,是官网 API 定价页上的版本号从预览版切换为正式版。不到 24 小时后,官网发布横幅和开放平台公告相继消失。DeepSeek 没有就此作出公开解释。

但就在 V4 Pro 发布信息消失之后,DeepSeek 此前准备的另一项产品仍按计划推进:DeepSeek Harness 进入 Developer Preview 并正式开源。一个发布动作突然收缩,一个 Agent 基础设施项目照常开放,这构成了过去 24 小时里最值得关注的反差。


这 24 小时内发生了什么

时间线并不复杂。8 月 12 日深夜,DeepSeek-V4-Pro-0813 正式上线;8 月 13 日白天,相关消息开始被中文科技媒体集中报道,官网和开放平台也出现对应的发布信息,第一批用户开始测试;到了 8 月 13 日晚些时候,官网发布横幅和开放平台公告相继消失。

需要特别指出的是,目前能够确认的是发布信息被撤下,而不是模型从产品体系中消失。API 相关页面仍可看到 V4 Pro,模型名称也仍然存在。因此,与其直接称之为「模型下架」,不如更准确地说,DeepSeek 暂时收回了 V4 Pro 正式发布的公开信号。

至于为什么撤回,目前官方没有解释。外界提出包含上错版本的各种猜测,但在官方进一步说明之前,任何具体原因都只能停留在推测层面。接下来真正值得观察的,是 DeepSeek 是否会重新发布、调整版本,或者对这次发布作出说明。


争议从哪里开始

V4 Pro 引发的争议,并不是模型「不能用」,而是官方展示的能力与部分用户实际体验之间出现了明显差距。

在正式版发布时,DeepSeek 公布了一组智能体基准测试,并将 V4 Pro 与 Claude Fable 5 等前沿模型进行比较。从官方数据来看,V4 Pro 在多项 Agent 任务上的表现已经接近甚至超过竞争模型。但随着第一批用户开始实际使用,反馈并没有完全复现这种领先。

集中出现的反馈是,V4 Pro 相较 Flash 版本的实际提升没有官方测试呈现得那么明显,尤其是在编程、工具调用以及长任务场景中,实际体验与基准测试之间存在一定距离。

这并不意味着官方测试必然存在问题。更值得讨论的是,官方测试与真实使用之间究竟隔着什么变量。对于 Agent 而言,这个变量可能并不只有模型本身。


V4 Pro 的高分测的是什么

先看 V4 Pro 本身。按照 DeepSeek 公布的信息,V4 Pro 采用混合专家架构,总参数量约 1.6 万亿,每个 token 激活约 490 亿参数,上下文窗口达到 100 万 token,最大输出长度达到 38.4 万 token。价格方面,V4 Pro 继续保持 DeepSeek 较低的 API 定价路线,与 Claude Fable 5 相比存在明显的价格差距。

但 V4 Pro 真正值得关注的并不只是参数规模和价格,而是 DeepSeek 试图在模型能力、推理成本和长上下文之间取得新的平衡。DeepSeek 此前强调了新一代注意力机制以及 KV Cache 等方面的效率优化,目标是降低大规模模型的实际推理成本。

问题出在 Agent 测试上。一个智能体最终能够完成多少工作,并不只取决于模型会不会「思考」,还取决于它如何调用工具、管理上下文、处理错误、执行任务循环,以及如何与文件系统和运行环境交互。

因此,对于 Agent 而言,更准确的关系并不是「模型等于 Agent」,而是模型能力加上执行框架,才构成用户最终看到的 Agent 能力。

这也使 Harness 成为理解这次争议的重要变量。


Harness 补上了哪一环

就在 V4 Pro 发布信息撤回的同时,DeepSeek Harness 如期开源。

从官方仓库来看,Harness 目前处于 Developer Preview 阶段,采用 MIT 协议,核心设计原则是「Everything is a Plugin」。模型、工具、技能、会话、沙盒、文件系统、任务循环、编排以及 UI 等,都可以通过插件方式进行组合和替换。项目基于 Cordis 元框架,开发者可以通过配置调整 Agent 能力,而不必修改底层源码。

简单来说,模型负责推理,Harness 负责把推理变成行动。

当模型需要读取文件、调用工具、修改代码、执行命令或者持续处理一个复杂任务时,中间需要有一套系统负责管理整个过程。Harness 解决的正是这一层问题。

这也是它与普通模型 SDK 最大的区别。SDK 主要解决「如何调用模型」,Harness 则进一步解决「如何让模型持续完成任务」。



为什么 Harness 的开源值得关注

如果 V4 Pro 部分官方 Agent 测试是在 DeepSeek 自己的执行环境中完成,那么外部用户直接调用模型,再使用自己的工具链,得到不同结果并不令人意外。

这并不是对官方测试结果的否定,而是说明 Agent 评测正在面临一个新的问题:我们究竟是在比较模型,还是在比较一整套 Agent 系统?

过去的模型评测更容易把模型本身作为核心变量。但随着 AI 从回答问题走向执行任务,工具调用、上下文管理、沙盒、任务循环等因素越来越重要。同一个模型,放在不同的执行框架中,最终表现可能存在明显差异。

因此,Harness 开源的意义并不只是「又开源了一个项目」。它至少提供了一种可能:让外部开发者使用更接近 DeepSeek 官方测试环境的执行框架,对此前公布的 Agent 能力进行重新验证。

当然,这里仍然需要保持边界。Harness 开源本身并不能证明此前的官方测试结果,也不能自动解释用户实测与官方数据之间的差距。它真正提供的是一个更公开的验证入口。最终答案,仍然要由第三方测试给出。

一个信号收缩 一个入口打开

把这两个动作放在一起看,过去 24 小时的脉络就更加清晰。

一边是 V4 Pro 的发布信息突然消失,另一边是 Harness 按照原计划进入 Developer Preview。前者留下了一个尚未回答的问题:DeepSeek 为什么调整了 V4 Pro 的发布口径?后者则把另一个问题交给了开发者:如果官方数据与实际体验之间存在差距,那么能不能在更接近官方条件的环境下重新测试?

从这个角度看,Harness 开源的价值正在于「验证」。

对于 DeepSeek 而言,开放 Harness 意味着将部分原本掌握在内部的 Agent 执行能力交给开发者。如果第三方在相同框架下能够得到接近官方的结果,那么 V4 Pro 此前的数据将获得更多外部支持;如果差距依然明显,外界则会进一步追问,问题究竟来自模型能力、执行框架还是评测方法。

这比单纯发布一组新的 Benchmark 更有意义。因为 Benchmark 告诉你一个结果,而开放工具则让更多人有机会自己验证这个结果。

接下来关注三个问题

第一,DeepSeek 是否会解释 V4 Pro 发布信息撤回的原因。目前模型仍处于可见、可调用的产品体系中,但正式发布的公开信号已经发生变化。后续究竟是重新发布、调整版本,还是仅仅修改公告,仍有待观察。

第二,第三方机构是否会使用 DeepSeek Harness 重新测试 V4 Pro。这将直接关系到此次争议能否得到进一步厘清。如果在相同 Harness 下能够接近官方结果,那么此前的体验差异可能与用户工具链有关;如果依然存在明显差距,那么问题就需要回到模型本身以及评测方法上。

第三,Harness 能否形成真正的开发者生态。DeepSeek 过去主要通过模型能力和推理成本建立竞争优势,而 Harness 代表着它进一步向 Agent 基础设施延伸。如果这个项目最终只是服务于 DeepSeek 自身模型,它的影响仍然有限;如果插件化设计能够吸引开发者,把模型、工具、沙盒和工作流组合起来,那么 DeepSeek 争夺的就不只是模型市场,还可能是 Agent 的基础设施层。


结语

过去 24 小时,DeepSeek 做出了两个方向看似相反的动作:V4 Pro 的发布信息悄然消失,Harness 却按计划向开发者开放。

前者意味着 V4 Pro 的正式发布仍存在需要观察的变量,后者则表明 DeepSeek 并没有因此放慢 Agent 基础设施的推进速度。

眼下,与其急于判断 V4 Pro 究竟「行不行」,不如等待更多可复现的结果。模型性能可以争论,Benchmark 可以争论,但当 Harness 被交到开发者手里之后,验证这件事本身开始变得更加开放。

V4 Pro 的发布信号暂时收了回去,验证它的工具却向外打开了。

接下来,答案不只来自 DeepSeek,也来自那些真正把这套系统跑起来的人。


本文信息来自 DeepSeek 官网及官方 GitHub 仓库、公开报道和用户公开反馈。涉及模型性能、Benchmark 和用户体验的内容,应区分公司自测与第三方测试;截至发稿,部分数据尚未经独立验证。本文不构成投资或采购建议。