公测一周即上新:DeepSeek Harness补上“视觉”短板
靳紫馨(Vivian Jin)
靳紫馨(Vivian Jin)

2026-08-20 · 224 [[ $t('article.detail.read') ]]

公测一周即上新:DeepSeek Harness补上“视觉”短板

DeepSeek Harness公测一周即上新,新增多模态图片输入和子代理集成,纯文本模型也能借助工具间接“看图”。

8月13日深夜,DeepSeek Harness(简称DSH)以MIT协议开源并开启全球公测,一夜之间在GitHub狂揽超5万星。仅过去不到一周,8月20日凌晨,Harness迎来公测后的首次重要更新——v0.1.0-rc.8版本正式上线,14项调整覆盖多模态输入、子代理协作、终端体验、工具调用和开发者支持等多个方向。

其中,多模态能力成为这次更新的重头戏

多模态正式补齐:Agent终于能“看图”了

根据官方更新日志,DeepSeek模型适配器现在可以通过配置启用原生图片请求。对于具备视觉能力的模型,Harness可以直接把图片送入模型处理;/goal/plan等核心命令也已经支持图文混合输入

与此同时,输入框中的@菜单新增了文件和会话引用功能,用户可以直接将本地文件、已有会话等内容拉进当前任务。这意味着,过去主要围绕文本和代码展开的Agent工作流,现在可以进一步将截图、图片等视觉信息纳入任务上下文

子代理体系也继续扩充。新版支持将Claude Code和Codex作为Profile Bundle按需安装,其中Codex支持非交互权限模式以及多个命名实例,方便在同一任务中配置不同子代理。

Windows用户此次也被重点照顾。DeepSeek Harness的PTY终端加入了持久PowerShell会话,并在极简模式预设中默认开启,减少命令执行过程中频繁重建终端环境的问题。

纯文本模型也能“看图”:工具层拼出视觉能力

DeepSeek Harness补上原生图片请求之外,一个有意思的细节很快被开发者发现。

有开发者测试发现,当所调用的模型本身没有声明图像输入能力时,直接调用read_image会首先失败。但任务并不会就此停下——Harness随后会退化到另一套工具链:先进行OCR文字识别,再统计图片中的颜色比例、扫描部分像素行,同时读取图片尺寸、色彩模式等元信息。

最后,这些结构化结果会被重新交给文本大模型,让模型根据OCR文本、颜色占比、像素位置等证据“脑补”出整张图的大致内容。

对于PPT截图、流程图、界面截图等结构相对明确的图片,它可以借助OCR和像素特征得到不少有效信息。这种能力和视觉大模型直接理解图片仍然有明显区别,但从Agent Harness的设计角度看,视觉能力并不完全绑死在底座模型上,工具也可以承担一部分感知工作

事实上,在官方加强多模态支持之前,DeepSeek Harness社区已经围绕视觉能力出现了一批插件,包括dsh-visiondsh-vision-toolkitmodlens等。其中一些方案就是通过OCR、像素分析或独立视觉子代理,让纯文本模型间接处理图片。rc.8上线后,原生多模态模型和这类工具层视觉方案可以进一步配合使用

“一切皆插件”:把模型能力“拆开重组”

8月13日公测时,DeepSeek Harness团队就强调其核心设计思路是“一切皆插件”:模型、工具、技能、会话、沙箱、存储、循环、调度和UI等Agent能力,都可以由不同插件组合和替换。

此次rc.8又继续强化了这种插件化思路:视觉模型可以原生接收图片,纯文本模型也能借助视觉工具获得部分图像信息;Claude Code和Codex则可以作为子代理按需装进同一套Harness中。

除了这些核心变化,rc.8还加入了web_search并发查询、子代理reportDelivery及时唤醒父任务等优化,并提升了大型历史会话分叉以及SQLite后端的读写性能。

从8月13日开源公测到如今把多模态和更多子代理能力装进来,DeepSeek Harness仍处于快速迭代阶段。下一步值得期待的,是这套插件化Harness能否继续把更多模型、工具和Agent装进同一个体系,并跑出更复杂、更稳定的任务流程。