DeepSeek也有自己的“马具”了。8月13日晚,DeepSeek发布首个Harness产品DeepSeek Harness。上线一天,GitHub Star就突破5万。Harness是什么?简单理解,如果模型是“大脑”,Harness就是让模型真正动手干活的一套“手脚”。文件怎么读、工具怎么调、上下文怎么管理、任务如何持续执行,都需要Harness来组织。模型决定它有没有能力完成一件事,Harness则影响这些能力最后能不能顺利跑起来。

过去,这套“手脚”通常由厂商提前装好。用户打开Agent,只需要告诉它要做什么,很少需要关心背后的工具、上下文和运行逻辑。
DeepSeek偏偏反着来。它给DeepSeek Harness定下的核心理念是“一切皆插件”。模型、工具、Skills等模块都可以拆开、替换和重新组合。缺什么能力,可以装插件;觉得现有Agent不顺手,还可以通过创造模式重新配置一套自己的Agent。
为了适应不同场景,它还提供标准、程序化工具调用模式(Programmatic Tool Calling,PTC)、极简和创造四种模式。标准模式功能最完整,适合直接干活;PTC模式可以通过代码组合多步工具调用,更适合批量、结构化任务;极简模式则把能力压缩到最基础的工具,更接近模型“裸奔”;创造模式允许用户自定义Agent。
DeepSeek Harness还有一个比较特别的设计,运行过程基本都可以回看。模型看到了什么、调用过哪些工具、在哪一步出错,以及上下文如何变化,都被记录下来。
DeepSeek配上自己的Harness,真的会更好用吗?我们也来上手试一试。
需要说明的是,除特别说明外,本文测试均接入DeepSeek-V4-Pro的API,使用标准模式,思考档位设置为High。本次测试也没有为了“集邮”逐一覆盖四种模式,PTC更偏向开发场景,因此没有单独展开。同时,各项结果均为单次生成,存在一定随机性,仅作为实际使用体验参考。
下面进入具体测试。
01.简单任务:财报会读,网页能搭
正式上强度之前,我们先从两个基础任务开始。
我们先让DeepSeek Harness读取桌面上的腾讯财报文件,整理关键数据,并总结其中值得关注的变化。
整个过程比较顺利,它能够正常读取文件,把主要财务指标和业务变化整理出来,再给出一份简短总结。结果谈不上惊艳,但信息抓得比较准,总结也比较到位。
←左右滑动查看更多→
Slide for more photos
DeepSeek Harness总结的财报信息
一个细节是,它在补充个别背景信息时,会主动注明内容来自外部来源,没有把额外搜索到的信息和财报原文混在一起。对于财报解读这类强调信息出处的任务来说,这种边界感还是比较实用的。
接下来,我们想看看,DeepSeek Harness的标准模式和极简模式之间到底有没有明显差距。
我们用两个不同的模式分别为一家名为“山雾咖啡”的独立咖啡店制作单页官网,页面需要包含品牌介绍、6款饮品菜单、营业时间和门店信息,同时有菜单分类切换、饮品详情板块。
结果是,几乎没拉开差距。标准模式选择了棕色作为主视觉,更接近常见的暖色咖啡馆风格;极简模式则用了墨绿色,整体更清冷一些。除了配色和部分排版细节,两边的页面结构、功能模块和交互都比较接近,菜单切换、饮品详情等要求也都正常实现,完成时间同样相差不大。
这可能和题目本身比较简单有关。网页的需求清楚,任务链也不长,不需要频繁搜索资料、调用多个工具或者长时间维护上下文。即便只保留最基础的能力,模型也足够把页面做出来。
至少在简单任务里,工具更多,并不等于结果一定更好。
02.复杂任务:能做“重”活,也会栽在细节上
接下来,我们继续上强度,加入更复杂的物理模型和3D交互演示,看看DeepSeek Harness面对长任务时,能不能把整套逻辑真正跑通。
我们要求它用Three.js制作一套鲁布·戈德堡机关:要求金属球从斜坡滚下,依次撞倒多米诺骨牌,再触发摆锤,最终弹起小方块撞下按钮、升起旗帜。
这道题最重要的是因果链必须成立。小球没有滚下来,多米诺骨牌就不能自己倒;骨牌没有触发摆锤,后面的机关也不能凭空开始运动。
DeepSeek Harness第一次交出的结果,就在这里出了问题。点击开始后,小球并没有顺着斜坡滚下来,多米诺骨牌却自己开始倒下。后面的摆锤虽然确实被骨牌撞到,但整条因果链从第一步就已经断了。
![]()
DeepSeek Harness生成的机关
我们指出问题后,它重新检查并修改了问题。第二版里,小球终于能够沿着斜坡滚落,撞上多米诺骨牌时,还能明显看到速度下降和受阻的效果。
第二道题,我们提高复杂度,让它制作一套可交互的3D机械陀飞轮。
相比连锁机关,这道题更考验持续运动中的协调关系。中心轮需要保持固定,陀飞轮框架持续旋转,擒纵轮既跟随框架公转又要自转,擒纵叉快速往复,摆轮周期摆动,游丝还要同步收缩和扩张。
这一次,DeepSeek Harness先闹了一个乌龙。它前后跑了40多分钟,最终却交付了一个打不开的成品。追问之后,它才发现由于两个任务同时在同一个文件夹里运行,另一个任务把陀飞轮的首页文件覆盖了,导致最后打开的不是正确版本。
![]()
DeepSeek Harness生成的机械陀飞轮
排除交付问题后,最终成品的完成度比较高。陀飞轮整体结构完整,播放、速度调节、爆炸视图等功能都可以正常使用,交互过程流畅,没有明显卡顿。框架、摆轮和游丝之间的运动关系也比较清楚。
两道复杂任务测下来,DeepSeek Harness更像一个能力强、但仍需要人工验收的搭档,不过它在复杂任务上的上限并不低,问题被指出以后,能够继续修正。
03.独家玩法:插件随便装,Agent也能自己造
前面两轮,我们测的还是DeepSeek Harness“干活”的能力。到了这一部分,才真正进入它最特别的地方。
DeepSeek Harness的亮点有两个,一个是“一切皆插件”,不同模块都可以被拆开、替换和重新组合;另一个是允许用户直接定制一套新的Agent预设。
我们先从插件开始试。我们从GitHub上找了一个开源设计插件,直接把仓库链接丢给DeepSeek Harness,让它自己完成安装。整个过程很省事,它很快识别了插件的安装方式并完成配置,重启后,新插件就可以正常调用了。
接着,我们让它制作一套“旅行足迹”App原型图,并调用刚刚安装的插件继续编辑页面。生成之后,卡片、文字和布局都可以基于插件在原有基础上继续调整,如果某个部分不满意,直接指定元素让它修改即可。

DeepSeek Harness编辑页面
这也是插件体系最容易让人感知到价值的地方,原本没有的能力,可以装进去。用户不必等DeepSeek官方把所有功能都做进产品,而是可以根据自己的需求补工具、换工具。
当然,这套玩法现阶段还谈不上完全“傻瓜式”。用户首先要知道自己缺什么能力,还得去社区找到合适的插件或是自己开发一个插件。对于普通用户来说,这本身就有一定门槛。
但给现有Agent加一个插件,还只是“添工具”。DeepSeek Harness更进一步的玩法,是连Agent本身也允许用户重新配置。
于是第二项测试,我们让它创建一个名为“事实核查员”的Agent,专门负责检查文章里的事实错误。
DeepSeek Harness花了大约11分钟完成创建。新开一个会话后,“事实核查员”已经出现在可选的Agent预设中,可以直接调用。

DeepSeek Harness模式选择页面
我们故意给它出了几道“找茬题”,混入模型参数、报告数据等不同类型的错误,再交给这个新Agent核查。结果问题都被它找了出来,并给出对应的核查结果和修改建议。
如果只是偶尔核查一次文章,直接在标准模式里写一大段提示词也能完成。但当一套工作方法需要反复使用时,把标准都提前固化下来,新会话里就不用每次从头解释一遍。创造模式真正省掉的,是重复任务里的沟通成本。
可以看出,DeepSeek Harness希望把更多原本藏在产品内部的能力开放出来,让用户自己决定Agent该拥有什么工具、遵循什么规则、以什么方式工作。
04.同一颗“大脑”,三种干活方式
前面几轮,我们基本摸清了DeepSeek Harness自己的能力。但一款Agent好不好用,只看它能不能完成任务还不够,还要放到现有产品里横向比较,才能更直观地看出它现在到底处在什么水平。
我们选了Codex和WorkBuddy作为参照。一个是海外同类产品中的重要玩家,一个是国内已经跑了一段时间的Agent产品。正好可以看看,DeepSeek第一次自己做Harness,实际体验能不能追上这些更成熟的对手。
为了尽量减少模型能力本身的干扰,我们在三款产品中都接入同一个API,并使用相同提示词完成两个任务。
第一题是相对常规的数据看板,主要看日常任务的执行效率和准确性;第二题则直接把难度拉到3D游戏,看任务变复杂以后,它们在执行、调试和最终交付上的差距会不会进一步放大。
先来看数据看板。我们要求三款产品制作一个大模型价格与能力对比的数据看板,不仅要展示各家模型的输入、输出价格和上下文长度,还要制作价格对比图、价格与跑分散点
Codex动作很快,大约8分钟就交出了结果。图表和数据表都有,但部分数字出现了重叠。此外,模型数据的新旧并不完全一致:刚发布不久的Grok 4.6已经能够正常展示价格,此前发布的Qwen3.8-Max价格却没有补全。它“做页面”很快,但在整理数据时,信息覆盖并不稳定。
WorkBuddy花了大约半小时,速度明显更慢,但结果没有因为耗时更长而更稳。部分图表存在渲染问题,有的数据没有完整展示,其中输出价格的柱状图甚至出现了方向错误。
DeepSeek Harness这一轮的过程最曲折。第一次测试,它跑了两个半小时,最终仍然没能把看板完整做出来。我们重新测试,并让它调用视觉插件以后,大约3分钟它就交出了完整成品。
它是数据最全的一个,一共整理了37款模型。除了常规的价格图表和数据表,散点图还会进一步解释不同区间代表的意义,帮助用户直接判断哪些模型处在“价格较低、能力较高”的位置。
我们再让它们分别做一个3D滑索游戏。玩家打开页面后就已经挂在滑索上向前滑行,需要左右倾斜身体穿过沿途的发光树叶环,在倒计时结束前抵达终点。
DeepSeek Harness交付最快,大约只用了13分钟。但快归快,还是犯了错误。按理说,角色应该挂在滑索上,但成品内的角色却没有受到绳索束缚。我们指出这个问题后,它重新调整了,角色才真正被“挂”在滑索上。
![]()
DeepSeek Harness生成的游戏
WorkBuddy大约23分钟完成初稿,但过程最不顺。第一次交付直接是一个空白页面,任务过程中甚至一度在思考链里吐槽自己“脑子转不过来了”。提醒以后,它重新修改,才成功给出可以运行的版本。
![]()
WorkBuddy生成的游戏
它的成品很有自己的特点,没有像另外两款一样把玩家放进相对密集的树林,而是把滑索架在树冠上方,画面更简单,滑索更“真实”。树林的建模方式也不同,DeepSeek Harness和Codex更偏体素化,能够看到明显的几何切面;WorkBuddy的视觉效果更精致细腻。
![]()
Codex生成的游戏
Codex用了大约30分钟,是最慢的。它的游戏能够正常运行,滑索、树叶环和雨林环境也都做了出来,但一个比较明显的问题是路线规划,角色在滑行过程中经常直接穿过树林,说明场景虽然搭起来了,空间关系却没有真正处理好。
两轮比下来,并没有出现“自家模型配自家Harness,就一定全面领先”的情况。DeepSeek Harness更像一个可塑性很强的开发者工具,默认表现未必最稳,但插件和配置空间大,调对工具后提升会很明显;Codex的特点是执行直接、效率优先,更像一套已经比较成熟的工程工具;WorkBuddy稳定性稍弱,但在视觉呈现和设计感上有自己的风格。
05.结语
几轮测下来,简单任务DeepSeek Harness能正常完成,复杂任务纠错后完成度也不错,插件和创造模式还提供了不少常规Agent没有的玩法。但它长任务和并行执行也还会出现一些问题,对工具配置比较敏感。
不过,好不好用也要区分来看。一方面是产品还在早期阶段,另一方面是DeepSeek主动选择了不同的产品定位。
DeepSeek从一开始就把Harness定义为“开发者预览版”,官方也明确表示,核心插件和基础API还会持续变化,希望开发者参与插件生态建设。它不追求“打开就能用”,而是把更多工具、配置和运行逻辑交给开发者自己调整。这样做换来了更大的自由度,也自然抬高了普通用户的使用门槛。
这也解释了为什么DeepSeek Harness发布后口碑迅速分化。一边是开发者对它的架构设计很感兴趣,认为留下了很大的改造空间;另一边,也有人觉得它的安装和使用体验还不如成熟工具,部分基础功能不够完善。再加上相关概念和文档明显偏工程化,即使只是想弄明白它到底怎么用,也需要一定学习成本。
DeepSeek为什么不干脆做一个“开箱即用”的Agent?
一个“开箱即用”的Agent,优势是用户不用理解背后的运行逻辑,但代价也是这些东西大多由厂商决定。DeepSeek Harness反过来把模型、工具、Skills、沙箱、存储、Agent Loop甚至UI都开放出来。甚至连模型也没有锁死在DeepSeek上,官方支持接入Anthropic、OpenAI以及其他自定义模型提供方。
这其实对应着DeepSeek正在补的一块能力。过去,DeepSeek主要解决的是模型层的问题:把模型能力做强,再通过API交给开发者。但到了Agent阶段,模型强不强已经不能完全决定最终体验。真正把能力转化成结果,还取决于模型被放进怎样的一套执行系统里。
Harness让DeepSeek第一次从提供模型,进入模型如何被组织起来完成任务的环节。相比直接做一个面向普通用户的Agent产品,这条路线更偏底层,也更符合DeepSeek过去偏技术和开发者生态的打法。
如果开发者在DeepSeek Harness里同时使用其他模型,这套产品的价值就不再只依附于某一个模型的能力。模型可以换,插件、Agent预设和工作流却可能继续留在同一套Harness里。这也是DeepSeek Harness更大的想象空间。
当然,现在谈生态还为时尚早。热度来得很快,但接下来还要看开发者愿不愿意长期使用、持续开发和维护插件。

