最近肯定被一个词刷屏:DeepSeek Harness。8 月 13 日晚发布开发者预览版 v0.1,开源 12 小时 GitHub 拿下 5 万+ star,封神“史上增长最快项目之一”。很多人第一反应:又发新模型了?又一个打榜的?其实都不是,它压根不是模型, 而是一个开源的 Agent 运行时框架,命令行工具叫 dsh (DeepSeek Harness)。

官网地址:https://www.deepseek.com/harness/
与模型的关系:Harness 是一台车,模型就是发动机
发动机马力再大,光秃秃放地上也跑不起来。得配上变速箱、刹车、方向盘、仪表盘,再装上油箱、座椅、外壳——车才能上路。Harness 就是这一整套“除了发动机以外的东西”。
官方定义更直接:除模型本身以外的所有工作,都算 Harness。包括 Prompt 编排、工具调用(跑 shell、读写文件、跑测试)、迭代控制与容错(失败自动重试)、上下文摘要(长代码库先压缩再喂)、测试失败回传(报错日志和截图喂回模型)、记忆系统、子 Agent 协调等等…
如果模型是芯片,Harness 就是操作系统。 芯片再好,没有操作系统也没法装软件,模型再强,没有 Harness 也只能“回答你一句话”,干不了“持续跑几个小时的活”。
DeepSeek Harness 就像是乐高积木,一切皆插件,模型、工具、技能、沙箱、存储、UI,全是可插拔的积木块,想换哪块换哪块。
一句话记住核心公式:Model + Harness = Agent
模型负责【想】,Harness 负责【干】。没有 Harness 的模型,是没装车壳的发动机;没有模型的 Harness,是没装发动机的空壳。
为什么值得关注:三组硬核数据
光讲概念没用,三组实验,直接告诉你一个扎心的事实:在很多场景里,Harness 比模型本身更重要。
第一组:LangChain 的 Terminal Bench 2.0
89 个任务,GPT-5.2-Codex 用默认提示词 + 标准工具,得分 52.8%,排 30 名开外。
不改任何模型权重,只调系统提示词、工具描述、中间件——得分直接飙到 66.5%,进前五。
同一个模型只换 Harness 配置,从 30 名开外 直接到前五。说明差距不在模型,在 Harness。
第二组:NVIDIA 的成本实验
Nemotron 3 Ultra + Harness 优化,Deep Agents 评测拿下 0.86 分,只比最好闭源模型差 0.01。关键在后半句:单次评测成本从 $43.48 降到 $4.48,将近 10 倍。
第三组:Anthropic 自己人测自己人
Claude Opus 4.5 单 Agent(无 Harness)做复古游戏,20 分钟花了 $9,代码不可用;套上三层 Harness(规划器 + 生成器 + 评估器),6 小时花了 $200,但交付了可用软件。
更扎心的对比:同一个 Claude Opus 4.5,放进 Claude Code 的 Harness,CORE-Bench Hard 95%;不使用 Harness,直接掉到 42%,说明模型再强,没有工具和流程,也发挥不出来最大作用。
这就是为啥 DeepSeek 一开源全网沸腾——大家第一次意识到,模型之外这一层才是胜负手。
项目背景时间线:这不是拍脑袋的项目
- 2026 年 3 月:崔添翼(Jane Street 前量化交易员)加入 DeepSeek,组建 Harness 团队
- 2026 年 5 月:DeepSeek 资深研究员陈德里公开表态:“对标 Claude Code,做 DeepSeek Code Harness”
- 2026 年 8 月 1 日:内测招募,769 位开发者、712 个仓库、120 万+ stars 涌入
- 2026 年 8 月 13 日晚:开发者预览版开源,12 小时 5 万+ star
AI 编程是商业化落地最快的领域,2025 年全球市场 295.7 亿美元,预计 2030 年冲到 646.8 亿美元,年复合增长率约 17.1%。
框架核心设计:为什么说它是“乐高积木”
Harness 底层叫 Cordis 插件系统(2022 年开源),内核极度克制,只干三件事:插件加载、卸载、依赖管理。
模型、工具、技能、会话、沙箱、存储、UI、循环调度——全是插件,全可替换。不用改框架源码,改配置文件就能换掉任意功能。
两个硬核特性:插件卸载后副作用可完整撤销(时间可组合性);依赖变化时能动态重建协作关系(空间可组合性)。
它还自带四种运行模式:
- 标准模式(Standard):完整工具集,新手无脑选
- Code 模式:标准能力 + SDK,模型生成 TypeScript 程序编排多轮工具调用,更省 Token,适合结构化多步骤任务
- 极简模式(Minimal):只留 Shell + 文件编辑器,系统提示词极简,专门给模型基准测试用
- 创造模式(Creator):最硬核。Agent 能检查自身运行时、在内存里试验插件、甚至现场造插件挂身上。
五分钟上手使用:复制就能跑
先说环境要求:Node.js 22.19+(22.x 系列)或 24+ 版本。
最快一条命令:
npx @deepseek-ai/dsh web
跑起来后浏览器打开 http://127.0.0.1:3080 就是本地 Web UI。
还有一种使用方式,就是下载源码后编译安装,也比较简单,详细参考源码目录下 README.zh.md 说明即可,这里不再细述。命令如下:
git clone https://github.com/deepseek-ai/deepseek-harness.git cd deepseek-harness pnpm install pnpm run build pnpm dsh web
接官方模型:Web UI → Settings → Models → DeepSeek 卡片,填 API key(写到 $DSH_HOME/.credentials.yaml)。
好消息:不锁死 DeepSeek。预置 Anthropic、OpenAI provider,settings.yaml 配 apiKeyEnv / api / baseURL / models 四个字段,就能接任何兼容 OpenAI 协议的网关,有啥模型插啥模型。
新手第一天上手清单
- 装 Node.js 22.19+ 或 24+
- 跑
npx @deepseek-ai/dsh web - 打开 http://127.0.0.1:3080,进 Settings 填 DeepSeek API key
- 模式选标准模式,别碰创造模式
- 丢个小任务试试水:帮我把这个文件夹里的 md 整理成目录
- 去 GitHub 搜
dsh-plugin标签,装两个社区插件:dsh-at-file、dsh-genui - 记住:预览版会变,别拿生产环境开玩笑
当前先可试用:别急着用于生产
项目说明文档最前面就提到:DeepSeek Harness 目前处于 开发者预览 阶段,正在快速迭代。未来将出现破坏兼容性的变更。
第一,它还是 v0.1。 官方原话:会有破坏兼容性的改动。GitHub Releases 页面是空的,当前 npm 版本 0.1.0-rc.6,不建议直接上生产。
第二,门槛不低。 它面向开发者,不面向普通用户。你得有 Node.js 环境,要懂插件、会话、provider 一堆术语。如果要达到点开就能用,为时尚早。
第三,插件安全是个坑。 工具插件能碰文件,存储插件掌握完整会话,循环插件可能改变决策——权限边界和供应链安全,是生产环境必解之题。
第四,“自进化”有争议。 动态生成的插件只能驻留内存,重启就消失,缺自动沉淀为永久插件的机制,网上有人质疑自动进化会带来维护混乱。
第五,易用性待打磨。 思维链显示过快导致文字闪烁、缺多标签预览、开发者工具面板占界面太大。
第六,涨价争议得说清楚。 Harness 开源当天,官方定价页同步发了涨价公告。V4-Pro 峰时(UTC 01:00-04:00、06:00-10:00,也就是北京 9:00-12:00、14:00-18:00)输出价从 $0.87/M 涨到 $3.96/M,约 4.55 倍;非峰时约 2.3 倍;缓存命中输入价涨幅超 6 倍。注意:媒体爱说“涨 4 倍”,但那只对应峰时输出这一项,不是全面涨幅。空闲时段价格约为高峰一半,想省钱就需要自行控制上班时间,避开高峰期。
对全行业意义:为什么这事不小
第一,DeepSeek 正从“模型供应商”向“应用框架层”延伸,不再满足于只卖 Token,开始争夺模型之上的开发者入口。
第二,开源竞争从“模型层”打到了“Agent 工程层”。开放权重解决的是“谁能运行模型”,开放 Harness 触及的是**“谁能决定模型如何工作”**。
第三,它直接对标 OpenAI Codex、Anthropic Claude Code,主打编程和办公场景。有开发者说:DeepSeek 将一切开源,这样我们就不必生活在 Anthropic 的统治之下了。
可以试用但也别上头。摩根士丹利认为中国大模型行业竞争将更多转向模型能力和算力供给;业内主流观点是:v0.1 阶段说“替代 Claude Code”为时尚早,更重要的意义是生态起点。
要测试就先跑起来,别光看
一句话总结:DeepSeek Harness 不是又一个模型,而是模型的那层【壳】——发动机外的整车,芯片外的操作系统,积木里的连接件。 它告诉你:Agent 好不好用,一半的功劳(甚至更多)在模型之外。现在就可以花 5 分钟把它跑起来,亲手感受【Model + Harness = Agent】是个啥。看十篇文章,不如跑一次 npx @deepseek-ai/dsh web。
与 OpenClaw、Hermes 等有啥区别
看到这儿你可能想问:搞 Agent 框架的不止 DeepSeek 一家吧?没错,市面上还有俩名字绕不开——OpenClaw 和 Hermes。它们和 Harness 有啥区别?
OpenClaw:聊天软件里养个【数字员工】
先聊 OpenClaw。它由 Peter Steinberger(PSPDFKit 创始人)发起,2025 年底立项、2026 年初定名,MIT 开源。2026 年 2 月创始人加入 OpenAI,但项目继续开源维护,GitHub 星星一路涨到 34.5 万+,是三者里生态最大的。
它的定位一句话:本地优先的开源个人 AI 智能体框架,目标不是做聊天机器人,而是“让 AI 真正帮你做事”——数字员工。
最骚的是无头架构:它没有独立界面,你直接在 WhatsApp、Telegram、Discord、Slack、iMessage、Microsoft Teams 里发消息,它就在那儿干活,支持私聊也支持群聊。模型无关,Claude、GPT、Gemini、DeepSeek 甚至本地 Ollama 随便换;能读写文件、跑 shell、控制浏览器,偏好和记忆存本地 Markdown/YAML,数据默认不出本机。
生态是它的护城河:ClawHub 技能市场有 3,286+ 技能,AI 还能自己写新技能;中国开发者贡献的插件占全球 43%。办公自动化(邮件、日历、报表)、智能家居、个人助理都有人拿它跑。中文社区叫它【小龙虾】——Claw 就是爪子。
Hermes:越用越懂你的【自进化】选手
Hermes Agent,出自 Nous Research(就是做 Hermes、Nomos、Psyche 系列模型的团队),2026 年 2 月 25 日开源,MIT 许可。它的定位叫【The agent that grows with you】——与你共同成长的智能体,主打自进化。
核心卖点是运行时学习闭环:执行→评估→抽象→精炼→沉淀。简单说,它干完一件复杂活,会自动把流程抽象成一个可复用的 Skill(Markdown 文件,存在 ~/.hermes/skills/),以后越用越熟。官方数据:10-20 次相似任务后,执行速度提升 2-3 倍;自建技能让类似研究任务时间减少 40%。
记忆系统也很能打:三层/四层记忆(工作记忆、情景记忆、语义记忆 + Honcho 用户建模),SQLite + FTS5 全文检索,10K+ 文档检索延迟约 10ms。支持 15+ 消息平台,连钉钉、飞书、企业微信都有;内置 118 项技能、40+ 工具,模型支持 200+ 随便热切换。
它常被称为“OpenClaw 的正式继承者”,提供完整迁移工具(hermes claw migrate),SOUL.md、MEMORY.md、技能、平台配置、API keys 都能搬。
一张表看明白:三个框架到底差在哪
| 维度 | DeepSeek Harness | OpenClaw | Hermes Agent |
|---|---|---|---|
| 开发方 | DeepSeek(深度求索) | Peter Steinberger(PSPDFKit 创始人) | Nous Research |
| 首发 | 2026-08-13(v0.1 预览) | 2026-01(2025年底发起) | 2026-02-25 |
| 开源协议 | MIT | MIT | MIT |
| 一句话定位 | Agent 运行时框架:模型之外的一层【身体】 | 本地优先个人 AI 智能体:数字员工 | 自进化 AI 智能体:越用越懂你 |
| 核心卖点 | 一切皆插件、四种运行模式、可回放事件日志 | 无头架构、聊天软件下发指令、本地执行 | 运行时学习闭环、技能自生成、持久记忆 |
| 编程能力 | 强(对标 Claude Code) | 中(可写代码跑命令) | 中(40+ 工具含代码执行) |
| 办公自动化 | 支持(定位含办公场景) | 强(邮件/日历/浏览器/报表) | 强(跨平台+定时任务) |
| 消息平台 | 本地 Web UI(127.0.0.1:3080) | 10+(WhatsApp/Telegram/Discord/iMessage 等) | 15+(含钉钉/飞书/企业微信) |
| 模型支持 | DeepSeek 官方 + Anthropic/OpenAI 预置 + 自定义 | 模型无关(Claude/GPT/Gemini/DeepSeek/本地 Ollama) | 200+(OpenRouter/OpenAI/Anthropic/国产/本地) |
| 技术栈 | TypeScript / Node.js | TypeScript / Node.js | Python |
| 部署方式 | npx 一条命令本地启动 | curl 本地安装 / 云厂商一键部署 | curl 本地 / VPS $5 起 / Docker / SSH / Serverless |
| 记忆系统 | 会话事件日志(可审计回放) | Markdown/YAML 本地持久记忆 | 三层/四层记忆 + FTS5 全文检索 + Honcho 用户建模 |
| MCP 支持 | 支持(工具来源) | 支持(经 MCP 调工具) | 原生支持(OAuth 2.1 + 安全扫描) |
| 自进化 | 创造模式(内存级,重启消失) | 技能可自写,有限 | 核心卖点(技能自动生成+持续优化) |
| 生态 | 插件(GitHub dsh-plugin 标签) | ClawHub 技能市场(3,286+ 技能) | agentskills.io 开放标准 + 社区技能 |
| GitHub Stars | 14.6 万+(2026年8月) | 38.7 万+(2026年8月) | 23.2 万+(2026年8月) |
| 国内可用性 | 优秀 | 好(阿里云/腾讯云/华为云支持) | 中(原生 Windows 需 WSL2) |
| 当前成熟度 | v0.1 早期预览,不建议生产 | 成熟,生态最大 | v0.10+,较稳定 |
| 目标用户 | 开发者 | 开发者/自由职业者/企业 | AI 研究者/MLOps/极客个人 |
| 中文昵称 | 无 | 小龙虾 | 爱马仕 |
到底怎么选?四条建议
- 想体验【代码智能体 + 插件自由拼装】、人在 DeepSeek 生态里 → 上 DeepSeek Harness。命令最简单,一条 npx 就跑起来,但它是 v0.1 预览版,玩玩可以,生产先等等。
- 想【在聊天软件发条消息就让 AI 干活】、要生态最成熟、主打办公自动化 → 选 OpenClaw。门槛相对最低,云厂商能一键部署,中文圈【小龙虾】名号不是白叫的。
- 想要【越用越聪明】、技能自进化、搞研究/MLOps → 看 Hermes Agent。自进化是它的独门绝活,但偏极客。
- 别把它们当敌人。三者理念一脉相承:OpenClaw → Hermes 是继承迁移,Harness 也在借鉴框架开放的思路。**能看到这里的同袍才不会做选择,都干就完了。**可以先跑 Harness 看个热闹,很多都已经装了 OpenClaw、Hermes Agent 干正事。
Good Luck~
《DeepSeek Harness 到底是啥?与 OpenClaw、Hermes 的关系》有0条回应