- NO.
- 028
- DATE
- READ
- ~4 min
- KIND
- 笔记
- STATUS
- 原文
当模型变成可替换零件:为什么我开始关注 Agent Harness
从 DeepSeek Harness 出发,记录我对 Agent 长期价值位置变化的判断:模型提供能力,而 Harness 负责让能力进入可验证、可维护的工程系统。
最近我在看 DeepSeek Harness。
第一反应不是“又一个 Coding Agent”,而是另一个问题:
如果未来模型越来越容易替换,一个 Agent 真正值得长期积累的东西是什么?
过去一段时间,我们习惯关注模型能力。哪个模型代码能力更强,哪个上下文更长,哪个价格更低。
这些当然重要。
但当模型开始进入真实工程环境,决定结果的不再只是模型本身。
它还包括:
- 它能访问什么工具;
- 它知道哪些项目规则;
- 它如何保存执行状态;
- 它什么时候需要人工确认;
- 它犯错以后能否恢复和追踪。
这些部分,正是 Harness 关注的问题。
Agent 不只是模型
一个简单的理解方式:
Agent = Model + Harness
模型负责推理。
Harness 负责让推理进入现实世界。
文件、Shell、Git、测试、权限、Sandbox、Session、Skills、Subagent,这些都不是模型权重里天然存在的能力,而是围绕模型建立的运行环境。
这也是为什么同一个模型,在不同 Agent 产品里的表现可能完全不同。
差异并不一定来自模型,而来自模型周围那一层工程系统。
模型可能正在变成可替换零件
如果 Harness 层逐渐成熟,未来工作流可能不再绑定某一个模型产品。
更像这样:
我的 Agent 工作环境
|
+-- Model A
+-- Model B
+-- Model C
+-- Tools
+-- Skills
+-- Sandbox
+-- Workflow
+-- Verification
模型负责提供能力。
而项目规则、工具链、验证流程和权限边界成为可以持续积累的资产。
这和我之前在和 AI Agent 一起搭站:我维护这个双语博客的工具流里记录的经验很接近:真正让我敢让 Agent 修改长期项目的,不是模型足够聪明,而是我提前建立了 AGENTS.md、schema、发布流程和验证边界。
验证会越来越重要
生成成本下降以后,新的瓶颈不是“能不能产生结果”,而是“如何判断结果是否值得进入系统”。
我之前写过生成变便宜以后,验证与信任成了新的生产资料。Agent 的发展其实强化了这个趋势。
未来一个成熟 Agent 系统需要的不只是生成能力,还需要:
生成
↓
检查
↓
测试
↓
审查
↓
发布
如果没有这些环节,Agent 越快,错误进入生产环境也越快。
可追踪比“更聪明”更容易被低估
DeepSeek Harness 让我比较关注的一点,是它对 Session 和运行轨迹的处理。
复杂 Agent 最大的问题不是偶尔失败,而是失败以后无法回答:
- 哪一步开始偏离?
- 哪次工具调用导致问题?
- 换一个模型是否还能复现?
- 从哪里恢复最合理?
传统软件需要日志和 tracing。
长期运行的 Agent 同样需要。
如果 Agent 从聊天工具变成基础设施,那么执行轨迹就会像传统系统日志一样重要。
权限边界不会因为模型变强而消失
很多人期待未来 Agent 可以完全自动工作。
但能力越强,权限设计越重要。
理想状态不是:
Agent 很聪明,所以给它所有权限。
而是:
读取项目 允许
修改工作区 允许
删除资源 需要确认
生产部署 需要确认
敏感数据 最小权限
这也是为什么 Sandbox、Approval、Policy 这些看似“不性感”的工程能力,会越来越重要。
我最近写给编码代理装 hook:从软约束到可验证的闸时也有类似感受:真正可靠的 Agent,不是没有限制,而是限制被设计成系统的一部分。
但 Harness 不会让模型自动变聪明
这里需要保持边界。
Harness 改善的是:
- 上下文管理;
- 工具调用;
- 执行流程;
- 权限控制;
- 可观察性。
它不会改变模型本身的能力上限。
一个不理解的问题,不会因为增加几个插件就突然理解。
所以我更愿意把 Harness 看成:
把不稳定的模型能力包装成一个可管理工程系统。
我的判断
我不会因为 DeepSeek Harness 出现,就马上迁移所有工作流。
它目前仍然更像一个值得观察和实验的基础设施方向,而不是成熟替代品。
但它提出的问题很重要:
未来人与 AI 协作时,长期积累的核心到底是什么?
可能不是某个模型本身。
模型会变化。
真正留下来的,也许是:
- 项目知识;
- 工具连接;
- 验证规则;
- 权限边界;
- 失败经验;
- 工作流程。
这些东西共同组成了一个 Agent 的 Harness。
如果这个方向成立,那么未来竞争的不只是“谁拥有更强模型”,还包括“谁拥有更好的让模型可靠工作的系统”。
评论
评论由 GitHub Discussions 提供。登录 GitHub 后即可评论。 前往对应 Discussion