返回文章
NO.
028
DATE
READ
~4 min
KIND
笔记
STATUS
原文

TAGS: AI 协作 架构

当模型变成可替换零件:为什么我开始关注 Agent Harness

从 DeepSeek Harness 出发,记录我对 Agent 长期价值位置变化的判断:模型提供能力,而 Harness 负责让能力进入可验证、可维护的工程系统。

最近我在看 DeepSeek Harness。

第一反应不是“又一个 Coding Agent”,而是另一个问题:

如果未来模型越来越容易替换,一个 Agent 真正值得长期积累的东西是什么?

过去一段时间,我们习惯关注模型能力。哪个模型代码能力更强,哪个上下文更长,哪个价格更低。

这些当然重要。

但当模型开始进入真实工程环境,决定结果的不再只是模型本身。

它还包括:

  • 它能访问什么工具;
  • 它知道哪些项目规则;
  • 它如何保存执行状态;
  • 它什么时候需要人工确认;
  • 它犯错以后能否恢复和追踪。

这些部分,正是 Harness 关注的问题。

Agent 不只是模型

一个简单的理解方式:

Agent = Model + Harness

模型负责推理。

Harness 负责让推理进入现实世界。

文件、Shell、Git、测试、权限、Sandbox、Session、Skills、Subagent,这些都不是模型权重里天然存在的能力,而是围绕模型建立的运行环境。

这也是为什么同一个模型,在不同 Agent 产品里的表现可能完全不同。

差异并不一定来自模型,而来自模型周围那一层工程系统。

模型可能正在变成可替换零件

如果 Harness 层逐渐成熟,未来工作流可能不再绑定某一个模型产品。

更像这样:

我的 Agent 工作环境
        |
        +-- Model A
        +-- Model B
        +-- Model C

        +-- Tools
        +-- Skills
        +-- Sandbox
        +-- Workflow
        +-- Verification

模型负责提供能力。

而项目规则、工具链、验证流程和权限边界成为可以持续积累的资产。

这和我之前在和 AI Agent 一起搭站:我维护这个双语博客的工具流里记录的经验很接近:真正让我敢让 Agent 修改长期项目的,不是模型足够聪明,而是我提前建立了 AGENTS.md、schema、发布流程和验证边界。

验证会越来越重要

生成成本下降以后,新的瓶颈不是“能不能产生结果”,而是“如何判断结果是否值得进入系统”。

我之前写过生成变便宜以后,验证与信任成了新的生产资料。Agent 的发展其实强化了这个趋势。

未来一个成熟 Agent 系统需要的不只是生成能力,还需要:

生成

检查

测试

审查

发布

如果没有这些环节,Agent 越快,错误进入生产环境也越快。

可追踪比“更聪明”更容易被低估

DeepSeek Harness 让我比较关注的一点,是它对 Session 和运行轨迹的处理。

复杂 Agent 最大的问题不是偶尔失败,而是失败以后无法回答:

  • 哪一步开始偏离?
  • 哪次工具调用导致问题?
  • 换一个模型是否还能复现?
  • 从哪里恢复最合理?

传统软件需要日志和 tracing。

长期运行的 Agent 同样需要。

如果 Agent 从聊天工具变成基础设施,那么执行轨迹就会像传统系统日志一样重要。

权限边界不会因为模型变强而消失

很多人期待未来 Agent 可以完全自动工作。

但能力越强,权限设计越重要。

理想状态不是:

Agent 很聪明,所以给它所有权限。

而是:

读取项目      允许
修改工作区    允许
删除资源      需要确认
生产部署      需要确认
敏感数据      最小权限

这也是为什么 Sandbox、Approval、Policy 这些看似“不性感”的工程能力,会越来越重要。

我最近写给编码代理装 hook:从软约束到可验证的闸时也有类似感受:真正可靠的 Agent,不是没有限制,而是限制被设计成系统的一部分。

但 Harness 不会让模型自动变聪明

这里需要保持边界。

Harness 改善的是:

  • 上下文管理;
  • 工具调用;
  • 执行流程;
  • 权限控制;
  • 可观察性。

它不会改变模型本身的能力上限。

一个不理解的问题,不会因为增加几个插件就突然理解。

所以我更愿意把 Harness 看成:

把不稳定的模型能力包装成一个可管理工程系统。

我的判断

我不会因为 DeepSeek Harness 出现,就马上迁移所有工作流。

它目前仍然更像一个值得观察和实验的基础设施方向,而不是成熟替代品。

但它提出的问题很重要:

未来人与 AI 协作时,长期积累的核心到底是什么?

可能不是某个模型本身。

模型会变化。

真正留下来的,也许是:

  • 项目知识;
  • 工具连接;
  • 验证规则;
  • 权限边界;
  • 失败经验;
  • 工作流程。

这些东西共同组成了一个 Agent 的 Harness。

如果这个方向成立,那么未来竞争的不只是“谁拥有更强模型”,还包括“谁拥有更好的让模型可靠工作的系统”。

评论 →

CC BY-NC-SA 4.0

评论

评论由 GitHub Discussions 提供。登录 GitHub 后即可评论。 前往对应 Discussion