驾驭工程(Harness Engineering)详解
本文以 OpenAI 和 Anthropic 两家的官方材料为准,讲清楚驾驭层(Harness)是什么、为什么需要、以及怎么把它做好。
一、它是什么:模型 + 驾驭层
Anthropic 在官方文章里给出过最经典的拆解:agentic system 的基本构建块是**「增强型 LLM」(augmented LLM)——一个 LLM,加上检索(retrieval)、工具(tools)、记忆(memory)**等增强能力,模型能主动生成搜索查询、选择合适的工具、决定保留哪些信息。
那层「增强」——除模型本身之外的一切(工具、记忆、检索、执行循环、沙盒、钩子)——就是驾驭层(Harness)。模型是引擎,驾驭层是整车结构。驾驭工程,就是设计这层驾驭层的工程。
OpenAI 在自己的实践总结里说得更直白:构建软件的纪律,正从「代码」本身转移到「支撑结构——环境、反馈回路和控制系统」。
二、为什么需要:模型开箱即用的局限
模型本身只会一件事:收文本、吐文本。它开箱即用做不到:
- 在多次交互间维持持久状态
- 执行代码、跑测试、装依赖
- 访问训练截止后的实时知识
- 自我验证"我做的对不对"
这些让"智能变可用"的能力,全靠驾驭层补上。Anthropic 对智能体的定义一针见血:
这个"循环 + 工具 + 环境反馈",正是驾驭层要支撑的核心。没有它,模型只是个会聊天的引擎。
三、OpenAI 的百万行实验(实证案例)
驾驭工程最权威的实证来自 OpenAI:一个 3 人小团队(后扩到 7 人),用 Codex(GPT-5 驱动)在约 5 个月里,从空仓库构建出一个约 100 万行代码、有真实内外部用户的产品。
核心理念是**"不手动编写代码"**——产品代码、测试、CI、文档、可观测性、内部工具、评估框架、甚至生产仪表板定义,全部由智能体生成,工程师只负责掌舵。
四、驾驭工程的核心原则(OpenAI + Anthropic)
1. 从最简单的方案开始,只在确有改善时加复杂度
来源:Anthropic。Anthropic 与数十个团队合作后发现,最成功的实现都不是用复杂框架,而是"简单、可组合的模式"。原话:成功不在于建最复杂的系统,而在于建对的系统——先用简单 prompt、配充分评估,只在更简单的方案不够时才上多步智能体。
2. 把工具当 prompt 一样精心设计(ACI)
来源:Anthropic。工具定义应当和整体 prompt 受到同等重视。Anthropic 做 SWE-bench 智能体时,优化工具花的时间比优化 prompt 还多。典型例子:把文件编辑工具从"相对路径"改成"强制绝对路径"后,模型就不再出错——这是给工具做防呆(poka-yoke)。原则是:像投入人机界面(HCI)那样,投入同样精力到智能体-计算机界面(ACI)。
3. 代码仓库是记录系统:给地图,不给千页说明书
来源:OpenAI。要给智能体一张地图,而不是一本 1000 页的说明书。巨型指令文件会挤占稀缺上下文、迅速腐烂、难以核实。所以把 AGENTS.md 当"目录"(约 100 行),真知识放结构化的 docs/,靠"渐进式披露"按需深入,并有专门的 doc-gardening 智能体清理过时文档。
4. 规范架构:强制不变量,而非微观管理
来源:OpenAI。强制执行不变量,但不规定实现方式。划分固定依赖层 Types → Config → Repo → Service → Runtime → UI,靠自定义 linter 和结构测试机械执行,报错信息里直接注入修复指令。边界处严格、边界内自由——生成代码不必符合人类风格,正确、可维护、对未来智能体可读即可。
5. 熵与垃圾回收:持续偿还技术债
来源:OpenAI。智能体会复制仓库已有的模式(包括坏的),必然漂移。解法是把"黄金原则"编码进仓库,跑循环清理流程:后台智能体定期扫描偏差、发起重构 PR。OpenAI 的比喻——技术债就像高息贷款,持续小额偿还,远胜累积后一次性清算。
6. 简洁、透明、可测
来源:Anthropic。实现智能体时遵循三原则:保持设计简洁;通过显式展示智能体的规划步骤来优先透明;通过充分的工具文档和测试精心打造 ACI。并强调要在沙盒环境里大量测试、配上合适的 guardrails——因为智能体的自主性意味着更高成本和错误累积风险。
五、工程师角色的根本转变
OpenAI 的观察:当"写代码"被交给智能体,工程师的工作重心转向系统、架构和杠杆作用。进展不顺时,答案几乎不再是"再努力一点",而是要追问——
每一次卡住都是一个信号:识别缺失的东西(工具、约束、文档),反馈进系统,再让智能体自己写出修复。工程师从"代码工匠"变成"环境与系统的设计者"。
六、一句话总结
延伸阅读(官方一手):OpenAI《工程技术:在智能体优先的世界中利用 Codex》;Anthropic《Building Effective AI Agents》。