Harness 驾驭系统

AI 里的 Harness(Agent Harness|驾驭系统)

一句话核心定义

Agent = LLM模型 + Harness
Harness = 包裹大模型之外的整套运行时控制系统、脚手架、约束环境。
名词本义:马具(缰绳、马鞍)。
比喻:大模型是野马,算力强但无约束、容易跑偏;Harness 是缰绳、护栏、方向盘、刹车,用来管控模型,把随机的模型能力变成稳定可落地的智能体。

经典总结:Anything that is not the model is the harness.
凡是不属于模型本身的代码、规则、环境,全部属于Harness。

核心组成(生产级Harness必备模块)

  1. 主循环(Harness Loop / TAO循环:Thought → Action → Observation)
    调度核心:调用LLM推理 → 解析工具调用 → 执行工具 → 结果回灌上下文,循环执行,包含终止条件(最大步数、任务完成判定,防止无限循环)
  2. 工具管理层
    工具注册、权限控制、沙箱隔离、参数校验、MCP/Function Calling适配
  3. 上下文与记忆系统
    对话窗口管理、状态持久化、摘要压缩、长期记忆RAG、历史快照
  4. 安全与强制卡口(最重要特征)
    区分Prompt软性约束 vs Harness硬性约束
    • Prompt:“请执行代码前运行测试”(模型可能忘记、无视)
    • Harness:底层钩子强制拦截,不管模型记不记得,系统强制执行校验,不通过禁止下一步
  5. 可观测层
    Trace日志、步骤回放、token统计、异常捕获、失败重试、回滚机制
  6. 生命周期控制
    任务启停、中断、人工介入(human-in-the-loop)、超时管控

关键区分:Harness vs 框架(LangGraph/LangChain)

很多人混淆,这里清晰划分:

  • LangGraph、AutoGen、CrewAI = Agent开发框架
    面向开发者,提供API、图结构、状态原语,用来搭建智能体;属于开发时工具
  • Harness = Agent运行时系统
    面向模型,是智能体上线之后包裹模型的整套执行环境;框架可以用来实现Harness,但框架 ≠ Harness。

简单类比:

  • LangGraph = 建筑图纸(开发框架)
  • Harness = 水电、安防、门禁、消防整套楼宇运维系统(运行环境)

AI工程范式演进(方便理解它出现的背景)

  1. Prompt Engineering(2023):学会如何跟模型说话
  2. Context Engineering:管理给到模型的信息、上下文窗口
  3. Harness Engineering(驾驭工程,2025–2026主流):搭建外部系统管控模型行为
    三者是同心圆,Harness包含前两者,范围最大。

极简最小Harness伪代码(直观感受)

def harness_run(task, llm, tools, max_steps=8):
    state = init_state(task)
    for _ in range(max_steps):
        # 调用大模型思考
        output = llm.call(state.messages)
        if output.is_answer:
            return output.final_result
        # Harness层:执行工具(不是模型执行!)
        tool_result = tools.execute(output.tool_call)
        # 强制校验卡口(硬性规则)
        if security_check(tool_result) is False:
            return "操作被系统拦截"
        # 更新上下文,进入下一轮循环
        state.append_observation(tool_result)
    return "达到最大步骤限制,任务终止"

补充:还有另一个冷门含义(传统ML领域)

在老式机器学习里,ML Test Harness 指模型自动化测试套件,用来批量跑评测、验证模型效果。
现在大家讨论Agent、Claude Code、Cursor时提到的Harness,全部指Agent Harness(驾驭系统),不是测试套件。

通俗总结

裸LLM只会生成文字;
加上Harness之后,AI才拥有:持续思考循环、调用外部工具、记住状态、被规则限制、安全兜底、稳定完成复杂多步骤任务的能力。
同一个大模型,Agent效果差距,绝大多数来源于Harness设计,而非Prompt微调。

一句话概括:

Harness 是包裹大模型、管控智能体执行流程、施加硬性约束与外部能力的整套运行控制系统。

相关资讯