Harness 架构 高级

评测 Harness:如何科学地衡量智能体好坏

从 lm-evaluation-harness 到 Agent 基准,建立"模型分≠智能体分"的评测观,为本站助手设计评测方案。

"Harness"的另一个身份:评测脚手架

Harness 一词最早广为人知是在评测领域:lm-evaluation-harness(开源社区标准的 LLM 评测框架)把"数据集加载 → 提示模板 → 推理 → 指标计算"这条流水线工程化,让任何模型都能在同一套考卷上公平打分。评测 Harness 与 Agent Harness 思想同源:把不确定的模型行为,装进确定可复现的流程里。

模型分 ≠ 智能体分

  • 模型基准(MMLU 等)测的是"裸脑"知识;
  • Agent 基准(SWE-bench、WebArena、TAU-bench)测的是"裸脑 + Harness"的整体 —— 工具循环、上下文管理、错误恢复全算在内;
  • 推论:换更好的 Harness 能大幅拉高同一模型的智能体分数 —— 优化 Harness 就是优化智能体。

给自己的 Agent 做评测的骨架

评测集 = 20~50 条真实任务(含输入 + 期望结果/检查点)
for task in tasks:
    result = run_agent(task)                  # 跑完整 Harness 流程
    checks = {
        "结果正确": verify(result),            # 程序化校验
        "步数预算内": result.steps <= 10,
        "无越权操作": no_dangerous_calls(result),
    }
score = 平均通过率                            # 每次改 Harness 回归一遍

与本站实践的闭环

本站 AI 助手可以直接套用:意图识别准确率(规则或 LLM 分类各测一遍)、课程推荐命中率("学习 RAG" 是否命中 RAG 课)、回答忠实度(是否只依据站内教程)。把线上误判 case 持续回填评测集 —— 这正是《RAG 评估》课强调的迭代闭环,只是这次评的是整个 Harness。

记住三层:模型 → Harness → 智能体。模型每月都在变强,而 Harness 的设计能力,才是你长期沉淀的工程资产。

📝 课后练习

quiz-1 为什么说"模型分 ≠ 智能体分"?