评测 Harness:如何科学地衡量智能体好坏
从 lm-evaluation-harness 到 Agent 基准,建立"模型分≠智能体分"的评测观,为本站助手设计评测方案。
"Harness"的另一个身份:评测脚手架
Harness 一词最早广为人知是在评测领域:lm-evaluation-harness(开源社区标准的 LLM 评测框架)把"数据集加载 → 提示模板 → 推理 → 指标计算"这条流水线工程化,让任何模型都能在同一套考卷上公平打分。评测 Harness 与 Agent Harness 思想同源:把不确定的模型行为,装进确定可复现的流程里。
模型分 ≠ 智能体分
- 模型基准(MMLU 等)测的是"裸脑"知识;
- Agent 基准(SWE-bench、WebArena、TAU-bench)测的是"裸脑 + Harness"的整体 —— 工具循环、上下文管理、错误恢复全算在内;
- 推论:换更好的 Harness 能大幅拉高同一模型的智能体分数 —— 优化 Harness 就是优化智能体。
给自己的 Agent 做评测的骨架
评测集 = 20~50 条真实任务(含输入 + 期望结果/检查点)
for task in tasks:
result = run_agent(task) # 跑完整 Harness 流程
checks = {
"结果正确": verify(result), # 程序化校验
"步数预算内": result.steps <= 10,
"无越权操作": no_dangerous_calls(result),
}
score = 平均通过率 # 每次改 Harness 回归一遍
与本站实践的闭环
本站 AI 助手可以直接套用:意图识别准确率(规则或 LLM 分类各测一遍)、课程推荐命中率("学习 RAG" 是否命中 RAG 课)、回答忠实度(是否只依据站内教程)。把线上误判 case 持续回填评测集 —— 这正是《RAG 评估》课强调的迭代闭环,只是这次评的是整个 Harness。
记住三层:模型 → Harness → 智能体。模型每月都在变强,而 Harness 的设计能力,才是你长期沉淀的工程资产。
📝 课后练习
quiz-1 为什么说"模型分 ≠ 智能体分"?