AI 工具开发 高级

工具评测与迭代:让工具越用越好

用数据驱动工具打磨:调用成功率、误选率、参数错误率三层指标,失败案例回填描述的迭代闭环。

工具也要有"考试"

工具上线后,模型用它用得对不对是可测量的。三层指标:

  • 误选率:该用 A 工具时选了 B —— 说明书(描述)写得让人误解;
  • 参数错误率:选对了但参数错 —— schema 或参数 description 不清;
  • 执行成功率:参数对但执行失败 —— 实现层问题(超时、依赖故障)。

三层指标正好对应《AI 工具开发》前三课:误选率改描述、参数错误率改 schema、执行失败改实现。

失败案例回填闭环

1. 记录每次调用:任务上下文 + 选了什么工具 + 传了什么参 + 结果
2. 每周复盘失败案例,归类到三层指标
3. 针对性修改:描述加一句边界说明 / 参数补枚举 / 实现加重试
4. 跑回归评测集(历史案例 + 新增失败案例),确认修复且未改坏其他
   ↺ 循环

这套闭环与《提示词版本管理》《RAG 评估》一脉相承——LLM 应用的每一层都要评测驱动

描述 A/B:低成本高收益

工具描述改一句话(如给 search_web 加上"仅在本地知识库查不到时使用"),误选率可能腰斩。改动小、见效快,是工具迭代的第一杠杆——但仍要过评测集验证,因为描述变化可能影响其他工具的被选概率。

毕业清单

  • 每个工具:单一职责、说明书自查通过、五道工程防线齐备;
  • 每个工具集:三层指标有数、失败案例有回填记录;
  • 能回答:"这个工具最坏能造成什么损失,损失被什么机制圈住了?"
完成本模块后,你已具备把《Tool Calling》《MCP》《Harness》串联成生产级工具体系的完整能力。

📝 课后练习

quiz-1 工具"误选率"高(该用 A 工具时选了 B),首先应该改什么?