LangSmith:可观测性与评估
用 LangSmith 做 trace 调试、数据集评测与线上监控,建立 LLM 应用的质量保障闭环。
LangSmith 是什么
LangSmith 是 LangChain 官方的 LLM DevOps 平台,解决三个问题:看得见(trace)、测得准(evaluation)、管得住(monitoring)。
接入只需两个环境变量
export LANGSMITH_TRACING=true
export LANGSMITH_API_KEY="你的Key"
# 之后所有 LangChain 调用自动上报 trace
打开控制台即可看到每次调用的完整链路:提示词渲染结果、模型原始输入输出、工具调用参数、每步耗时与 token 消耗。
数据集评测
from langsmith import Client
client = Client()
dataset = client.create_dataset("rag-qa-评测集")
client.create_examples(
dataset_id=dataset.id,
inputs=[{"question": "退货流程是什么?"},
{"question": "会员积分怎么用?"}],
outputs=[{"answer": "……"}, {"answer": "……"}], # 标准答案
)
再配置评估器(如正确性、相关性、幻觉检查),即可批量跑分并对比不同提示词/模型版本的效果。
实践中最有价值的三件事
- 上线前:用评测集回归验证每次提示词改动;
- 上线后:按 trace 排查坏 case,回填进评测集;
- 长期:监控延迟、token 成本与失败率曲线。
📝 课后练习
quiz-1 接入 LangSmith 的 trace 只需设置哪两个环境变量?