生态与工具 中级

LangSmith:可观测性与评估

用 LangSmith 做 trace 调试、数据集评测与线上监控,建立 LLM 应用的质量保障闭环。

LangSmith 是什么

LangSmith 是 LangChain 官方的 LLM DevOps 平台,解决三个问题:看得见(trace)、测得准(evaluation)、管得住(monitoring)。

接入只需两个环境变量

export LANGSMITH_TRACING=true
export LANGSMITH_API_KEY="你的Key"
# 之后所有 LangChain 调用自动上报 trace

打开控制台即可看到每次调用的完整链路:提示词渲染结果、模型原始输入输出、工具调用参数、每步耗时与 token 消耗。

数据集评测

from langsmith import Client

client = Client()
dataset = client.create_dataset("rag-qa-评测集")
client.create_examples(
    dataset_id=dataset.id,
    inputs=[{"question": "退货流程是什么?"},
            {"question": "会员积分怎么用?"}],
    outputs=[{"answer": "……"}, {"answer": "……"}],  # 标准答案
)

再配置评估器(如正确性、相关性、幻觉检查),即可批量跑分并对比不同提示词/模型版本的效果。

实践中最有价值的三件事

  • 上线前:用评测集回归验证每次提示词改动;
  • 上线后:按 trace 排查坏 case,回填进评测集;
  • 长期:监控延迟、token 成本与失败率曲线。

📝 课后练习

quiz-1 接入 LangSmith 的 trace 只需设置哪两个环境变量?