Langfuse WorkshopClickHouse Workshops

06 实验

学习者指南:06 实验

工作坊资料在公开的 langfuse/langfuse-workshop 仓库中维护。使用该仓库获取可运行的应用、检查点分支和本地设置。

查看此 Markdown 文件

学习者指南:06 实验

讲师笔记

  • 关键思想是重用:实验运行程序调用与网络应用相同的 runSupportConversation(...)。
  • 对比脚本中的确定性评分(keyword_overlap)与 LLM 作为评判评分(correctness)。
  • 在正确性设置之前确认默认评估器模型。如果学习者在第 4 节中未配置它,请先将他们发送到 项目设置 → LLM 连接。
  • 强调混合设置:脚本拥有廉价的确定性检查,而 Langfuse 拥有语义评判。
  • 保持并发为一,以便工作坊追踪和最终运行摘要易于跟踪。

演示节奏

  1. 浏览 scripts/run-dataset.ts 中的编号部分。
  2. 指出脚本内的 keyword_overlap 评估器。
  3. 将正确性评估器配置为数据集运行评估器。
  4. 运行 npm run dataset:run。
  5. 打开运行表、每项追踪和图表视图。

注意事项

  • 正确性评估器目标。保持 运行于 设置为 实验,如果您希望分数显示在运行行中并在运行比较中显示。
  • 让学习者在配置任何其他内容之前从默认的 观测 切换 运行于 到 实验。
  • 如果不存在实验运行,审查表或提示词预览可能为空。这在 npm run dataset:run 创建第一次运行之前是预期的。
  • 正确性评估器映射使用三个不同的源下拉列表:query 是输入与 $.messages[-1].content,generation 是输出,无 JsonPath,ground_truth 是预期输出与 $.idealAnswer。
  • 常见的配置错误是将所有三个变量留在输入上,这默认地使评估器为每个字段读取错误的数据。
  • 学习者假设确定性检查现在必须在 Langfuse 中。它不是;仅作为替代方案提及代码评估器文档。
  • "未设置默认模型"意味着 Langfuse 需要 LLM 连接/默认评估器模型;它不是通过编辑 .env 来修复的。
  • 慢的异步评估器结果;控制台仅显示最终摘要,所以如果 correctness 仍待决,请在运行完成后刷新 Langfuse。

本页内容

ZH