06 实验
学习者指南:06 实验
工作坊资料在公开的 langfuse/langfuse-workshop 仓库中维护。使用该仓库获取可运行的应用、检查点分支和本地设置。
学习者指南:06 实验
讲师笔记
- 关键思想是重用:实验运行程序调用与网络应用相同的
runSupportConversation(...)。 - 对比脚本中的确定性评分(
keyword_overlap)与 LLM 作为评判评分(correctness)。 - 在正确性设置之前确认默认评估器模型。如果学习者在第 4 节中未配置它,请先将他们发送到 项目设置 → LLM 连接。
- 强调混合设置:脚本拥有廉价的确定性检查,而 Langfuse 拥有语义评判。
- 保持并发为一,以便工作坊追踪和最终运行摘要易于跟踪。
演示节奏
- 浏览
scripts/run-dataset.ts中的编号部分。 - 指出脚本内的
keyword_overlap评估器。 - 将正确性评估器配置为数据集运行评估器。
- 运行
npm run dataset:run。 - 打开运行表、每项追踪和图表视图。
注意事项
- 正确性评估器目标。保持 运行于 设置为 实验,如果您希望分数显示在运行行中并在运行比较中显示。
- 让学习者在配置任何其他内容之前从默认的 观测 切换 运行于 到 实验。
- 如果不存在实验运行,审查表或提示词预览可能为空。这在
npm run dataset:run创建第一次运行之前是预期的。 - 正确性评估器映射使用三个不同的源下拉列表:
query是输入与$.messages[-1].content,generation是输出,无 JsonPath,ground_truth是预期输出与$.idealAnswer。 - 常见的配置错误是将所有三个变量留在输入上,这默认地使评估器为每个字段读取错误的数据。
- 学习者假设确定性检查现在必须在 Langfuse 中。它不是;仅作为替代方案提及代码评估器文档。
- "未设置默认模型"意味着 Langfuse 需要 LLM 连接/默认评估器模型;它不是通过编辑
.env来修复的。 - 慢的异步评估器结果;控制台仅显示最终摘要,所以如果
correctness仍待决,请在运行完成后刷新 Langfuse。