Langfuse WorkshopClickHouse Workshops

06 실험

학습자 가이드: 06 실험

워크숍 자료는 공개 langfuse/langfuse-workshop 저장소에서 관리됩니다. 저장소를 사용하여 실행 가능한 앱, 체크포인트 분기, 로컬 설정을 확인하세요.

이 마크다운 파일 보기

학습자 가이드: 06 실험

강사 노트

  • 핵심 아이디어는 재사용입니다: 실험 러너가 웹 앱과 동일한 runSupportConversation(...)을 호출합니다.
  • 스크립트의 결정론적 점수 지정(keyword_overlap)과 LLM 판사 점수 지정(correctness)을 대조하세요.
  • 정확성 설정 전에 기본 평가자 모델을 확인하세요. 학습자가 세션 4에서 구성하지 않은 경우 먼저 Project Settings → LLM Connections으로 보내세요.
  • 혼합 설정을 강조하세요: 스크립트는 저렴한 결정론적 확인을 소유하고 Langfuse는 의미론적 판사를 소유합니다.
  • 워크숍에서 동시성을 1로 유지하여 추적과 최종 실행 요약이 따라가기 쉽도록 하세요.

데모 리듬

  1. scripts/run-dataset.ts의 번호가 매겨진 섹션을 훑습니다.
  2. 스크립트 내의 keyword_overlap 평가자를 지적합니다.
  3. 정확성 평가자를 데이터셋 실행 평가자로 구성합니다.
  4. npm run dataset:run을 실행합니다.
  5. 실행 테이블, 항목별 추적, 차트 보기를 엽니다.

주의할 점

  • 정확성 평가자 대상입니다. Run on을 Observations의 기본값에서 Experiments로 유지하면 점수가 실행 행과 실행 비교에 나타나기를 원할 경우입니다.
  • 학습자가 다른 모든 항목 전에 Run on을 기본값 Observations에서 Experiments로 전환하도록 하세요.
  • 실험 실행이 없으면 리뷰 테이블이나 프롬프트 미리 보기가 비어 있을 수 있습니다. 이는 npm run dataset:run 전에 예상된 것입니다.
  • 정확성 평가자 매핑은 세 가지 다른 소스 드롭다운을 사용합니다: query은 Input with $.messages[-1].content, generation은 Output JsonPath 없음, ground_truth은 Expected Output with $.idealAnswer.
  • 일반적인 오류 설정은 세 가지 변수를 모두 Input에 유지하는 것이며, 이는 모든 필드에 대해 평가자가 잘못된 데이터를 읽도록 조용히 합니다.
  • 학습자가 결정론적 확인이 이제 Langfuse에 있어야 한다고 가정합니다. 그렇지 않습니다. 코드 평가자 문서는 대안으로만 언급하세요.
  • "No default model set"은 Langfuse가 LLM 연결/기본 평가자 모델을 필요로 한다는 뜻입니다. 이는 .env을 편집하여 수정되지 않습니다.
  • 느린 비동기 평가자 결과; 콘솔은 최종 요약만 표시하므로 correctness가 여전히 보류 중인 경우 실행이 완료된 후 Langfuse를 새로 고치세요.

이 페이지의 내용

KO