06 Eksperimen
Panduan pelajar: 06 Eksperimen
Materi workshop dikelola dalam repositori publik langfuse/langfuse-workshop repository. Gunakan repositori untuk aplikasi yang dapat dijalankan, cabang checkpoint, dan pengaturan lokal.
Panduan pelajar: 06 Eksperimen
Catatan instruktur
- Ide utamanya adalah penggunaan ulang: pelari eksperimen memanggil
runSupportConversation(...)yang sama dengan aplikasi web. - Kontraskan penilaian deterministik dalam skrip (
keyword_overlap) dengan penilaian LLM-sebagai-hakim (correctness). - Konfirmkan model evaluator default sebelum penyetelan Correctness. Jika pelajar tidak mengonfigurasinya dalam sesi 4, kirim mereka ke Project Settings → LLM Connections terlebih dahulu.
- Tekankan pengaturan campuran: skrip memiliki pemeriksaan deterministik yang murah, sementara Langfuse memiliki hakim semantik.
- Jaga konkurensi di satu untuk workshop sehingga jejak dan ringkasan run akhir mudah diikuti.
Ritme demo
- Skim bagian bernomor di
scripts/run-dataset.ts. - Tunjukkan evaluator
keyword_overlapdi dalam skrip. - Konfigurasikan evaluator Correctness sebagai evaluator dataset-run.
- Jalankan
npm run dataset:run. - Buka tabel run, jejak per-item, dan tampilan bagan.
Perhatikan
- Target evaluator Correctness. Jaga Run on atur ke Experiments jika Anda ingin skor muncul di baris run dan dalam perbandingan run.
- Buat pelajar beralih Run on dari default Observations ke Experiments sebelum mereka mengonfigurasi apa pun.
- Jika belum ada eksperimen run, tabel review atau pratinjau prompt mungkin kosong. Itu diharapkan sebelum
npm run dataset:runmembuat run pertama. - Pemetaan evaluator Correctness menggunakan tiga dropdown sumber yang berbeda:
queryadalah Input dengan$.messages[-1].content,generationadalah Output tanpa JsonPath, danground_truthadalah Expected Output dengan$.idealAnswer. - Kesalahan konfigurasi umum adalah membiarkan ketiga variabel di Input, yang secara diam-diam membuat evaluator membaca data yang salah untuk setiap bidang.
- Pelajar menganggap pemeriksaan deterministik harus aktif di Langfuse sekarang. Tidak; sebutkan docs evaluator kode hanya sebagai alternatif.
- "No default model set" berarti Langfuse memerlukan koneksi LLM/model evaluator default; itu tidak diperbaiki dengan mengedit
.env. - Hasil evaluator asinkron lambat; konsol hanya menunjukkan ringkasan akhir, jadi segarkan Langfuse setelah run selesai jika
correctnessmasih tertunda.