Agent Arena — Lokakarya Langfuse
Masukkan sederet LLM ke dalam sebuah kontes, tentukan pemenang untuk NL→SQL di atas ClickHouse, dan terus tingkatkan kualitasnya — semuanya diinstrumentasi dengan Langfuse sejak langkah pertama.
Selamat datang di panduan Agent Arena. Agent Arena adalah kontes head-to-head untuk agen LLM: sepanjang lokakarya ini, Anda akan memasukkan sederet LLM ke dalam sebuah kontes untuk satu pekerjaan spesifik — natural-language-to-SQL di atas dataset e-commerce yang didukung ClickHouse — lalu menentukan pemenang berdasarkan bukti, bukan papan peringkat publik. Langfuse dihubungkan sejak modul pertama, bukan ditempelkan di akhir: Langfuse yang menjalankan kontes, mengukur kualitas pemenang, mendorong perbaikan berkelanjutan, dan terus mengikuti hingga ke produksi.
Mengapa lokakarya ini
Saat Anda membangun aplikasi agen yang serius, salah satu keputusan pertama dan paling menentukan adalah model mana yang akan digunakan. Kemampuan dan harga antar-model bisa jauh berbeda, dan pilihan yang tepat bergantung pada tugas spesifik Anda — bukan pada papan peringkat publik milik orang lain. Kalau Anda hanya menebak, Anda bisa rugi lewat dua arah: membayar mahal untuk model frontier yang sebenarnya tidak Anda butuhkan, atau memakai model murah yang diam-diam salah menangani beban kerja nyata Anda.
Jawaban yang disiplin adalah menjalankan kontes itu sendiri: uji sederet model dan strategi prompt melalui eksperimen Langfuse terhadap golden dataset milik Anda sendiri, lalu biarkan biaya per jawaban benar — kualitas per dolar untuk kasus penggunaan Anda — yang menentukan pemenangnya. Keputusan itu adalah pijakan bagi semua yang lain; tidak ada gunanya mengukur, memperbaiki, atau merilis agen yang dibangun di atas model yang salah.
Lokakarya ini mewujudkan hal itu dengan chatbot NL→SQL sebagai studi kasus, dalam satu alur: pilih model dasar → ukur secara offline → rilis dan deteksi → investigasi bersama manusia → buktikan dan pantau perbaikannya. Langfuse adalah benang merah yang menyatukan setiap langkah — proyek, jejak (trace), umpan balik, anotasi, evaluator, dan dataset yang sama, mulai dari Modul 00 hingga loop perbaikan di produksi.
Panduan ini punya dua jalur. Jalur Peserta adalah pelajaran yang Anda ikuti langsung di ruangan. Jalur Instruktur adalah pendamping fasilitator untuk modul yang sama: pengaturan waktu, alur penyampaian, kegagalan umum, dan langkah reset.
Modul
| # | Peserta | Instruktur | Hasil |
|---|---|---|---|
| 00 | Persiapan | catatan | OpenRouter, ClickHouse, dan Langfuse tersambung — Langfuse sudah terpasang sebelum model apa pun dipilih — dan dataset Agent Arena sudah diisi (seeded) |
| 01 | Pilih model dasar | catatan | Kontes dijalankan sebagai eksperimen Langfuse; pemenang ditentukan berdasarkan biaya per jawaban benar — keputusan yang menjadi fondasi |
| 02 | Ukur secara offline | catatan | Kualitas pemenang dipahami per pertanyaan dan per tingkat kesulitan sebelum rilis, menggunakan evaluator, dataset, dan jejak Langfuse |
| 03 | Rilis dan deteksi | catatan | Agen terpilih dirilis dengan satu titik buta kebijakan yang sudah diketahui; SQL yang dapat dieksekusi lolos evaluator operasional, sementara umpan balik pengguna sungguhan menandai jawabannya |
| 04 | Investigasi bersama manusia | catatan | Seorang manusia menyusuri umpan balik negatif hingga ke jejak otoritatifnya, mendiagnosis kebijakan yang usang, memverifikasi koreksinya, dan mencatat asal-usul (provenance) produksi |
| 05 | Tutup siklusnya | catatan | Insiden yang sudah dikaji menjadi golden data; eksperimen berpasangan membuktikan perbaikannya, evaluator kebijakan umum dikalibrasi lalu diaktifkan secara online, dan trafik mendatang dipantau |