Satu kontes, dijalankan dan diputuskan
Delapan belas konfigurasi model × prompt dinilai terhadap golden question Anda dan diperingkat berdasarkan biaya per jawaban benar.
ClickHouse Seri Use-Case
Dalam 90 menit Anda menjalankan kontes sendiri — enam model di tiga strategi prompt, menjawab pertanyaan bisnis nyata dalam SQL di atas ClickHouse — lalu memilih yang layak dirilis berdasarkan bukti: biaya per jawaban benar, bukan leaderboard publik.
Bukan leaderboard publik. Kontes Anda sendiri.
Memilih model adalah keputusan berkonsekuensi pertama dalam aplikasi agent, dan paling sering ditebak-tebak. Tebak terlalu tinggi, Anda membayar harga frontier untuk kemampuan yang tidak pernah dibutuhkan tugasnya. Tebak terlalu rendah, Anda merilis sesuatu yang diam-diam salah pada workload Anda yang sebenarnya.
Jadi Anda menjalankan kontesnya sendiri. Grid enam model di tiga strategi prompt menjawab satu set pertanyaan bisnis ber-ground-truth di atas dataset ClickHouse yang live.
Setiap jawaban dinilai dengan akurasi eksekusi — apakah query-nya mengembalikan hasil yang benar, bukan SQL yang tampak benar — dan setiap konfigurasi diperingkat berdasarkan biaya per jawaban benar. Itulah kualitas per dolar untuk tugas Anda, satu-satunya angka yang benar-benar bisa menyelesaikan perdebatan.
Langfuse sudah tersambung sejak modul 00, bukan ditempel di akhir: ia menjalankan kontes sebagai experiment, menilainya dengan code evaluator dan LLM judge, menyimpan setiap trace, dan mengikuti pemenangnya sampai ke produksi.
Yang Anda bawa pulang
Di trial ClickHouse Cloud Anda sendiri, project Langfuse Anda sendiri, dan satu key OpenRouter.
Delapan belas konfigurasi model × prompt dinilai terhadap golden question Anda dan diperingkat berdasarkan biaya per jawaban benar.
Satu evaluator kebenaran dan satu LLM judge berjalan server-side di project Langfuse Anda sendiri, menilai setiap run.
Jawaban dibandingkan dengan result set golden yang di-cache — posisi kolom, pembulatan float, normalisasi row-set — sehingga query yang cuma terlihat benar tidak bisa lolos.
Jawaban yang sudah ditinjau menjadi golden question baru dan grid dijalankan ulang — seluruh loop-nya terlihat end to end di Langfuse.
Konfigurasi pemenang live di balik POST /ask, ter-trace per sesi, dengan thumbs-up/thumbs-down yang ditulis balik sebagai score Langfuse.
Harness, agent, SQL guard read-only, API serving dan UI arena — milik Anda untuk diarahkan ke data Anda sendiri.
Rutenya · ~90 menit hands-on
Satu alur, awal sampai selesai: pilih model berdasarkan bukti, pahami, perbaiki, lalu pantau di produksi.
Sambungkan OpenRouter, ClickHouse Cloud, dan Langfuse — tracing aktif sebelum satu model pun dipilih — lalu seed dataset arena.
Jalankan grid model × prompt sebagai experiment Langfuse dan tentukan pemenangnya berdasarkan biaya per jawaban benar.
Lebih jauh dari “dia menang”: akurasi per tier, signal llm_judge, dan trace individual dari prompt sampai SQL yang dihasilkan.
Ubah jawaban yang sudah ditinjau menjadi golden question baru lewat annotation queue, lalu jalankan ulang grid-nya.
Sajikan konfigurasi pemenang di balik API sungguhan dan pantau trace produksi, sesi, biaya, serta feedback thumbs-up/thumbs-down.
Mandiri secara default. Setiap modul menyebut checkpoint awalnya dan diakhiri verifikasi yang bisa Anda periksa sendiri, jadi tidak ada yang tertinggal karena tempo ruangan.
Sebelum Anda ikut
Bawa trial ClickHouse Cloud, project Langfuse, dan satu key OpenRouter. Pulang dengan tahu model mana yang layak dirilis, berapa biayanya per jawaban benar, dan cara membuktikannya lagi kuartal depan.