決着までやり切ったコンテスト
18 通りのモデル × プロンプト構成を、自分のゴールデン質問で採点し、正解 1 件あたりのコスト で順位付け。
ClickHouse ユースケースシリーズ
90 分で自分のコンテストを走らせます — 6 つのモデルと 3 つのプロンプト戦略が、ClickHouse に対する SQL で実際のビジネス上の問いに答えます。採用は公開リーダーボードではなく、正解 1 件あたりのコストという証拠で決めます。
公開リーダーボードではなく、 自分のコンテスト。
モデル選びはエージェントアプリケーションで最初に効く判断で、そして最も勘で決められがちな判断でもあります。高く見積もれば、タスクに必要のない能力にフロンティア価格を払い続けます。低く見積まれば、実際のワークロードで静かに間違える何かを出荷することになります。
だから、コンテストは自分で走らせます。6 つのモデルと 3 つのプロンプト戦略のグリッドが、正解が用意されたビジネス上の問いに、ライブの ClickHouse データセットに対して答えます。
採点はすべて 実行精度 — 正しそうな SQL ではなく、クエリが正しい結果を返したか — で行い、各構成は 正解 1 件あたりのコスト で順位付けします。それは自分のタスクにおける 1 ドルあたりの品質であり、議論に決着をつけられる唯一の数字です。
Langfuse はモジュール 00 から組み込まれていて、最後に付け足すものではありません。コンテストを experiments として実行し、コード評価器と LLM ジャッジで採点し、すべてのトレースを保存して、勝者を本番まで追い続けます。
持ち帰るもの
自分の ClickHouse Cloud トライアル、自分の Langfuse プロジェクト、そして OpenRouter のキー 1 本で。
18 通りのモデル × プロンプト構成を、自分のゴールデン質問で採点し、正解 1 件あたりのコスト で順位付け。
正答性の評価器と LLM ジャッジ が、自分の Langfuse プロジェクトのサーバー側で全実行を採点。
回答はキャッシュ済みのゴールデン 結果セット と比較 — 列の位置、浮動小数点の丸め、行集合の正規化まで見るので、たまたま正しそうに見えるクエリは通りません。
レビュー済みの回答が新しいゴールデン質問になり、グリッドを再実行 — ループ全体が Langfuse でエンドツーエンドに 見えます。
勝った構成が POST /ask の背後で稼働し、セッション単位でトレースされ、高評価/低評価が Langfuse のスコアとして書き戻されます。
ハーネス、エージェント、読み取り専用の SQL ガード、サービング API、アリーナ UI — 自分のデータ に向けて使えます。
行程 · ハンズオン約 90 分
ひと続きの流れ: 証拠でモデルを選び、理解し、改善し、そして本番で見守ります。
OpenRouter、ClickHouse Cloud、Langfuse を接続 — モデルを選ぶ前にトレースを配線し、アリーナのデータセットを投入します。
モデル × プロンプトのグリッドを Langfuse の experiments として実行し、正解 1 件あたりのコストで勝者を決めます。
「勝った」で終わらせません: ティア別の精度、llm_judge のシグナル、そしてプロンプトから生成 SQL までの個別トレース。
レビュー済みの回答をアノテーションキュー経由で新しいゴールデン質問に変え、それに対してグリッドを再実行します。
勝った構成を実際の API の背後で提供し、本番のトレース、セッション、コスト、高評価/低評価のフィードバックを見ます。
既定は自習形式です。 どのモジュールにも開始チェックポイントがあり、自分で確認できる検証で終わるので、会場のペースに取り残される人は出ません。
参加する前に
ClickHouse Cloud のトライアル、Langfuse のプロジェクト、OpenRouter のキーを持って参加してください。どのモデルを採用すべきか、正解 1 件あたりいくらかかるか、そして来四半期にもう一度それを証明する方法を持ち帰れます。