Agent Arena — Langfuse ワークショップ
LLM のロスターをコンテストに投入し、ClickHouse 上の NL→SQL で勝者を戴冠させ、そこから改善を続けます — 最初のステップから一貫して Langfuse で計測します。
Agent Arena のプレイブックへようこそ。Agent Arena は LLM エージェントの直接対決型コンテストです。 このワークショップを通して、あなたは LLM のロスターを 1 つの具体的な仕事 — ClickHouse を裏側に持つ e-commerce データセットに対する自然言語から SQL への変換 — をめぐる コンテスト に投入し、公開リーダーボードではなくエビデンスによって勝者を戴冠させます。 Langfuse は最後に後付けするのではなく、最初のモジュールから接続されています。 コンテストを走らせ、勝者の品質を測り、継続的な改善を駆動し、そのまま本番へとつながっていきます。
このワークショップの狙い
本気のエージェントアプリケーションを作るとき、最初に来る最も影響の大きい判断のひとつが どのモデルを使うか です。モデルは能力も価格も大きく異なり、正しい選択は あなた自身の タスクに依存します。誰か他の人の公開リーダーボードではありません。ここで当て推量をすると、 2 つの方向のどちらかで負けます。必要のなかったフロンティアモデルに過剰に支払うか、 安いモデルを出荷して実際のワークロードを静かに間違えさせるかです。
規律ある答えは、コンテストを自分で走らせることです。モデルとプロンプト戦略のグリッドを 自分のゴールデンデータセットに対して Langfuse の experiments として通し、 正答あたりのコスト — あなたの ユースケースにおける 1 ドルあたりの品質 — に勝者を選ばせます。 その判断は他のすべてが乗る土台です。間違ったモデルの上に組み立てたエージェントを測っても、 改善しても、リリースしても意味がありません。
このワークショップは、NL→SQL チャットボットをユースケースとし、1 本の流れでそれを具体化します。 ベースモデルを選ぶ → オフラインで測る → リリースして検知する → 人が調査する → 改善を証明して監視する。 Langfuse がすべてのステップを縫い合わせる糸です。Module 00 から 本番の改善ループまで、同じプロジェクト、trace、フィードバック、annotation、evaluator、 データセットを使います。
このプレイブックは 2 トラック構成です。受講者トラックは教室で進めるレッスンです。 講師トラックは同じモジュールについてのファシリテーター向けの手引きで、タイミング、 トークトラック、よくある失敗、リセット手順を含みます。
モジュール
| # | 受講者 | 講師 | 成果 |
|---|---|---|---|
| 00 | セットアップ | ノート | OpenRouter、ClickHouse、Langfuse を接続 — モデルを選ぶ前に Langfuse を組み込む — し、Agent Arena のデータセットをシード |
| 01 | ベースモデルを選ぶ | ノート | コンテストを Langfuse experiments として実行し、正答あたりのコストで勝者を戴冠 — 土台となる判断 |
| 02 | オフラインで品質を測る | ノート | Langfuse の evaluator、データセット、trace を使い、リリース前に勝者の品質を質問ごと・ティアごとに理解 |
| 03 | リリースして検知する | ノート | 既知のポリシーの盲点を抱えたまま選ばれたエージェントをリリース。実行可能な SQL は運用 evaluator を通るのに、実際のユーザーのフィードバックがその回答に旗を立てる |
| 04 | 人が調査する | ノート | 人が否定的なフィードバックをたどって正典となる trace に到達し、古びたポリシーを診断し、修正を検証し、本番の由来を記録する |
| 05 | ループを閉じる | ノート | レビュー済みのインシデントがゴールデンデータになる。対になった experiment が改善を証明し、汎用のポリシー evaluator を校正してオンラインで有効化し、以後のトラフィックを監視する |