Agent Arena — Langfuse 实训
让一组 LLM 角逐 ClickHouse 上的自然语言转 SQL 冠军,并持续改进;从第一步起,全程由 Langfuse 提供观测。
欢迎来到 Agent Arena 实训手册。Agent Arena 是一场面向 LLM agent 的正面对决:在这次 实训中,你会把一批 LLM 送进一场竞赛,让它们竞争同一份具体工作—— 在 ClickHouse 支撑的电商数据集上做自然语言转 SQL——然后用证据而不是某个公开榜单 来加冕冠军。Langfuse 从第一个模块起就接入,而不是最后才补上:它主持竞赛、 衡量冠军的质量、驱动持续改进,并一路延伸到生产环境。
为什么要做这场实训
当你着手构建一个正式的 agent 应用时,最早也最关键的决定之一就是 用哪个模型。模型在能力和价格上差异巨大,而最佳选择取决于你 的具体任务——而不是别人的公开榜单。在这里靠猜测,你会在两个方向上吃亏: 为一个你并不需要的前沿模型多花钱,或者上线一个便宜模型,却在你真实的 工作负载上悄悄答错。
严谨的做法是自己跑一场竞赛:把一个模型和 prompt 策略的网格,通过 Langfuse experiments,跑在你自己的黄金数据集上,让每个正确答案的成本—— 也就是你的用例下每美元的质量——来选出冠军。这个决定是后面一切的基础; 如果 agent 用错了模型,衡量、改进或发布它都毫无意义。
本次实训用一个自然语言转 SQL 的聊天机器人把这一切落到实处,只走一条流程: 选出基座模型 → 离线衡量 → 发布并发现问题 → 人工调查 → 证明并监控改进效果。 Langfuse 是把每一步串起来的那条线——从模块 00 到生产改进循环,始终是同一个项目、同一批 trace、反馈、annotation、evaluator 和数据集。
这份手册是双轨的。学员课程是你在现场跟着走的课。讲师配套材料是 同一模块的主持人配套材料:时间安排、讲解脚本、常见故障和重置步骤。
模块
| # | 学员课程 | 讲师配套 | 产出 |
|---|---|---|---|
| 00 | 环境准备 | 笔记 | 接通 OpenRouter、ClickHouse 和 Langfuse——在选定任何模型之前就把 Langfuse 接好——并初始化 Agent Arena 数据集 |
| 01 | 选出基座模型 | 笔记 | 以 Langfuse experiments 的形式跑竞赛;按每个正确答案的成本加冕冠军——这是最基础的决策 |
| 02 | 离线衡量 | 笔记 | 借助 Langfuse 的 evaluator、数据集和 trace,在发布前逐题、逐档位理解冠军的质量 |
| 03 | 发布并发现问题 | 笔记 | 带着一个已知的策略盲点发布选定的 agent;可执行的 SQL 通过了运维 evaluator,而真实用户反馈却标出了这个答案的问题 |
| 04 | 人工调查 | 笔记 | 一位人工评审顺着负面反馈找到那条权威 trace,诊断出过期的策略,验证一次修正,并记录生产环境的溯源信息 |
| 05 | 闭合改进循环 | 笔记 | 被复核的事件变成黄金数据;配对 experiment 证明了改进效果,一个通用的策略 evaluator 完成校准并在线启用,未来的流量将持续被监控 |