Agent Arena — Workshop Langfuse
Đưa nhiều LLM vào một cuộc thi, chọn mô hình tốt nhất cho NL→SQL trên ClickHouse và liên tục cải thiện mô hình đó — tất cả đều được quan sát bằng Langfuse ngay từ bước đầu tiên.
Chào mừng bạn đến với cẩm nang Agent Arena. Đây là cuộc thi đối đầu giữa các tác nhân LLM: trong workshop này, bạn đưa nhiều LLM vào một cuộc thi cho một nhiệm vụ cụ thể — chuyển ngôn ngữ tự nhiên thành SQL trên bộ dữ liệu thương mại điện tử chạy bằng ClickHouse — rồi chọn mô hình chiến thắng dựa trên bằng chứng, không dựa vào bảng xếp hạng công khai. Langfuse được kết nối ngay từ mô-đun đầu tiên thay vì chỉ bổ sung ở cuối: Langfuse vận hành cuộc thi, đo chất lượng của mô hình chiến thắng, thúc đẩy cải tiến liên tục và theo sát hệ thống khi đi vào production.
Vì sao có workshop này
Khi xây dựng một ứng dụng tác nhân nghiêm túc, một trong những quyết định đầu tiên và quan trọng nhất là chọn mô hình nào. Các mô hình khác nhau đáng kể về cả năng lực lẫn chi phí, và lựa chọn phù hợp phụ thuộc vào nhiệm vụ cụ thể của bạn — không phải bảng xếp hạng công khai của người khác. Nếu chỉ phỏng đoán, bạn sẽ hoặc trả quá nhiều cho một mô hình cao cấp không cần thiết, hoặc triển khai một mô hình rẻ nhưng âm thầm trả lời sai trên khối lượng công việc thực tế.
Cách làm có kỷ luật là tự tổ chức cuộc thi: chạy một lưới gồm nhiều mô hình và chiến lược prompt dưới dạng experiments của Langfuse trên chính bộ dữ liệu vàng của bạn, rồi dùng chi phí trên mỗi câu trả lời đúng — chất lượng trên mỗi đô la cho trường hợp sử dụng của bạn — để chọn mô hình chiến thắng. Quyết định này là nền tảng cho mọi bước tiếp theo; sẽ không có ý nghĩa nếu đo lường, cải thiện hay phát hành một tác nhân được xây dựng trên mô hình không phù hợp.
Workshop cụ thể hóa bài toán này bằng một chatbot NL→SQL và một quy trình xuyên suốt: chọn mô hình nền → đo lường offline → phát hành và phát hiện → điều tra với con người → chứng minh và giám sát cải tiến. Langfuse kết nối mọi bước bằng cùng một project, các trace, phản hồi, annotation, evaluator và dataset từ Mô-đun 00 cho đến vòng lặp cải tiến trên production.
Cẩm nang có hai lộ trình. Lộ trình người học là các bài thực hành tại workshop. Lộ trình giảng viên là tài liệu đồng hành cho cùng từng mô-đun, gồm thời lượng, nội dung dẫn dắt, lỗi thường gặp và các bước đặt lại môi trường.
Các mô-đun
| # | Người học | Giảng viên | Kết quả |
|---|---|---|---|
| 00 | Thiết lập | ghi chú | Kết nối OpenRouter, ClickHouse và Langfuse — Langfuse có mặt trước khi chọn mô hình — rồi seed bộ dữ liệu Agent Arena |
| 01 | Chọn mô hình nền | ghi chú | Chạy cuộc thi dưới dạng Langfuse experiments và chọn mô hình theo chi phí trên mỗi câu trả lời đúng |
| 02 | Đo lường offline | ghi chú | Hiểu chất lượng của mô hình chiến thắng theo từng câu hỏi và từng cấp độ trước khi phát hành bằng evaluator, dataset và trace của Langfuse |
| 03 | Phát hành và phát hiện | ghi chú | Phát hành tác nhân đã chọn với một điểm mù chính sách có chủ đích; SQL thực thi thành công vượt qua evaluator vận hành nhưng phản hồi thật của người dùng phát hiện vấn đề |
| 04 | Điều tra với con người | ghi chú | Con người lần theo phản hồi tiêu cực đến trace có thẩm quyền, chẩn đoán chính sách lỗi thời, xác minh bản sửa và ghi lại nguồn gốc production |
| 05 | Khép kín vòng lặp | ghi chú | Biến sự cố đã được duyệt thành dữ liệu vàng; dùng các experiment đối chứng để chứng minh cải tiến, hiệu chỉnh evaluator chính sách tổng quát, bật online và giám sát traffic tương lai |