Lộ trình người học
Các bài thực hành dành cho người tham dự workshop.
Đây là lộ trình người học: chuỗi bài thực hành bạn sẽ hoàn thành trong workshop. Mỗi mô-đun tiếp nối mô-đun trước, đưa chatbot NL→SQL của Agent Arena qua một quy trình: chọn mô hình nền → đo lường offline → phát hành và phát hiện → điều tra với con người → chứng minh và giám sát cải tiến — tất cả đều được quan sát bằng Langfuse ngay từ mô-đun đầu tiên, gọi mô hình qua OpenRouter và truy vấn dữ liệu trên ClickHouse.
Lộ trình bắt đầu bằng quyết định quan trọng nhất khi xây dựng một tác nhân nghiêm túc: chọn mô hình nào. Mô-đun 01 trả lời bằng bằng chứng — một cuộc thi chạy dưới dạng Langfuse experiments và xếp hạng theo chi phí trên mỗi câu trả lời đúng. Mọi mô-đun sau đó đều phát triển từ lựa chọn này.
Làm việc thông qua các mô-đun theo thứ tự:
- 00 Thiết lập — kết nối OpenRouter, ClickHouse Cloud và Langfuse Cloud, rồi seed cơ sở dữ liệu.
- 01 Chọn mô hình nền — đưa lưới mô hình × prompt vào Langfuse experiments và chọn mô hình theo chi phí trên mỗi câu trả lời đúng.
- 02 Đo lường offline — không chỉ dừng ở kết quả
“mô hình này thắng”: đọc độ chính xác theo cấp độ, score
agent-arena-llm-judgevà từng trace để hiểu hiệu năng thực tế. - 03 Phát hành và phát hiện — phát hành cấu hình đã chọn với chính sách kinh doanh lỗi thời, rồi quan sát evaluator vận hành vẫn đạt trong khi 👎 thật của người dùng làm lộ điểm mù.
- 04 Điều tra với con người — dùng tín hiệu phản hồi để tìm trace production có thẩm quyền, hoàn tất annotation của con người, xác minh bản sửa và ghi lại nguồn gốc.
- 05 Khép kín vòng lặp — đưa sự cố đã được duyệt vào bộ dữ liệu vàng, chứng minh cải tiến bằng các experiment đối chứng, hiệu chỉnh và bật một evaluator online tổng quát, rồi giám sát traffic tương lai bằng cả điểm số lẫn phản hồi.
Xem trang tổng quan để biết bảng mô-đun đầy đủ và phần ghi chú tương ứng dành cho giảng viên.