Agent ArenaClickHouse Workshops

02 Đo chất lượng

Ghi chú giảng viên cho module 02 — thời lượng, nội dung dẫn dắt, lỗi thường gặp và các bước reset.

Tài liệu đồng hành của người điều phối cho bài học của học viên 02 Đo chất lượng.

Thời lượng

Tổng khoảng 15 phút.

  • 5 phút — độ chính xác theo tier và phần phân tách outcome trên màn hình chi tiết Leaderboard của cấu hình thắng.
  • 4 phút — score thứ cấp agent-arena-llm-judge, và những nơi nó bất đồng với correctness.
  • 6 phút — đào vào hai hoặc ba trace Langfuse riêng lẻ của các câu hỏi bị sai hoặc bị điểm thấp.

Nội dung dẫn dắt

  • Đặt lại khung mục tiêu: thắng Arena chỉ cho biết một cấu hình đã vượt phần còn lại tính tổng thể; module này nói về cách nó thắng và nơi nó yếu nhất — cũng ý đó như việc biết không chỉ rằng một ứng viên đã qua phỏng vấn, mà là họ trả lời xuất sắc câu nào.
  • Hãy nói rõ rằng module này không sinh dữ liệu mới nào — mọi thứ ở đây đã được correctness và score agent-arena-llm-judge do evaluator definition llm_judge phát ra ở Module 01 ghi lại. Đây là một bài tập đọc, không phải một lần chạy lại.
  • Xác nhận lại mẫu số: repo có 20 câu hỏi YAML, nhưng q019 và q020 là few-shot holdout, nên Experiment có 18 dataset item được chấm điểm.
  • Về độ chính xác theo tier: hãy chỉ ra rằng một cấu hình có thể trông mạnh tổng thể mà vẫn chông chênh ở tier khó nhất, và đó đúng là điều mà một con số tổng thể trên leaderboard che giấu.
  • Về phần phân tách outcome: hãy đi qua các hạng mục thành tiếng — SQL bị sandbox từ chối, một lỗi ClickHouse, một kết quả rỗng, một tập kết quả sai — và rằng mỗi loại là một dạng vấn đề khác nhau với một cách sửa khác nhau, không phải một cục "thất bại" không phân biệt.
  • Về agent-arena-llm-judge: nó là người em mịn hơn của độ chính xác nhị phân — một cấu hình có thể đúng theo độ chính xác khi thực thi mà vẫn viết ra SQL mà người review sẽ gắn cờ (một subquery không cần thiết, một phép so sánh ngày mong manh). Hãy tìm một điểm bất đồng ngay tại lớp giữa correctness và agent-arena-llm-judge nếu bạn có thể, đó là cách rõ nhất để học viên nắm được sự phân biệt này.
  • Kết lại bằng cách chọn hai hoặc ba câu hỏi bị sai hoặc điểm thấp và đọc trọn trace của chúng từ đầu đến cuối ngay tại lớp — prompt đã gửi, SQL được sinh ra, lỗi hoặc kết quả — vừa đọc vừa nói ra khuôn mẫu bạn thấy (một cách diễn đạt, một phép join, một bộ lọc ngày mà model liên tục xử lý sai). Đây cũng chính là kỹ năng đọc trace mà Mô-đun 04 dùng lại để điều tra trace production được đánh dấu bằng feedback. Kết thúc bằng cách mang config_id đã chọn sang Mô-đun 03.

Lỗi thường gặp

  • Chưa cấu hình các evaluator của Langfuse — không có score agent-arena-llm-judge hay correctness nào để xây module này quanh nó. Hãy trở lại Module 01, sửa target/bộ lọc của evaluator, và chạy một lưới nhỏ mới trước khi tiếp tục.
  • Không có câu trả lời sai nào để đào vào — nếu cấu hình thắng đạt 100% trên lưới demo, hãy lấy các lỗi của một cấu hình không thắng; kỹ năng đọc trace là điểm chính, không phải việc tìm ra một khuyết điểm của riêng người thắng.
  • ClickHouse chưa được seed / harness chưa từng chạy — màn hình chi tiết Leaderboard (độ chính xác theo tier, phân tách outcome) trống trơn. Điều này nghĩa là Module 01 chưa chạy xong; hãy quay lại và chạy lại trước khi tiếp tục.
  • Bấm vào một trace thì bị 404 hoặc mở sai project — thường nghĩa là trình duyệt đang trỏ vào một project Langfuse khác với project trong .env, hoặc LANGFUSE_BASE_URL/các key không khớp với tài khoản đã chạy harness ở Module 01.

Các bước reset

  • Nếu màn hình chi tiết Leaderboard trống, hãy seed lại và chạy lại tập con giá rẻ: scripts/arena.sh up, rồi python -m eval.harness --run-id demo2 --models qwen3.7-flash,gpt-5.6-luna --prompts P1_zeroshot,P3_dialect.
  • Dùng một --run-id mới cho lần chạy lại để không nhập nhằng bạn đang đọc những dòng nào trên Leaderboard và Experiment nào trong Langfuse khi đang ở trên lớp.
  • Nếu chỉ phần hiển thị của dashboard bị treo (các Experiment vẫn có trong Langfuse), hãy khởi động lại các server cục bộ mà không seed lại: scripts/arena.sh stop && scripts/arena.sh serve.
  • Nếu các evaluator là chỗ thiếu, độ sâu của module này phụ thuộc vào việc sửa nó trước buổi kế tiếp — không có gì thay thế được các score phía Langfuse ngay trong buổi học.

Trên trang này

VI