02 Đo chất lượng
Ghi chú giảng viên cho module 02 — thời lượng, nội dung dẫn dắt, lỗi thường gặp và các bước reset.
Tài liệu đồng hành của người điều phối cho bài học của học viên 02 Đo chất lượng.
Thời lượng
Tổng khoảng 15 phút.
- 5 phút — độ chính xác theo tier và phần phân tách outcome trên màn hình chi tiết Leaderboard của cấu hình thắng.
- 4 phút — score thứ cấp
agent-arena-llm-judge, và những nơi nó bất đồng vớicorrectness. - 6 phút — đào vào hai hoặc ba trace Langfuse riêng lẻ của các câu hỏi bị sai hoặc bị điểm thấp.
Nội dung dẫn dắt
- Đặt lại khung mục tiêu: thắng Arena chỉ cho biết một cấu hình đã vượt phần còn lại tính tổng thể; module này nói về cách nó thắng và nơi nó yếu nhất — cũng ý đó như việc biết không chỉ rằng một ứng viên đã qua phỏng vấn, mà là họ trả lời xuất sắc câu nào.
- Hãy nói rõ rằng module này không sinh dữ liệu mới nào — mọi thứ ở đây đã được
correctnessvà scoreagent-arena-llm-judgedo evaluator definitionllm_judgephát ra ở Module 01 ghi lại. Đây là một bài tập đọc, không phải một lần chạy lại. - Xác nhận lại mẫu số: repo có 20 câu hỏi YAML, nhưng
q019vàq020là few-shot holdout, nên Experiment có 18 dataset item được chấm điểm. - Về độ chính xác theo tier: hãy chỉ ra rằng một cấu hình có thể trông mạnh tổng thể mà vẫn chông chênh ở tier khó nhất, và đó đúng là điều mà một con số tổng thể trên leaderboard che giấu.
- Về phần phân tách outcome: hãy đi qua các hạng mục thành tiếng — SQL bị sandbox từ chối, một lỗi ClickHouse, một kết quả rỗng, một tập kết quả sai — và rằng mỗi loại là một dạng vấn đề khác nhau với một cách sửa khác nhau, không phải một cục "thất bại" không phân biệt.
- Về
agent-arena-llm-judge: nó là người em mịn hơn của độ chính xác nhị phân — một cấu hình có thể đúng theo độ chính xác khi thực thi mà vẫn viết ra SQL mà người review sẽ gắn cờ (một subquery không cần thiết, một phép so sánh ngày mong manh). Hãy tìm một điểm bất đồng ngay tại lớp giữacorrectnessvàagent-arena-llm-judgenếu bạn có thể, đó là cách rõ nhất để học viên nắm được sự phân biệt này. - Kết lại bằng cách chọn hai hoặc ba câu hỏi bị sai hoặc điểm thấp và đọc trọn
trace của chúng từ đầu đến cuối ngay tại lớp — prompt đã gửi, SQL được sinh ra, lỗi hoặc kết quả — vừa đọc vừa
nói ra khuôn mẫu bạn thấy (một cách diễn đạt, một phép join, một bộ lọc ngày mà model liên tục xử lý sai).
Đây cũng chính là kỹ năng đọc trace mà Mô-đun 04 dùng lại để điều tra trace production
được đánh dấu bằng feedback. Kết thúc bằng cách mang
config_idđã chọn sang Mô-đun 03.
Lỗi thường gặp
- Chưa cấu hình các evaluator của Langfuse — không có score
agent-arena-llm-judgehay correctness nào để xây module này quanh nó. Hãy trở lại Module 01, sửa target/bộ lọc của evaluator, và chạy một lưới nhỏ mới trước khi tiếp tục. - Không có câu trả lời sai nào để đào vào — nếu cấu hình thắng đạt 100% trên lưới demo, hãy lấy các lỗi của một cấu hình không thắng; kỹ năng đọc trace là điểm chính, không phải việc tìm ra một khuyết điểm của riêng người thắng.
- ClickHouse chưa được seed / harness chưa từng chạy — màn hình chi tiết Leaderboard (độ chính xác theo tier, phân tách outcome) trống trơn. Điều này nghĩa là Module 01 chưa chạy xong; hãy quay lại và chạy lại trước khi tiếp tục.
- Bấm vào một trace thì bị 404 hoặc mở sai project — thường nghĩa là
trình duyệt đang trỏ vào một project Langfuse khác với project trong
.env, hoặcLANGFUSE_BASE_URL/các key không khớp với tài khoản đã chạy harness ở Module 01.
Các bước reset
- Nếu màn hình chi tiết Leaderboard trống, hãy seed lại và chạy lại tập con giá rẻ:
scripts/arena.sh up, rồipython -m eval.harness --run-id demo2 --models qwen3.7-flash,gpt-5.6-luna --prompts P1_zeroshot,P3_dialect. - Dùng một
--run-idmới cho lần chạy lại để không nhập nhằng bạn đang đọc những dòng nào trên Leaderboard và Experiment nào trong Langfuse khi đang ở trên lớp. - Nếu chỉ phần hiển thị của dashboard bị treo (các Experiment vẫn có trong Langfuse), hãy khởi động lại
các server cục bộ mà không seed lại:
scripts/arena.sh stop && scripts/arena.sh serve. - Nếu các evaluator là chỗ thiếu, độ sâu của module này phụ thuộc vào việc sửa nó trước buổi kế tiếp — không có gì thay thế được các score phía Langfuse ngay trong buổi học.