ClickHouse ซีรีส์ยูสเคส

ประกาศผู้ชนะ
พิสูจน์ต้นทุน

ใน 90 นาที คุณจัดการแข่งของคุณเอง — หกโมเดลกับสามกลยุทธ์ prompt ตอบคำถามธุรกิจจริงด้วย SQL บน ClickHouse — แล้วเลือกตัวที่จะใช้งานจริงจากหลักฐาน: ต้นทุนต่อคำตอบที่ถูกหนึ่งข้อ ไม่ใช่ leaderboard สาธารณะ

90 นาที · ตั้งแต่ต้นจนจบ18 คอนฟิกที่ให้คะแนนLangfuse ตั้งแต่ขั้น 0$0 ด้วยเครดิตทดลองใช้

ไม่ใช่ leaderboard สาธารณะ แต่เป็นการแข่งของคุณเอง

การเลือกโมเดลคือการตัดสินใจแรกที่มีผลจริงในแอปพลิเคชัน agent และเป็นข้อที่คนเดามากที่สุด เดาสูงไป คุณจ่ายราคาโมเดลระดับแนวหน้าเพื่อความสามารถที่งานนั้นไม่เคยต้องการ เดาต่ำไป คุณส่งของที่ตอบเวิร์กโหลดจริงผิดอย่างเงียบ ๆ

เพราะอย่างนั้นคุณจึงจัดการแข่งด้วยตัวเอง กริดของหกโมเดลกับสามกลยุทธ์ prompt ตอบชุดคำถามธุรกิจที่มีเฉลยจริง บนชุดข้อมูล ClickHouse ที่ใช้งานอยู่

ทุกคำตอบถูกให้คะแนนด้วย ความแม่นยำของการรันจริง — คิวรีคืนผลลัพธ์ที่ถูกหรือไม่ ไม่ใช่ SQL ที่ดูเหมือนจะถูก — และทุกคอนฟิกถูกจัดอันดับด้วย ต้นทุนต่อคำตอบที่ถูกหนึ่งข้อ นั่นคือคุณภาพต่อเงินหนึ่งดอลลาร์สำหรับงานของคุณ ซึ่งเป็นตัวเลขเดียวที่ยุติข้อถกเถียงได้จริง

Langfuse ถูกต่อไว้ตั้งแต่โมดูล 00 ไม่ใช่แปะเพิ่มตอนท้าย: มันรันการแข่งเป็น experiment ให้คะแนนด้วย code evaluator และ LLM judge เก็บทุก trace และติดตามผู้ชนะไปจนถึงโปรดักชัน

สิ่งที่คุณจะได้กลับไป

ทุกอย่างที่จะรันอยู่เมื่อคุณจบ

บนบัญชีทดลองใช้ ClickHouse Cloud ของคุณเอง โปรเจกต์ Langfuse ของคุณเอง และคีย์ OpenRouter หนึ่งอัน

01

การแข่งที่จัดและตัดสินจบแล้ว

สิบแปดคอนฟิกโมเดล × prompt ที่ให้คะแนนกับคำถามเฉลยทองของคุณ และจัดอันดับด้วย ต้นทุนต่อคำตอบที่ถูกหนึ่งข้อ

02

Langfuse experiment และ evaluator

evaluator ตรวจความถูกต้องและ LLM judge ที่รันฝั่งเซิร์ฟเวอร์ในโปรเจกต์ Langfuse ของคุณเอง ให้คะแนนทุกรอบการรัน

03

การให้คะแนนที่คุณอธิบายได้

คำตอบถูกเทียบกับ ชุดผลลัพธ์ เฉลยทองที่แคชไว้ — ตำแหน่งคอลัมน์ การปัดทศนิยม การนอร์มัลไลซ์ชุดแถว — คิวรีที่ดูเหมือนฟลุกจึงผ่านไม่ได้

04

ลูปการพัฒนาต่อเนื่อง

คำตอบที่ผ่านการรีวิวกลายเป็นคำถามเฉลยทองใหม่ แล้วกริดรันซ้ำ — เห็นลูปทั้งวง ครบวงจรใน Langfuse

05

ผู้ชนะบนโปรดักชัน

คอนฟิกผู้ชนะรันสดอยู่หลัง POST /ask มี trace แยกตามเซสชัน และผลโหวตนิ้วโป้งขึ้น/นิ้วโป้งลงถูกเขียนกลับเป็นคะแนน Langfuse

+

ทั้ง repo

harness, agent, ตัวกัน SQL แบบอ่านอย่างเดียว, API สำหรับให้บริการ และ UI ของ arena — เป็นของคุณที่จะชี้ไปที่ ข้อมูลของคุณเอง

เส้นทาง · ลงมือทำ ~90 นาที

ห้าจุดจอด เรียงตามลำดับ

หนึ่งสายงาน ตั้งแต่ต้นจนจบ: เลือกโมเดลจากหลักฐาน ทำความเข้าใจมัน ปรับให้ดีขึ้น แล้วเฝ้าดูมันบนโปรดักชัน

  1. 00

    การติดตั้ง

    20 min

    ต่อ OpenRouter, ClickHouse Cloud และ Langfuse — วาง tracing ไว้ก่อนเลือกโมเดลใด ๆ — แล้ว seed ชุดข้อมูลของ arena

  2. 01

    เลือกโมเดลตั้งต้น

    20 min

    รันกริดโมเดล × prompt เป็น Langfuse experiment แล้วประกาศผู้ชนะจากต้นทุนต่อคำตอบที่ถูกหนึ่งข้อ

  3. 02

    วัดคุณภาพ

    15 min

    ไปไกลกว่า “มันชนะ”: ความแม่นยำแยกตามระดับ สัญญาณ llm_judge และ trace รายตัวจาก prompt ไปถึง SQL ที่สร้างออกมา

  4. 03

    พัฒนาต่อเนื่อง

    20 min

    เปลี่ยนคำตอบที่รีวิวแล้วให้เป็นคำถามเฉลยทองใหม่ผ่านคิวการทำ annotation แล้วรันกริดซ้ำกับคำถามชุดนั้น

  5. 04

    ปล่อยขึ้นโปรดักชัน

    15 min

    ให้บริการคอนฟิกผู้ชนะหลัง API จริง แล้วเฝ้าดู trace บนโปรดักชัน เซสชัน ต้นทุน และฟีดแบ็กนิ้วโป้งขึ้น/นิ้วโป้งลง

ค่าเริ่มต้นคือทำเองตามจังหวะของคุณ ทุกโมดูลระบุจุดตรวจเริ่มต้นและจบด้วยการตรวจสอบที่คุณเช็คได้เอง จึงไม่มีใครถูกทิ้งไว้เพราะจังหวะของห้อง

ก่อนเข้าร่วม

เหมาะกับใคร และต้องเตรียมอะไร

เหมาะกับใคร ผู้เข้าร่วม

  • วิศวกรและสถาปนิกที่กำลังจะเลือกโมเดลสำหรับฟีเจอร์ agent
  • ใครก็ตามที่เคยถูกถามว่า “ทำไมต้องโมเดลนี้” และอยากมีคำตอบที่อธิบายได้
  • ทีมที่กำลังตั้งระบบประเมิน LLM เป็นครั้งแรก
  • ใช้ SQL และเทอร์มินัลได้คล่อง — ไม่ต้องมีพื้น ML

ต้องเตรียมอะไร สิ่งที่ต้องมี

  • Python 3.11 และ Node 18+ บนแล็ปท็อปของคุณ
  • เซอร์วิส ClickHouse Cloud ที่มีเครดิตทดลองใช้
  • โปรเจกต์ Langfuse Cloud
  • คีย์ API ของ OpenRouter — endpoint เดียวที่เข้ากันกับ OpenAI ครอบทุกโมเดลในรายชื่อ จึงไม่มี credential แยกตามผู้ให้บริการให้ต้องจัดการ

รูปแบบการเรียน รูปแบบ

  • ลงมือทำ 100% ตลอดห้าโมดูล — ทุกคำสั่งและทุกคิวรีคัดลอกไปวางได้
  • ทำเองได้เต็มรูปแบบ พร้อมแทร็กผู้สอนที่มีทุกโมดูลคู่ขนานสำหรับผู้ดำเนินการ
  • การให้คะแนนรันในโปรเจกต์ Langfuse ของคุณ หลักฐานจึงเป็นของคุณ
  • รายชื่อโมเดลตั้งใจให้ต้นทุนต่ำ — NL→SQL ไม่ต้องใช้โมเดลระดับแนวหน้า

พร้อมจัดการแข่งหรือยัง

เตรียมบัญชีทดลองใช้ ClickHouse Cloud โปรเจกต์ Langfuse และคีย์ OpenRouter มา แล้วกลับไปพร้อมคำตอบว่าจะใช้โมเดลไหน มันมีต้นทุนเท่าไรต่อคำตอบที่ถูกหนึ่งข้อ และจะพิสูจน์ซ้ำได้อย่างไรในไตรมาสหน้า

18คอนฟิกโมเดล × prompt ที่ให้คะแนนในการรันครั้งเดียว
$0เครดิตทดลองใช้กับรายชื่อโมเดลต้นทุนต่ำครอบคลุมทั้งเซสชัน
ของคุณharness เป็นของคุณที่จะชี้ไปที่คำถามของคุณเอง
TH