끝까지 치러진 대결
모델 × 프롬프트 18개 구성을 여러분의 골든 질문으로 채점하고 정답 하나당 비용으로 순위를 매깁니다.
ClickHouse 유스케이스 시리즈
90분 동안 직접 대결을 엽니다 — 여섯 개 모델과 세 가지 프롬프트 전략이 ClickHouse 위에서 실제 비즈니스 질문에 SQL로 답합니다 — 그리고 공개 리더보드가 아니라 근거로 고릅니다: 정답 하나당 비용으로.
공개 리더보드가 아닙니다. 여러분의 대결입니다.
모델 선택은 에이전트 애플리케이션에서 가장 먼저 내리는 중대한 결정이고, 가장 자주 감으로 내리는 결정입니다. 높게 잡으면 과제에 필요하지도 않은 성능에 프런티어 가격을 냅니다. 낮게 잡으면 실제 워크로드를 조용히 틀리는 것을 내보냅니다.
그래서 대결을 직접 엽니다. 여섯 개 모델과 세 가지 프롬프트 전략으로 이루어진 그리드가, 정답이 확정된 비즈니스 질문 세트에 실제 ClickHouse 데이터셋을 상대로 답합니다.
모든 답은 실행 정확도로 채점합니다 — 그럴듯해 보이는 SQL이 아니라, 쿼리가 올바른 결과를 돌려주었는지 — 그리고 모든 구성은 정답 하나당 비용으로 순위를 매깁니다. 여러분의 과제에 대한 달러당 품질이고, 논쟁을 실제로 끝낼 수 있는 유일한 숫자입니다.
Langfuse는 마지막에 덧붙이는 것이 아니라 모듈 00부터 연결됩니다: 대결을 실험으로 실행하고, 코드 평가자와 LLM 심판으로 채점하고, 모든 트레이스를 저장하고, 우승자를 따라 프로덕션까지 갑니다.
가지고 돌아가는 것
여러분의 ClickHouse Cloud 트라이얼, 여러분의 Langfuse 프로젝트, 그리고 OpenRouter 키 하나 위에서.
모델 × 프롬프트 18개 구성을 여러분의 골든 질문으로 채점하고 정답 하나당 비용으로 순위를 매깁니다.
정확성 평가자와 LLM 심판이 여러분의 Langfuse 프로젝트에서 서버 사이드로 돌면서 모든 실행을 채점합니다.
답을 캐시된 골든 결과 집합과 비교합니다 — 컬럼 위치, 부동소수점 반올림, 행 집합 정규화까지 — 그래서 운 좋아 보이는 쿼리는 통과하지 못합니다.
검토한 답이 새로운 골든 질문이 되고 그리드가 다시 돌아갑니다 — 이 루프 전체가 Langfuse에서 엔드투엔드로 보입니다.
우승 구성이 POST /ask 뒤에서 라이브로 서비스되고, 세션 단위로 추적되며, 좋아요/싫어요가 Langfuse 점수로 다시 기록됩니다.
하네스, 에이전트, 읽기 전용 SQL 가드, 서빙 API와 아레나 UI — 여러분의 데이터로 돌려볼 수 있게 전부 여러분 것.
코스 · 실습 약 90분
하나의 흐름, 처음부터 끝까지: 근거로 모델을 고르고, 이해하고, 개선하고, 프로덕션에서 지켜봅니다.
OpenRouter, ClickHouse Cloud, Langfuse를 연결하고 — 모델을 고르기 전에 트레이싱부터 붙입니다 — 아레나 데이터셋을 시드합니다.
모델 × 프롬프트 그리드를 Langfuse 실험으로 돌리고 정답 하나당 비용으로 우승자를 가립니다.
“이겼다”에서 한 걸음 더: 티어별 정확도, llm_judge 신호, 그리고 프롬프트에서 생성된 SQL까지의 개별 트레이스.
검토한 답을 어노테이션 큐를 통해 새 골든 질문으로 만들고, 그 질문으로 그리드를 다시 돌립니다.
우승 구성을 실제 API 뒤에 서비스하고 프로덕션 트레이스, 세션, 비용, 좋아요/싫어요 피드백을 지켜봅니다.
기본은 자율 진행입니다. 모든 모듈이 시작 체크포인트를 명시하고 스스로 확인할 수 있는 검증으로 끝나므로, 강의실 속도에 낙오되는 사람이 없습니다.
참가 전에
ClickHouse Cloud 트라이얼, Langfuse 프로젝트, OpenRouter 키를 가져오세요. 어떤 모델을 도입할지, 정답 하나당 비용이 얼마인지, 그리고 다음 분기에 그것을 다시 증명하는 방법까지 알고 돌아갑니다.