ClickHouse 유스케이스 시리즈

우승자를 가린다.
비용을 증명한다.

90분 동안 직접 대결을 엽니다 — 여섯 개 모델과 세 가지 프롬프트 전략이 ClickHouse 위에서 실제 비즈니스 질문에 SQL로 답합니다 — 그리고 공개 리더보드가 아니라 근거로 고릅니다: 정답 하나당 비용으로.

90분 · 처음부터 끝까지18 개 구성 채점Langfuse · 0단계부터$0 트라이얼 크레딧

공개 리더보드가 아닙니다. 여러분의 대결입니다.

모델 선택은 에이전트 애플리케이션에서 가장 먼저 내리는 중대한 결정이고, 가장 자주 감으로 내리는 결정입니다. 높게 잡으면 과제에 필요하지도 않은 성능에 프런티어 가격을 냅니다. 낮게 잡으면 실제 워크로드를 조용히 틀리는 것을 내보냅니다.

그래서 대결을 직접 엽니다. 여섯 개 모델과 세 가지 프롬프트 전략으로 이루어진 그리드가, 정답이 확정된 비즈니스 질문 세트에 실제 ClickHouse 데이터셋을 상대로 답합니다.

모든 답은 실행 정확도로 채점합니다 — 그럴듯해 보이는 SQL이 아니라, 쿼리가 올바른 결과를 돌려주었는지 — 그리고 모든 구성은 정답 하나당 비용으로 순위를 매깁니다. 여러분의 과제에 대한 달러당 품질이고, 논쟁을 실제로 끝낼 수 있는 유일한 숫자입니다.

Langfuse는 마지막에 덧붙이는 것이 아니라 모듈 00부터 연결됩니다: 대결을 실험으로 실행하고, 코드 평가자와 LLM 심판으로 채점하고, 모든 트레이스를 저장하고, 우승자를 따라 프로덕션까지 갑니다.

가지고 돌아가는 것

마칠 때 전부 돌아가고 있습니다.

여러분의 ClickHouse Cloud 트라이얼, 여러분의 Langfuse 프로젝트, 그리고 OpenRouter 키 하나 위에서.

01

끝까지 치러진 대결

모델 × 프롬프트 18개 구성을 여러분의 골든 질문으로 채점하고 정답 하나당 비용으로 순위를 매깁니다.

02

Langfuse 실험과 평가자

정확성 평가자와 LLM 심판이 여러분의 Langfuse 프로젝트에서 서버 사이드로 돌면서 모든 실행을 채점합니다.

03

방어할 수 있는 채점

답을 캐시된 골든 결과 집합과 비교합니다 — 컬럼 위치, 부동소수점 반올림, 행 집합 정규화까지 — 그래서 운 좋아 보이는 쿼리는 통과하지 못합니다.

04

지속적 개선 루프

검토한 답이 새로운 골든 질문이 되고 그리드가 다시 돌아갑니다 — 이 루프 전체가 Langfuse에서 엔드투엔드로 보입니다.

05

프로덕션에 올라간 우승자

우승 구성이 POST /ask 뒤에서 라이브로 서비스되고, 세션 단위로 추적되며, 좋아요/싫어요가 Langfuse 점수로 다시 기록됩니다.

+

저장소 전체

하네스, 에이전트, 읽기 전용 SQL 가드, 서빙 API와 아레나 UI — 여러분의 데이터로 돌려볼 수 있게 전부 여러분 것.

코스 · 실습 약 90분

다섯 개 구간, 순서대로.

하나의 흐름, 처음부터 끝까지: 근거로 모델을 고르고, 이해하고, 개선하고, 프로덕션에서 지켜봅니다.

  1. 00

    설치

    20분

    OpenRouter, ClickHouse Cloud, Langfuse를 연결하고 — 모델을 고르기 전에 트레이싱부터 붙입니다 — 아레나 데이터셋을 시드합니다.

  2. 01

    기본 모델 선정

    20분

    모델 × 프롬프트 그리드를 Langfuse 실험으로 돌리고 정답 하나당 비용으로 우승자를 가립니다.

  3. 02

    품질 측정

    15분

    “이겼다”에서 한 걸음 더: 티어별 정확도, llm_judge 신호, 그리고 프롬프트에서 생성된 SQL까지의 개별 트레이스.

  4. 03

    지속적으로 개선

    20분

    검토한 답을 어노테이션 큐를 통해 새 골든 질문으로 만들고, 그 질문으로 그리드를 다시 돌립니다.

  5. 04

    프로덕션 배포

    15분

    우승 구성을 실제 API 뒤에 서비스하고 프로덕션 트레이스, 세션, 비용, 좋아요/싫어요 피드백을 지켜봅니다.

기본은 자율 진행입니다. 모든 모듈이 시작 체크포인트를 명시하고 스스로 확인할 수 있는 검증으로 끝나므로, 강의실 속도에 낙오되는 사람이 없습니다.

참가 전에

누구를 위한 것이고, 무엇을 준비할까.

대상 참가자

  • 에이전트 기능을 위해 모델을 고르기 직전인 엔지니어와 아키텍트
  • “왜 이 모델인가?”라는 질문을 받아봤고 방어할 수 있는 답을 원하는 분
  • LLM 평가 체계를 처음 세우는 팀
  • SQL과 터미널이 익숙하면 충분 — ML 배경은 필요 없습니다

준비물 사전 준비

  • 노트북의 Python 3.11과 Node 18+
  • 트라이얼 크레딧이 있는 ClickHouse Cloud 서비스
  • Langfuse Cloud 프로젝트
  • OpenRouter API 키 — OpenAI 호환 엔드포인트 하나가 로스터의 모든 모델을 앞에서 받아주므로, 제공사별 자격 증명을 따로 관리할 일이 없습니다

진행 방식 형식

  • 다섯 모듈 100% 실습 — 모든 명령과 쿼리는 복사·붙여넣기
  • 완전 자율 진행, 진행자를 위해 각 모듈을 그대로 따라가는 강사 트랙도 함께
  • 채점은 여러분의 Langfuse 프로젝트에서 돌아가므로 근거도 여러분 것으로 남습니다
  • 로스터는 의도적으로 저비용입니다 — NL→SQL에 프런티어 모델은 필요 없습니다

대결을 열 준비 되셨나요?

ClickHouse Cloud 트라이얼, Langfuse 프로젝트, OpenRouter 키를 가져오세요. 어떤 모델을 도입할지, 정답 하나당 비용이 얼마인지, 그리고 다음 분기에 그것을 다시 증명하는 방법까지 알고 돌아갑니다.

18한 번의 실행으로 채점하는 모델 × 프롬프트 구성 수.
$0트라이얼 크레딧과 저비용 로스터로 세션 전체가 커버됩니다.
여러분 것하네스는 여러분의 질문으로 돌려볼 수 있게 여러분 것입니다.
KO