LLM 품질 평가 A/B 실습
"LLM eval" · "챗봇 A/B 테스트" — 교육 ⑦ · 감이 아닌 측정.
Golden set 만들기
- CS 실제 티켓 200건 샘플 (PII 마스킹)
- MD·시니어 CS가 모범 답변 작성
- 태그: shipping / return / product / angry
메트릭
| 메트릭 | 정의 | 목표 |
|---|---|---|
| Faithfulness | CONTEXT와 일치 | ≥ 95% |
| Coverage | 질문에 답했는가 | ≥ 90% |
| Escalation precision | 사람 보낼 때 맞음 | ≥ 85% |
| Latency p95 | API+검색 | < 3s |A/B 설계
- A: gpt-4o-mini + RAG
- B: claude-3-5 + RAG
- 동일 golden · temperature 0 · 100문항
LLM-as-judge (주의)
- judge도 환각 → 사람 spot check 10%
Lab 7-1 · 스프레드시트 템플릿
열: question | gold | answer_A | faith_A | answer_B | faith_B다음 ⑧ 보안·비용

| 주기 | 활동 | 담당 |
|---|---|---|
| 주 | 새 FAQ 10건 추가 | CS |
| 월 | golden 재평가 | PM+CS |
| 분기 | 모델·벤더 리뷰 | CTO |
핵심 키워드
· golden
· faithfulness
· A/B
· latency
추천 링크

