"LLM eval" · "챗봇 A/B 테스트" — 교육 ⑦ · 감이 아닌 측정.
Golden set 만들기
- CS 실제 티켓 200건 샘플 (PII 마스킹)
- MD·시니어 CS가 모범 답변 작성
- 태그: shipping / return / product / angry
메트릭
메트릭 정의 목표 Faithfulness CONTEXT와 일치 ≥ 95% Coverage 질문에 답했는가 ≥ 90% Escalation precision 사람 보낼 때 맞음 ≥ 85% Latency p95 API+검색 < 3s A/B 설계
- A: gpt-4o-mini + RAG
- B: claude-3-5 + RAG
- 동일 golden · temperature 0 · 100문항
LLM-as-judge (주의)
- judge도 환각 → 사람 spot check 10%
Lab 7-1 · 스프레드시트 템플릿
열: question | gold | answer_A | faith_A | answer_B | faith_B다음 ⑧ 보안·비용

| 주기 | 활동 | 담당 |
|---|---|---|
| 주 | 새 FAQ 10건 추가 | CS |
| 월 | golden 재평가 | PM+CS |
| 분기 | 모델·벤더 리뷰 | CTO |
핵심 키워드
· golden
· faithfulness
· A/B
· latency
추천 링크






