6. 평가 설계

⚠ 2026-08-28 방향 전환 — 이 페이지보다 결정 기록이 우선한다

도메인을 다산콜센터 하나로 줄이고 외국인 고객 지원을 차별점으로 세웠다 (_project/decisions/201, 비공개). 아래 본문의 금융보험·쇼핑·질병관리본부 서술은 그 시점의 사실이라 지우지 않았다 — 절대 원칙 8(“실패를 지운 기록은 기록이 아니다”)과 같은 이유로, 계획이 바뀐 사실 자체가 기록이다.

이 페이지에서 바뀐 것: ① B-0 도메인 분류 정확도 지표는 폐기됐다 ② F-2 채점 케이스가 0건이다(다산에는 종결 유형이 없다) ③ 이전 실측치 Recall@5 0.857 / MRR 0.702 는 무효 — 4개 도메인 14건 기준이었다. 다산 기준 재측정 전까지 이 페이지에 숫자를 다시 적지 않는다(절대 원칙 2). ④ A-3 번역 품질을 무엇으로 채점할지 아직 정하지 않았다 — LLM 채점은 절대 원칙 1이 막는다.

6.1 지표

오른쪽 실측 열은 2026-08-28 전부 무효가 됐다 — 4개 도메인 골든셋 14건으로 잰 값인데 도메인이 다산 하나로 줄었다(decisions/201). 지우지 않고 취소선으로 남긴다(절대 원칙 8) — 잰 사실 자체는 기록이고, 재측정 전까지 이 자리에 새 숫자를 넣지 않는다(절대 원칙 2).

영역 지표 목표 기준선 2026-08-27 실측 무효
B-0 도메인 분류 정확도 (자동 분류, 3.2절) ≥ 0.95 지표 폐기 — 분류할 도메인이 없다 0.857 ❌ (n=14)
검색 Recall@5 ≥ 0.70 (오류 없음) / ≥ 0.60 (오류 10%) 0.857 (n=14) 재측정 필요
검색 MRR ≥ 0.55 0.702 (n=14) 재측정 필요
트리거 적절 발동률 (종료 후 0~1,500ms) ≥ 0.85  
트리거 조기 발동률 / 지연 발동률 각각 별도 집계  
트리거 발동 지연시간 분포 (p50/p95) 측정·기록 (허용 창은 합/불 판정선일 뿐, 개선 추이는 이 분포로 본다)  
생성 환각 수치 발생 150문항 중 5건 이하  
생성 출처 표시율 100%  
컴플라이언스 재현율 ≥ 0.90  
컴플라이언스 정밀도 ≥ 0.60  
C-5 P1~P7 패턴 마스킹 누락 0건 — 절대 규칙  
C-5 과잉 마스킹률 참고 기록 (목표 아님)  
C-5 STT 오류율별 마스킹 재현율 곡선 기록  
성능 내부 처리 p95 ≤ 1,000ms  
성능 E2E 체감 지연 측정·기록  
성능 통화당 토큰 비용 측정·기록  
F-2 종결 요건 판정 정확도 (금융보험·쇼핑만 해당 — 1.4절) 100% — 절대 규칙 (조건부 착수)  
F-2 근거 규정 검색 정확도 (금융보험·쇼핑만 해당) ≥ 0.90 (조건부 착수)  
F-3 반복 문의 연결 재현율 ≥ 0.95 (여유 시 — 미구현 시 N/A)  
G-2 자원 매칭 정확도 ≥ 0.95 (여유 시 — 미구현 시 N/A)  
G-2 폐지·이전 기관 반환 0건 (여유 시 — 미구현 시 N/A)  
F-1 / G-1 탐지 성능 측정 불가 — 5.5절  

부록 B의 H·I 지표는 착수 확정 시 이 표에 편입한다.

첫 실측 (2026-08-27, 잠정)

측정일 2026-08-27 · 커밋 39cbe68 기준 작업분 · 표본 golden-set/v1-50.json (검색 B 케이스 14건 / 도메인 라벨 34건) · 재현:

cd infra && docker compose up -d elasticsearch && cd ..
export ELASTICSEARCH_URL=http://localhost:9200
.venv/bin/python scripts/index_knowledge_base.py --to-es --recreate
.venv/bin/python scripts/run_eval.py --golden-set golden-set/v1-50.json --runs 3

3회 실행 최저치가 1회 값과 같다 — BM25 도 검색 기반 도메인 판정도 결정적이라 흔들리지 않는다 (절대 원칙 4의 “최저치 고정”이 여기서는 자명하게 성립한다). 임베딩이 들어가는 4주차부터는 다시 본다.

이 값은 잠정이다. 공식 기준선은 3주차 골든셋 150건 재측정이고, CI 게이트로 고정하지 않는다 (w2-baseline-gate).

도메인 4종 반영 (2026-08-26) — Recall@5·MRR 등 검색 지표는 4개 도메인 전체 평균과 함께 도메인별로도 따로 집계한다. 도메인마다 지식베이스 크기·카테고리 수가 달라 평균값 하나로는 특정 도메인의 부진을 가릴 수 있다.

6.2 채점 원칙

  1. LLM을 채점자로 쓰지 않는다. 답을 만든 모델이 자기 답을 심판하면 순환이 된다. 모든 지표를 규칙으로 계산해 재현 가능하게 한다.
  2. 여러 번 실행한 값 중 최저치를 기준선으로 고정한다. 생성 모델은 같은 입력에도 답이 달라진다.
  3. 기준선 미달 시 CI 실패로 처리한다. 개선이 아니라 회귀 방지가 목적이다.
  4. C-5·F-2의 절대 규칙은 1건이라도 뚫리면 실패로 처리한다. 평균값으로 평가하지 않는다.
  5. 모든 지표는 정답 정의가 코드로 표현 가능해야 한다. 표현할 수 없는 지표는 지표가 아니다 (4.1절 트리거 허용 창이 그 예).

← 개발목차로 돌아가기