미결 항목

예상 리스크

리스크 대응
AI Hub 승인 지연 1주차 즉시 신청. 4.2절 오류 내성 실험은 텍스트 레벨 오류 주입이므로 승인과 무관하게 진행 가능
화자 분리 정확도 미달 [V1] 모노 확인됨. diarization 필수, 데모는 물리 2채널(브라우저 2대)로 우회
류준 부하 집중 (백엔드+AI 동시 담당) (해소됨, 2026-08-26) 7.2절 팀 개편(장민석이 백엔드·AI 합류)으로 구조적으로 해소. C-5·CI 운영은 정성윤에게 둔 기존 조치는 유지, F-2는 여전히 조건부
GPU 미확보 [V2] 확인됨 — Apple M5, CUDA 없음. polyglot-ko-1.3b 등 소형 모델 MPS로 대응, 4개 오픈소스 모델 다운로드 완료
외국인 화자 한국어 음성 데이터 0건 (신규 2026-08-28) 대응 미정 — A-3 최대 리스크. AI Hub 다산 데이터는 전부 내국인 발화다. 출처를 못 찾으면 A-3 의 STT 정확도를 측정할 방법이 없다(절대 원칙 10 — 측정할 수 없는 것을 측정한 것처럼 쓰지 않는다)
A-3 번역 품질 채점 방법 미정 (2026-08-28 1차 범위에서는 해소) ⓑ 로 좁히면서 1차 지표가 번역 품질이 아니라 STT 정확도(WER/CER) 가 됐다. WER 은 규칙 기반이라 절대 원칙 1 과 충돌하지 않는다. 번역 채점 문제는 ⓐ 확장 시점으로 미뤄진 것이지 풀린 것이 아니다
골든셋 13건 — 지표 신뢰 불가 (신규 2026-08-28) 도메인 축소로 50 → 13건. 다산 기준 재확장 전까지 Recall@5·MRR 을 문서에 기록하지 않는다
A-5 통번역 지연 예산 미계산 (신규 2026-08-28) ⓑ 1차 범위에는 번역 경로가 없어 STT 지연만 얹힌다. 번역+TTS 왕복은 ⓐ 확장 시점의 문제다. 기획서 4.3절에 항목만 열어 두고 목표치는 비워 뒀다(절대 원칙 2)
범위 과다 (F·G·H·I) 코어(A~E, C-5)만 절대 사수, 나머지는 6주차 기준선 통과 시에만 조건부 착수
깃허브 저장소·데모 도메인 아직 미배포 (해소됨, 2026-08-28) 원격은 github.com/solidbob02/call.solidbob.cloud로 연결 완료. 데모 도메인 연결은 Sprint 7 로 미뤄 뒀으나, 미룬 탓에 배포 사이트의 본문 링크가 전부 404 라 2주차로 앞당겼다(프로젝트 페이지의 /call.solidbob.cloud/ 한 겹과 루트 절대경로 링크 405곳이 어긋난다). _project/decisions/102 · w2-custom-domain

2026-08-28 해소 — 트리거 허용 창을 1,500ms 로 확정했다(_project/decisions/202). 새 결정이 아니라 2026-08-25 팀 확정의 누락된 반영이다. 코드·사이트는 그때부터 1,500ms 였고 _project/plan.md 만 800ms 로 남아 있었는데, 그 사실이 어디에도 적혀 있지 않아 3일간 같은 질문이 네 번 올라왔다. 팀 컨펌을 로그에만 적고 결정 기록으로 올리지 않은 것이 원인이다.

정하지 못한 것 (2주차로 넘어감)

골든셋 50건 — 비율은 정해졌고, 측정 방법 두 가지가 남았다

2026-08-28 무효. 도메인이 다산 하나가 되면서(decisions/201) 아래 배분 전체가 의미를 잃었다. 골든셋은 50 → 13건이 됐고, F-2 케이스는 0건이다(다산에 종결 유형이 없다). P1~P7 커버리지도 다시 확인해야 한다 — 아래에서 큰 소득이라 적은 그 커버리지가 삭제된 37건에 실려 있었을 수 있다. 재확장 계획은 부록 C 9번 항목.

배분은 확정됐다(F-2 가중: 금융보험 18 · 쇼핑 16 · 다산콜센터 9 · 질병관리본부 7). 근거는 w2-golden-set-50에 기록돼 있다. P1~P7 개인정보 패턴이 전부 커버된 것이 큰 소득이다 — 1주차 10건에는 P3·P5·P6·P7 이 아예 없어 C-5 “누락 0건” 절대 규칙을 4개 패턴에 대해 측정할 방법 자체가 없었다.

남은 것은 이 표본으로 지표를 어떻게 읽을 것인가다. 둘 다 숫자로 판단할 수 있다.

  1. B-0 도메인 분류 정확도(≥0.95)의 기저율이 올라간다. 도메인이 18/16/9/7 로 기울어 다수 도메인으로 찍기만 해도 36% 가 나온다(균등이면 25%). 6.1절이 이 지표를 “도메인 내 검색 지표보다 엄격”하게 잡은 취지가 흐려진다 → 균형 부분집합으로 따로 재거나, 다수 클래스 기저율을 함께 보고하면 해소된다
  2. B(검색) 14건은 2주차 베이스라인용으로 얇다. 도메인당 2~4건이라 Recall@5·MRR 의 분산이 크다. 잠정 베이스라인을 “여러 번 실행한 값 중 최저치”로 고정할 때(절대 원칙 4) 표본이 작으면 그 최저치가 실력이 아니라 운을 반영할 수 있다

배분을 다시 잡자는 게 아니다. 측정 방법에 반영할지만 정하면 되고, 3주차 150건 확장 때 비율을 다시 볼 기회가 있다.

이번 주 할 일 (1주차)

세부 진행은 8주 마일스톤의 칸반 보드, 완료 기록은 진행상황에서 확인하세요.


← 표지로 돌아가기