DEVELOPMENT NOTE / Ask Wiki
골든셋 기반 RAG 평가 하네스
문제
- 몇 차례 수동 질문만으로 내린 환각 억제 성공 판단
- 청크 크기·top-K·프롬프트 변경의 품질 저하를 감지할 공통 기준 부재
평가 데이터
- 평가 문서 8개와 질문 50개를 변경 후에도 그대로 재사용하는 고정 테스트 세트로 구성
- 답이 있는 30문항에는 기대 문서 ID를 지정해 어떤 출처가 검색돼야 하는지 명시
- 답이 없는 20문항에는 '근거 부족으로 답변 거절'을 기대값으로 지정
- 질문마다 검색된 문서 ID와 생성 답변을 함께 남겨 검색 실패와 생성 실패를 분리
실행·판정 방법
- 같은 8개 문서를 동일한 청킹·임베딩 설정으로 색인
- 답이 있는 30문항을 top-K 1·4·8로 각각 검색하고, 기대 문서가 결과 안에 있으면 적중으로 판정
- 답이 없는 20문항을 검색·생성까지 실행하고, 거절하지 않고 사실을 만들어내면 환각으로 판정
- 청킹·top-K·프롬프트·모델을 바꿀 때마다 같은 50문항을 다시 실행해 직전 기준선과 비교
- 결과가 결정적인 검색 적중률 검사는 CI에서 실행하고, 모델 출력이 달라질 수 있는 생성 검사는 로컬에서 주기 실행
여기서 골든셋은 정답·기대 출처·거절 여부를 미리 정한 고정 질문 모음이고, 회귀 검증은 같은 질문을 다시 실행해 이전에 맞던 동작이 나빠지지 않았는지 확인하는 테스트다.
측정 결과
| 측정 지표 | 판정 기준 | 결과 |
|---|---|---|
| 첫 번째 검색 결과 적중률 | 첫 검색 결과가 기대 문서 | 36.7% |
| 상위 4개 검색 결과 적중률 | 상위 4개 안에 기대 문서 포함 | 93.3% |
| 상위 8개 검색 결과 적중률 | 상위 8개 안에 기대 문서 포함 | 100% |
| 근거 없는 답변 비율 | 답 없는 질문에서 답변 생성 | 65% |
결론
- 수동 확인과 실제 50문항 평가 사이의 큰 격차 확인
- 검색과 생성을 분리해 실패 원인을 특정할 변경 전후 비교 기준 확보
- 이 문서 집합의 기본 검색 범위로 top-K 4 선택