DEVELOPMENT NOTE / Ask Wiki

골든셋 기반 RAG 평가 하네스

문제

  • 몇 차례 수동 질문만으로 내린 환각 억제 성공 판단
  • 청크 크기·top-K·프롬프트 변경의 품질 저하를 감지할 공통 기준 부재

평가 데이터

  • 평가 문서 8개와 질문 50개를 변경 후에도 그대로 재사용하는 고정 테스트 세트로 구성
  • 답이 있는 30문항에는 기대 문서 ID를 지정해 어떤 출처가 검색돼야 하는지 명시
  • 답이 없는 20문항에는 '근거 부족으로 답변 거절'을 기대값으로 지정
  • 질문마다 검색된 문서 ID와 생성 답변을 함께 남겨 검색 실패와 생성 실패를 분리

실행·판정 방법

  1. 같은 8개 문서를 동일한 청킹·임베딩 설정으로 색인
  2. 답이 있는 30문항을 top-K 1·4·8로 각각 검색하고, 기대 문서가 결과 안에 있으면 적중으로 판정
  3. 답이 없는 20문항을 검색·생성까지 실행하고, 거절하지 않고 사실을 만들어내면 환각으로 판정
  4. 청킹·top-K·프롬프트·모델을 바꿀 때마다 같은 50문항을 다시 실행해 직전 기준선과 비교
  5. 결과가 결정적인 검색 적중률 검사는 CI에서 실행하고, 모델 출력이 달라질 수 있는 생성 검사는 로컬에서 주기 실행

여기서 골든셋은 정답·기대 출처·거절 여부를 미리 정한 고정 질문 모음이고, 회귀 검증은 같은 질문을 다시 실행해 이전에 맞던 동작이 나빠지지 않았는지 확인하는 테스트다.

측정 결과

측정 지표판정 기준결과
첫 번째 검색 결과 적중률첫 검색 결과가 기대 문서36.7%
상위 4개 검색 결과 적중률상위 4개 안에 기대 문서 포함93.3%
상위 8개 검색 결과 적중률상위 8개 안에 기대 문서 포함100%
근거 없는 답변 비율답 없는 질문에서 답변 생성65%

결론

  • 수동 확인과 실제 50문항 평가 사이의 큰 격차 확인
  • 검색과 생성을 분리해 실패 원인을 특정할 변경 전후 비교 기준 확보
  • 이 문서 집합의 기본 검색 범위로 top-K 4 선택