DEVELOPMENT NOTE / Ask Wiki
프롬프트 튜닝의 환각 한계
측정 방법
- 환각률: 답이 없는 20문항 중 근거 부족을 알리지 않고 내용을 만들어낸 비율
- 오거부율: 답이 있는 30문항 중 기대 문서가 검색됐는데도 답변을 거절한 비율
- 프롬프트 실험에서는 문서 8개·임베딩 모델·검색 top-K 4를 고정하고 프롬프트 문구만 변경
- 모델 비교에서는 같은 50문항·같은 날·같은 머신·같은 검색 결과를 사용하고 챗 모델만 교체
- 각 구성은 한 번씩 실행했으며 반복 실행·독립 평가자 판정은 수행하지 않음
프롬프트 실험
| 버전 | 환각률 | 오거부율 |
|---|
| 기본 | 65% | 0% |
| 강한 거절 유도 | 20% | 26.7% |
| 판단 순서 명시 | 70% | 3.3% |
| 예시 추가 | 60% | 3.3% |
- 환각 감소와 오거부 증가가 맞물린 트레이드오프
- 답이 있는 질문과 없는 질문의 검색 점수 분포 중첩으로 유사도 임계값 기각
모델 교체 비교
- 임베딩을
nomic-embed-text로 고정하고 챗 모델만 교체한 통제 실험
- Spring AI 버전 상향 없이 Gemini OpenAI 호환 엔드포인트 연결
- 로컬 모델과 상용 모델을 같은 골든셋·같은 날·같은 머신에서 비교
결과
| 지표 | Ollama 3B | Gemini |
|---|
| 환각률 | 75% | 0% |
| 오거부율 | 10% | 6.7% |
| 평균 지연 | 8,823ms | 637ms |
- 이 평가셋의 단일 실행에서는 프롬프트 조정보다 모델 교체의 개선 폭이 컸음
- 상위 4개 검색 결과의 정답 문서 포함률 93.3%를 유지해 같은 검색 결과에서 생성 모델만 비교
- 0%는 답이 없는 고정 질문 20개의 단일 실행 관측값이며 일반 질의 전체의 환각률 0%를 의미하지 않음