DEVELOPMENT NOTE / Ask Wiki

프롬프트 튜닝의 환각 한계

측정 방법

  • 환각률: 답이 없는 20문항 중 근거 부족을 알리지 않고 내용을 만들어낸 비율
  • 오거부율: 답이 있는 30문항 중 기대 문서가 검색됐는데도 답변을 거절한 비율
  • 프롬프트 실험에서는 문서 8개·임베딩 모델·검색 top-K 4를 고정하고 프롬프트 문구만 변경
  • 모델 비교에서는 같은 50문항·같은 날·같은 머신·같은 검색 결과를 사용하고 챗 모델만 교체
  • 각 구성은 한 번씩 실행했으며 반복 실행·독립 평가자 판정은 수행하지 않음

프롬프트 실험

버전환각률오거부율
기본65%0%
강한 거절 유도20%26.7%
판단 순서 명시70%3.3%
예시 추가60%3.3%
  • 환각 감소와 오거부 증가가 맞물린 트레이드오프
  • 답이 있는 질문과 없는 질문의 검색 점수 분포 중첩으로 유사도 임계값 기각

모델 교체 비교

  • 임베딩을 nomic-embed-text로 고정하고 챗 모델만 교체한 통제 실험
  • Spring AI 버전 상향 없이 Gemini OpenAI 호환 엔드포인트 연결
  • 로컬 모델과 상용 모델을 같은 골든셋·같은 날·같은 머신에서 비교

결과

지표Ollama 3BGemini
환각률75%0%
오거부율10%6.7%
평균 지연8,823ms637ms
  • 이 평가셋의 단일 실행에서는 프롬프트 조정보다 모델 교체의 개선 폭이 컸음
  • 상위 4개 검색 결과의 정답 문서 포함률 93.3%를 유지해 같은 검색 결과에서 생성 모델만 비교
  • 0%는 답이 없는 고정 질문 20개의 단일 실행 관측값이며 일반 질의 전체의 환각률 0%를 의미하지 않음