DEVELOPMENT NOTE / Ask Wiki

에이전틱 RAG의 검증 한계

목표

  • LLM의 추가 검색 판단과 질의 재작성으로 멀티홉 질문 처리
  • 기존 Spring AI Tool Calling을 활용한 의존성 추가 없는 구현

차단 요인

  • Gemini 다중 tool 호출의 thought_signature를 보존하지 못하는 OpenAI 호환 어댑터
  • 에러 없이 동작하지만 단발 2/6보다 낮은 에이전틱 정답 1/6을 기록한 로컬 3B 모델
  • 강한 모델과 네이티브 tool-calling을 동시에 제공하지 못한 무료·로컬 스택

반증 실험

  • 위키 검색이 필요한 질문과 잡담·도메인 밖 질문에 기대 분류를 미리 지정
  • 같은 질문·도구 목록·시스템 프롬프트를 유지하고 모델만 바꿔 검색 여부 판단을 비교
  • 분류 결과와 실제 단발·에이전틱 정답 수를 함께 확인해 구현 성공과 품질 개선을 분리
분류 정확도GeminiOllama 3B
전체97.2%41.7%
위키 검색 의도100%100%
잡담·도메인 외100%0%
  • 단일턴 분류·질문 재작성에서는 정상 동작한 동일 Gemini 경로
  • 전부 검색으로 분류한 3B 모델을 안전하게 흡수한 fail-open 기본값

결론

  • 구현 완료와 효과 검증을 분리한 미증명 결론
  • 다음 검증 조건으로 네이티브 tool-calling 모델 또는 Spring AI 전용 SDK 필요