DEVELOPMENT NOTE / Ask Wiki
에이전틱 RAG의 검증 한계
목표
- LLM의 추가 검색 판단과 질의 재작성으로 멀티홉 질문 처리
- 기존 Spring AI Tool Calling을 활용한 의존성 추가 없는 구현
차단 요인
- Gemini 다중 tool 호출의
thought_signature를 보존하지 못하는 OpenAI 호환 어댑터 - 에러 없이 동작하지만 단발 2/6보다 낮은 에이전틱 정답 1/6을 기록한 로컬 3B 모델
- 강한 모델과 네이티브 tool-calling을 동시에 제공하지 못한 무료·로컬 스택
반증 실험
- 위키 검색이 필요한 질문과 잡담·도메인 밖 질문에 기대 분류를 미리 지정
- 같은 질문·도구 목록·시스템 프롬프트를 유지하고 모델만 바꿔 검색 여부 판단을 비교
- 분류 결과와 실제 단발·에이전틱 정답 수를 함께 확인해 구현 성공과 품질 개선을 분리
| 분류 정확도 | Gemini | Ollama 3B |
|---|---|---|
| 전체 | 97.2% | 41.7% |
| 위키 검색 의도 | 100% | 100% |
| 잡담·도메인 외 | 100% | 0% |
- 단일턴 분류·질문 재작성에서는 정상 동작한 동일 Gemini 경로
- 전부 검색으로 분류한 3B 모델을 안전하게 흡수한 fail-open 기본값
결론
- 구현 완료와 효과 검증을 분리한 미증명 결론
- 다음 검증 조건으로 네이티브 tool-calling 모델 또는 Spring AI 전용 SDK 필요