목차6. RAG와 출처 기반 답변
Chapter 06 · 검색 파이프라인과 provenance를 분리해 평가하기
RAG와 출처 기반 답변
임베딩·전문 검색·문맥 우선순위·source registry로 구성된 실제 RAG 흐름과 실패 모드를 분석한다.
- RAG 파이프라인의 단계를 설명한다.
- 하이브리드 검색과 문맥 우선순위를 비교한다.
- 인용의 존재와 인용의 정확성을 구별한다.
RAG는 모델의 매개변수 지식과 외부 코퍼스를 결합하지만 “검색을 붙인 언어 모델”이라는 한 문장만으로는 품질을 평가하기 어렵습니다. 질의 표현, 회수, 순위, 문맥 구성, 생성, provenance 검증을 분리하면 실패 원인과 개선 지점을 측정할 수 있습니다.
회수에서 생성까지
먼저 질문을 임베딩 벡터나 전문 검색 질의로 표현합니다. 코퍼스에서 후보 passage를 찾고 관련도와 현재 맥락으로 순위를 조정합니다. 상위 passage를 source ID와 함께 프롬프트에 넣고 모델이 답을 생성합니다. 마지막으로 응답의 source ID와 인용 표식을 레지스트리와 대조합니다.
RAG 파이프라인은 질의 표현, 후보 회수, 순위화, 문맥 구성, 생성과 인용 검증을 서로 다른 품질 단계로 평가해야 합니다. NeurIPSRetrieval-Augmented Generation for Knowledge-Intensive NLP TasksSections 2–3, retriever and generator components
이 서비스는 Upstage Embed 2의 질의·passage 임베딩과 PostgreSQL 전문 검색을 결합합니다. 현재 절, 현재 챕터, 현재 트랙 순으로 가점을 주며 다른 트랙의 원고는 후보에서 제외합니다. 의미 유사도만 쓰면 정확한 용어를 놓칠 수 있고, 낱말 일치만 쓰면 표현이 다른 같은 뜻을 놓칠 수 있어 두 신호를 함께 씁니다.
하이브리드 검색과 provenance
문서의 내용과 출처 정보는 분리해 관리합니다. passage는 검색할 원고 조각이고, claim registry는 어떤 문장이 어떤 source ID와 locator에 기대는지 기록합니다. source registry는 기관, 판, 날짜, URL, 라이선스, 검토일을 보관합니다.
인용의 존재와 인용의 정확성은 다르므로 안정된 source ID뿐 아니라 주장과 정확한 locator의 연결을 검증해야 합니다. National Institute of Standards and TechnologyArtificial Intelligence Risk Management Framework: Generative Artificial Intelligence ProfileSection 2.7, Information Integrity and provenance
모델에는 임의 URL을 만들 권한을 주지 않습니다. 모델이 반환한 source ID는 Go 서버가 레지스트리에 있는지 검증하고, UI는 그 ID에 연결된 URL만 엽니다. 답변 텍스트와 source/data event를 AG-UI 스트림에서 분리하면 표현을 바꾸더라도 출처 계약을 별도로 검사할 수 있습니다. 출처 수는 검증을 통과한 고유 ID의 실제 개수입니다.
RAG의 실패 모드
회수 실패에는 코퍼스 누락, 부적절한 chunk, 임베딩 불일치, 전문 검색 형태소 문제, 잘못된 맥락 가점이 있습니다. 생성 실패에는 근거 무시, 수치 변형, 서로 다른 passage의 부당한 결합이 있습니다. 인용 실패에는 존재하지 않는 ID, 맞지 않는 locator, 오래된 판 연결이 있습니다.
이 프로젝트의 production RAG는 제3자 원문 전체가 아니라 검수된 자체 원고와 claim-source 레지스트리만 코퍼스로 사용합니다. OECD · European UnionEmpowering Learners for the Age of AI: An AI Literacy Framework for Primary and Secondary Educationpublication copyright and third-party material notice
이 경계는 저작권과 품질을 함께 다룹니다. 외부 원문 전체를 무단 적재하지 않고, 원문을 확인해 독립 집필한 교재 passage만 검색합니다. 답할 자료가 없으면 “근거 부족” 또는 “교재 범위 밖”으로 멈춥니다. RAG는 정확성 보증 장치가 아니라 근거를 회수하고 검증 가능하게 만드는 구조입니다.
확인 문제
참고문헌
- 1차 연구
NeurIPS. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020 paper, arXiv v4, 2020-05-22.
원문 - 독립 공공기관
National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile. NIST AI 600-1, 2024-07-26.
원문 - 독립 공공기관
OECD · European Union. Empowering Learners for the Age of AI: An AI Literacy Framework for Primary and Secondary Education. Final, 64 pages, 2026-06-18.
원문
외부 기술·연령 적합성 검토 대기 · 검토 게이트 #12