목차6. RAG와 출처 기반 답변
Chapter 06 · 검색 파이프라인과 provenance를 분리해 평가하기
RAG와 출처 기반 답변
임베딩·전문 검색·문맥 우선순위·source registry로 구성된 실제 RAG 흐름과 실패 모드를 분석한다.
- RAG 파이프라인의 단계를 설명한다.
- 하이브리드 검색과 문맥 우선순위를 비교한다.
- 인용의 존재와 인용의 정확성을 구별한다.
RAG는 질문과 관련된 외부 자료를 먼저 찾고, 그 자료를 참고해 답을 생성하는 방식입니다. 품질을 평가하려면 “무엇을 찾았는가”, “찾은 자료를 어떻게 답에 사용했는가”, “표시된 출처가 주장을 실제로 뒷받침하는가”를 나누어 봐야 합니다.
회수에서 생성까지
먼저 질문을 핵심 낱말이나 의미를 나타내는 숫자 벡터(임베딩)로 바꿉니다. 검색할 자료 모음에서는 질문과 가까운 글 조각을 여러 개 찾고, 관련도가 높은 순서로 정리합니다. 상위 조각과 출처 정보를 모델에 함께 주어 답을 만들고, 마지막으로 답의 출처 ID가 실제 등록 자료와 연결되는지 확인합니다.
RAG 파이프라인은 질의 표현, 후보 회수, 순위화, 문맥 구성, 생성과 인용 검증을 서로 다른 품질 단계로 평가해야 합니다. 출처 미리보기NeurIPS · Retrieval-Augmented Generation for Knowledge-Intensive NLP TasksRAG 파이프라인은 질의 표현, 후보 회수, 순위화, 문맥 구성, 생성과 인용 검증을 서로 다른 품질 단계로 평가해야 한다.Sections 2–3, retriever and generator components
낱말 검색은 제품명이나 법 조항처럼 정확한 표현을 찾는 데 유리합니다. 의미 검색은 “기온 상승”과 “더워지는 날씨”처럼 표현이 달라도 가까운 뜻을 찾는 데 유리합니다. 많은 RAG 시스템은 두 방법을 함께 쓰고, 현재 읽는 문서나 최신 자료에 가점을 주어 순서를 다시 정합니다.
검색 결과와 근거 이력
검색할 글 조각과 출처 정보는 분리해 관리합니다. 각 글 조각에는 출처 ID와 정확한 쪽·절을 붙이고, 답변의 어떤 주장이 그 위치에 기대는지 기록합니다. 이런 연결 기록을 근거 이력(provenance)이라고 합니다. 출처 목록에는 기관, 판, 날짜, URL, 이용 조건과 검토일을 보관합니다.
인용의 존재와 인용의 정확성은 다르므로 안정된 출처 ID뿐 아니라 주장과 정확한 쪽·절의 연결을 검증해야 합니다. 출처 미리보기National Institute of Standards and Technology · Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile인용의 존재와 인용의 정확성은 다르므로 안정된 source ID뿐 아니라 주장과 정확한 locator의 연결을 검증해야 한다.Section 2.7, Information Integrity and provenance
모델이 임의 URL을 만들게 두지 않고, 서버가 등록된 출처 ID인지 확인한 뒤 그 ID에 연결된 주소만 보여 주는 편이 안전합니다. 화면에는 이 연결을 근거 · NIST 같은 칩으로 표시할 수 있습니다. 답변 문장과 출처 목록을 따로 관리하면 문장 표현이 달라져도 출처 연결을 별도로 검사할 수 있습니다. 출처 수 역시 이 검사를 통과한 서로 다른 자료의 실제 개수여야 합니다.
RAG의 실패 모드
검색 실패에는 필요한 자료의 누락, 너무 짧거나 긴 글 조각, 질문과 검색 표현의 불일치, 잘못된 순위가 있습니다. 생성 실패에는 근거 무시, 수치 변형, 서로 다른 글 조각의 부당한 결합이 있습니다. 인용 실패에는 존재하지 않는 출처 ID, 맞지 않는 쪽·절, 오래된 판 연결이 있습니다.
이 경계는 저작권과 품질을 함께 다룹니다. 외부 원문 전체를 무단으로 넣지 않고, 원문을 확인해 독립 집필한 교재만 검색합니다. 답할 자료가 없으면 “근거 부족” 또는 “교재 범위 밖”으로 멈춥니다. RAG는 정확성을 보증하는 장치가 아니라 근거를 찾아 검증할 수 있게 만드는 구조입니다.
확인 문제
참고문헌
- 1차 연구
NeurIPS. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020 paper, arXiv v4, 2020-05-22.
원문 - 독립 공공기관
National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile. NIST AI 600-1, 2024-07-26.
원문 - 독립 공공기관
OECD · European Union. Empowering Learners for the Age of AI: An AI Literacy Framework for Primary and Secondary Education. Final, 64 pages, 2026-06-18.
원문
외부 기술·연령 적합성 검토 대기 · 검토 게이트 #12