AI Platform Series · 01 운영 체계와 지식 구조
LlamaIndex로 배우는 나만의 지식 연결법 — 자료가 없어서가 아니라, 자료가 다시 쓰일 수 있는 구조로 놓여 있지 않아서다.
"AI에게 매번 같은 설명을 반복하는 이유는 자료가 없어서가 아니다. 자료가 다시 쓰일 수 있는 구조로 놓여 있지 않기 때문이다."
RAG 5단계 프로세스 플로우
왜 RAG가 필요한가
이유 01
학습 데이터에 없다
LLM은 공개된 인터넷 텍스트로 훈련된다. 내 PRD, 보고서, 회의록은 포함되지 않았다.
이유 02
컨텍스트 창은 유한
한 번에 넣을 수 있는 텍스트 분량에 한계가 있다. 모든 자료를 한꺼번에 붙여넣을 수 없다.
이유 03
매 대화마다 초기화
이전 대화 내용은 다음 세션에 인계되지 않는다. 설명을 매번 반복해야 한다.
RAG의 역할: 필요한 순간에 관련 자료를 찾아 컨텍스트에 끼워 넣어 LLM이 내 자료를 근거로 답하게 만든다.
단계별 쉬운 해석
Loading
흩어진 자료 모으기
PDF·노션·구글독스·슬랙 등에 분산된 자료를 한 곳으로 끌어온다.
Indexing
나중에 찾기 쉽게
자료를 쪼개고 임베딩해 벡터로 변환. 유사도 검색이 가능한 구조로 만든다.
Storing
구조를 보관
만들어진 인덱스를 벡터 DB에 저장. 매번 다시 만들지 않아도 된다.
Querying
꺼내 쓰기
질문이 들어오면 관련 자료 조각을 찾아 LLM 프롬프트에 함께 전달한다.
Evaluation
근거 있게 말했는지 확인
답변이 자료에 근거했는지, 검색 결과가 관련 있었는지 품질을 측정한다.
품질 기준
| 항목 | 좋은 RAG | 나쁜 RAG |
|---|---|---|
| 자료 메타데이터 | 제목·출처·날짜·신뢰도 부착 | 원문을 그냥 쌓기만 함 |
| 평가 구조 | 검색 품질과 답변 품질을 분리 평가 | 평가 없이 배포 |
| 검색 결과 처리 | 관련도 점수와 함께 검토 | 검색 결과를 그대로 신뢰 |
| 출처 표시 | 답변마다 근거 문서 명시 | 근거 없이 답변 생성 |
실행 계획
STEP 1
Source Registry
어떤 자료를 인덱싱할지 목록 정의. PRD·아이디어노트·회의록 우선.
STEP 2
인덱스 생성
LlamaIndex로 자료를 로딩하고 임베딩 인덱스 구축.
STEP 3
질문 → 출처 표시 답변
질문을 입력하면 관련 자료를 찾아 출처와 함께 답변 생성.