본 포스팅은 패스트캠퍼스 환급 챌린지 참여를 위해 작성하였습니다.
Map
요약 체인에서의 Map 단계 : 문서를 쪼개서 각각을 독립적으로 처리하는 단계를 의미
역할
- 각 문서 또는 Chunk를 LLM 컨텍스트에 안전하게 넣을 수 있는 크기로 처리
- 대용량 문서를 다룰 때 컨텍스트 초과 문제를 방지
⇒ Map 단계에서는 전역적인 맥락보다 부분 요약의 정확성이 중요.
이 단계에서 잘못 요약되면 이후 Reduce/Refine 단계에서도 품질이 떨어짐
요약(Summarization)
요약기를 구축할 때 중심적인 질문 : 문서를 LLM의 컨텍스트 창에 어떻게 전달할 것인가?
- Stuff : 전체 문서 한 번에 요약
→ 단순히 모든 문서를 단일 프롬프트로 넣는 방식을 의미. 이는 가장 간단한 접근 방식. - Map-Reduce : 분할 요약 후 일괄 병합
→ 각 문서를 map 단계에서 개별적으로 요약한 다음, reduce 단계에서 요약본들을 최종 요약본으로 합치는 방식. - Map-Refine : 분할 요약 후 점진적 병합
→ 생성된 요약들을 순차적으로 처리하며 최종 요약을 점진적으로 개선 ⇒ 요약의 흐름을 유지할 수 있음. - Chain of Density : N번 반복 실행하며, 누락된 entity를 보완하며 요약 개선
- Clustering-Map-Refine : 문서의 Chunk를 N개의 클러스터로 나누고, 각 클러스터에서 중심점에 가까운 문서에 대한 요약을 Refine 요약.
Reduce vs Refine 차이
| Reduce | Refine |
| 이미 요약된 것들을 다시 한 번 줄임 | 기존 요약을 기준으로 새 정보를 덧붙여 개선 |
| 압축 중심 | 흐름·일관성 중심 |
| 구조가 단순하고 빠름 | 문맥 유지에 강함 |
⇒ 문서 간 연결성과 스토리가 중요하면 Refine이 유리함.
Chain of Density(CoD)가 필요한 이유
- 일반 요약의 문제점
→ 중요한 엔티티(인물, 조직, 개념)가 빠질 수 있음 - CoD 방식
→ 처음엔 느슨한 요약이지만 반복실행하면서 빠진 핵심 엔티티를 의도적으로 추가
⇒ CoD는 짧지만 정보 밀도가 높은 요약이 가능함. 즉, 디테일이 살아있는 요약 가능.
Clustering 기반 요약의 의미
- 문서가 너무 많을 때
모든 Chunk를 동일하게 다루면 노이즈 증가 - Clustering-Map-Refine
비슷한 문서끼리 묶고, 각 클러스터의 대표 문서 중심으로 요약
⇒ 중복 제거가 가능하고, 대규모 문서 요약에 매우 효과적.
오늘은 요약(Summarization) 기법과 대용량 문서를 다룰 때 사용되는 다양한 요약 체인 구조에 대해 학습했어요. 요약기를 설계할 때 가장 중심이 되는 질문은 '문서를 LLM의 컨텍스트 창에 어떻게 전달할 것인가?' 라는 점이었고, 결국 요약은 단순히 문장을 줄이는 작업이 아니라 제한된 컨텍스트 안에서 핵심 의미를 어떻게 보존할 것인가에 대한 문제라는 것을 깨달았습니다.
가장 단순한 방식은 Stuff 방식으로, 모든 문서를 한 번에 프롬프트에 넣고 요약하는 방법을 의미합니다. 구현이 간단하지만 문서 길이가 길어질수록 컨텍스트 한계에 쉽게 부딪힌다는 단점이 있죠. 그래서 실무나 RAG 환경에서는 분할 기반 요약 방식이 더 많이 사용된다고 합니다.
대표적인 방식은 Map-Reduce 요약 입니다. Map 단계에서는 문서를 여러 개의 Chunk로 나누고, 각 Chunk를 독립적으로 요약하니다. 이 과정은 컨텍스트 초과를 방지하면서도 각 부분의 핵심을 놓치지 않는 단계라고 할 수 있습니다. 이후 Reduce 단계에서 이 요약본들을 다시 하나의 최종 요약으로 병합합니다. 구조가 단순하고 효율적이지만, 문서 전체의 흐름이 끊기는 경우도 발생한다고 합니다. 이를 개선한 방식이 Map-Refine 입니다. Map 단계에서 생성된 요약을 순차적으로 Refine하면서 기존 요약을 점진적으로 개선해 나가는 방식으로, 새로운 정보가 들어올 때마다 이전 요약을 보완하여 전체적인 맥락과 스토리 흐름을 유지하는데 강점이 있습니다.
마지막으로 Clustering-Map-Refine 방식은 문서 수가 매우 많을 때 활용하기 좋은 방식입니다. 유사한 문서들을 클러스터링한 후, 각 클러스터의 중심 문서를 기준으로 요약을 수행함으로써 중복을 최소화하고 요약 품질을 높일 수 있습니다.
오늘 수업 내용으로, 요약은 단순한 기능이 아니라 LLM의 한계를 우회하기 위한 중요한 설계 전략이라는 것을 알 수 있었습니다.




커리어 성장을 위한 최고의 실무교육 아카데미 | 패스트캠퍼스
성인 교육 서비스 기업, 패스트캠퍼스는 개인과 조직의 실질적인 '업(業)'의 성장을 돕고자 모든 종류의 교육 콘텐츠 서비스를 제공하는 대한민국 No. 1 교육 서비스 회사입니다.
fastcampus.co.kr
'RAG' 카테고리의 다른 글
| 패스트캠퍼스 환급챌린지 36일차 : 테디노트의 RAG 비법노트 강의 후기 (0) | 2025.12.17 |
|---|---|
| 패스트캠퍼스 환급챌린지 35일차 : 테디노트의 RAG 비법노트 강의 후기 (0) | 2025.12.16 |
| 패스트캠퍼스 환급챌린지 33일차 : 테디노트의 RAG 비법노트 강의 후기 (0) | 2025.12.14 |
| 패스트캠퍼스 환급챌린지 32일차 : 테디노트의 RAG 비법노트 강의 후기 (0) | 2025.12.13 |
| 패스트캠퍼스 환급챌린지 31일차 : 테디노트의 RAG 비법노트 강의 후기 (1) | 2025.12.12 |