본문 바로가기
패캠 환챌 07월 시작

패스트캠퍼스 환급챌린지 15일차 : 모두의 AI 케인의 Agent로 완성하는 RAG: 데이터 별 아키텍처 설계를 중심으로 강의 후기

by 논문보관함 2025. 7. 15.

본 포스팅은 패스트캠퍼스 환급 챌린지 참여를 위해 작성하였습니다.

https://fastcampus.info/4n8ztzq

 

(~6/20) 50일의 기적 AI 환급반💫 | 패스트캠퍼스

초간단 미션! 하루 20분 공부하고 수강료 전액 환급에 AI 스킬 장착까지!

fastcampus.co.kr

오늘 수업에서는 PyMuPDF를 활용하여 PDF에서 텍스트를 추출하고, 이를 마크다운 형식 및 LLM 연계용 데이터로 가공하는 과정을 실습했습니다. 첫 번째 파일 CH02.02.간단한 텍스트 추출_Markitdown.ipynb에서는 PDF 문서를 열어 페이지별로 get_text("blocks")를 이용해 블록 단위 텍스트를 추출하고, 블록 안에 포함된 각 요소를 좌표 정보와 함께 출력해 시각적으로 구조를 이해하는 방법을 배웠습니다. 이후 특정 키워드를 포함한 블록만 필터링하여 필요한 정보만 뽑는 방식과, 리스트 컴프리헨션을 통해 불필요한 빈 문자열을 제거하고 요약 형태로 정리하는 기법을 실습했습니다. 이를 통해 텍스트 기반 문서의 자동화 처리 및 구조적 정리를 위한 기초적인 텍스트 추출 파이프라인을 체험했습니다.

두 번째 파일 CH02.03.간단한 텍스트 추출_PyMuPDF4LLM.ipynb에서는 LLM과 연계할 때의 실전적인 텍스트 처리 기법을 집중적으로 다뤘습니다. 먼저 get_text("blocks")로 페이지별 텍스트 블록을 얻고, LLM에 입력하기 전에 토큰 길이를 고려해 블록을 합치는 과정을 진행했습니다. 특히, 블록별 길이를 측정하고 기준 토큰 수(예: 500자)를 넘어가지 않도록 적절히 분리 및 병합하여 LLM에 효율적으로 전달할 수 있도록 구성했습니다. 이 과정을 통해 추출된 데이터를 기반으로 요약문 작성, 질의응답 시스템, 문서 요약 AI 등의 실전 활용 가능성을 탐구했습니다.

이번 수업을 통해 단순한 PDF 추출 기술을 넘어, 실제 LLM 활용을 위한 전처리와 데이터 최적화 과정을 직접 체험함으로써, AI 기반 문서 자동화 및 지식 관리 시스템을 구축하는 데 필요한 전반적인 흐름을 이해할 수 있었습니다. 이로써 복잡한 문서를 다룰 때 필요한 실무 능력과 AI 응용력 모두를 한층 끌어올릴 수 있었습니다.