본문 바로가기
패캠 환챌 07월 시작

패스트캠퍼스 환급챌린지 16일차 : 모두의 AI 케인의 Agent로 완성하는 RAG: 데이터 별 아키텍처 설계를 중심으로 강의 후기

by 논문보관함 2025. 7. 16.

본 포스팅은 패스트캠퍼스 환급 챌린지 참여를 위해 작성하였습니다.

https://fastcampus.info/4n8ztzq

 

(~6/20) 50일의 기적 AI 환급반💫 | 패스트캠퍼스

초간단 미션! 하루 20분 공부하고 수강료 전액 환급에 AI 스킬 장착까지!

fastcampus.co.kr

오늘은 복잡한 문서 파싱 기술에 대해 배우고, 실제로 오픈 API를 활용해 PDF나 다양한 포맷의 문서를 정제된 구조 데이터로 변환하는 방법을 실습했습니다. 특히, Upstage Document Parse API와 LlamaParse API 두 가지를 중점적으로 다뤘습니다.

먼저 Upstage Document Parse는 한국 스타트업 업스테이지에서 제공하는 문서 파싱 API로, PDF 등 다양한 문서를 입력하면 페이지 단위, 섹션 단위, 표, 이미지, 인용 등 복잡한 레이아웃까지 자동으로 파싱해 구조화된 JSON 형태로 반환해 줍니다. 이를 통해 수작업으로 텍스트를 정제하거나 표를 다시 그릴 필요 없이, LLM 기반 응용 서비스나 검색 시스템에 바로 연결할 수 있는 깔끔한 데이터셋을 얻을 수 있습니다. 이번 실습에서는 실제 API 키를 설정하고, 예제 PDF를 업로드하여 JSON 데이터로 파싱된 결과를 출력 및 시각화해보았습니다.

다음으로 LlamaParse는 LlamaIndex에서 제공하는 최신 문서 파서로, 특히 표와 복잡한 레이아웃의 문서 처리에 강력한 성능을 자랑합니다. LlamaParse는 Python SDK를 통해 손쉽게 연동할 수 있고, 문서를 업로드한 뒤 문서 ID를 이용해 진행 상황을 확인하며, 완성된 JSON 형태의 결과물을 다운로드할 수 있습니다. 이를 통해 문서 요약, 질문 답변, RAG(Retrieval-Augmented Generation) 기반 검색 시스템 구축 등 다양한 AI 서비스에 활용할 수 있습니다.

두 API 모두 실제 기업 환경이나 서비스에서 유용하게 쓰일 수 있는 기술이며, 오늘 실습을 통해 문서 파싱 → 데이터 구조화 → LLM 입력 준비까지 전 과정을 체험할 수 있었습니다. 이러한 오픈 API 활용법은 앞으로 LLM 응용 서비스나 데이터 분석 자동화에서 매우 중요한 스킬로 자리 잡을 것입니다. 오늘 배운 내용을 바탕으로 복잡한 문서 처리 파이프라인을 설계하고, 보다 정밀한 데이터 추출 및 활용에 도전해볼 수 있겠습니다.