본 포스팅은 패스트캠퍼스 환급 챌린지 참여를 위해 작성하였습니다.
https://fastcampus.info/4n8ztzq
(~6/20) 50일의 기적 AI 환급반💫 | 패스트캠퍼스
초간단 미션! 하루 20분 공부하고 수강료 전액 환급에 AI 스킬 장착까지!
fastcampus.co.kr
오늘의 수강 내용은 RAG 파이프라인과 복잡한 문서에서 정보 추출하는 방법에 대해 심도 있게 다뤘습니다. 먼저 RAG(검색 증강 생성, Retrieval-Augmented Generation) 파이프라인을 되돌아보며, 문서 전처리부터 임베딩, 검색, 답변 생성까지 전 과정에서 발생할 수 있는 문제와 실무적인 난관을 학습했습니다. 특히 문서 전처리의 중요성을 강조하며, Garbage in-Garbage out 원칙을 다시 한번 상기시켰습니다. 공공문서처럼 복잡하고 많은 정보가 압축된 문서의 경우, 꼼꼼한 레이아웃 분석과 표, 이미지 처리, 추가 맥락 제공 등이 필요함을 배웠습니다. 또한, 임베딩 모델 선택, 벡터 데이터베이스 저장 방식, 검색 전략, LLM(대형 언어 모델) 선택 및 근거 문서 제공 방식 등 다양한 의사결정 포인트도 정리했습니다.
이어지는 내용에서는 복잡한 문서에서 데이터를 추출하는 다양한 방법을 다뤘습니다. 단순한 텍스트 문서는 PyPDF, PyMuPDF, PDFPlumber 등으로 추출할 수 있지만, 표가 포함된 문서는 단순 추출로는 정확도가 떨어져 DL 기반 Table Transformer 같은 전문 도구를 사용해야 함을 배웠습니다. 이미지와 텍스트, 표가 혼합된 복잡한 형태는 VLM(비전-언어 모델)을 활용해 이미지 캡셔닝과 마크다운 변환을 시도하지만, 환각(hallucination) 문제로 인해 하이브리드 접근법을 사용하는 것이 중요했습니다.
또한, 최근에는 문서를 페이지 단위로 이미지화해 VLM에 마크다운 변환을 요청하는 새로운 흐름과, 문서 객체를 파이프라인 방식으로 분류하고 특성별로 처리하는 최신 트렌드도 함께 살펴보았습니다. 이 과정을 통해 문서 내 중요한 표, 차트, 이미지 정보를 보다 정확하고 효율적으로 추출할 수 있는 최신 기술 동향을 익혔습니다. 오늘 배운 내용을 통해 RAG 파이프라인과 문서 데이터 처리에 대한 이해를 높이고, 실제 프로젝트나 실무에 적용할 때 더 정교한 데이터 기반 AI 서비스 설계에 도움이 될 수 있음을 느낄 수 있었습니다.




