본 포스팅은 패스트캠퍼스 환급 챌린지 참여를 위해 작성하였습니다.
https://fastcampus.info/4n8ztzq
(~6/20) 50일의 기적 AI 환급반💫 | 패스트캠퍼스
초간단 미션! 하루 20분 공부하고 수강료 전액 환급에 AI 스킬 장착까지!
fastcampus.co.kr





이번에 수강한 Metadata Tagger 실습은 문서 기반 RAG 시스템을 한층 정교하게 만드는 데 꼭 필요한 핵심 기술을 배울 수 있었던 유익한 시간이었다. 단순히 텍스트를 청크 단위로 자르고 벡터화하는 일반적인 RAG 구성에서 한 걸음 더 나아가, 각 청크에 출처(source), 제목(title), 섹션(section)과 같은 메타데이터를 자동으로 태깅하는 방법을 다룬 것이 인상 깊었다.
실습에서는 먼저 Docling을 활용해 PDF 문서를 Markdown 구조로 변환하고, MarkdownHeaderTextSplitter를 사용해 문서의 계층적 구조를 인식하며 Parent-Child 방식으로 텍스트를 청킹했다. 이후 각 청크의 위치와 헤더 정보를 기반으로 section과 title을 유추하는 로직을 구현했는데, 단순한 패턴 매칭이 아닌 문서 구조를 보존하면서 메타데이터를 자동 부여하는 접근 방식이 매우 깔끔하고 실용적이었다.
메타데이터가 붙은 청크들은 단순히 검색 정확도를 높이는 데 그치지 않고, 향후 출처 기반 응답 생성, 문서 내 위치 추적, 세부 필터링 검색 등 다양한 고급 기능으로 확장할 수 있다는 점에서 응용 가능성이 높다. 예를 들어, “한국의 AI 전략에서 LLM 도입 정책은?”과 같은 질문에 대해, 해당 정보가 어느 섹션의 어떤 제목 하에 있었는지를 명시한 응답을 생성할 수 있게 된다. 이는 단순한 정보 제공을 넘어 신뢰성과 투명성 있는 응답 생성을 가능하게 해준다.
실습 과정은 전체적으로 구성도 매우 깔끔했고, 단계별로 따라가며 구현할 수 있도록 예제 코드와 시각화까지 잘 되어 있어 이해하기 쉬웠다. 특히 중간중간 청크 내용과 태깅된 메타데이터를 DataFrame으로 확인하면서 결과를 검증할 수 있어 실습이 지루하지 않고 직관적으로 다가왔다.
이후 내 프로젝트에서도 공공 정책 문서나 논문 같은 구조화된 문서에 메타데이터 태깅을 적용해 더욱 정밀한 검색 및 응답 시스템을 구축할 수 있을 것 같다. 전체적으로 실습 내용이 명확하고 실무에서 바로 적용 가능한 기법들이 포함되어 있어, 실질적인 도움이 되는 매우 만족스러운 수강이었다.