본문 바로가기
패캠 환챌 07월 시작

패스트캠퍼스 환급챌린지 6일차 : 모두의 AI 케인의 Agent로 완성하는 RAG: 데이터 별 아키텍처 설계를 중심으로 강의 후기

by 논문보관함 2025. 7. 6.

본 포스팅은 패스트캠퍼스 환급 챌린지 참여를 위해 작성하였습니다.

https://fastcampus.info/4n8ztzq

 

(~6/20) 50일의 기적 AI 환급반💫 | 패스트캠퍼스

초간단 미션! 하루 20분 공부하고 수강료 전액 환급에 AI 스킬 장착까지!

fastcampus.co.kr

 

 

 

수강후기

이번 노트북을 통해 배운 **시맨틱 청킹(Semantic Chunking)**은 단순한 문서 분할 기술을 넘어서, 언어와 의미를 바라보는 관점을 완전히 바꿔 놓았습니다. 그동안 저는 문서를 분할한다는 작업을 단순히 "몇 글자 단위로 자르는 기술적 조작" 정도로 생각했는데, 이번 실습을 통해 청킹이야말로 모델과 인간 사이의 "의미 단위 소통"의 본질이라는 점을 깨닫게 되었습니다.

처음에는 CharacterTextSplitter나 RecursiveCharacterTextSplitter처럼 룰 기반(rule-based)으로 문서를 자르는 방식을 배웠습니다. 이런 방식은 정해진 규칙(문자 수, 구분자 등)에 따라 빠르고 단순하게 분할할 수 있다는 장점이 있지만, 문맥이나 의미를 전혀 고려하지 못한다는 한계가 분명했습니다. 예를 들어, 중요한 문장의 중간을 자르거나 논리 흐름을 끊어버려, 결국 모델이 문서를 이해하거나 검색할 때 맥락을 잃는 경우가 많았습니다.

하지만 이번에 새롭게 접한 Ollama를 통한 임베딩 기반 시맨틱 청킹은 정말 혁명적이라고 느꼈습니다. 특히 bge-m3와 같은 오픈소스 임베딩 모델을 사용해 문서의 의미적 벡터를 계산하고, 이를 기반으로 문맥적으로 연결된 부분을 하나의 chunk로 묶어주는 과정은 기존 룰 기반 청킹과는 차원이 다른 접근이었습니다. 마치 모델이 실제로 문서를 "이해"하고 있는 듯한 느낌을 주었고, 이를 통해 훨씬 정교하고 일관된 정보를 검색하거나 생성할 수 있다는 점에서 큰 감동을 받았습니다.

이러한 시맨틱 청킹을 통해 분할된 문서는 단순한 조각이 아니라, 하나의 완결된 의미 단위로서 존재하며, 각 chunk가 문서 전체 맥락 속에서 살아 숨쉬는 듯한 인상을 받았습니다. 특히 RAG 파이프라인과 결합했을 때, 이 의미 단위 chunk들이 검색과 생성 과정에서 훨씬 자연스럽고 정확한 응답을 만들어낸다는 점은 정말 강렬한 깨달음이었습니다.

무엇보다 이번 강의에서 가장 의미심장하게 다가온 것은, "기계적 규칙을 넘어, 모델이 의미 기반으로 문서를 재구성한다"는 철학적 전환이었습니다. 앞으로 RAG나 요약, 문서 질문 응답 시스템을 설계할 때, 룰 기반 청킹만 사용했던 과거의 방식에서 벗어나, 의미 기반 chunk 설계까지 고민하게 될 것 같습니다.

이번 강의를 통해 청킹은 더 이상 단순한 텍스트 분할 도구가 아니라, 모델과 사용자가 공유하는 "언어적 사유의 단위"라는 점을 깊이 깨달았습니다. 특히 Ollama와 같은 오픈소스 임베딩 모델을 활용해, 누구나 쉽게 시맨틱 청킹을 적용할 수 있다는 점은 앞으로의 실무와 연구 모두에 큰 영감을 주었습니다.

결론적으로, 이번 강의는 단순히 기술적인 학습을 넘어, AI가 인간 언어를 어떻게 이해하고 재해석할 수 있는지를 철학적으로 성찰할 수 있는 값진 기회였습니다. 이 새로운 의미 단위 청킹 패러다임을 경험하게 해주신 것에 깊은 감사를 드립니다. 앞으로 더 사람 중심적이고 의미 있는 NLP 서비스를 설계할 수 있을 것 같아 기대가 큽니다. 정말 멋진 강의였습니다. 감사합니다.