본문 바로가기
패캠 환챌 07월 시작

패스트캠퍼스 환급챌린지 33일차 : 모두의 AI 케인의 Agent로 완성하는 RAG: 데이터 별 아키텍처 설계를 중심으로 강의 후기

by 논문보관함 2025. 8. 2.

본 포스팅은 패스트캠퍼스 환급 챌린지 참여를 위해 작성하였습니다.

https://fastcampus.info/4n8ztzq

 

(~6/20) 50일의 기적 AI 환급반💫 | 패스트캠퍼스

초간단 미션! 하루 20분 공부하고 수강료 전액 환급에 AI 스킬 장착까지!

fastcampus.co.kr

이번에 수강한 멀티모달 리트리버 강의는 그동안 자연어 처리나 컴퓨터 비전 중 한쪽에 치우쳐 공부해왔던 제게 매우 신선한 자극이 되었습니다. 단일 모달이 아닌 텍스트와 이미지를 동시에 입력으로 받아 유사한 결과를 찾는 시스템, 이른바 "멀티모달 리트리버"의 작동 방식을 실제 코드와 함께 하나하나 따라가며 배울 수 있었기 때문입니다. 단순히 이론을 설명하는 데 그치지 않고, Python 기반의 실습 노트북을 제공해 모델 불러오기부터 임베딩 생성, 검색 결과 평가와 시각화까지 직접 수행해볼 수 있었던 점이 특히 인상 깊었습니다.

가장 인상적이었던 부분은 LAVIS 라이브러리와 CLIP 모델을 활용하여 텍스트와 이미지를 동일한 임베딩 공간으로 매핑한 뒤, cosine similarity를 기준으로 유사한 이미지나 텍스트를 검색하는 구조였습니다. 이 과정을 통해 단순한 분류나 예측이 아닌, 내용 기반 검색(content-based retrieval) 이라는 또 다른 가능성을 경험할 수 있었습니다. 예를 들어 "A man riding a bike"라는 문장을 쿼리로 입력했을 때, 실제로 자전거를 타는 사람의 이미지가 top-1로 검색되었을 때는 모델의 일반화 능력에 놀라지 않을 수 없었습니다.

또한 Recall@1, Recall@5, Recall@10 같은 성능 지표를 통해 검색 시스템의 효과를 정량적으로 평가하는 방법도 배울 수 있었는데, 이 덕분에 단순히 "결과가 그럴 듯하다"는 느낌을 넘어서, 모델의 정확도를 실제 숫자로 비교하고 판단할 수 있었습니다. 특히 텍스트 → 이미지 검색과 이미지 → 이미지 검색을 비교하면서, 어떤 방식이 더 효과적인지 직접 실험할 수 있었던 점도 매우 유익했습니다. 이 부분은 실제로 리트리버 시스템을 설계할 때 방향성을 잡는 데 도움이 될 것 같습니다.

실습 과정도 매우 매끄럽게 구성되어 있었습니다. Path, PIL, matplotlib, torch, sklearn 등의 주요 라이브러리들을 바탕으로 전처리부터 후처리까지 전 과정이 깔끔하게 짜여 있었고, 주석도 잘 달려 있어 실습 흐름을 이해하는 데 무리가 없었습니다. 또한, 전처리된 이미지나 텍스트 쿼리를 통해 직접 유사도를 계산하고, 시각적으로 검색된 이미지들을 확인할 수 있었기 때문에 학습 효과가 훨씬 높았습니다.

이 강의를 통해 단순히 “멀티모달 리트리버가 무엇인지”에 대한 개념만 익힌 것이 아니라, 실제 프로젝트에서 어떻게 활용할 수 있을지에 대한 감도 얻게 되었습니다. 예를 들어, 검색 기반 전자상거래 시스템, 이미지 기반 논문 검색기, 의학 영상과 진단 텍스트 간의 연관성 분석 등 다양한 분야로의 응용 가능성이 머릿속에 떠올랐습니다. 특히 학술 문서 내에서 도표/이미지와 텍스트를 연결하는 시스템을 만들고 싶었던 제게 이번 강의는 구체적인 기술적 출발점을 제공해주었다고 생각합니다.

결론적으로, 이 강의는 멀티모달 기반 검색 시스템에 대해 실습 중심으로 학습하고 싶은 분들께 자신 있게 추천드릴 수 있습니다. 단순히 모델을 돌려보는 수준이 아니라, 왜 이렇게 작동하는지를 이해할 수 있게 도와주고, 결과를 해석하는 눈까지 키워주는 정말 잘 구성된 강의였습니다. 수강 후에도 다양한 프로젝트에 직접 활용해볼 수 있을 만큼 실용적인 배움이었고, 향후 멀티모달 연구나 서비스 기획에도 큰 도움이 될 것이라 확신합니다.