
이미지 → 576개 토큰 | VLM 내부 구조 해부 (Encoder + Adapter + LLM)
0
0
0 Views·
22 May 2026
🔍 AI가 "보는" 능력을 갖게 된 원리가 궁금하셨나요?
이 영상에서는 Vision Language Model(VLM)의 내부 구조를 완전 해부합니다.
2015년 단순 이미지 캡셔닝에서 2024년 VQA, OCR, 수학적 추론까지
가능해진 VLM의 진화 과정을 살펴봅니다.
📌 다루는 내용
- VLM의 핵심 방정식: Vision Encoder + Adapter + LLM
- 이미지가 576개 토큰으로 변환되는 과정 (DeepSeek-VL 케이스 스터디)
- 3단계 학습 파이프라인: Alignment → Pre-training → SFT
- 오픈소스 VLM 생태계: Llama Vision, Phi Vision, DeepSeek-VL
- 한국어 VLM의 필요성과 Kakao Kana
- Next Frontier: 그라운딩(Grounding)
#VLM #비전언어모델 #DeepSeekVL #멀티모달AI #LLM #AI아키텍처
Show less
0 Comments
sort Sort By


