

- 신영선의 AI탐구
- 조코딩 JoCoding
- CONNET AI LAB
- 편집자P
- 필로소피AI
- 코드팩토리
- 코난쌤
- 메타코드M
- 개발동생
- 메이커에반
- 바이브랩스
- 단테랩스
- 괴발자
- 홍정모AI
- 한빛미디어
- 칼퇴왕김과장N8N
- 퀀텀점프클럽N8N
- 짐코딩
- 시현의모험
- AI겸임교수 이종범
- AI ON
- 태오의실행비즈니스
- 오후다섯씨
- 코드깎는노인
- 데브남
- 스테판초 AI
- 빌더조쉬
- Claudical (클로디컬)
- 테크브릿지
- 실밸개발자
- Ai 서대표
- 일하는 Ai
- 시민개발자 구씨
- 일잘러 장피엠
- 이동훈의 루트ai
- 조태호교수
- 아는개발자 캐슬
- Jay Choi 인디해커
- 기술노트with일렉
- 제초초토크
- Ai IMPACT
- 오늘노트
- 알쓸신작 AI 이야기
- AI 튜터랩
- CODE DECK ★ 중요함
- 샘호트만 AI엔지니어
- 테디노트
- 경희대학교 SW사업단
- 강원대학교 SW사업단
- 지투지 AI STUDY
- 바퍼
- 소스놀이터
이미지 → 576개 토큰 | VLM 내부 구조 해부 (Encoder + Adapter + LLM)
0
0
0 :조회수·
22 May 2026
-
AI ON
🔍 AI가 "보는" 능력을 갖게 된 원리가 궁금하셨나요?
이 영상에서는 Vision Language Model(VLM)의 내부 구조를 완전 해부합니다.
2015년 단순 이미지 캡셔닝에서 2024년 VQA, OCR, 수학적 추론까지
가능해진 VLM의 진화 과정을 살펴봅니다.
📌 다루는 내용
- VLM의 핵심 방정식: Vision Encoder + Adapter + LLM
- 이미지가 576개 토큰으로 변환되는 과정 (DeepSeek-VL 케이스 스터디)
- 3단계 학습 파이프라인: Alignment → Pre-training → SFT
- 오픈소스 VLM 생태계: Llama Vision, Phi Vision, DeepSeek-VL
- 한국어 VLM의 필요성과 Kakao Kana
- Next Frontier: 그라운딩(Grounding)
#VLM #비전언어모델 #DeepSeekVL #멀티모달AI #LLM #AI아키텍처
간략히
0 댓글
sort 정렬

