

- 신영선의 AI탐구
- 조코딩 JoCoding
- CONNET AI LAB
- 편집자P
- 필로소피AI
- 코드팩토리
- 코난쌤
- 메타코드M
- 개발동생
- 메이커에반
- 바이브랩스
- 단테랩스
- 괴발자
- 홍정모AI
- 한빛미디어
- 칼퇴왕김과장N8N
- 퀀텀점프클럽N8N
- 짐코딩
- 시현의모험
- AI겸임교수 이종범
- AI ON
- 태오의실행비즈니스
- 오후다섯씨
- 코드깎는노인
- 데브남
- 스테판초 AI
- 빌더조쉬
- Claudical (클로디컬)
- 테크브릿지
- 실밸개발자
- Ai 서대표
- 일하는 Ai
- 시민개발자 구씨
- 일잘러 장피엠
- 이동훈의 루트ai
- 조태호교수
- 아는개발자 캐슬
- Jay Choi 인디해커
- 기술노트with일렉
- 제초초토크
- Ai IMPACT
- 오늘노트
- 알쓸신작 AI 이야기
- AI 튜터랩
- CODE DECK ★ 중요함
- 샘호트만 AI엔지니어
- 테디노트
- 경희대학교 SW사업단
- 강원대학교 SW사업단
- 지투지 AI STUDY
- 바퍼
- 소스놀이터
아직도 Ollama 쓰시나요? 로컬 LLM 속도 9배 올리는 vLLM 소개
Ollama를 뛰어넘는 괴물 같은 오픈소스 vLLM! 🚀
이번 영상에서는 Ollama 대비 TPS가 약 19배 높고, 응답 속도는 8배나 빠른 강력한 오픈소스 'vLLM'을 소개합니다.
vLLM의 핵심 기술인 PagedAttention과 Continuous Batching의 원리에 대해 알기 쉽게 살펴보고,
마지막으로 동일한 모델 환경에서 Ollama와 vLLM의 실제 추론 속도를 비교한 테스트 결과까지 전달해 드립니다.
⏱️ Timestamps (타임스탬프)
0:00 - 인트로: Ollama를 압도한 vLLM
0:42 - vLLM 프로젝트 소개
1:44 - vLLM의 핵심 기술 1: PagedAttention
4:13 - vLLM의 핵심 기술 2: Continuous Batching
5:10 - 추론 성능 비교: Ollama vs vLLM
6:58 - 마무리 (+ 개인적인 생각)
📑 Reference
vLLM 공식 GitHub
https://github.com/vllm-project/vllm
Qwen3-8B 양자화 모델 (HuggingFace)
https://huggingface.co/Qwen/Qwen3-8B-AWQ
vLLM의 PagedAttention 논문
https://arxiv.org/abs/2309.06180
Ollama와 vLLM 비교: 성능 벤치마킹 심층 분석 자료 (RedHat)
https://developers.redhat.com/articles/2025/08/08/ollama-vs-vllm-deep-dive-performance-benchmarking?_gl=1*1prrvjj*_gcl_au*MTk5OTcyOTM3MS4xNzcwODE1ODQ3&extIdCarryOver=true&sc_cid=RHCTG0180000382536#
vLLM 개발자 '권우석' 박사님 프로필
https://woosuk.me/
NVIDIA-supported vLLM
https://docs.nvidia.com/deeple....arning/frameworks/vl
AMD-supported vLLM
https://www.amd.com/ko/develop....er/resources/open-so
vLLM 설치 명령어 정리
https://weirdeveloper.notion.s....ite/vLLM-323edc521ab
테스트 코드
https://github.com/weirdevelop....er/llm-inference-ben
#vllm #ollama #llm #opensource #ai #오픈소스

