
초보자도 가능한 vLLM을 200% 활용하기 위한 Argument 설정법!
vLLM 활용도를 200% 끌어올리는 필수 Argument 설정 가이드! (OOM 해결부터 성능 최적화까지)
이번 영상에서는 vLLM의 엄청난 속도 향상 효과를 제대로 맛보기 위해 꼭 알아야 할 Argument(설정값) 튜닝 가이드를 준비했습니다.
보면 울렁거릴 것 같은 vLLM이 제공하는 수많은 Argument들을 아래와 같이 두 가지 케이스로 나누어, 각 주요 Argument에 대한 설명과 어떻게 조정해야 하는지 쉽게 설명해 드립니다!
Case 1. VRAM이 부족해서 메모리를 절약해야 할 때
Case 2. VRAM이 넉넉해서 처리 속도를 극대화할 때
마지막으로, 모든 상황에서 반드시 체크해야 할 Argument와 그 사용법을 소개합니다.
⏱️ Timestamps (타임스탬프)
0:00 - vLLM의 Argument를 알아야 하는 이유
0:51 - VRAM 부족해 메모리 절약을 위한 필수 Arguments
2:58 - 최후의 보루 : vLLM의 Offloading 사용법
3:54 - vLLM 처리 속도 극대화를 위한 필수 Arguments
6:00 - 공통: --tensor-parallel-size
6:12 - 공통: --quantization
6:57 - 마무리
📑 Reference
vLLM Arguments (공식 페이지)
https://docs.vllm.ai/en/stable..../configuration/engin
#vllm #ollama #llm #opensource #ai #오픈소스


