Ollama 보다 빠르다는 vLLM을 뛰어넘었습니다! 로컬 LLM 서빙 엔진 SGLang 소개
00:07:51
글로벌비전
0 :조회수 · 2 달 전

Ollama 보다 빨랐다던 vLLM을 뛰어 넘는 서빙 엔진? 글로벌 빅테크가 선택한 오픈소스 SGLang! 🚀

⏱️ Timestamps (타임스탬프)

0:00 - 인트로: vLLM을 압도한 SGLang
0:48 - SGLang 프로젝트 소개
1:43 - vLLM의 핵심 기술 1: RadixAttention
4:45 - 추론 성능 비교: Ollama vs vLLM vs SGLang
6:03 - vLLM의 한계점
6:57 - SGLang, 언제 써야 할까?
7:32 - 마무리

📑 Reference

SGLang 공식 GitHub
https://github.com/sgl-project/sglang

LMSYS Org 공식 홈페이지
https://www.lmsys.org/

PyTorch 블로그 (grok이 Sglang의 서빙 엔진으로 사용한다)
https://pytorch.org/blog/sglang-joins-pytorch/

NVIDIA NGC이 SGLang 지원
https://catalog.ngc.nvidia.com..../orgs/nvidia/contain

젠슨황 GTC 2026 연설에 SGLang이 포함
https://www.lmsys.org/blog/2026-03-25-gtc2026/

#sglang #vllm #ollama #llm #opensource #ai #오픈소스

2026년 RTK-AI 처음 접하는 90%가 놓치는 10가지 꿀팁
00:03:58
글로벌비전
0 :조회수 · 2 달 전

RTK-AI 10가지 필수 팁 완벽 가이드! 🚀

이번 영상에서는 RTK(Rust Token Killer)를 더욱 스마트하고 안전하게 활용할 수 있는 10가지 핵심 꿀팁을 소개합니다.

⏱️ **Timestamps (타임스탬프)**

00:00 - RTK-AI가 내 터미널 사용을 원격으로 엿보고 있다?!
00:28 - ripgrep 설치 안하면 무조건 오류 발생합니다!
00:40 - RTK-AI를 내 입맛대로 설정하는 방법!
01:00 - RTK-AI에서 특정 명령어만 압축을 제외하는 방법!
01:30 - 토큰을 더 절약할 수 있는 꿀팁!
01:59 - 특정 폴더 안에서만 RTK-AI를 켜는법!
02:29 - 이거 설정 안하면 SKILL.md와 충돌납니다!
03:03 - rtk gain 여러가지 확인 방법
03:27 - RTK-AI가 Claude 외에 지원하는 AI 도구들
03:43 - 불편한게 있다면 그냥 기다리는 것도 해결방법?

📑 **Reference**

RTK (Rust Token Killer) GitHub
https://github.com/rtk-ai/rtk

RTK 원격 수집(Telemetry) 관련 문서
https://github.com/rtk-ai/rtk/blob/master/docs/TELEMETRY.md

#rtk-ai #claudecode #바이브코딩 #ai #오픈소스

클로드 코드의 토큰 낭비를 60% 줄여주는 오픈소스 RTK-AI 소개
00:10:17
글로벌비전
0 :조회수 · 2 달 전

RTK(Rust Token Killer)로 Claude Code 토큰 대폭 절약하기 💸

이번 영상에서는 Claude Code로 바이브 코딩을 할 때 스트레스를 주었던 토큰 부족을 획기적으로 줄여주는 오픈소스, RTK(Rust Token Killer) 를 소개합니다.

터미널에서 실행되는 불필요한 시스템 출력과 노이즈를 똑똑하게 압축하여 Claude에게 꼭 필요한 정보만 전달하는 RTK의 핵심 원리를 짚어봅니다.

RTK가 지원하는 주요 명령어의 압축 전후 결과를 보여주고, RTK의 Hooking 기술을 통해 어떻게 Claude Code에 통합되어 토큰 절약을 제공해주는지 세부적으로 소개합니다.

마지막으로, SWE-Bench 데이터셋을 활용한 실제 토큰 절감 테스트 결과와

RTK의 한계점과 사용시 알아두셔야 할 사항까지도 정리합니다.

⏱️ Timestamps (타임스탬프)

0:00 - 인트로: 설치 한번으로 토큰을 절약할 수 있다?
0:38 - RTK(Rust Token Killer) 프로젝트 소개
0:50 - RTK의 핵심 아이디어
1:51 - 얼마나 줄어들까? RTK 사용 전/후 비교
4:10 - RTK 작동 원리
6:42 - 검증 테스트 : RTK 토큰 절약 효과 확인
8:43 - RTK의 한계점과 Tread-Off
9:55 - 마무리

📑 Reference

RTK (Rust Token Killer) GitHub
https://github.com/rtk-ai/rtk

SWE-Bench Verfied 데이터셋
https://huggingface.co/dataset....s/SWE-bench/SWE-benc

#rtk-ai #claudecode #바이브코딩 #ai #오픈소스

초보자도 가능한 vLLM을 200% 활용하기 위한 Argument 설정법!
00:07:11
글로벌비전
0 :조회수 · 2 달 전

vLLM 활용도를 200% 끌어올리는 필수 Argument 설정 가이드! (OOM 해결부터 성능 최적화까지)

이번 영상에서는 vLLM의 엄청난 속도 향상 효과를 제대로 맛보기 위해 꼭 알아야 할 Argument(설정값) 튜닝 가이드를 준비했습니다.

보면 울렁거릴 것 같은 vLLM이 제공하는 수많은 Argument들을 아래와 같이 두 가지 케이스로 나누어, 각 주요 Argument에 대한 설명과 어떻게 조정해야 하는지 쉽게 설명해 드립니다!

Case 1. VRAM이 부족해서 메모리를 절약해야 할 때
Case 2. VRAM이 넉넉해서 처리 속도를 극대화할 때

마지막으로, 모든 상황에서 반드시 체크해야 할 Argument와 그 사용법을 소개합니다.

⏱️ Timestamps (타임스탬프)

0:00 - vLLM의 Argument를 알아야 하는 이유
0:51 - VRAM 부족해 메모리 절약을 위한 필수 Arguments
2:58 - 최후의 보루 : vLLM의 Offloading 사용법
3:54 - vLLM 처리 속도 극대화를 위한 필수 Arguments
6:00 - 공통: --tensor-parallel-size
6:12 - 공통: --quantization
6:57 - 마무리


📑 Reference

vLLM Arguments (공식 페이지)
https://docs.vllm.ai/en/stable..../configuration/engin

#vllm #ollama #llm #opensource #ai #오픈소스

Ollama 대신 vLLM를 연동해 Openclaw 8배 빠르게 만들기!
00:07:06
글로벌비전
0 :조회수 · 2 달 전

초보자도 쉽게 따라 하는 OpenClaw + vLLM 연동 완벽 가이드! 🚀

로컬 LLM을 사용하면서 Ollama의 병렬 처리 한계(병목 현상) 때문에 답답하셨나요? 이번 영상에서는 추론 속도를 극대화해주는 강력한 서빙 프레임워크인 vLLM을 OpenClaw에 연동하는 과정을 단계별로 알기 쉽게 소개합니다.

Docker를 활용한 깔끔한 vLLM 설치법과 Openclaw와 연동 실습까지 이번 영상에 모두 담았습니다!

⏱️ **Timestamps (타임스탬프)**

0:00 - 인트로: Openclaw와 vLLM를 사용하면 장점
0:36 - vLLM 구축 - 왜 Docker 인가?
1:11 - vLLM 구축 - Docker 설치 실습
2:35 - vLLM 실행 명령어 설명
4:51 - vLLM 구축 - vLLM 구동 실습
5:08 - Openclaw와 연동 방법
6:53 - 마무리

📑 **Reference**

🚨 Docker를 활용한 vLLM 설치 가이드 (*중요*)
https://weirdeveloper.notion.s....ite/Docker-vLLM-331e

🚨 Openclaw 설치 가이드 (*중요*)
https://weirdeveloper.notion.s....ite/Openclaw-331edc5

Docker 기반 vLLM 설치 및 배포 가이드
https://docs.vllm.ai/en/stable/deployment/docker/

모델별 Tool Call 파서(--tool-call-parser) 설정 참고
https://docs.vllm.ai/en/stable..../configuration/engin

OpenClaw - vLLM 연동 공식 가이드
https://docs.openclaw.ai/providers/vllm


#openclaw #vllm #로컬llm #ai

아직도 Ollama 쓰시나요? 로컬 LLM 속도 9배 올리는 vLLM 소개
00:07:51
글로벌비전
0 :조회수 · 2 달 전

Ollama를 뛰어넘는 괴물 같은 오픈소스 vLLM! 🚀

이번 영상에서는 Ollama 대비 TPS가 약 19배 높고, 응답 속도는 8배나 빠른 강력한 오픈소스 'vLLM'을 소개합니다.
vLLM의 핵심 기술인 PagedAttention과 Continuous Batching의 원리에 대해 알기 쉽게 살펴보고,
마지막으로 동일한 모델 환경에서 Ollama와 vLLM의 실제 추론 속도를 비교한 테스트 결과까지 전달해 드립니다.

⏱️ Timestamps (타임스탬프)

0:00 - 인트로: Ollama를 압도한 vLLM
0:42 - vLLM 프로젝트 소개
1:44 - vLLM의 핵심 기술 1: PagedAttention
4:13 - vLLM의 핵심 기술 2: Continuous Batching
5:10 - 추론 성능 비교: Ollama vs vLLM
6:58 - 마무리 (+ 개인적인 생각)

📑 Reference

vLLM 공식 GitHub
https://github.com/vllm-project/vllm

Qwen3-8B 양자화 모델 (HuggingFace)
https://huggingface.co/Qwen/Qwen3-8B-AWQ

vLLM의 PagedAttention 논문
https://arxiv.org/abs/2309.06180

Ollama와 vLLM 비교: 성능 벤치마킹 심층 분석 자료 (RedHat)
https://developers.redhat.com/articles/2025/08/08/ollama-vs-vllm-deep-dive-performance-benchmarking?_gl=1*1prrvjj*_gcl_au*MTk5OTcyOTM3MS4xNzcwODE1ODQ3&extIdCarryOver=true&sc_cid=RHCTG0180000382536#

vLLM 개발자 '권우석' 박사님 프로필
https://woosuk.me/

NVIDIA-supported vLLM
https://docs.nvidia.com/deeple....arning/frameworks/vl

AMD-supported vLLM
https://www.amd.com/ko/develop....er/resources/open-so

vLLM 설치 명령어 정리
https://weirdeveloper.notion.s....ite/vLLM-323edc521ab

테스트 코드
https://github.com/weirdevelop....er/llm-inference-ben

#vllm #ollama #llm #opensource #ai #오픈소스

Ollama보다 뛰어나다고?! 게임용 GPU에서 671B LLM을 빠른속도로 구동시킨 Ktransformer 소개
00:07:49
글로벌비전
0 :조회수 · 2 달 전

24GB VRAM으로 671B 모델을? Ollama를 압도하는 KTransformer 완벽 가이드!

이번 영상에서는 24GB VRAM으로 671B 모델을 실사용 가능한 수준으로 실행할 수 있게 하는 무서운 오픈소스, KTransformer를 소개합니다.
KTransformer의 MoE(Mixture of Experts) 모델 구조에 맞춘 '최적화된 오프로딩' 원리에 대해 먼저 살펴보고,

KTransformer를 사용하실 분들을 위한 상세한 설치 과정을 단계별로 설명합니다.
마지막에는 동일한 모델로 KTransformer과 Ollama 간의 추론 속도 비교하고 테스트 결과까지 전달합니다.

⏱️ Timestamps (타임스탬프)

0:00 - 인트로: Ollama 다음은 KTransformer?
0:52 - KTransformer 프로젝트 소개
1:40 - 기존 Ollama(llama.cpp), 무엇이 문제였을까?
2:58 - KTransformer 핵심 알고리즘 : MoE Offloading
4:14 - 속도 비교: Ollama vs KTransformer
6:35 - 마무리 (+ 개인적인 생각)

📑 Reference

KTransformer 깃허브
https://github.com/kvcache-ai/ktransformers

Qwen3-30B-A3B 모델 (HuggingFace)
https://huggingface.co/Qwen/Qwen3-30B-A3B

Qwen3-30B-A3B 양자화 모델 (HuggingFace)
https://huggingface.co/Qwen/Qwen3-30B-A3B-GGUF

KTransformer 설치 명령어 정리
https://weirdeveloper.notion.s....ite/Ktransformer-314

테스트 코드
https://github.com/weirdevelop....er/llm-inference-ben

---

Ollama AVX2 최적화 지원
https://github.com/ollama/ollama/issues/1317

Ollama MoE offloading 업데이트
https://github.com/ggml-org/llama.cpp/pull/15077

#ktransformer #ollama #llm #opensource #ai #오픈소스

99%가 모르는 저사양 GPU에 초대형 LLM을 실행할 수 있는 오픈소스 AirLLM 소개
00:05:23
글로벌비전
0 :조회수 · 2 달 전

저사양 GPU에 초대형 LLM을 실행할 수 있는 AirLLM 소개!

이번 영상에서는 매달 나가는 클라우드 구독비와 고가의 GPU 없이도, 오픈소스 도구인 AirLLM을 활용해 일반 가정용 PC에서 70B급 대규모 언어 모델(LLM)을 구동하는 방법을 소개합니다.

AirLLM의 핵심인 '계층별 추론(Layer-wise Inference)' 방식을 통해, 단 4GB의 VRAM 환경에서도 거대한 파라미터 덩어리인 Llama3 70B 모델이 어떻게 작동하는지 그 원리를 살펴보고 직접 코드를 통해 실습해 봅니다.

⏱️ Timestamps (타임스탬프)

0:00 - 인트로: VRAM 부족 문제와 AirLLM
0:45 - AirLLM 프로젝트 및 개발자 소개
0:56 - AirLLM 핵심 작동 원리 (메커니즘)
2:20 - 지원 모델 및 신규 모델 신청 방법
2:50 - AirLLM 실습: Llama3-70B 구동 및 코드 설명
4:52 - 실행 결과 분석 및 마무리

📑 Reference

AirLLM 깃허브
https://github.com/lyogavin/airllm

Llama3-70B 모델 (HuggingFace)
https://huggingface.co/meta-ll....ama/Meta-Llama-3-70B

실습 코드
https://github.com/weirdevelop....er/AirLLM-Example-Co

#AirLLM #llm #opensource #ai #오픈소스