Ollama보다 뛰어나다고?! 게임용 GPU에서 671B LLM을 빠른속도로 구동시킨 Ktransformer 소개

0 Views· 22 May 2026
글로벌비전
글로벌비전
5 subscribers
1
In

24GB VRAM으로 671B 모델을? Ollama를 압도하는 KTransformer 완벽 가이드!

이번 영상에서는 24GB VRAM으로 671B 모델을 실사용 가능한 수준으로 실행할 수 있게 하는 무서운 오픈소스, KTransformer를 소개합니다.
KTransformer의 MoE(Mixture of Experts) 모델 구조에 맞춘 '최적화된 오프로딩' 원리에 대해 먼저 살펴보고,

KTransformer를 사용하실 분들을 위한 상세한 설치 과정을 단계별로 설명합니다.
마지막에는 동일한 모델로 KTransformer과 Ollama 간의 추론 속도 비교하고 테스트 결과까지 전달합니다.

⏱️ Timestamps (타임스탬프)

0:00 - 인트로: Ollama 다음은 KTransformer?
0:52 - KTransformer 프로젝트 소개
1:40 - 기존 Ollama(llama.cpp), 무엇이 문제였을까?
2:58 - KTransformer 핵심 알고리즘 : MoE Offloading
4:14 - 속도 비교: Ollama vs KTransformer
6:35 - 마무리 (+ 개인적인 생각)

📑 Reference

KTransformer 깃허브
https://github.com/kvcache-ai/ktransformers

Qwen3-30B-A3B 모델 (HuggingFace)
https://huggingface.co/Qwen/Qwen3-30B-A3B

Qwen3-30B-A3B 양자화 모델 (HuggingFace)
https://huggingface.co/Qwen/Qwen3-30B-A3B-GGUF

KTransformer 설치 명령어 정리
https://weirdeveloper.notion.s....ite/Ktransformer-314

테스트 코드
https://github.com/weirdevelop....er/llm-inference-ben

---

Ollama AVX2 최적화 지원
https://github.com/ollama/ollama/issues/1317

Ollama MoE offloading 업데이트
https://github.com/ggml-org/llama.cpp/pull/15077

#ktransformer #ollama #llm #opensource #ai #오픈소스

Show less

 0 Comments sort   Sort By