

- 신영선의 AI탐구
- 조코딩 JoCoding
- CONNET AI LAB
- 편집자P
- 필로소피AI
- 코드팩토리
- 코난쌤
- 메타코드M
- 개발동생
- 메이커에반
- 바이브랩스
- 단테랩스
- 괴발자
- 홍정모AI
- 한빛미디어
- 칼퇴왕김과장N8N
- 퀀텀점프클럽N8N
- 짐코딩
- 시현의모험
- AI겸임교수 이종범
- AI ON
- 태오의실행비즈니스
- 오후다섯씨
- 코드깎는노인
- 데브남
- 스테판초 AI
- 빌더조쉬
- Claudical (클로디컬)
- 테크브릿지
- 실밸개발자
- Ai 서대표
- 일하는 Ai
- 시민개발자 구씨
- 일잘러 장피엠
- 이동훈의 루트ai
- 조태호교수
- 아는개발자 캐슬
- Jay Choi 인디해커
- 기술노트with일렉
- 제초초토크
- Ai IMPACT
- 오늘노트
- 알쓸신작 AI 이야기
- AI 튜터랩
- CODE DECK ★ 중요함
- 샘호트만 AI엔지니어
- 테디노트
- 경희대학교 SW사업단
- 강원대학교 SW사업단
- 지투지 AI STUDY
- 바퍼
- 소스놀이터
Ollama보다 뛰어나다고?! 게임용 GPU에서 671B LLM을 빠른속도로 구동시킨 Ktransformer 소개
24GB VRAM으로 671B 모델을? Ollama를 압도하는 KTransformer 완벽 가이드!
이번 영상에서는 24GB VRAM으로 671B 모델을 실사용 가능한 수준으로 실행할 수 있게 하는 무서운 오픈소스, KTransformer를 소개합니다.
KTransformer의 MoE(Mixture of Experts) 모델 구조에 맞춘 '최적화된 오프로딩' 원리에 대해 먼저 살펴보고,
KTransformer를 사용하실 분들을 위한 상세한 설치 과정을 단계별로 설명합니다.
마지막에는 동일한 모델로 KTransformer과 Ollama 간의 추론 속도 비교하고 테스트 결과까지 전달합니다.
⏱️ Timestamps (타임스탬프)
0:00 - 인트로: Ollama 다음은 KTransformer?
0:52 - KTransformer 프로젝트 소개
1:40 - 기존 Ollama(llama.cpp), 무엇이 문제였을까?
2:58 - KTransformer 핵심 알고리즘 : MoE Offloading
4:14 - 속도 비교: Ollama vs KTransformer
6:35 - 마무리 (+ 개인적인 생각)
📑 Reference
KTransformer 깃허브
https://github.com/kvcache-ai/ktransformers
Qwen3-30B-A3B 모델 (HuggingFace)
https://huggingface.co/Qwen/Qwen3-30B-A3B
Qwen3-30B-A3B 양자화 모델 (HuggingFace)
https://huggingface.co/Qwen/Qwen3-30B-A3B-GGUF
KTransformer 설치 명령어 정리
https://weirdeveloper.notion.s....ite/Ktransformer-314
테스트 코드
https://github.com/weirdevelop....er/llm-inference-ben
---
Ollama AVX2 최적화 지원
https://github.com/ollama/ollama/issues/1317
Ollama MoE offloading 업데이트
https://github.com/ggml-org/llama.cpp/pull/15077
#ktransformer #ollama #llm #opensource #ai #오픈소스

