<?xml version="1.0" encoding="UTF-8"?>
<rss xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:sy="http://purl.org/rss/1.0/modules/syndication/" xmlns:media="http://search.yahoo.com/mrss/" version="2.0">
  <channel>
    <title>(주)글로벌비전 아카데미</title>
    <link>https://pro.gv-edu.kr</link>
    <description/>
    <item>
      <title>Ollama 보다 빠르다는 vLLM을 뛰어넘었습니다! 로컬 LLM 서빙 엔진 SGLang 소개</title>
      <link>https://pro.gv-edu.kr/watch/nl7ZtYUuKeNYDUW</link>
      <pubDate>Fri, 22 May 2026 06:44:51 +0000</pubDate>
      <guid isPermaLink="true">https://pro.gv-edu.kr/watch/nl7ZtYUuKeNYDUW</guid>
      <description>Ollama 보다 빨랐다던 vLLM을 뛰어 넘는 서빙 엔진? 글로벌 빅테크가 선택한 오픈소스 SGLang! 🚀 &lt;br&gt; &lt;br&gt;⏱️ Timestamps (타임스탬프) &lt;br&gt; &lt;br&gt;0:00 - 인트로: vLLM을 압도한 SGLang  &lt;br&gt;0:48 - SGLang 프로젝트 소개 &lt;br&gt;1:43 - vLLM의 핵심 기술 1: RadixAttention &lt;br&gt;4:45 - 추론 성능 비교: Ollama vs vLLM vs SGLang &lt;br&gt;6:03 - vLLM의 한계점 &lt;br&gt;6:57 - SGLang, 언제 써야 할까? &lt;br&gt;7:32 - 마무리 &lt;br&gt; &lt;br&gt;📑 Reference &lt;br&gt; &lt;br&gt;SGLang 공식 GitHub &lt;br&gt;&lt;a href="https://github.com/sgl-project/sglang" target="_blank" class="hash" rel="nofollow"&gt;https://github.com/sgl-project/sglang&lt;/a&gt; &lt;br&gt; &lt;br&gt;LMSYS Org 공식 홈페이지 &lt;br&gt;&lt;a href="https://www.lmsys.org/" target="_blank" class="hash" rel="nofollow"&gt;https://www.lmsys.org/&lt;/a&gt; &lt;br&gt; &lt;br&gt;PyTorch 블로그 (grok이 Sglang의 서빙 엔진으로 사용한다) &lt;br&gt;&lt;a href="https://pytorch.org/blog/sglang-joins-pytorch/" target="_blank" class="hash" rel="nofollow"&gt;https://pytorch.org/blog/sglang-joins-pytorch/&lt;/a&gt; &lt;br&gt; &lt;br&gt;NVIDIA NGC이 SGLang 지원 &lt;br&gt;&lt;a href="https://catalog.ngc.nvidia.com/orgs/nvidia/containers/sglang" target="_blank" class="hash" rel="nofollow"&gt;https://catalog.ngc.nvidia.com..../orgs/nvidia/contain&lt;/a&gt; &lt;br&gt; &lt;br&gt;젠슨황 GTC 2026 연설에 SGLang이 포함 &lt;br&gt;&lt;a href="https://www.lmsys.org/" target="_blank" class="hash" rel="nofollow"&gt;https://www.lmsys.org/&lt;/a&gt;blog/2026-03-25-gtc2026/ &lt;br&gt; &lt;br&gt;#sglang #vllm #ollama #llm #opensource #ai #오픈소스</description>
      <media:thumbnail url="https://i.ytimg.com/vi/hG9X3ihi3oQ/maxresdefault.jpg"/>
    </item>
    <item>
      <title>2026년 RTK-AI 처음 접하는 90%가 놓치는 10가지 꿀팁</title>
      <link>https://pro.gv-edu.kr/watch/xZ8g3f32AbbGtWw</link>
      <pubDate>Fri, 22 May 2026 06:44:51 +0000</pubDate>
      <guid isPermaLink="true">https://pro.gv-edu.kr/watch/xZ8g3f32AbbGtWw</guid>
      <description>RTK-AI 10가지 필수 팁 완벽 가이드! 🚀 &lt;br&gt; &lt;br&gt;이번 영상에서는 RTK(Rust Token Killer)를 더욱 스마트하고 안전하게 활용할 수 있는 10가지 핵심 꿀팁을 소개합니다. &lt;br&gt; &lt;br&gt;⏱️ **Timestamps (타임스탬프)** &lt;br&gt; &lt;br&gt;00:00 - RTK-AI가 내 터미널 사용을 원격으로 엿보고 있다?! &lt;br&gt;00:28 - ripgrep 설치 안하면 무조건 오류 발생합니다! &lt;br&gt;00:40 - RTK-AI를 내 입맛대로 설정하는 방법! &lt;br&gt;01:00 - RTK-AI에서 특정 명령어만 압축을 제외하는 방법! &lt;br&gt;01:30 - 토큰을 더 절약할 수 있는 꿀팁! &lt;br&gt;01:59 - 특정 폴더 안에서만 RTK-AI를 켜는법! &lt;br&gt;02:29 - 이거 설정 안하면 SKILL.md와 충돌납니다! &lt;br&gt;03:03 - rtk gain 여러가지 확인 방법 &lt;br&gt;03:27 - RTK-AI가 Claude 외에 지원하는 AI 도구들 &lt;br&gt;03:43 - 불편한게 있다면 그냥 기다리는 것도 해결방법? &lt;br&gt; &lt;br&gt;📑 **Reference** &lt;br&gt; &lt;br&gt;RTK (Rust Token Killer) GitHub &lt;br&gt;&lt;a href="https://github.com/rtk-ai/rtk" target="_blank" class="hash" rel="nofollow"&gt;https://github.com/rtk-ai/rtk&lt;/a&gt; &lt;br&gt; &lt;br&gt;RTK 원격 수집(Telemetry) 관련 문서 &lt;br&gt;&lt;a href="https://github.com/rtk-ai/rtk" target="_blank" class="hash" rel="nofollow"&gt;https://github.com/rtk-ai/rtk&lt;/a&gt;/blob/master/docs/TELEMETRY.md &lt;br&gt; &lt;br&gt;#rtk-ai #claudecode #바이브코딩 #ai #오픈소스</description>
      <media:thumbnail url="https://i.ytimg.com/vi/UCk0R05i5V8/maxresdefault.jpg"/>
    </item>
    <item>
      <title>클로드 코드의 토큰 낭비를 60% 줄여주는 오픈소스 RTK-AI 소개</title>
      <link>https://pro.gv-edu.kr/watch/b5lDprP9MLZG7fI</link>
      <pubDate>Fri, 22 May 2026 06:44:51 +0000</pubDate>
      <guid isPermaLink="true">https://pro.gv-edu.kr/watch/b5lDprP9MLZG7fI</guid>
      <description>RTK(Rust Token Killer)로 Claude Code 토큰 대폭 절약하기 💸 &lt;br&gt; &lt;br&gt;이번 영상에서는 Claude Code로 바이브 코딩을 할 때 스트레스를 주었던 토큰 부족을 획기적으로 줄여주는 오픈소스, RTK(Rust Token Killer) 를 소개합니다.  &lt;br&gt; &lt;br&gt;터미널에서 실행되는 불필요한 시스템 출력과 노이즈를 똑똑하게 압축하여 Claude에게 꼭 필요한 정보만 전달하는 RTK의 핵심 원리를 짚어봅니다.  &lt;br&gt; &lt;br&gt;RTK가 지원하는 주요 명령어의 압축 전후 결과를 보여주고, RTK의 Hooking 기술을 통해 어떻게 Claude Code에 통합되어 토큰 절약을 제공해주는지 세부적으로 소개합니다. &lt;br&gt; &lt;br&gt;마지막으로, SWE-Bench 데이터셋을 활용한 실제 토큰 절감 테스트 결과와 &lt;br&gt; &lt;br&gt;RTK의 한계점과 사용시 알아두셔야 할 사항까지도 정리합니다. &lt;br&gt; &lt;br&gt;⏱️ Timestamps (타임스탬프) &lt;br&gt; &lt;br&gt;0:00 - 인트로: 설치 한번으로 토큰을 절약할 수 있다? &lt;br&gt;0:38 - RTK(Rust Token Killer) 프로젝트 소개 &lt;br&gt;0:50 - RTK의 핵심 아이디어 &lt;br&gt;1:51 - 얼마나 줄어들까? RTK 사용 전/후 비교 &lt;br&gt;4:10 - RTK 작동 원리 &lt;br&gt;6:42 - 검증 테스트 : RTK 토큰 절약 효과 확인 &lt;br&gt;8:43 - RTK의 한계점과 Tread-Off &lt;br&gt;9:55 - 마무리 &lt;br&gt; &lt;br&gt;📑 Reference &lt;br&gt; &lt;br&gt;RTK (Rust Token Killer) GitHub &lt;br&gt;&lt;a href="https://github.com/rtk-ai/rtk" target="_blank" class="hash" rel="nofollow"&gt;https://github.com/rtk-ai/rtk&lt;/a&gt; &lt;br&gt; &lt;br&gt;SWE-Bench Verfied 데이터셋 &lt;br&gt;&lt;a href="https://huggingface.co/datasets/SWE-bench/SWE-bench_Verified" target="_blank" class="hash" rel="nofollow"&gt;https://huggingface.co/dataset....s/SWE-bench/SWE-benc&lt;/a&gt; &lt;br&gt; &lt;br&gt;#rtk-ai #claudecode #바이브코딩 #ai #오픈소스</description>
      <media:thumbnail url="https://i.ytimg.com/vi/MVIkG2rL7nM/maxresdefault.jpg"/>
    </item>
    <item>
      <title>초보자도 가능한 vLLM을 200% 활용하기 위한 Argument 설정법!</title>
      <link>https://pro.gv-edu.kr/watch/z1cl3GFzMjiYqSv</link>
      <pubDate>Fri, 22 May 2026 06:44:51 +0000</pubDate>
      <guid isPermaLink="true">https://pro.gv-edu.kr/watch/z1cl3GFzMjiYqSv</guid>
      <description>vLLM 활용도를 200% 끌어올리는 필수 Argument 설정 가이드! (OOM 해결부터 성능 최적화까지) &lt;br&gt; &lt;br&gt;이번 영상에서는 vLLM의 엄청난 속도 향상 효과를 제대로 맛보기 위해 꼭 알아야 할 Argument(설정값) 튜닝 가이드를 준비했습니다. &lt;br&gt; &lt;br&gt;보면 울렁거릴 것 같은 vLLM이 제공하는 수많은 Argument들을 아래와 같이 두 가지 케이스로 나누어, 각 주요 Argument에 대한 설명과 어떻게 조정해야 하는지 쉽게 설명해 드립니다! &lt;br&gt; &lt;br&gt;Case 1. VRAM이 부족해서 메모리를 절약해야 할 때 &lt;br&gt;Case 2. VRAM이 넉넉해서 처리 속도를 극대화할 때 &lt;br&gt; &lt;br&gt;마지막으로, 모든 상황에서 반드시 체크해야 할 Argument와 그 사용법을 소개합니다. &lt;br&gt; &lt;br&gt;⏱️ Timestamps (타임스탬프) &lt;br&gt; &lt;br&gt;0:00 - vLLM의 Argument를 알아야 하는 이유 &lt;br&gt;0:51 - VRAM 부족해 메모리 절약을 위한 필수 Arguments &lt;br&gt;2:58 - 최후의 보루 : vLLM의 Offloading 사용법 &lt;br&gt;3:54 - vLLM 처리 속도 극대화를 위한 필수 Arguments &lt;br&gt;6:00 - 공통: --tensor-parallel-size &lt;br&gt;6:12 - 공통: --quantization &lt;br&gt;6:57 - 마무리 &lt;br&gt; &lt;br&gt; &lt;br&gt;📑 Reference &lt;br&gt; &lt;br&gt;vLLM Arguments (공식 페이지) &lt;br&gt;&lt;a href="https://docs.vllm.ai/en/stable/configuration/engine_args/" target="_blank" class="hash" rel="nofollow"&gt;https://docs.vllm.ai/en/stable..../configuration/engin&lt;/a&gt; &lt;br&gt; &lt;br&gt;#vllm #ollama #llm #opensource #ai #오픈소스</description>
      <media:thumbnail url="https://i.ytimg.com/vi/qIWBgp3K_90/maxresdefault.jpg"/>
    </item>
    <item>
      <title>Ollama 대신 vLLM를 연동해 Openclaw 8배 빠르게 만들기!</title>
      <link>https://pro.gv-edu.kr/watch/CTx8LP1N2wYQhWG</link>
      <pubDate>Fri, 22 May 2026 06:44:51 +0000</pubDate>
      <guid isPermaLink="true">https://pro.gv-edu.kr/watch/CTx8LP1N2wYQhWG</guid>
      <description>초보자도 쉽게 따라 하는 OpenClaw + vLLM 연동 완벽 가이드! 🚀 &lt;br&gt; &lt;br&gt;로컬 LLM을 사용하면서 Ollama의 병렬 처리 한계(병목 현상) 때문에 답답하셨나요? 이번 영상에서는 추론 속도를 극대화해주는 강력한 서빙 프레임워크인 vLLM을 OpenClaw에 연동하는 과정을 단계별로 알기 쉽게 소개합니다. &lt;br&gt; &lt;br&gt;Docker를 활용한 깔끔한 vLLM 설치법과 Openclaw와 연동 실습까지 이번 영상에 모두 담았습니다! &lt;br&gt; &lt;br&gt;⏱️ **Timestamps (타임스탬프)** &lt;br&gt; &lt;br&gt;0:00 - 인트로: Openclaw와 vLLM를 사용하면 장점 &lt;br&gt;0:36 - vLLM 구축 - 왜 Docker 인가? &lt;br&gt;1:11 - vLLM 구축 - Docker 설치 실습 &lt;br&gt;2:35 - vLLM 실행 명령어 설명 &lt;br&gt;4:51 - vLLM 구축 - vLLM 구동 실습 &lt;br&gt;5:08 - Openclaw와 연동 방법 &lt;br&gt;6:53 - 마무리 &lt;br&gt; &lt;br&gt;📑 **Reference** &lt;br&gt; &lt;br&gt;🚨 Docker를 활용한 vLLM 설치 가이드 (*중요*) &lt;br&gt;&lt;a href="https://weirdeveloper.notion.site/Docker-vLLM-331edc521ab080bea8c7de11f099a349?source=copy_link" target="_blank" class="hash" rel="nofollow"&gt;https://weirdeveloper.notion.s....ite/Docker-vLLM-331e&lt;/a&gt; &lt;br&gt; &lt;br&gt;🚨 Openclaw 설치 가이드 (*중요*) &lt;br&gt;&lt;a href="https://weirdeveloper.notion.site/Openclaw-331edc521ab080bda5a4f05d769e762e?source=copy_link" target="_blank" class="hash" rel="nofollow"&gt;https://weirdeveloper.notion.s....ite/Openclaw-331edc5&lt;/a&gt; &lt;br&gt; &lt;br&gt;Docker 기반 vLLM 설치 및 배포 가이드 &lt;br&gt;&lt;a href="https://docs.vllm.ai/en/stable/deployment/docker/" target="_blank" class="hash" rel="nofollow"&gt;https://docs.vllm.ai/en/stable/deployment/docker/&lt;/a&gt; &lt;br&gt; &lt;br&gt;모델별 Tool Call 파서(--tool-call-parser) 설정 참고 &lt;br&gt;&lt;a href="https://docs.vllm.ai/en/stable/configuration/engine_args/" target="_blank" class="hash" rel="nofollow"&gt;https://docs.vllm.ai/en/stable..../configuration/engin&lt;/a&gt; &lt;br&gt; &lt;br&gt;OpenClaw - vLLM 연동 공식 가이드 &lt;br&gt;&lt;a href="https://docs.openclaw.ai/providers/vllm" target="_blank" class="hash" rel="nofollow"&gt;https://docs.openclaw.ai/providers/vllm&lt;/a&gt; &lt;br&gt; &lt;br&gt; &lt;br&gt;#openclaw #vllm #로컬llm #ai</description>
      <media:thumbnail url="https://i.ytimg.com/vi/7eO1kqAAWsc/maxresdefault.jpg"/>
    </item>
    <item>
      <title>아직도 Ollama 쓰시나요? 로컬 LLM 속도 9배 올리는 vLLM 소개</title>
      <link>https://pro.gv-edu.kr/watch/jgjPULYWZuF5dWR</link>
      <pubDate>Fri, 22 May 2026 06:44:51 +0000</pubDate>
      <guid isPermaLink="true">https://pro.gv-edu.kr/watch/jgjPULYWZuF5dWR</guid>
      <description>Ollama를 뛰어넘는 괴물 같은 오픈소스 vLLM! 🚀 &lt;br&gt; &lt;br&gt;이번 영상에서는 Ollama 대비 TPS가 약 19배 높고, 응답 속도는 8배나 빠른 강력한 오픈소스 &amp;#039;vLLM&amp;#039;을 소개합니다. &lt;br&gt;vLLM의 핵심 기술인 PagedAttention과 Continuous Batching의 원리에 대해 알기 쉽게 살펴보고, &lt;br&gt;마지막으로 동일한 모델 환경에서 Ollama와 vLLM의 실제 추론 속도를 비교한 테스트 결과까지 전달해 드립니다. &lt;br&gt; &lt;br&gt;⏱️ Timestamps (타임스탬프) &lt;br&gt; &lt;br&gt;0:00 - 인트로: Ollama를 압도한 vLLM  &lt;br&gt;0:42 - vLLM 프로젝트 소개 &lt;br&gt;1:44 - vLLM의 핵심 기술 1: PagedAttention &lt;br&gt;4:13 - vLLM의 핵심 기술 2: Continuous Batching &lt;br&gt;5:10 - 추론 성능 비교: Ollama vs vLLM  &lt;br&gt;6:58 - 마무리 (+ 개인적인 생각)  &lt;br&gt; &lt;br&gt;📑 Reference &lt;br&gt; &lt;br&gt;vLLM 공식 GitHub &lt;br&gt;&lt;a href="https://github.com/vllm-project/vllm" target="_blank" class="hash" rel="nofollow"&gt;https://github.com/vllm-project/vllm&lt;/a&gt; &lt;br&gt; &lt;br&gt;Qwen3-8B 양자화 모델 (HuggingFace) &lt;br&gt;&lt;a href="https://huggingface.co/Qwen/Qwen3-8B-AWQ" target="_blank" class="hash" rel="nofollow"&gt;https://huggingface.co/Qwen/Qwen3-8B-AWQ&lt;/a&gt; &lt;br&gt; &lt;br&gt;vLLM의 PagedAttention 논문 &lt;br&gt;&lt;a href="https://arxiv.org/abs/2309.06180" target="_blank" class="hash" rel="nofollow"&gt;https://arxiv.org/abs/2309.06180&lt;/a&gt; &lt;br&gt; &lt;br&gt;Ollama와 vLLM 비교: 성능 벤치마킹 심층 분석 자료 (RedHat) &lt;br&gt;https://developers.redhat.com/articles/2025/08/08/ollama-vs-vllm-deep-dive-performance-benchmarking?_gl=1*1prrvjj*_gcl_au*MTk5OTcyOTM3MS4xNzcwODE1ODQ3&amp;amp;extIdCarryOver=true&amp;amp;sc_cid=RHCTG0180000382536# &lt;br&gt; &lt;br&gt;vLLM 개발자 &amp;#039;권우석&amp;#039; 박사님 프로필 &lt;br&gt;&lt;a href="https://woosuk.me/" target="_blank" class="hash" rel="nofollow"&gt;https://woosuk.me/&lt;/a&gt; &lt;br&gt; &lt;br&gt;NVIDIA-supported vLLM &lt;br&gt;&lt;a href="https://docs.nvidia.com/deeplearning/frameworks/vllm-release-notes/index.html" target="_blank" class="hash" rel="nofollow"&gt;https://docs.nvidia.com/deeple....arning/frameworks/vl&lt;/a&gt; &lt;br&gt; &lt;br&gt;AMD-supported vLLM &lt;br&gt;&lt;a href="https://www.amd.com/ko/developer/resources/open-source-projects.html" target="_blank" class="hash" rel="nofollow"&gt;https://www.amd.com/ko/develop....er/resources/open-so&lt;/a&gt; &lt;br&gt; &lt;br&gt;vLLM 설치 명령어 정리 &lt;br&gt;&lt;a href="https://weirdeveloper.notion.site/vLLM-323edc521ab0806a9ee5f01b7234f136?source=copy_link" target="_blank" class="hash" rel="nofollow"&gt;https://weirdeveloper.notion.s....ite/vLLM-323edc521ab&lt;/a&gt; &lt;br&gt; &lt;br&gt;테스트 코드 &lt;br&gt;&lt;a href="https://github.com/weirdeveloper/llm-inference-benchmark" target="_blank" class="hash" rel="nofollow"&gt;https://github.com/weirdevelop....er/llm-inference-ben&lt;/a&gt; &lt;br&gt; &lt;br&gt;#vllm #ollama  #llm #opensource #ai #오픈소스</description>
      <media:thumbnail url="https://i.ytimg.com/vi/OfpGLIUuzww/maxresdefault.jpg"/>
    </item>
    <item>
      <title>Ollama보다 뛰어나다고?! 게임용 GPU에서 671B LLM을 빠른속도로 구동시킨 Ktransformer 소개</title>
      <link>https://pro.gv-edu.kr/watch/ZIARe5EFB3Rnf6B</link>
      <pubDate>Fri, 22 May 2026 06:44:51 +0000</pubDate>
      <guid isPermaLink="true">https://pro.gv-edu.kr/watch/ZIARe5EFB3Rnf6B</guid>
      <description>24GB VRAM으로 671B 모델을? Ollama를 압도하는 KTransformer 완벽 가이드! &lt;br&gt; &lt;br&gt;이번 영상에서는 24GB VRAM으로 671B 모델을 실사용 가능한 수준으로 실행할 수 있게 하는 무서운 오픈소스, KTransformer를 소개합니다. &lt;br&gt;KTransformer의 MoE(Mixture of Experts) 모델 구조에 맞춘 &amp;#039;최적화된 오프로딩&amp;#039; 원리에 대해 먼저 살펴보고, &lt;br&gt; &lt;br&gt;KTransformer를 사용하실 분들을 위한 상세한 설치 과정을 단계별로 설명합니다. &lt;br&gt;마지막에는 동일한 모델로 KTransformer과 Ollama 간의 추론 속도 비교하고 테스트 결과까지 전달합니다. &lt;br&gt; &lt;br&gt;⏱️ Timestamps (타임스탬프) &lt;br&gt; &lt;br&gt;0:00 - 인트로: Ollama 다음은 KTransformer? &lt;br&gt;0:52 - KTransformer 프로젝트 소개 &lt;br&gt;1:40 - 기존 Ollama(llama.cpp), 무엇이 문제였을까? &lt;br&gt;2:58 - KTransformer 핵심 알고리즘 : MoE Offloading &lt;br&gt;4:14 - 속도 비교: Ollama vs KTransformer &lt;br&gt;6:35 - 마무리 (+ 개인적인 생각) &lt;br&gt; &lt;br&gt;📑 Reference &lt;br&gt; &lt;br&gt;KTransformer 깃허브 &lt;br&gt;&lt;a href="https://github.com/kvcache-ai/ktransformers" target="_blank" class="hash" rel="nofollow"&gt;https://github.com/kvcache-ai/ktransformers&lt;/a&gt; &lt;br&gt; &lt;br&gt;Qwen3-30B-A3B 모델 (HuggingFace) &lt;br&gt;&lt;a href="https://huggingface.co/Qwen/Qwen3-30B-A3B" target="_blank" class="hash" rel="nofollow"&gt;https://huggingface.co/Qwen/Qwen3-30B-A3B&lt;/a&gt; &lt;br&gt; &lt;br&gt;Qwen3-30B-A3B 양자화 모델 (HuggingFace) &lt;br&gt;&lt;a href="https://huggingface.co/Qwen/Qwen3-30B-A3B" target="_blank" class="hash" rel="nofollow"&gt;https://huggingface.co/Qwen/Qwen3-30B-A3B&lt;/a&gt;-GGUF &lt;br&gt; &lt;br&gt;KTransformer 설치 명령어 정리 &lt;br&gt;&lt;a href="https://weirdeveloper.notion.site/Ktransformer-314edc521ab080aba3abce6e12e00973?source=copy_link" target="_blank" class="hash" rel="nofollow"&gt;https://weirdeveloper.notion.s....ite/Ktransformer-314&lt;/a&gt; &lt;br&gt; &lt;br&gt;테스트 코드 &lt;br&gt;&lt;a href="https://github.com/weirdeveloper/llm-inference-benchmark" target="_blank" class="hash" rel="nofollow"&gt;https://github.com/weirdevelop....er/llm-inference-ben&lt;/a&gt; &lt;br&gt; &lt;br&gt;--- &lt;br&gt; &lt;br&gt;Ollama AVX2 최적화 지원 &lt;br&gt;&lt;a href="https://github.com/ollama/ollama/issues/1317" target="_blank" class="hash" rel="nofollow"&gt;https://github.com/ollama/ollama/issues/1317&lt;/a&gt; &lt;br&gt; &lt;br&gt;Ollama MoE offloading 업데이트 &lt;br&gt;&lt;a href="https://github.com/ggml-org/llama.cpp/pull/15077" target="_blank" class="hash" rel="nofollow"&gt;https://github.com/ggml-org/llama.cpp/pull/15077&lt;/a&gt; &lt;br&gt; &lt;br&gt;#ktransformer #ollama  #llm #opensource #ai #오픈소스</description>
      <media:thumbnail url="https://i.ytimg.com/vi/XkNdcB8VINM/maxresdefault.jpg"/>
    </item>
    <item>
      <title>99%가 모르는 저사양 GPU에 초대형 LLM을 실행할 수 있는 오픈소스 AirLLM 소개</title>
      <link>https://pro.gv-edu.kr/watch/gjnAiRfP6McB2AA</link>
      <pubDate>Fri, 22 May 2026 06:44:51 +0000</pubDate>
      <guid isPermaLink="true">https://pro.gv-edu.kr/watch/gjnAiRfP6McB2AA</guid>
      <description>저사양 GPU에 초대형 LLM을 실행할 수 있는 AirLLM 소개! &lt;br&gt; &lt;br&gt;이번 영상에서는 매달 나가는 클라우드 구독비와 고가의 GPU 없이도, 오픈소스 도구인 AirLLM을 활용해 일반 가정용 PC에서 70B급 대규모 언어 모델(LLM)을 구동하는 방법을 소개합니다. &lt;br&gt; &lt;br&gt;AirLLM의 핵심인 &amp;#039;계층별 추론(Layer-wise Inference)&amp;#039; 방식을 통해, 단 4GB의 VRAM 환경에서도 거대한 파라미터 덩어리인 Llama3 70B 모델이 어떻게 작동하는지 그 원리를 살펴보고 직접 코드를 통해 실습해 봅니다. &lt;br&gt; &lt;br&gt;⏱️ Timestamps (타임스탬프) &lt;br&gt; &lt;br&gt;0:00 - 인트로: VRAM 부족 문제와 AirLLM &lt;br&gt;0:45 - AirLLM 프로젝트 및 개발자 소개 &lt;br&gt;0:56 - AirLLM 핵심 작동 원리 (메커니즘) &lt;br&gt;2:20 - 지원 모델 및 신규 모델 신청 방법 &lt;br&gt;2:50 - AirLLM 실습: Llama3-70B 구동 및 코드 설명 &lt;br&gt;4:52 - 실행 결과 분석 및 마무리 &lt;br&gt; &lt;br&gt;📑 Reference &lt;br&gt; &lt;br&gt;AirLLM 깃허브 &lt;br&gt;&lt;a href="https://github.com/lyogavin/airllm" target="_blank" class="hash" rel="nofollow"&gt;https://github.com/lyogavin/airllm&lt;/a&gt; &lt;br&gt; &lt;br&gt;Llama3-70B 모델 (HuggingFace) &lt;br&gt;&lt;a href="https://huggingface.co/meta-llama/Meta-Llama-3-70B-Instruct" target="_blank" class="hash" rel="nofollow"&gt;https://huggingface.co/meta-ll....ama/Meta-Llama-3-70B&lt;/a&gt; &lt;br&gt; &lt;br&gt;실습 코드 &lt;br&gt;&lt;a href="https://github.com/weirdeveloper/AirLLM-Example-Code/blob/main/AirLLM_Test.ipynb" target="_blank" class="hash" rel="nofollow"&gt;https://github.com/weirdevelop....er/AirLLM-Example-Co&lt;/a&gt; &lt;br&gt; &lt;br&gt;#AirLLM #llm #opensource #ai #오픈소스</description>
      <media:thumbnail url="https://i.ytimg.com/vi/VRt_Xyvs24c/mqdefault.jpg"/>
    </item>
  </channel>
</rss>
