← Все статьи

Локальные LLM без серверной видеокарты: MoE, RAM и VRAM в 2026

Почему модели со смесью экспертов требуют много памяти при малом числе активных параметров, как работают квантование и выгрузка слоёв, и почему 64 ГБ RAM плюс 16 ГБ VRAM — серьёзный старт для домашнего локального ИИ.

Локальные LLM без серверной видеокарты: MoE, RAM и VRAM в 2026
Содержание

Представьте склад с сотней узких специалистов. На каждый заказ выходят двое–трое, остальные ждут. Счёт за работу небольшой — трудятся немногие. Но зарплату «за присутствие» склад всё равно платит всем: каждого нужно где-то держать на полке. Локальная языковая модель со смесью экспертов (MoE) устроена похоже. Считает мало параметров за токен. Хранить приходится почти всю модель.

Несколько лет назад домашний запуск упирался в один вопрос: «сколько видеопамяти у карты?». В 2026 году рядом встаёт другой: «сколько памяти система может отдать модели и насколько быстро эта память работает?». Ниже — практическая карта выбора железа: от формул памяти до сборок, мифов и чек-листа покупки. Рядом — обзор CPU, GPU, TPU и NPU и кейс мини‑ПК с NPU.

Ключевые выводы

MoE экономит вычисления, а не место на полках. У модели может быть 120 млрд параметров всего и несколько миллиардов активных на токен. Скорость счёта ближе к «лёгкой» модели. Объём весов — ближе к тяжёлой.

Запустить и комфортно пользоваться — разные цели. Модель может отвечать на CPU с выгрузкой слоёв на GPU и при этом быть слишком медленной для живого ассистента в редакторе. Сначала решите, что для вас приемлемо: «открылась», «терпимо для фона» или «удобно каждый день».

64 ГБ оперативной памяти плюс 16 ГБ видеопамяти — уже серьёзный старт, а не игрушка. Вместе это около 80 ГБ физической памяти разных уровней. Это не «80 ГБ VRAM». Зато на такой машине реально жить со смесью экспертов для кода класса 20–30B и экспериментировать с более крупными квантованными моделями через выгрузку.

Контекст ест память незаметно. Длинное окно раздувает кэш ключей и значений (KV cache). Для ассистента в IDE часто важнее стабильные 8–32K, чем теоретический максимум с карточки модели.

Покупайте путь роста, а не идеальный ПК с первого чека. Быстрая память, запас слотов под RAM и нормальное охлаждение важнее разовой «топовой» карты при тесной оперативке.

Что происходит с памятью, когда модель отвечает

Файл модели — не весь счёт. На складе лежат не только коробки с весами. Рядом — рабочие зоны: активации текущего шага, кэш внимания, буферы движка, запас под длинный контекст. Грубая оценка:

память ≈ веса модели + KV cache + накладные расходы движка + буферы

Файл model.gguf на 18 ГБ не означает «хватит 18 ГБ RAM». Нужны загрузка, рантайм, кэш под выбранный контекст и запас ОС. Две фазы ответа ведут себя по-разному: чтение промпта (prefill) — прогреть кэш; генерация (decode) — выдавать токены по одному. На слабой шине памяти длинный промпт часто больнее, чем сама генерация.

Плотная модель и смесь экспертов

Плотная (Dense) сеть на 70B почти на каждом токене гоняет большую долю параметров. Смесь экспертов держит много «узких специалистов» и на токене включает лишь часть через маршрутизатор:

                 ┌── эксперт 1
                 ├── эксперт 2
токен → router ──┼── эксперт 3
                 ├── …
                 └── эксперт N
         активна только часть

Ключевая пара чисел:

всего параметров ≠ активных параметров

Пример порядка величин: порядка 120B всего и 5–6B активных. Вычислений меньше, чем у плотной 70B. Но все эксперты должны быть доступны для маршрутизатора — иначе «специалиста» не вызвать. Отсюда главный тезис статьи: MoE экономит вычисления, но не пропорционально экономит память.

Два разных потолка: счёт и память

Любой локальный вывод упирается в два разных ограничения. Счёт — терафлопсы GPU/CPU, тензорные ядра, число активных параметров. Память — VRAM, RAM, единая память ноутбука или мини‑ПК, и главное — пропускная способность (DDR5, GDDR, HBM, единая память).

Отсюда парадокс: модель на 100 ГБ иногда «оживает» на машине с 64 ГБ RAM и 16 ГБ VRAM через выгрузку слоёв. Но «оживает» ≠ «быстро». Медленная оперативка при огромном объёме даёт склад без погрузчиков: места много, заказы ползут.

Квантование: как уплотнить коробки на полках

Точность хранения веса — это «толщина» упаковки. Ориентиры первого приближения: FP32 ≈ 4 байта на параметр, FP16/BF16 ≈ 2, INT8 ≈ 1, 4‑бит ≈ 0,5 плюс накладные расходы. Для домашнего запуска популярен формат GGUF: метаданные, тензоры и удобная стыковка с движками вроде llama.cpp.

Линейка Q4_K_M, Q5_K_M, Q6_K, Q8 — компромисс размера, качества и скорости. Часто удобный баланс — около Q4/Q5: модель заметно легче полной точности, а код и следование инструкции ещё держатся. Слишком агрессивное сжатие бьёт по рассуждению, коду и стабильности инструкций — это уже не «бесплатная экономия», а другая модель по поведению.

Таблица-оценка для плотных моделей (порядок величин, не паспорт конкретной сборки):

Модель FP16 INT8 Q4
7B ~14 ГБ ~7 ГБ ~4–5 ГБ
14B ~28 ГБ ~14 ГБ ~8–10 ГБ
32B ~64 ГБ ~32 ГБ ~18–22 ГБ
70B ~140 ГБ ~70 ГБ ~35–45 ГБ
120B ~240 ГБ ~120 ГБ ~60–70 ГБ

Для MoE смотрите отдельную тройку: всего параметров, активных параметров, размер выбранного квантования. Формула параметры × байт_на_параметр остаётся стартовой, к ней всегда добавляют накладные расходы, KV и рантайм.

Выгрузка слоёв: когда карта и процессор делят одну модель

Три режима удобно держать в голове.

Только GPU — веса в VRAM, максимальная скорость, нужен большой объём карты. Только CPU — веса в RAM, доступны огромные модели, скорость часто фоновая. CPU + GPU — часть слоёв на карте, часть в оперативке; появляется цена переноса между «верстаком» и «складом».

Даже 16 ГБ VRAM полезны, когда модель целиком не влезает: тяжёлые слои, ускорение внимания, кусок кэша. Карта не обязана держать всё — она обязана ускорять то, что вы на неё положили. Подробнее про роли чипов — в обзоре железа для AI.

Почему связка 64 ГБ RAM + 16 ГБ VRAM интересна

Шестнадцать гигабайт видеопамяти комфортно держат 7–14B, часть 20–30B и небольшие MoE целиком или почти целиком. Шестьдесят четыре гигабайта оперативки позволяют хранить крупные GGUF, гонять выгрузку и пробовать модели тяжелее карты. Сумма «80 ГБ» — удобный ориентир ёмкости системы, не маркетинговый слоган про единую сверхбыструю память.

Практические зоны на такой машине:

  • Отлично: 7–14B, около 20B, смеси экспертов для кода порядка 30B с умеренным контекстом.
  • Возможно: 70B в Q4, крупные MoE 100B+ с заметной выгрузкой слоёв.
  • Уже компромисс: 200B+ и особенно 400B+ — скорее эксперимент, чем ежедневный ассистент.

Соседний полюс — мини‑ПК с NPU и 64 ГБ: там выигрывают тишина и энергобюджет, а не пик против дискретной карты.

Современные модели, на которых стоит мерить железо

Ориентиры для стенда, а не рейтинг «лучшая модель недели».

gpt-oss-20b — удобный класс «серьёзно, но ещё бытово»: смотрите полный и активный размер, квант, скорость чтения промпта и генерации, качество кода и рассуждения.

gpt-oss-120b — другой класс памяти. Здесь быстро заканчивается «влезло в карту» и начинается жизнь на RAM и выгрузке слоёв. Практичность зависит от терпимости к задержке, не только от факта запуска.

Qwen3-Coder 30B-A3B — главный бытовой пример смеси экспертов для кода: десятки миллиардов всего при нескольких активных. На 32 ГБ RAM тесно; на 64 ГБ плюс 16 ГБ VRAM — как раз зона комфортного эксперимента. Более крупные такие модели сдвигают полку к 128–256 ГБ.

Сравнивайте близкие задачи: плотная 30B против MoE ~30B; плотная 70B против MoE 100B+. Память, активные параметры, токены в секунду и цена железа редко голосуют одинаково.

Контекст: скрытый потребитель полок

Окно 32K — не такое же «дешёвое», как 4K. Чем длиннее вход и история, тем больше KV cache. Ассистент в IDE особенно прожорлив: текущий файл, соседи, патч изменений, ошибки, куски документации, история диалога. Максимум с карточки модели часто не оптимален: выигрыш в «всё влезло в промпт» съедается памятью и медленным чтением промпта.

Реалистичные режимы для дома — 4K / 8K / 16K / 32K, иногда 64K, если железо и задача правда требуют. Для агентов и IDE полезно читать также как ИИ‑среды работают с кодом.

Процессор и шина памяти

Число ядер само по себе плохо предсказывает скорость локального вывода. Важнее скорость на такт (IPC), каналы памяти, кэш, набор инструкций и реальная пропускная способность. На десктопе смотрят линейки Ryzen и Core с запасом по RAM. На Apple Silicon сильна единая память: нет жёсткой стены «карта / оперативка», зато потолок задаёт выбранный объём единой памяти и экосистема (MLX, Metal). Платформы вроде Ryzen AI Max с 128 ГБ единой памяти иногда интереснее связки «обычный ПК + 16 ГБ дискретной карты», если цель — большие MoE на одной коробке. Серверные CPU оправданы, когда нужны 128–512 ГБ и несколько пользователей.

Конкретные сборки и классы задач

Ультрабюджет: 32 ГБ RAM и 8–12 ГБ VRAM — 7–14B и небольшие MoE, знакомство со стеком. Оптимальный старт статьи: 64 ГБ + 16 ГБ — gpt-oss-20b, Qwen3-Coder 30B-A3B, крупные Q4 через выгрузку слоёв. Продвинутая: 128 ГБ + 24 ГБ — большие MoE, 70B Q4, длиннее контекст. Рабочая станция: 128–256 ГБ и 48 ГБ+ VRAM. Единая память: сравнивайте 64 / 128 / 256 ГБ единой памяти с классической парой RAM + дискретная GPU по цене, пропускной способности и софту.

RAM VRAM Класс моделей Сценарий
16 ГБ 8 ГБ ~7B базовый пробы
32 ГБ 12 ГБ 7–20B хороший старт
64 ГБ 16 ГБ 20–30B MoE оптимальный старт
128 ГБ 24 ГБ 30–100B+ продвинутый
192 ГБ 48 ГБ крупные MoE рабочая станция
256–512 ГБ 48–80+ ГБ 200–500B MoE верхний сегмент

Цифры ориентировочные: конкретный GGUF и контекст всегда перепроверяйте на своём стенде.

Мини‑ПК, обычный ПК и «AI‑коробки»

Мини‑ПК выигрывают компактностью, шумом, энергобюджетом и часто объёмом единой или плотной оперативки. Проигрывают охлаждению под долгий нагрузкой, апгрейду и дискретной GPU. Обычный настольный ПК сильнее в карте, слотах RAM и SSD, но больше и прожорливее. Имеет смысл сравнивать три подхода:

Apple Silicon     → единая память, CPU+GPU, MLX/Metal
x86 + NVIDIA      → RAM + VRAM, CUDA, самый привычный софт
Ryzen AI Max      → большая единая память + сильная iGPU/NPU

Совместимость софта решает не меньше кремния: CUDA, ROCm, Metal, поддержка конкретной MoE‑архитектуры в движке. Кейс с NPU на мини‑ПК показывает: маркетинг «AI» не отменяет очереди в один поток и странностей драйверов — см. разбор на практике.

Программный стек

llama.cpp — лучший «рентген» локального вывода: слои, кванты, выгрузку слоёв, метрики. Ollama и LM Studio ускоряют старт. vLLM ближе к серверному контуру. MLX — естественный путь на Apple. Transformers удобны для экспериментов в Python и исследований, но не всегда оптимальны как домашний ассистент‑сервер. Общий ландшафт фреймворков — в обзоре PyTorch / TensorFlow / JAX.

Как измерять, чтобы не обмануть себя

Одной цифры «токены в секунду» мало. Смотрите отдельно: время до первого токена, скорость чтения промпта, скорость генерации, память под веса и под KV, стабильность на вашем контексте. Бенчмарк «40 токенов/с на коротком чате» плохо предсказывает IDE с огромным контекстом, RAG и вызовами инструментов — там решает полная задержка сценария. Экономика облака против своего железа — в учёте затрат шлюза LLM; про контуры с поиском по базе — в боевом RAG.

Мини‑протокол на одну модель:

железо → модель → квант → контекст
RAM/VRAM used → prompt tok/s → generation tok/s → TTFT
CPU-only / GPU-offload / GPU-only → заметки по качеству кода

Локальный ассистент для кода на своей машине

Типичная схема домашнего контура:

IDE → локальный API → сервер модели → `MoE` → GPU + RAM

Сверху — Continue, агенты в духе Cline, OpenAI‑совместимый API, MCP и вызовы инструментов. Именно здесь всплывают чтение длинного промпта, контекст и очередь: ассистент «думает долго», хотя токены/с на коротком промпте был приличным. Роль программиста рядом с моделями меняется — об этом отдельный лонгрид.

Мифы, которые мешают купить правильный ПК

«MoE — это маленькая модель». Нет: маленькими бывают активные параметры. «Раз активно 5B, памяти нужно как для 5B». Нет: полки заняты всеми экспертами. «64 ГБ RAM заменяют 64 ГБ VRAM». Нет: разная скорость. «Чем больше VRAM, тем всегда лучше». Не обязательно, если оперативки мало для ваших MoE. «Вывод на CPU бесполезен». Нет — особенно для крупных моделей и приватного фона. «Всегда включайте максимальный контекст». Нет: платите памятью и чтением промпта.

Не стоит: очень сильный CPU при тесной RAM; дорогая карта при 32 ГБ, которые нельзя расширить; медленная память «ради экономии»; гнаться за терафлопсами без VRAM и без запаса оперативки.

Чек-лист покупки и путь апгрейда

Перед оплатой проверьте: RAM ≥ 64 ГБ или реальный путь расширения; VRAM ≥ 16 ГБ либо сопоставимая единая память; высокая пропускная способность памяти; быстрый NVMe; охлаждение под долгий вывод; Linux или нужная вам ОС; CUDA / ROCm / Metal под стек; запас блока питания; шум; сеть для домашнего API.

Путь роста без покупки «всего сразу»:

этап 1:  64 ГБ RAM  + 16 ГБ VRAM
этап 2: 128 ГБ RAM  + 24 ГБ VRAM
этап 3: 128–256 ГБ  + 48 ГБ VRAM
этап 4: 256–512 ГБ  + несколько GPU

Идея простая: наращивайте ёмкость памяти и ускорение по мере того, как упираетесь в реальный сценарий, а не в чужой скриншот.

Частые вопросы

Можно ли запускать современные MoE без карты на 80 ГБ?

Да, если хватает системной памяти и вы принимаете скорость выгрузки слоёв и CPU. «Запускается» не значит «удобно как облачный чат».

Чем 64 ГБ RAM + 16 ГБ VRAM лучше, чем 32 ГБ + 24 ГБ?

Для больших MoE часто важнее полка под все эксперты, чем лишние 8 ГБ на карте при тесной оперативке. Для плотных моделей, которые целиком живут в VRAM, перевес может быть у 24 ГБ.

Какой квант выбрать для кода?

Начните с Q4_K_M / Q5_K_M и прогоните свои задачи. Если ломается следование инструкции или качество патчей — поднимайте точность, а не только контекст.

Нужен ли мини‑ПК с NPU вместо десктопа?

Если нужны тишина, энергобюджет и большая единая/плотная память — да, как класс. Если нужен привычный CUDA‑стек и апгрейд карты — чаще выигрывает обычный ПК. Смотрите практический кейс NPU.

Почему ассистент в IDE тормозит при «нормальных» токенах/с?

Часто виноваты длинное чтение промпта, большой контекст, повторная подача файлов и инструменты. Смотрите время до первого токена и полный сценарий, не только генерацию.

Заключение

MoE не сделал видеокарту ненужной. MoE сделал большую системную память заметно ценнее. В домашнем локальном ИИ 2026 года удобная упрощённая формула звучит так:

RAM  ≈ какие модели вам вообще доступны
VRAM ≈ насколько быстро вы их обрабатываете

Практическая стартовая точка для экспериментов со смесями экспертов для кода — 64 ГБ RAM + 16 ГБ VRAM, быстрая память и нормальный NVMe. Часто это интереснее, чем 32 ГБ оперативки при более жирной карте, если ваша цель — именно большие смеси экспертов, а не одна плотная модель целиком в VRAM.

Склад по-прежнему должен вмещать всех специалистов. Вопрос лишь в том, скольких вы готовы держать на полках — и насколько быстрый у вас верстак.

Комментарии

Загрузка комментариев…