Содержание
Коротко
На Habr автор купил мини‑ПК с Ryzen AI 9 365 и 64 ГБ памяти, чтобы гонять большую локальную модель на NPU. Гибрид NPU и встроенной графики на Windows для нужной модели не сложился, зато на Proxmox через FastFlowLM заработала Qwen3.6–35B-A3B: чтение промпта около 200 ток/с, генерация 13–17 ток/с. По дороге выяснилось, что NPU видит примерно половину оперативки, обслуживает один запрос за раз и падает, если клиент отменяет долгий вызов.
Что произошло
Исходная машина на Ryzen 7 5800U без видеокарты почти всё время тратила на чтение длинного промпта, а не на ответ. Маркетинг AMD обещал выигрыш именно на этой фазе, и автор выбрал FIREBAT на Ryzen AI 9 365: коробка плюс память вышли примерно в 70 тыс. ₽. Привычный стек llama.cpp / Ollama / LM Studio NPU не использует. Lemonade от AMD обещал гибрид, но только для заранее подготовленных малых моделей на Windows. Для Qwen3.6–35B осталась отдельная среда выполнения FastFlowLM (flm) с каталогом моделей под NPU.
На Windows драйвер NPU пришлось добывать отдельно, а после запуска выяснилось, что NPU видит около половины оперативки, которую показывает система, плюс настройки платы заранее откусывают кусок под встроенную графику. Модель около 20 ГБ плюс кэш и второй запрос уже не помещались — лечилось минимумом UMA Frame Buffer в настройках платы. Гибрид так и не пригодился, поэтому автор переехал на Proxmox VE 9: NPU в виртуалку не пробрасывается, а flm запустился прямо на хосте рядом с гипервизором. Память виртуалкам зафиксировали жёстко, без «воздушного шара», чтобы в момент вывода модели хост не остался без страниц.
Когда к серверу подключились сервисы с суточным потоком около 6 млн токенов, проявились ограничения железа. Один NPU — как одна касса в магазине: очередь есть, параллельной работы нет. Клиент с таймаутом 120 с отменял запрос во время чтения промпта, и flm падал с повреждением памяти, унося всю очередь. Отдельно модель для векторных представлений на том же NPU иногда выгружала большую модель ради маленькой. Рабочий контур: длинные таймауты, Restart=on-failure, явный --ctx-len, прокси с общим потолком параллелизма и эмбеддинги на CPU через llama.cpp.
Почему это важно
Локальная большая модель обещает тишину, предсказуемый счёт и независимость от чужого API. Цифры автора для его профиля нагрузки показывают, что железо около $825 окупается за месяцы против дорогих облачных тарифов — и за год‑два против самых дешёвых. Но NPU здесь не замена видеокарте: против RTX 3090 он проигрывает в разы и по чтению, и по генерации. Выигрыш в другом — энергопотребление, шум и компактность.
Для продакшена важнее не пиковая скорость на одном запросе, а поведение под очередью. Один поток, падения на отмене, вытеснение модели эмбеддингами — это уже архитектура сервиса, а не «поставил и забыл». Без общего входа перед NPU несколько клиентов сами устраивают шторм, который один чип не переварит.
На практике
Текст — подробный разбор с цифрами, а не универсальная рекомендация купить любой мини‑ПК с наклейкой «ИИ». Имеет смысл, если нужна большая модель со смесью экспертов круглосуточно в тихой коробке, нагрузка фоновая, промпты длинные, ответы короткие. Слабо подходит для живого чата на 13–17 ток/с и для сценариев с настоящей параллельностью.
- Считайте доступную NPU память как примерно половину RAM минус резерв настроек платы под встроенную графику; 32 ГБ для модели ~20 ГБ обычно мало.
- Не ждите гибрида NPU и встроенной графики на крупных моделях: для 35B автор ушёл на чистый NPU через
flm. - На
Proxmoxдержитеflmна хосте: проброс NPU в ВМ пока сырой. - Перед NPU поставьте один прокси с общим лимитом параллелизма; таймауты клиентов делайте длиннее худшей очереди.
- Эмбеддинги и сверхдлинные промпты лучше увести с NPU, чтобы не вытеснять основную модель и не блокировать очередь на минуты.
Итог
Мини‑ПК с NPU может тянуть серьёзную локальную LLM круглосуточно, если принять, что чип — одна очередь, а не ферма. Автор дошёл до стабильной связки Proxmox + FastFlowLM + Qwen3.6–35B и понятных скоростей на длинных промптах. Цена вопроса — память, драйверы, дисциплина клиентов и отдельный путь для задач, которые NPU ломают.



Комментарии