Qwen локально — открытые веса, GGUF и Ollama
Часть линейки Qwen — не сервис, а файл: скачал, запустил, работаешь без интернета и без чужого сервера между собой и моделью. Разбираем, что именно открыто и чем это запускать.
Что именно открыто
Qwen3.8-27B
27,8 млрд параметров, мультимодальная
Понимает изображения и текст в одном запросе. Community-сборки в GGUF есть уже в первые часы после релиза — модель совместима с Ollama, llama.cpp, LM Studio и MLX.
Qwen3.8-2.4T-A95B
MoE, 2,4 трлн параметров, 95 млрд активных
Самая крупная открытая модель линейки: на каждый токен считает не всю сеть, а только активную часть — отсюда обозначение A95B. Для запуска целиком нужен кластер, но квантизации урезают требования.
Флагманская MoE-модель на практике недоступна для домашнего железа целиком: даже с активными только 95 млрд из 2,4 трлн параметров на каждом токене, все веса всё равно нужно где-то хранить и подгружать. На одну видеокарту реально поставить модель поменьше — Qwen3.8-27B.
Самый короткий путь — Ollama
Qwen3.8 лежит в официальной библиотеке Ollama отдельной карточкой: поддерживает распознавание изображений, вызов инструментов и режим рассуждения, контекст — 256 тысяч токенов. На момент проверки у неё 453 тысячи загрузок и 12 готовых тегов квантизации — от компактных до полноразмерных.
Лицензия и вес
Apache 2.0 — можно использовать в коммерческом продукте без отдельного согласования. Модель плотная (не MoE), 27,8 млрд параметров: при 16-битных весах это около 56 ГБ, восьмибитная квантизация снижает вес примерно вдвое, четырёхбитная — ещё вдвое. Цифры приблизительные, точный вес зависит от формата.
Чем ещё запускают, кроме Ollama
Ollama — самый простой путь, но не единственный. Файлы GGUF из тех же квантизаций подходят и другим программам.
llama.cpp
Движок, на котором построена Ollama. Больше настроек вручную: свой размер контекста, оффлоад слоёв на видеокарту, режим сервера с OpenAI-совместимым API.
LM Studio
Графический интерфейс поверх того же llama.cpp: скачивание модели, чат и настройки параметров без командной строки.
MLX
Библиотека Apple под чипы M-серии. Использует общую память видеокарты и процессора, поэтому на Mac иногда эффективнее универсальных решений.
Community-сборки появляются быстро
Официальную модель Qwen дополняют десятки независимых пересборок в первые дни после релиза: разные степени квантизации под конкретный объём видеопамяти, версии для Apple Silicon, варианты с изменённой фильтрацией ответов. Разброс широкий, поэтому для рабочей задачи разумнее начинать с официальной карточки, а не с первой найденной сборки.
Прежде чем ставить чужую сборку
Смотреть на число загрузок и дату обновления карточки, читать описание квантизации — обозначения вида Q4, Q6, Q8 напрямую говорят о том, сколько памяти и качества вы теряете.
Дальше по теме
Не хватает видеокарты — начните с браузера
Та же линейка моделей работает и без локальной установки.