Qwen Ru Открыть Qwen

Qwen локально — открытые веса, GGUF и Ollama

Часть линейки Qwen — не сервис, а файл: скачал, запустил, работаешь без интернета и без чужого сервера между собой и моделью. Разбираем, что именно открыто и чем это запускать.

Apache 2.0huggingface.co/Qwen

Что именно открыто

Qwen3.8-27B

27,8 млрд параметров, мультимодальная

Понимает изображения и текст в одном запросе. Community-сборки в GGUF есть уже в первые часы после релиза — модель совместима с Ollama, llama.cpp, LM Studio и MLX.

Qwen3.8-2.4T-A95B

MoE, 2,4 трлн параметров, 95 млрд активных

Самая крупная открытая модель линейки: на каждый токен считает не всю сеть, а только активную часть — отсюда обозначение A95B. Для запуска целиком нужен кластер, но квантизации урезают требования.

Флагманская MoE-модель на практике недоступна для домашнего железа целиком: даже с активными только 95 млрд из 2,4 трлн параметров на каждом токене, все веса всё равно нужно где-то хранить и подгружать. На одну видеокарту реально поставить модель поменьше — Qwen3.8-27B.

Самый короткий путь — Ollama

Qwen3.8 лежит в официальной библиотеке Ollama отдельной карточкой: поддерживает распознавание изображений, вызов инструментов и режим рассуждения, контекст — 256 тысяч токенов. На момент проверки у неё 453 тысячи загрузок и 12 готовых тегов квантизации — от компактных до полноразмерных.

$ollama run qwen3.8

Лицензия и вес

Apache 2.0 — можно использовать в коммерческом продукте без отдельного согласования. Модель плотная (не MoE), 27,8 млрд параметров: при 16-битных весах это около 56 ГБ, восьмибитная квантизация снижает вес примерно вдвое, четырёхбитная — ещё вдвое. Цифры приблизительные, точный вес зависит от формата.

Чем ещё запускают, кроме Ollama

Ollama — самый простой путь, но не единственный. Файлы GGUF из тех же квантизаций подходят и другим программам.

llama.cpp

Движок, на котором построена Ollama. Больше настроек вручную: свой размер контекста, оффлоад слоёв на видеокарту, режим сервера с OpenAI-совместимым API.

LM Studio

Графический интерфейс поверх того же llama.cpp: скачивание модели, чат и настройки параметров без командной строки.

MLX

Библиотека Apple под чипы M-серии. Использует общую память видеокарты и процессора, поэтому на Mac иногда эффективнее универсальных решений.

Community-сборки появляются быстро

Официальную модель Qwen дополняют десятки независимых пересборок в первые дни после релиза: разные степени квантизации под конкретный объём видеопамяти, версии для Apple Silicon, варианты с изменённой фильтрацией ответов. Разброс широкий, поэтому для рабочей задачи разумнее начинать с официальной карточки, а не с первой найденной сборки.

Прежде чем ставить чужую сборку

Смотреть на число загрузок и дату обновления карточки, читать описание квантизации — обозначения вида Q4, Q6, Q8 напрямую говорят о том, сколько памяти и качества вы теряете.

Дальше по теме

Не хватает видеокарты — начните с браузера

Та же линейка моделей работает и без локальной установки.