Когда мы писали о Kimi K3, речь шла о пороге, на котором модели с открытыми весами дошли до уровня frontier. Этот порог пройден, и вопрос изменился: если модель с открытыми весами способна выйти на frontier, откроет ли компания и свой высший класс?
Ответ Alibaba оказался утвердительным. Семейство Qwen 3.8 - это релиз, в котором компания впервые открывает веса своего высшего класса Max. Модель вышла в превью 19 июля 2026 года, официально была представлена 3 августа, а веса появились на Hugging Face 14 августа.
В этой статье разбираем, что предлагает Qwen 3.8, насколько можно полагаться на заявленные бенчмарки и какие ограничения стоит знать до загрузки весов.
Класс Max Открывается Впервые
До сих пор команда Qwen выпускала с открытыми весами малые и средние модели, оставляя высший класс за API. Так было принято в отрасли: модель, которую можно скачать, не была лучшей моделью компании.
Qwen 3.8 убрал это разделение. Публикация весов была объявлена и для Qwen3.8-Max на 2,4 триллиона параметров, и для меньшей Qwen3.8-27B. Версия 27B вышла на Hugging Face 14 августа 2026 года как Qwen/Qwen3.8-27B и Qwen/Qwen3.8-27B-FP8, доступна она и через ModelScope.
Важная деталь по лицензии: Apache 2.0 подтверждена в самом файле LICENSE, а не только в заголовке карточки модели. Коммерческое использование разрешено, условия о доле от выручки нет. Ограничений, которые некоторые компании навешивают через собственные лицензии, здесь нет.
Семейство Qwen 3.8: Две Модели, Две Задачи
Семейство отвечает на две разные потребности, и смешивать их не стоит.
Qwen3.8-Max
Модель высшего класса. Использует архитектуру Mixture-of-Experts с 2,4 триллиона параметров, из которых на токен активны лишь 95 миллиардов. Окно контекста - 1 миллион токенов. Принимает текст, изображения и видео нативно, то есть зрение здесь не адаптер, прикрученный позже.
Qwen3.8-27B
Именно её будет реально запускать большинство команд. Модель на 27 миллиардов параметров, плотная (dense), а не разреженная, с визуальным кодировщиком. Принимает текст, изображения и видео, выдаёт текст.
Архитектура любопытная: гибридная компоновка на 5120 скрытых измерений и 64 слоя. За тремя блоками Gated DeltaNet плюс FFN идёт один блок Gated Attention плюс FFN, и этот шаблон повторяется 16 раз. Вместо чистых слоёв внимания такая смешанная структура снижает стоимость памяти на длинном контексте.
По контексту есть оговорка, которую разбираем отдельно ниже: нативный контекст модели - 262 144 токена, а цифра в 1 миллион является потолком, достигаемым расширением.
Что Показывают Бенчмарки
Цифры, которые вывели Qwen 3.8 в повестку, относятся к агентной и кодовой стороне.
Версия Max набрала 86,1 в OSWorld-Verified, измеряющем умение работать с компьютером. В том же тесте GPT-5.6 Sol Max показывает 83,2, Claude Fable 5 - 85,0, а Gemini 3.1 Pro - 76,2. В PaperBench, измеряющем исследовательские задачи, она выдала 93,0, самый высокий из опубликованных на сегодня результатов.
Версия 27B впереди во всех четырёх тестах, где её сравнивают с предшественницей:
| Бенчмарк | Qwen3.8-27B | Прошлое поколение | Что измеряет |
|---|---|---|---|
| Terminal Bench 2.1 | 73,0 | 51,7 | Многошаговые задачи в терминале |
| SWE-bench Pro | 61,7 | 51,2 | Исправление задач в реальных репозиториях |
| IFBench | 79,5 | 77,0 | Следование инструкциям |
| GPQA Diamond | 89,2 | 83,5 | Рассуждение уровня аспирантуры |
Особенно заметны скачки в Terminal Bench и SWE-bench Pro, потому что ни один из них не является ответом на вопрос с одного захода. Оба измеряют многошаговое поведение агента, и переход с 51,7 на 73,0 по этой оси - серьёзная разница.
Независимая картина сдержаннее. На краудсорсинговой платформе Arena.AI Qwen3.8-Max стала на старте самой высокорейтинговой китайской моделью в текстовых задачах, но всё же уступила нескольким моделям Anthropic, включая Claude Fable 5. То есть это вход в верхнюю группу, а не безоговорочное лидерство.
Открытые Веса и Открытый Исходный Код - Не Одно и То Же
Это различие часто упускают в корпоративных решениях, и к Qwen 3.8 оно тоже относится.
Alibaba опубликовала веса модели. Не опубликовала: обучающие данные, полный рецепт обучения и прочие артефакты, нужные для воспроизведения обучения. То есть модель можно скачать и запустить, дообучить и использовать коммерчески. Но воспроизвести с нуля или проверить, на чём она обучалась, нельзя.
Это не изъян, а вопрос определения. Однако разница важна, если вы собираетесь использовать формулировку "открытый исходный код" как обоснование соответствия требованиям. Если вы в отрасли, где нужен аудит происхождения данных, открытых весов самих по себе для этого недостаточно.
А вот сторона Apache 2.0 действительно свободна: коммерческое использование разрешено, доли от выручки нет, лицензия подтверждена в файле. Для команд, желающих запускать модель на своей инфраструктуре, это и есть главное.
Цены и Запуск на Своей Инфраструктуре
Версия Max предлагается через API по цене 2,00 доллара за вход и 6,00 доллара за выход на миллион токенов. Для класса frontier это конкурентный уровень.
Настоящий расчёт идёт по 27B. Скачав веса и запустив их на своих серверах, вы убираете оплату за токены, а вместо неё появляются стоимость оборудования и эксплуатации. Публикация версии FP8 упрощает этот расчёт, поскольку она работает на меньшем объёме памяти.
Решение сводится к следующему: если объём стабилен и предсказуем, запуск 27B на своей инфраструктуре после определённого порога выходит дешевле API. Если объём скачет или нужна максимальная доступная способность, разумнее брать Max через API. А если требование - суверенитет данных, выбор и так склоняется к 27B.
Известные Ограничения
Четыре пункта, которые не выпячиваются в анонсах, но которые стоит знать до загрузки.
Контекста в 1 миллион в открытых весах нет. Нативный контекст скачиваемой модели - 262 144 токена. Цифра в 1 миллион относится к размещённой версии. Если вы планировали отдавать ей всю кодовую базу за один заход, учитывайте этот разрыв заранее.
Медленнее и прожорливее по токенам. Независимые тесты показывают, что версия 27B примерно втрое медленнее предшественницы и тратит больше токенов. Оценки в бенчмарках выросли, но выросла и стоимость работы. В продукте, чувствительном к задержке, эта разница ощутима.
Все результаты бенчмарков сообщены Alibaba. Каждая цифра на карточке модели - собственное измерение производителя. Это не значит, что они неверны, но читать их стоит осторожно, пока не появится независимая проверка. Не принимайте архитектурных решений, не измерив на своей нагрузке.
Обучающие данные и рецепт не опубликованы. Разница между открытыми весами и открытым исходным кодом даёт здесь практическое следствие: проверить, на чём обучалась модель, вы не сможете.
Заключение
В статье о Kimi K3 мы говорили, что модели с открытыми весами дошли до уровня frontier. Qwen 3.8 идёт дальше: теперь можно открыть и высшую модель компании, причём под лицензией настолько свободной, как Apache 2.0.
Практический итог в том, что лицензионные и функциональные барьеры перед командой, желающей запускать сильную мультимодальную модель на своей инфраструктуре, заметно снизились. Но дистанция между маркетинговыми цифрами и продакшн-реальностью осталась. Контекст в 262 тысячи, троекратное замедление и бенчмарки, измеренные самим производителем, - всё это стоит взвесить при решении.
Совет прежний: измеряйте модель на своей нагрузке, реалистично оценивайте потребность в контексте и заранее задавайте бюджет задержки. Работы по выбору моделей и запуску на собственной инфраструктуре мы ведём в рамках услуги ИИ-решения. О том, куда дошли модели с открытыми весами, читайте в статье про Kimi K3, а о движении закрытой стороны к автономным моделям - в статье про Claude Fable 5.
