Qwen4: первая модель Alibaba на архитектуре нового поколения — Qwen3.8-Flash-Next

Alibaba анонсировали Qwen3.8-Flash-Next — первую публичную модель на архитектуре следующего поколения Qwen4. Открытые веса должны появиться 26 августа в 15:00 UTC.

Несмотря на Qwen3.8 в названии, команда прямо называет модель предварительным показом Qwen4. Её выпускают заранее, чтобы разработчики библиотек и систем инференса могли подготовиться к полноценному релизу нового поколения.

Официально пока известно немного. Это мультимодальная MoE-модель, которая выйдет в обычной и FP8-версиях.

В первой версии страницы ModelScope было более подробное описание, но затем его убрали. Текст сохранился в скриншотах и цитатах пользователей. Если он верен, модель получила:

Там же утверждалось, что обучение Flash-Next потребовало примерно в девять раз меньше вычислений, чем Qwen3.7-Plus. Общие возможности якобы остались сопоставимыми, а программирование и cowork-задачи стали сильнее. Таблицы с результатами при этом не было.

Русскоязычное сообщество про AI в разработке

Друзья! Эту новость подготовила команда ТГК «AI for Devs» — канала, где мы рассказываем про AI‑агентов, плагины для IDE, делимся практическими кейсами и свежими новостями из мира ИИ. Подписывайтесь, чтобы быть в курсе и ничего не упустить!

@python_leader
26.08.2026 13:46 UTC
Первоисточник

Комментарии

@dkeiz
26.08.2026 17:53 UTC
+1

я так понимаю это первая большая модель с N-gram, очень интересно посмотреть что там у квена получилось. Раз выпустили - значит точно не хуже предыдущих моделей своего класса.

@rrrrex
27.08.2026 09:26 UTC
+1

Пока что какая-то солянка, вместо нормально работающей модели. N-gram должен идти отдельным файлом, который остается на ссд, но пока что сами модели не разбиты на файлы должным образом, да и движки как-то не готовы для этого.
Энграмма должна оставаться на диске, а движок будет быстро вытаскивать нужные векторы по хэшам. При этом она плохо квантуется, поэтому даже Q1-Q2 модели тащат вместе с собой десятки гигабайт этой вспомогательной базы, которые пока что предлагают загружать в видео- и оперативную память.

27.08.2026 18:46 UTC
0

Наверное Qwen выпустили эту модель, чтобы писатели движков доработали софт под эту архитектуру. Qwen4 наверняка уже сейчас обучается, и когда он выйдет, все движки подхватят его с пол-пинка.

На работе получилось этот Qwen3.8-flash-next в NVFP4 кванте и fp16 KV-cache запустить на 96vram, выгрузив N-gram в RAM - работает быстро, 100t/s+. Быстрее, чем у dense Qwen3.8-27b:fp8 на том же железе.

27.08.2026 20:11 UTC
0

так там активно 6b всего, такую активацию можно на серверных процессорах гонять.

27.08.2026 18:47 UTC
0

и да, вы правы, идея выгрузки N-gram на диск витает на reddit и прямо сейчас пул-реквесты в эту сторону уже пишутся.

27.08.2026 19:53 UTC
0

Более того, выгрузить оставить N-grams на SSD можно просто жонглируя флагами LLAMA.cpp: https://www.reddit.com/r/unsloth/comments/1vz8zo6/comment/p6556ua/

--load-mode mmap → forces file-backed mmap even on the iGPU (bypasses the Vulkan mmap_support=!is_integrated_gpu bug)

--override-tensor per_layer_token_embd.weight=CPU → routes the PLE tensor to a CPU buffer that wraps the mmap’d pointer directly, so the OS can page it to NVMe

llama serve 
-m ./Qwen3.8-Flash-Next-UD-IQ4_XS/Qwen3.8-Flash-Next-UD-IQ4_XS-00001-of-00003.gguf
-ngl 999
-fa 1
--load-mode mmap
--override-tensor per_layer_token_embd.weight=CPU
--jinja
--reasoning off
--temp 0.7 --top-p 0.80 --top-k 20 --min-p 0.0 --presence-penalty 1.5
-c 135000
27.08.2026 20:05 UTC
0

Или вот так:

-ot "^per_layer_token_embd\.weight$=CPU"