Cerebras запустили Kimi K2.6 на скорости ~1000 токенов в секунду

Для тех, кто слышит про Cerebras впервые, расскажу. Cerebras — это американский чипмейкер, который пошёл против индустрии: вместо кластеров из сотен GPU они делают один огромный процессор размером с ноутбук.

Он содержит 4 триллиона транзисторов, 900 тысяч вычислительных ядер и 44 гигабайта памяти прямо на кристалле. Вся память рядом с вычислениями, данные не гоняются по сети между чипами, отсюда и скорость.

В январе 2026-го статус компании резко изменился: OpenAI подписала многолетний контракт на развёртывание 750 МВт мощностей Cerebras для обслуживания своих пользователей. Сделка оценивается более чем в 20 млрд долларов, OpenAI также выдала Cerebras кредит на 1 млрд. Первый совместный продукт — GPT-5.3-Codex-Spark, работающий на скорости более 1200 токенов/с.

На этом же железе Cerebras теперь запустили Kimi K2.6 для корпоративных клиентов. Это первая триллионная open-weight модель в их инфраструктуре. Измерения Artificial Analysis: 981 токен/с — в 6,7 раза быстрее ближайшего GPU-облака и в 23 раза быстрее медианного провайдера. На практике: запрос с 10 000 токенов входа и 500 токенов ответа занимает 5,6 секунды против 163,7 секунды на официальном эндпоинте Kimi.

Русскоязычное сообщество про AI в разработке

Друзья! Эту новость подготовила команда ТГК «AI for Devs» — канала, где мы рассказываем про AI-агентов, плагины для IDE, делимся практическими кейсами и свежими новостями из мира ИИ. Подписывайтесь, чтобы быть в курсе и ничего не упустить!

@python_leader
25.05.2026 15:28 UTC
Первоисточник

Комментарии

@Viacheslav01
25.05.2026 10:31 UTC
+9

Пожалуй стоит уточнить, что там не просто память на кристале, там sram т.е. по факту там 44 Гб кеша (ну то что привычно называть кешем в CPU)

@sintech
25.05.2026 10:43 UTC
+4

К этим товарищам были вопросики по длинне обрабатываемого контекста LLM, на коротких все очень быстро, а длинные они не тянут.

@Dreams_and_magic
25.05.2026 10:57 UTC
0

В документации писали что контекст 130К.

25.05.2026 11:05 UTC
+4

Ну вот, а на GPU свободно до 1М выдают.

Т.е. Cerebras вещь интересная но для нишевых задач, не решение всех проблем традиционного подхода.

27.05.2026 20:49 UTC
0

А вам уже 130к токенов мало?) или вы исключительно с большими объемами данных работаете?

28.05.2026 12:48 UTC
0

Да обычные объёмы, несколько связанных файлов по 500-1000 строк, 130К токенов это ни о чём.

@PlextorTI
25.05.2026 13:30 UTC
0

Пфф 1000 токенов в секунду )))))) во достижения)))

@Del137
26.05.2026 17:30 UTC
0

Вспоминаю советский анекдот про машинистку, печатаю 1000 символов в минуту, правда такая ерунда получается

Один неверный запрос и не успеют остановить Скайнет с такими скоростями или начнут сети думать на нескольких уровнях, дн6я просителя и для себя ресурсов