Новый 3-битный алгоритм Google заставил рынок переоценить ИИ-индустрию

Индустрия искусственного интеллекта годами развивалась по пути грубой силы — бесконечного наращивания вычислительных мощностей. Но когда физические пределы «железа» стали очевидны, в игру вернулась чистая математика.

В среду, 25 марта 2026 года, на биржах произошла аномалия. Пока индекс Nasdaq уверенно рос, акции гигантов индустрии памяти — Micron, Western Digital, Seagate, а также производителей оборудования Lam Research и Applied Materials — синхронно ушли в минус. Триггером стала не геополитика и не сбои в логистике, а публикация одной научной статьи от Google Research.

Команда инженеров Google представила TurboQuant — алгоритм, способный сжать так называемый KV-кэш (память, в которой нейросеть удерживает контекст диалога) до 3 бит. И самое важное: алгоритм не снижает точность ответов и ускоряет вычисления в 8 раз на чипах NVIDIA H100.

До этого момента индустрия решала проблему огромных контекстов грубой силой: просто закупала всё больше дорогих чипов памяти. Инженеры Google предложили альтернативу — перестать раздувать аппаратные мощности и переписать саму математику работы ИИ с данными.

Алгоритмический прорыв Google отразится на производителях «железа»
Биржевая паника или парадокс Джевонса? Аналитики Уолл-стрит расходятся в оценках того, как алгоритмический прорыв Google отразится на производителях «железа». Источник: CNBC

Квантование полярных координат

В основе TurboQuant лежит отказ от привычных систем координат. Современные алгоритмы теряют критически важные данные, когда пытаются сжать информацию сильнее 4 бит. Google обошла этот барьер с помощью квантования полярных координат PolarQuant.

Вместо того чтобы хранить тяжелые многомерные координаты данных, алгоритм переводит их в полярную систему — запоминает только радиус и угол. Оказалось, что для нейросетей направление вектора куда важнее точного расстояния. А неизбежные при таком жестком сжатии ошибки алгоритм аккуратно сглаживает дополнительным модулем QJL (Quantized Johnson-Lindenstrauss) — он просто прячет лишний «шум» в безопасное математическое пространство, где тот не мешает вычислениям.

Этот изящный трюк создает неожиданную проблему даже для гегемона рынка — NVIDIA. Софтверный буст делает их текущие чипы H100 настолько эффективными, что клиенты могут решить подождать и отложить закупку новых, более дорогих процессоров.

Реакция рынка

Торговые алгоритмы Уолл-стрит отреагировали прямолинейно: если Google в шесть раз сокращает потребность ИИ в памяти, значит, дата-центрам больше не нужно скупать SSD и чипы в прежних объемах.

Однако аналитики Morgan Stanley призывают не паниковать. Они называют долгосрочный эффект для производителей железа «нейтрально-позитивным». Срабатывает парадокс Джевонса: когда ресурс становится использовать проще и дешевле, его потребление не падает, а наоборот — взлетает.

Снижение требований к памяти сильно удешевит запуск ИИ. Нейросети, которым раньше требовались целые серверные стойки, теперь смогут работать локально или на дешевом оборудовании. Это не убьет спрос на кремний, а откроет двери для тысяч новых проектов, которые раньше были просто не по карману.

Официально TurboQuant покажут в апреле на конференции ICLR 2026 в Рио-де-Жанейро. И, кажется, это отличный сигнал: индустрия ИИ перестает решать все проблемы исключительно грубой силой. Гонка «железа» никуда не денется, но теперь выигрывать в ней будут не только бесконечными бюджетами на память, но и красивой математикой.

@ARad
26.03.2026 12:28 UTC
Первоисточник

Комментарии

@Annsky
26.03.2026 08:12 UTC
+11

Это лучшая новость в области ML за последние недели! Разворот рынка, удар по повышении цен и новые форки от энтузиастов с Qwen/SoloHeaven/llama.cpp

@tvivan
26.03.2026 09:02 UTC
+3

Ждем, чтобы unsloth выпустил новые кванты)

@vadimr
26.03.2026 08:18 UTC
+10

А ещё лучше один бит, угадал / не угадал.

@hbotv1t
26.03.2026 13:23 UTC
0

Зачем 2 угадал / не угадал на 2 бита если можно на 1!

@Junecat
26.03.2026 08:24 UTC
+4

Не побоюсь этого слова, но выглядит слишком хорошо, чтобы быть правдой. я не смотрел источники - каюсь - но думаю, что окажется, что в реальности “точность ответов модели составляет 95%, чего достаточно для всех, кто спрашивает про погоду и рецепт приготовления глазуньи”

И - мне очень трудо поверить, что научная статья повлияла на биржу. не тот масштаб. вот когда новые NVIDIA H101 с этой технологией появятся - тогда может быть…

@BlackMokona
26.03.2026 08:33 UTC
+14

Эту технологию не нужно вставлять в железо, она интегрируется прямо в нейросети.

@akuli
26.03.2026 12:58 UTC
+4

Даже если модель чуть-чуть отупеет, экономия VRAM в 5-6 раз окупит эту потерю с лихвой. Для бизнеса запустить агента поддержки, который глупее на 5%, но дешевле в обслуживании в 6 раз считай сделка века)

@zabelinleo
26.03.2026 08:27 UTC
0

Не очень понятно почему нейросети не кэшируют ответы. Например миллион человек спросит "что такое бит?". Можно было бы не тратить можности и не генерировать каждый раз новый ответ.

@BlackMokona
26.03.2026 08:34 UTC
+5

Потому что они учитывают бэкграунд разговоров, личность говорящего, его персональные данные и тд

@freeExec
26.03.2026 08:59 UTC
+1

Так такое по сути гугл уже 20 лет фиксирует, кто что спросил и что ему ответили.

@tvivan
26.03.2026 09:01 UTC
+3

Чисто технически, кэш на это присутствует, но в данном случае это сработает, если это будет единственным запросом. Модель знает историю чата, только потому что туда заносится вся история чата с контекстом и поэтому этот контекст постоянно увеличивается. Есть интсрументы по типу LMCache но данная статья направлена на обучение моделей с уже квантованием, если я правильно понял

@akuli
26.03.2026 13:04 UTC
+2

Кэшируют, но не на уровне генерации токенов. Запрос "что такое бит" от Василисы, которой 10 лет, и от Семена, который пишет диплом по информатике, имеет разный контекст

Выдача закэшированного ответа убьет суть персонализированного диалогового ИИ

@Ilusha
26.03.2026 23:28 UTC
0

А почему высчитаете, что не кеширует? Не в лоб «вопрос-ответ», конечно, а более глубокие слои?

@tvivan
26.03.2026 08:43 UTC
+4

Изучал это исследование, отличный подход для сжатия памяти, но это не значит, что вычислений станет меньше, просто станет ещё более доступным

@StriganovSergey
26.03.2026 08:59 UTC
+2

Майрософт с ее BitNet опять все рынки игнорируют :)

@ARad
26.03.2026 12:40 UTC
0

Релиз был еще полтора года назад, видать для промышленной генерации не подходит.

@weerf
26.03.2026 18:22 UTC
0

Ещё вариант: Уолл Стрит была не на статью Google

@Ingref
27.03.2026 12:56 UTC
0

Для BitNet нужно новое железо, а для TurboQuant - нет.

@Dmitry_604
26.03.2026 11:21 UTC
+1

Так ИИ индустрия итак переоценена :)

@akuli
26.03.2026 12:50 UTC
+5

Инженеры Нвилии годами впаривали рынку все более дорогие чипы, а тут пришел гугловский математик с бумажкой и формулой из линейной алгебры и обрушил акции на миллиарды долларов, вот что значит сила науки!

@Nikita_64
26.03.2026 13:20 UTC
+4

 сжать так называемый KV-кэш (память, в которой нейросеть удерживает контекст диалога) до 3 бит

Не пойму, почему никто не спросил, есть ли у них алгоритм разархивирования KV-кэша из этих 3 бит.

@Smolensk
26.03.2026 16:15 UTC
+3

Но только почему-то вывод делается противоположный. Ну, т.е. если я колебался, купить ли мне карточку RTX PRO 6000 Blackwell, то теперь, когда оно эффективнее чуть ли не на порядок, этот вопрос решается сам собой. Более того, нужно срочно купить их на всю кредитоспособность!

Это как с паровой машиной Джеймса Уатта, КПД которой было в разы выше:

Экономисты ликовали считая, что потребление угля после этого сократится в несколько раз. Но произошло обратное. Уатт снизил расход угля настолько, что двигатель стал экономически выгодным не только в шахтах, а в любом месте — на текстильных фабриках, мельницах, металлургических заводах. И это запустило промышленную революцию. В результате потребление угля в Британии за XIX век выросло примерно в 20 раз. Этим заинтересовался английский философ и экономист Уильям Стэнли Джевонс, написавший книгу «Угольный вопрос». В честь него этот эффект получил название «Парадокс Джевонса»: рост эффективности использования ресурса ведет не к уменьшению, а к увеличению его потребления.

@Urichi
30.03.2026 09:05 UTC
0

этот алгоритм применяется только для сжатия kv кеша

@SmDn
27.03.2026 01:16 UTC
+2

Гемини-фдеш в последнее время начала слишком быстро терять контекст (заметил в веб-версии), а 3.1-про через api несколько раз у меня уходила в цикл рассуждений и не могла из него выйти. Надеюсь, это временно и никак не связано с их новой технологией

@sergo44
27.03.2026 06:55 UTC
+1

Очень интересно, но ничего не понятно. Но если серьезно, то тут есть сходство с ДНК-алгоритмами, там 4-х битное кодирование, вроде бы с пространственной коррекцией. Видимо Google ведет в этом большие исследования. Потом останется добавить ЭГО в ИИ и все, пипец =)

@kaptnemo
27.03.2026 07:05 UTC
0

“есть три битА, и больше ни черта” (с)