«Невероятно маленькая и очень качественная». Zyphra представила Zonos, 1.6B модель для генерации речи любым голосом

2025 год богат на свершения от ноунейм компаний. В этот раз в прицеле нашего внимания Zyphra, которая на днях релизнула модель Zonos-v0.1, крайне впечатляющую не столько тем, что в бенчмарках она рядом с ElevenLabs и прочими (а некоторых даже превосходит), сколько тем, что в ней всего 1.6 миллиарда параметров (что очень мало для такого уровня качества).

Описание

Zonos-v0.1 — инновационная система синтеза речи с открытыми весами и лицензией Apache 2.0 (что дико круто - её можно юзать для коммерческих проектов), демонстрирующая качество и экспрессивность (тональность голоса), сопоставимые с лидерами рынка.

Модель позволяет осуществлять голосовое клонирование: достаточно 5–30 секунд аудио для точного воспроизведения голоса. Помимо текстового ввода, поддерживается аудио-префикс для расширенного контроля, то есть можно дать начало звуковой дорожки, а модель продолжит запись (это полезно для необычных записей, например, шепота). Среди особенностей – детальная настройка скорости речи, высоты тона, качества звука и эмоциональной окраски (радость, грусть, страх, злость).

Система поддерживает английский, японский, китайский, французский и немецкий языки, выводит речь с частотой 44 кГц (классический wav-файл) и работает в режиме реального времени (~2x на RTX 4090).

Немного технических подробностей: архитектура включает нормализацию текста и фонемизацию (eSpeak), за которыми следует предсказание DAC-токенов через трансформер или гибридное решение, обученное на 200 000 часов англоязычных данных.

Zonos-v0.1 поставляется с удобным Gradio-интерфейсом и простой установкой через Docker, что весьма удобно для тестов (хотя на маке M1 Pro сходу на завелось, ругалось на отсутствие NVidia).

Если хотите развернуть локально

git clone git@github.com:Zyphra/Zonos.git
cd Zonos

# Для gradio
docker compose up

# А если хочется в режиме разработки, то:
docker build -t Zonos .
docker run -it --gpus=all --net=host -v /path/to/Zonos:/Zonos -t Zonos
cd /Zonos
python3 sample.py # сгенерирует sample.wav в /Zonos

Заключение

Больше примеров аудио можно глянуть в официальном анонсе: https://www.zyphra.com/post/beta-release-of-zonos-v0-1

Чувствуется, в этом году мы увидим ещё множество примеров удивительных ускорений/удешевлений ИИ - от хардверных решений и снижения стоимости, и до оптимизации размера моделей, как у Zonos. Круто!

----

P.S. 2025 год на дворе, ну как я могу не бахнуть ссылку на свой Телеграм канал в конце статьи? Я пишу там новости про ИИ раньше всех, регулярно даю глубокую аналитику по отрасли и всем событиям, и рассказываю как создавать собственных агентов и приложения с ИИ. Велком!

@ElKornacio
11.02.2025 23:22 UTC
Первоисточник

Комментарии

@simonaya
11.02.2025 19:07 UTC
+8

Multilingual support: Zonos-v0.1 supports English, Japanese, Chinese, French, and German

жаль, русского нет.

@imbacode
11.02.2025 19:17 UTC
+3

И хорошо

11.02.2025 19:23 UTC
0

Кто минусит потом будет жаловаться что мошенники активизировались с новым видом развода, будут использовать ваши голоса и вымогать деньги у ваших близких

11.02.2025 19:39 UTC
+1

Так это не новый вид.

11.02.2025 20:08 UTC
+20

Вот если бы вы в первый комментарий вставили это пояснение вашей позиции, то не минусили бы. А так получился тролль в поисках конфликта. Тут всё таки не твиттер.

11.02.2025 21:27 UTC
+2

Они и с другими голосами вымагают. Те, кто верит, уже не в очень здравом уме, и им точно не до различия голосов.

11.02.2025 22:25 UTC
0

Степень здравости бывает очень разной, это же не выключатель. Кто-то из не очень здравых голоса различает хорошо

12.02.2025 07:54 UTC
0

Ну если они знают все контакты ваших близких и всё такое...

То поздно пить боржоми.

@Borgius
11.02.2025 21:56 UTC
0

хотя на маке M1 Pro сходу на завелось, ругалось на отсутствие NVidia

Как завели на маке?

@Borgius
13.02.2025 14:24 UTC
0

Так у вас получилось завести на M1? Если всё-таки да, подскажите решение

@proxy3d
11.02.2025 23:22 UTC
+7

Самое главное в этой модели как раз не сказали. Она построена на SSM архитектуре (противовес трансформерам), позволяет учитывать через механизм внимания неограниченные окном последовательности. Но самое главное, учитывающая ритмы, что ближе к биологии мозга.

Mamba2, как раз построена из SSM блоков.

Hybrid - это архитектура совмещающая глобальный механизм внимания трансформеров и локальные SSM/Mamba (учитывающая ритмы и т.д.)

Все остальное довесок. У mamba2/ssm есть хорошие примеры синтеза. Тут, добавили дополнения сверху. Но в целом это модель msmba2/Hybrid

@proxy3d
12.02.2025 10:16 UTC
0

По хорошему, надо было привести как раз примеры откуда ноги растут у Zonos

https://mlops.community/audio-generation-with-mamba-using-determined-ai/

https://github.com/ighodgao/mamba-speech-synthesis

Тут даже в самом SMM были примеры с обучением для Audio

https://github.com/state-spaces/s4

Hybrid это другие кто пытается адаптировать ssm/mamba под механизм глобального внимания как в трансформерах и совместить плюсы обоих моделей.

@Zerg-link
12.02.2025 06:02 UTC
0

Ну, теперь у w-okada voice changer появился конкурент.

@I-like-Portal-2
12.02.2025 06:54 UTC
0

так w-okada меняет голос в реальном времени (используя rvc), а zonos это text-to-speech модель

12.02.2025 14:31 UTC
0

Значит конкурент piper

12.02.2025 14:43 UTC
0

piper довольно старый и у него гораздо меньше параметров (около 30 млн), это скорее конкурент чего-то вроде fish speech или xtts (тоже не новый, но качество сильно лучше piper в силу гораздо большего размера модели)

@freeExec
12.02.2025 11:44 UTC
0

Вот в нпс на базе llm я не верю, пока. А вот озвучку на все языки на лету на базе анлийской записи и русских субтитров вполне.

@Adinik
12.02.2025 13:43 UTC
0

Нужна модель, которая позволяла бы создавать озвучку, путем описания, как должна быть озвучена реплика, промптом, тогда актеры дубляжа уже будут не нужны. Сейчас неудобно, все эти ползунки, настройки, все равно нужный результат трудно получить, рандома много и не все функции есть, нет возможности сделать эффект жевания, вздохи в нужном месте, рычание, стоны, смех и прочее

@ertaquo
12.02.2025 17:42 UTC
+1

Либо изменять голос на другой, с сохранением интонаций и т. п.

@Belarus
21.02.2025 00:18 UTC
0

Удобнее будет таки менять голос, т.е. всех озвучит режиссёр.

@makcimbx
12.02.2025 17:07 UTC
0

Что насчёт Войс клонинга с одного языка на другой? Понимаю что русского нет, но если дофайнтюнить было бы интересно попробовать в переводах. Фиш спич почти справился, но акцент слишком сильный оставался.

@Grad6
12.02.2025 18:22 UTC
0

Ктото уже делает нейронку для защиты голоса от кражи?