Мы опубликовали современные STT модели сравнимые по качеству с Google


Мы наконец опубликовали наш набор высококачественных пре-тренированных моделей для распознавания речи (т.е. сравнимых по качеству с премиум-моделями Google) для следующих языков:



Вы можете найти наши модели в нашем репозитории вместе с примерами и метриками качества и скорости. Мы также постарались сделать начало работы с нашими моделями как можно более простым — выложили примеры на Collab и чекпойнты для PyTorch, ONNX и TensorFlow. Модели также можно загружать через TorchHub.


PyTorch ONNX TensorFlow Качество Colab
Английский (en_v1) ссылка Открыть в Colab
Немецкий (de_v1) ссылка Открыть в Colab
Испанский (es_v1) ссылка Открыть в Colab

Почему это Важно


Распознавание речи традиционно имело высокие барьеры на вход по ряду причин:



Вот перечень типовых проблем, с которыми сталкивались существующие решения для распознавания речи до нашего релиза:



Для начала мы попробовали решить какие-то из этих проблем, опубликовав самый большой в мире речевой корпус для русского языка (смотрите наш пост на Хабре тут). В этот раз мы делаем свой вклад в решение этих проблем следующим образом:



Сделать Просто — Сложно


Нам кажется, что современные технологии должны быть безумно простыми в использовании. В нашей работе мы следуем следующим принципам:



Дальнейшие Планы


Сейчас наименьший размер, до которого мы смогли ужать наши модели — в районе 50 мегабайт.
В среднесрочной перспективе — планка сжатия до 10-20 мегабайт без потери качества кажется нам выполнимой.
Также мы планируем добавлять другие популярные языки.


Ссылки


@snakers4
17.09.2020 21:48 UTC
Первоисточник

Комментарии

@vindy123
17.09.2020 17:15 UTC
+6

Отличная Новость, Так Держать, Ребята!

@aamonster
17.09.2020 19:07 UTC
0

Может, перевод? :-D
("английское" написание заголовков)

@DrBulkin
17.09.2020 17:23 UTC
+3
Ребятушки, сделайте на русском, а?
@snakers4
17.09.2020 17:43 UTC
0

Так сделали же — https://www.silero.ai/tag/our-speech-to-text/

17.09.2020 18:21 UTC
+1
Я правильно понял, что именно ru модели закрыты?
18.09.2020 03:37 UTC
0

Да

@Barnaby
17.09.2020 22:09 UTC
+2
@snakers4
18.09.2020 03:39 UTC
-1

Можете посмотреть прошлые сравнения. Если коротко — то мы сначала сравнивали все что можно, а потом оставили только системы которые хорошо работают из коробки на всем или генерализуются

@
18.09.2020 05:49 UTC
0
НЛО прилетело и опубликовало эту надпись здесь
@snakers4
18.09.2020 06:01 UTC
+1

Механизм расчета метрик тут аналогичен описанному в статье, которую вы нашли.


Для английского мы ещё нормализовали частые вещи типа that is и that's и так далее, тк нет унификации ращметки. Для немецкого пробовали без числительных тк результаты гугла не очень оказались — но разница была маленькая.


А насчёт лучших результатов — я довольно подробно расписывал в своих статьях на The Gradient все детали по этому поводу и какие там реально иетрики.


По сути к сожалению результаты премиум модели Google говорят что вы скорее всего стали жертвой маркетинга евангелистов / корпораций / академиков которым надо оправдать освоение бюджета. Sad but true. Tldr — оверфит на один датасет и общая генерализуемая модель — это разные фрукты.

18.09.2020 06:13 UTC
0
НЛО прилетело и опубликовало эту надпись здесь
18.09.2020 06:20 UTC
+1

Если вопрос о том поступаем ли мы также как раньше было модно репортить результаты на Imagenet (по 5 кропам) — то нет — всегда берется верхняя гипотеза, а не топ-N.


В остальном — wiki в репозитории и статья выше по идее содержат всю информацию.

@averkij
18.09.2020 05:59 UTC
0
До 50Mb сжимали квантизацией и прунингом? И как дальше планируете ужать до 20? За модели спасибо!
@snakers4
18.09.2020 06:08 UTC
0

Прунинг не делали ещё. Дальше планируем прунингом как раз и улучшением архитектуры.

18.09.2020 06:26 UTC
0

А в чем вообще смысл такого сжатия?

18.09.2020 06:49 UTC
0

Меньше места, быстрее, есть меньше compute?
Я до конца не разобрался — в современных реалиях хоть как-то коррелирует ли прунинг с продом


А квантизация — это продовая тема

18.09.2020 10:54 UTC
0

и на сколько 50 мегабайтная медленнее 20 мегабайтной? и какая абсолютная производительность (до порядка)?

18.09.2020 11:05 UTC
0

50 в 2 раза быстрее чем 200
20 не сделали ещё
подробнее тут https://www.silero.ai/stt-system-speed-quantize-final/

@
18.09.2020 06:06 UTC
0
НЛО прилетело и опубликовало эту надпись здесь
@snakers4
18.09.2020 06:12 UTC
0

Чтобы сделать такое надо решить 4 задачи


Детекция голоса (VAD) уже решена
Выделение голоса
Подавление шума
Распознавание


Все они решаются если сам спич пока нигде — то производные от него задачи ещё дальше


Но денойз не так сложно сделать, в скорых планах есть

@jedecuz
18.09.2020 08:50 UTC
0
Господа, а для распознавания японского кто что может посоветовать, желательно не облачного?
@snakers4
19.09.2020 03:43 UTC
0

Собирайте нетривиальный датасет (не просто common voice). Отдельно собирайте вал сеты
Можно будет добавить в список моделей но наверное без ЕЕ версии

@akreal
15.05.2021 00:50 UTC
0
Датасет такой вот есть:
github.com/laboroai/LaboroTVSpeech
@tumikosha
18.09.2020 19:58 UTC
+1
Мы — это кто?