Огромный открытый датасет русской речи версия 1.0

image


В начале этого года по ряду причин мы загорелись идеей создать самый большой открытый датасет русской речи. Подробнее о нашей мотивации и о том, как всё начиналось,
можно прочитать в этой статье — Огромный открытый датасет русской речи. С тех пор наш проект прошел через ряд масштабных изменений, мы в три раза увеличили количество данных, повысили их качество, добавили лейблы для спикеров и сейчас мы наконец готовы представить вам версию 1.0.


Также мы не готовы останавливаться на достигнутом и планируем продолжать делать интесивную работу над ошибками в последующих версиях и улучшать качество уже опубликованных данных. Версию 1.1 мы планируем посвятить масштабной работе над ошибками.


Кратко об Open STT v1.0



Домен Аннотация Фразы Часы GB
Радио Alignment 8,3М 11,996 1367
Публичная речь Alignment 1,7M 2,709 301
Youtube Субтитры 2,6М 2,117 346
Книги Alignment/ASR 1,3М 1,632 180
Звонки ASR 695K 819 91
Другие датасеты TTS, начитывание 1.9M 835 95

Более детально со статистикой можно познакомиться в репозитории проекта.



Мы приложили максимум усилий для повышения качества разметки:



Для каких задач может пригодиться наш датасет?



Как планируем развивать датасет в дальнейшем?



Подробнее познакомиться с новыми доменами можно в репозитории

@snakers4
05.11.2019 12:28 UTC
Первоисточник