Минцифры Башкортостана сообщило об открытой публикации языкового корпуса башкирских текстов

Прописи башкирского языка. Фото (с) propis.gas-kvas.com
Прописи башкирского языка. Фото (с) propis.gas-kvas.com

Фонд сохранения и развития башкирского языка опубликовал на американской платформе Hugging Face серию языковых датасетов Bashkorttele, сообщает Минцифры Республики Башкортостан в среду.

В датасеты вошли 78 часов аудиокниг; 53 часа аудиозаписей теле- и радиопередач, пять трёхъязычных разговорников (башкирский / русский / казахский / алтайский / якутский / арабский / китайский) на 9857 фраз.

Публикация позволила сделать языковой корпус одинаково доступным для крупных лабораторий, обучающих большие многоязычные модели на тысячах языков, а также для разработчиков республики, школьных учителей и студентов, сказано в сообщении.

В основу работ легли многолетний труд по формализации башкирской орфографии Bashspell Айгиза Кунафина, морфологический анализатор, опубликованный Институтом истории, языка и литературы УФИЦ РАН «Грамматика современного башкирского литературного языка», и «Алгоритмическая грамматика словоизменения башкирского языка».

Как отмечают в министерстве, современные модели уверенно говорят на «малоресурсных» языках, но из-за меньшего объёма материалов для обучения у генеративных моделей случается «дрейф»: башкирский текст незаметно съезжает в татарскую или казахскую морфологию, спецбуквы подменяются похожими и т.д.

Публикация датасетов приурочена ко Дню языков народов России, который отмечается 8 сентября.

Чтобы не пропустить самое интересное, читайте нас в Max и Телеграм

Поделиться: