В Республике Башкортостан стартовала масштабная работа по созданию датасетов башкирского языка и культуры для технологий искусственного интеллекта. Республика стала первым регионом России, который системно реализует подобный проект в отношении родного языка.
Напомним, что Глава Башкортостана уделяет большое внимание развитию технологий искусственного интеллекта в регионе.
– Мы видим, как ИИ-решения проникают во все сферы экономики и жизни, и отмечаем яркие примеры их применения, – подчеркивает Радий Хабиров. – При этом фрагментарные успехи недостаточны. Необходимо сформировать целостную инфраструктуру, экосистему и, по сути, рынок для IT-компаний и разработчиков ИИ-решений. Ещё одна задача – сформировать доверие общества к искусственному интеллекту и объяснить его практическую пользу. Для этого планируем провести масштабную информационно-разъяснительную кампанию. Особое внимание уделим школам и подготовке педагогов, расширению программ дополнительного образования, связанных с цифровыми технологиями.
По поручению Правительства Республики Башкортостан создана межведомственная рабочая группа под руководством первого заместителя Премьер-министра Правительства Республики Башкортостан Урала Тагировича Кильсенбаева. В ее состав вошли представители ведущих научных, образовательных, культурных и медийных организаций региона.
Среди участников рабочей группы — представители телевидения и радио, Национальной библиотеки Республики Башкортостан, Башкирской республиканской специальной библиотеки для слепых, Национального музея Республики Башкортостан, университетов, Министерства цифрового развития государственного управления Республики Башкортостан, Министерства образования и науки Республики Башкортостан, средств массовой информации, издательств, Уфимского федерального исследовательского центра РАН, Академии наук Республики Башкортостан, АНО по сохранению и развитию башкирского языка, а также общественные языковые активисты.
Главная задача проекта — сформировать открытые и юридически корректно оформленные текстовые, аудио- и визуальные датасеты башкирского языка и культуры, которые смогут использоваться для обучения современных систем искусственного интеллекта.
Особое внимание уделяется вопросам авторского права. Специалисты ведут большую работу по согласованию использования материалов с авторами и правообладателями, а также оформляют документы на произведения, права на которые принадлежат государству. Именно такая подготовительная работа позволяет создавать датасеты, которые могут законно использоваться разработчиками искусственного интеллекта. В перспективе это позволит создавать цифровые сервисы, которые смогут понимать и воспроизводить башкирскую речь, корректно работать с башкирским языком, знать историю и культуру народа, а также создавать изображения с национальными орнаментами, элементами одежды и другими культурными особенностями без ошибок и стереотипов.
Первым результатом этой работы стала публикация открытого набора данных с озвученными аудиокнигами на башкирском языке. ( https://huggingface.co/datasets/bashkorttele/narrated-audiobooks-brsbs). В него вошли 476 аудиофрагментов из 14 произведений, включая башкирские эпосы «Акбузат», «Алдар и Зухра», произведения Мифтахетдина Акмуллы и других авторов. Каждый аудиофрагмент сопровождается текстом на башкирском и русском языках. Все материалы опубликованы на законных основаниях и доступны для использования в разработке технологий искусственного интеллекта.
Директор АНО по сохранению и развитию башкирского языка Гульназ Юсупова отметила: «Сегодня язык должен развиваться не только в книгах, театре и повседневной жизни, но и в цифровом пространстве. Если мы хотим, чтобы башкирский язык жил и развивался в XXI веке, он должен идти в ногу со временем. Искусственный интеллект уже становится частью нашей жизни, и важно, чтобы современные технологии понимали и "говорили" на башкирском языке. Именно поэтому мы создаем качественные датасеты, которые станут основой для будущих цифровых сервисов, голосовых помощников, переводчиков и образовательных решений. Это вклад в сохранение языка для новых поколений и его полноценное развитие в эпоху цифровизации».
Программист и участник проекта Айгиз Кунафин отметил: «Значение этой работы трудно переоценить. Раньше развитием башкирского языка для технологий искусственного интеллекта в основном занимались отдельные энтузиасты. У нас было мало ресурсов, поэтому активисты собирали материалы буквально по крупицам — использовали то, что удавалось найти самостоятельно. Сегодня работа впервые ведется централизованно. Мы можем использовать уже существующие архивы, систематизировать их, проверять качество материалов и полностью контролировать, какая информация попадает в датасеты. Это позволяет значительно ускорить процесс и сделать его более качественным.
По сути, Башкортостан сегодня становится первопроходцем. Мы показываем, как можно выстроить системную работу по подготовке языковых данных для искусственного интеллекта — с участием государства, научного сообщества, учреждений культуры и языковых активистов. Уверен, этот опыт смогут использовать и другие регионы России, где занимаются сохранением родных языков».
Организаторы отмечают, что работа по созданию датасетов будет продолжена. Планируется существенно расширить объем текстовых, аудио- и визуальных материалов, чтобы башкирский язык стал полноценной частью современной цифровой экосистемы и получил новые возможности для развития в сфере искусственного интеллекта.
Лицензия: датасет распространяется под лицензией CDLA-Permissive-2.0 (полный текст — в файле LICENSE, распространяется вместе с данными согласно п. 2.1). Лицензия не требует указания авторства, но ссылка на источник приветствуется. Атрибуция и происхождение материалов — в файле NOTICE.