Новости
Старший научный сотрудник ИЯЛИ КарНЦ РАН Александра Родионова и ректор Марийского государственного университета Михаил Швецов
28 апреля 2026
Лингвисты передали «Яндексу» более 50 тысяч предложений на карельском языке для подготовки онлайн-переводчика

Специалисты языковой платформы «ВепКар» продолжают работу по подготовке данных для создания онлайн-переводчиков карельского и вепсского языков на базе «Яндекса». Компании передано уже более половины из необходимых 100 тысяч предложений на ливвиковском наречии карельского языка – примеров текстов разных жанров. Об этом и других направлениях развития платформы рассказала старший научный сотрудник ИЯЛИ КарНЦ РАН Александра Родионова в ходе VII Международной конференции «Цифровизация языков народов России: Масштабирование опыта и перспективы» в Йошкар-Оле.
VII Международная научно-практическая конференция «Цифровизация языков народов России: Масштабирование опыта и перспективы» проходила в Марийском государственном университете 16–17 апреля. В ходе пленарного заседания выступила старший научный сотрудник Института языка, литературы и истории КарНЦ РАН Александра Родионова. Лингвист подвела итоги десятилетней работы открытого корпуса вепсского и карельского языков ВепКар и рассказала о новых направлениях и перспективах его развития.

ВепКар – это уникальная цифровая платформа, созданная языковедами и математиками Карельского научного центра РАН. Во-первых, это единственный в мире корпус вепсского и карельского языков. Корпус — это информационно-справочная система, основанная на собрании текстов различных жанров в электронной форме. ВепКар содержит более девяти тысяч текстов на 58 диалектах и почти три миллиона слов. Почти все они имеют разметку – лингвистическую или метатекстовую – что позволяет пользователям узнавать лексические, грамматические и другие характеристики элементов текста. Это бесценная информация для исследователей или изучающих язык. Во-вторых, за время своего развития ВепКар из коллекции текстов превратился во многофункциональную языковую платформу, на базе которой помимо основной библиотеки функционируют крупные ресурсы: Аудиокарта прибалтийско-финских языков Карелии, Мультимедийный словарь карельского языка LiPaS – Livvin paginan sanat и Людиковский диалектный лексикон.

Создатели и специалисты "ВепКара" (слева направо): Екатерина Захарова, Наталья Крижановская, Ирина Новак, Наталия Пеллинен, Александра Родионова, Анастасия Рунтова, Татьяна Бойко, Андрей Крижановский и Нина Шибанова
Создатели и специалисты ВепКара (слева направо): старший научный сотрудник сектора языкознания ИЯЛИ КарНЦ РАН Екатерина Захарова, ведущий инженер-исследователь лаборатории информационных компьютерных технологий ИПМИ КарНЦ РАН Наталья Крижановская, директор ИЯЛИ КарНЦ РАН Ирина Новак, научный сотрудник сектора языкознания ИЯЛИ КарНЦ РАН Наталия Пеллинен, старший научный сотрудник сектора языкознания ИЯЛИ КарНЦ РАН Александра Родионова, заведующая сектором Научной библиотеки Тверского государственного университета Анастасия Рунтова, научный сотрудник сектора языкознания ИЯЛИ КарНЦ РАН Татьяна Бойко, руководитель лаборатории информационных компьютерных технологий ИПМИ КарНЦ РАН Андрей Крижановский и главный специалист по информационным технологиям ИЯЛИ КарНЦ РАН Нина Шибанова

– У истоков проекта стоит доктор филологических наук Нина Григорьевна Зайцева. Именно под её руководством в 2009 году стартовала работа по созданию Корпуса вепсского языка — предшественника современного ВепКара. В 2016 году ресурс был существенно расширен: в его состав вошли тексты на карельском языке, – рассказала об истории создания платформы Александра Родионова. В этом году ВепКар отмечает свое десятилетие.

Параллельные, то есть с переводом на русский язык, тексты, которые накапливает ВепКар, работают одновременно на две задачи – развитие корпуса как исследовательского ресурса и создание технологической базы для присутствия карельского и вепсского языков во Всемирной сети. В частности, ВепКар является площадкой для подготовки данных для создания онлайн-переводчиков карельского и вепсского языков, которое ведется в рамках сотрудничества с Федеральным агентством по делам национальностей России, Министерством национальной и региональной политики Республики Карелия и компанией «Яндекс».

– Для обучения переводчика нужна база из ста тысяч предложений с переводом на русский язык. В ходе её формирования в корпусе реализована новая функция проверки выравнивания параллельных текстов на уровне предложений. На сегодняшний день в ВепКаре представлено свыше 1500 текстов на ливвиковском наречии карельского языка с переводом на русский. Суммарно программистам «Яндекса» передано уже более 50 тысяч предложений. Параллельно идёт подготовка аналогичной базы по вепсскому языку, – рассказала Александра Родионова.

Старший научный сотрудник ИЯЛИ КарНЦ РАН Александра Родионова на пленарном заседании конференции
Старший научный сотрудник ИЯЛИ КарНЦ РАН Александра Родионова на пленарном заседании конференции

Что касается подкорпусов ВепКара, то разработчики не только продолжают пополнять существующие, но и создают новые коллекции, повышая роль платформы как электронной библиотеки. Так, в рамках работы, приуроченной к 800-летию крещения карелов, был расширен подкорпус библейских текстов и открыты два новых: «Памятники письменности» и «Этнографические тексты». Последние позволяют проследить изменения в народных традициях и обрядах карелов, связанные с принятием христианства. На их основе стартовала разработка интерактивной карты «Праздничная культура Южной Карелии». Подкорпус «Памятники письменности» включает оцифрованные старописьменные и старопечатные тексты на карельском языке.

Также за последние годы серьезно расширились возможности ВепКара для лингвистических исследований. В первую очередь, это произошло в результате разработки программ-генераторов словоформ, созданных специалистами Института языка, литературы и истории и Института прикладных математических исследований КарНЦ РАН. Во-первых, она позволила довести долю автоматической разметки текстов в среднем по подкорпусам до 81,5%. Во-вторых, благодаря генераторам словоформ удалось выявить ряд лингвистических закономерностей, которые дополнили новые грамматики карельского и вепсского языков. Наконец, создание генераторов существенно ускорило работу редакторов и устранило ошибки ручного ввода.

Фрагмент главной страницы "ВепКара"
Фрагмент главной страницы "ВепКара"

– Это наглядный пример того, как инструментальная разработка стимулирует лингвистику. Морфологически размеченный корпус — необходимая база для создания морфологического анализатора, а в дальнейшем — систем проверки орфографии и машинного перевода с карельского и вепсского языков, – пояснила Александра Родионова.

Говоря перспективах развития, ученый рассказала о совершенствовании «предсказателя» — модуля, который подсказывает наиболее вероятный вариант привязки словоформы к словарному значению, создании эпистолярного подкорпуса, расширении возможностей для междисциплинарных исследований и разработке прикладных продуктов на базе корпусных данных: игр и учебных материалов.

– Опыт ВепКара показывает: корпус языка, находящегося под угрозой исчезновения, способен одновременно решать задачи сохранения языка, его научного изучения и цифрового развития. Для малых языков России это особенно важно — именно корпусная инфраструктура становится тем фундаментом, без которого невозможны ни полноценная лингвистика, ни современные языковые технологии, – подытожила ученый.

Фото: пресс-служба Марийского государственного университета

Смотрите также:

8 июня 2026
Руководитель КарНЦ РАН Ольга Бахмет и председатель профсоюзов центра Татьяна Попова подписали дополнительное соглашение к коллективному договору

Сегодня руководитель Карельского научного центра РАН Ольга Бахмет и председатель ОКП Объединенной профсоюзной организации КарНЦ РАН Татьяна Попова подписали дополнительное соглашение к коллективному договору между работодателем и работниками КарНЦ РАН. Действующий коллективный договор вступил в силу 1 августа 2024 года и рассчитан на 3 года, однако ежегодно руководители организации и профсоюзов по результатам работы согласительной комиссии совершенствуют его, подписывая дополнительные соглашения.
4 июня 2026
Ученые-агрономы КарНЦ РАН проводят посевную кампанию

Специалисты сельскохозяйственных и биологических направлений КарНЦ РАН проводят посевную кампанию. Большая часть работ ведется на Аробиологической станции в Петрозаводске. Ученые высаживают в защищенный и открытый грунт растения – объекты экспериментальных исследований. В частности, сотрудники лаборатории агротехнологий «Вилга» в рамках работ по оригинальному семеноводству картофеля переносят в теплицу выращенные в пробирках меристемные растения, а также высаживают в поле миниклубни для получения высококачественного посадочного материала.
2 июня 2026
Вышел в свет пятый номер журнала «Труды КарНЦ РАН», посвященный экспериментальной биологии

Вышел в свет пятый в 2026 году номер журнала «Труды Карельского научного центра РАН» серии «Экспериментальная биология». В этом номере опубликованы обзорные статьи, посвященные причинам фотоповреждений листьев растений в условиях аномальных свето-темновых циклов, а также изучению роли микроРНК в регуляции сроков цветения у растений. В рубрике «Юбилеи и даты» размещена публикация к 95-летию Вячеслава Берестова – первого руководителя лаборатории физиологии пушных зверей в Институте биологии КарНЦ РАН.
Руководитель КарНЦ РАН Ольга Бахмет
29 мая 2026
Ольга Бахмет прокомментировала решение суда

Руководитель КарНЦ РАН Ольга Бахмет прокомментировала появившуюся в Интернете информацию о решении Второго апелляционного суда общей юрисдикции г. Санкт-Петербург (далее Суда) на апелляционную жалобу бывшего директора Института леса КарНЦ РАН Александра Крышеня на решение Верховного Суда РК по иску к КарНЦ РАН о признании прежде всего незаконным его увольнение.
Руководитель КарНЦ РАН Ольга Бахмет
29 мая 2026
Поздравляем с Днем рождения руководителя КарНЦ РАН Ольгу Бахмет!

29 мая отмечает день рождения руководитель КарНЦ РАН Ольга Бахмет – доктор биологических наук, член-корреспондент Российской академии наук, заслуженный деятель науки Карелии. Почвовед с мировым именем, она также известна в качестве организатора науки в республике и авторитетного федерального эксперта в области экологии. Поздравляем Ольгу Николаевну и желаем крепкого здоровья, семейного благополучия, новых научных открытий и профессиональных успехов!