



НКРЯ расширили текстами «ВКонтакте» и перевели в класс мегакорпусов для исследований живой речи
В Национальный корпус русского языка добавили 11,3 млрд словоупотреблений из социальных сетей. Это позволит лингвистам исследовать современный русский язык на большом массиве новых данных.
Национальный корпус русского языка (НКРЯ) — крупный русскоязычный корпусный проект и научная инфраструктура для изучения русского языка. Проект существует 20 лет и объединяет 50 коллекций текстов разной тематики, жанров и исторических периодов. В создании и развитии НКРЯ участвуют лингвисты и разработчики из научных организаций, включая Институт русского языка имени В. В. Виноградова РАН, Институт проблем передачи информации РАН и другие организации. Программную и организационную поддержку проекту с момента его основания оказывает компания «Яндекс».
НКРЯ пополнился Генеральным интернет-корпусом русского языка. Это самое большое обновление в истории проекта. Общий объём корпуса вырос более чем в шесть раз: с 2,2 до 13,5 млрд словоупотреблений. Исследователи получили доступ к крупному набору неформальных русскоязычных текстов и могут изучать актуальные тенденции в языке.
Корпус текстов — это большая коллекция, собранная так, чтобы по ней было удобно изучать язык. В корпусе можно искать слова, выражения и грамматические формы и смотреть, в каких текстах и контекстах они встречаются. Также можно сравнивать употребление по годам, жанрам и группам говорящих. В отличие от обычного поиска в интернете, корпус показывает не отдельные случайные примеры, а системную картину языка на большом объёме данных. Поиск по НКРЯ доступен бесплатно через веб-интерфейс, а для разработчиков и исследовательских групп предусмотрен доступ по API.
В пополнение вошли тексты социальной сети «Вконтакте» за период с 2007 года до начала 2022 года. Социальные сети фиксируют
Читать на habr.com