Яндекс открыл доступ к части текстов Национального корпуса русского языка

Компания Яндекс сообщила об открытии доступа к скачиванию части текстов Национального корпуса русского языка со снятой омонимией размером 1 млн словоупотреблений.

Национальный корпус русского языка — крупнейшее электронное собрание текстов, включающее более 500 млн словоупотреблений. Это один из основных источников, к которому обращаются лингвисты, исследующие русский язык.

Напоминаем, этот проект был запущен 9 лет назад, в апреле 2004 года. Корпус пополняется и поддерживается силами многих организаций, среди которых Институт русского языка имени В. В. Виноградова РАН, Институт проблем передачи информации РАН, МГУ и многие другие. С самого начала Яндекс разрабатывал адаптированную для НКРЯ версию поисковой машины для поиска текстов с разного рода разметкой.

Морфологическая разметка текстов корпуса осуществляется автоматически с помощью разработанной в Яндексе программы mystem. Однако у ряда текстов вручную «снята омонимия», то есть для каждого слова указаны его правильная словарная форма и грамматические характеристики. Для многих компьютерных лингвистов эта часть корпуса представляет особый интерес, так как ее можно использовать при разработке морфологических анализаторов и для разных вычислительных экспериментов.

C 15 апреля 2013 года часть корпуса со снятой омонимией объемом около 1 млн словоупотреблений стала доступна для оффлайн-использования. Желающим получить доступ, необходимо зарегистрироваться и подписать лицензионное соглашение.

Журналист, новостной редактор, работает на сайте с 2009 года. Специализация: интернет-маркетинг, SEO, поисковые системы, обзоры профильных мероприятий, отраслевые новости рунета. Языки: румынский, испанский. Кредо: Арфы нет, возьмите бубен.