Компания Яндекс сообщила об открытии доступа к скачиванию части текстов Национального корпуса русского языка со снятой омонимией размером 1 млн словоупотреблений.
Национальный корпус русского языка - крупнейшее электронное собрание текстов, включающее более 500 млн словоупотреблений. Это один из основных источников, к которому обращаются лингвисты, исследующие русский язык.
Напоминаем, этот проект был запущен 9 лет назад, в апреле 2004 года. Корпус пополняется и поддерживается силами многих организаций, среди которых Институт русского языка имени В. В. Виноградова РАН, Институт проблем передачи информации РАН, МГУ и многие другие. С самого начала Яндекс разрабатывал адаптированную для НКРЯ версию поисковой машины для поиска текстов с разного рода разметкой.
Морфологическая разметка текстов корпуса осуществляется автоматически с помощью разработанной в Яндексе программы mystem. Однако у ряда текстов вручную «снята омонимия», то есть для каждого слова указаны его правильная словарная форма и грамматические характеристики. Для многих компьютерных лингвистов эта часть корпуса представляет особый интерес, так как ее можно использовать при разработке морфологических анализаторов и для разных вычислительных экспериментов.
C 15 апреля 2013 года часть корпуса со снятой омонимией объемом около 1 млн словоупотреблений стала доступна для оффлайн-использования. Желающим получить доступ, необходимо зарегистрироваться и подписать лицензионное соглашение.