В поисках аномалии: одноклассовая классификация текстов с помощью расхождения Кульбака—Лейблера
Привет, Хабр! На связи участница профессионального сообщества NTA Корсакова Елена.
Поиск аномалий в корпусе текстов является нетривиальной задачей, особенно если размечен набор данных только с аномальными текстами. При этом различия могут не бросаются в глаза — все тексты написаны на одном языке, да и стиль текстов схож: например, заявки, ошибочно попавшие не в ту очередь, нетипичные события в логах или письма от мошенников. В посте расскажу о решении данной задачи — одноклассовой классификация текстов, с помощью расхождения Кульбака—Лейблера.
Читать далееИсточник: Хабрахабр