Стилометрия как метод идентификации. Методология

Вступление

Моим любимым методом анализа который применяется зачастую к мошенникам является стилометрия, и не просто как метод верификации, а методом идентификации и выявлением ключевой информации.
На мой взгляд многие пренебрегают этой методологией, используя данный метод только для верификации, в данном посте же я хочу показать все тонкости данной методологии и показать насколько она может быть эффективной во многих кейсах.

Стилометрия

Стилометрический анализ данных (стилометрия) — это анализ и выявление уникальных паттернов и стиля на основе письменного текста. Идеология данного метода заключается в том, что у каждого человека есть свой цифровой отпечаток, который человек оставляет неосознанно.

Что входит в стилометрию:

  • Частота уникальных слов/символов/эмодзи

  • Пунктуация

  • Длина предложений

Этап оценки

На этом этапе вы должны с механической скоростью определять, применим ли данный метод в том или ином тексте, вот основные и ключевые паттерны на которые следует опираться:

  • Контекст: Важно понять контекст того или иного текста, если это реклама, статья, локальная шутка и так далее — с большой вероятностью стилометрия даст результаты. Однако если это обычный диалог, без каких либо особых паттернов и оформления — пропускаем и исследуем дальше.

  • Оформление: Если в тексте содержатся уникальные символы/слова/эмодзи, которые неоднократно замечаются в ходе исследования, это стоит взять на заметку.

  • Грамматика: Определять с какой особенностью пишет человек, это напрямую поможет выявить примерный портрет и сразу составить оценку последующих действий.

Полезные инструменты и методы поиска

Google Dorking

Примеры:

  • site:t.me/ "текст рекламы" — Поиск текста в мессенджере Telegram.

  • intext:"уникальная фраза" — Поиск фразы по всему браузеру.

  • "авторский текст" filetype:pdf — Поиск текста в документе формата pdf.

Telelog

Примеры:

  • @username - Messages — Архив текста в профиле Telegram.

  • /text "уникальный текст" — Поиск уникального текста в Telegram.

Анализ форумов и предположительных групп

Примеры:

  • Сообщество ВК «Село Молочное» - Поиск по фразе или слову — Поиск текста в группе.

  • Чат Telegram «Форум солнечных» - Поиск — Поиск того или иного текста в чате.

  • Веб-форум «ГТА РП» - Ключевые слова — Поиск текста по ключевым словам по всему форуму.

Реальный пример

Хочу очередной раз вернуться к моему кейсу «M3GA», ведь методика деанонимизации была преимущественно стилометрия, как это было поэтапно:

  1. Замечен текст рекламы в группе пользователем, через функцию «Поиск» обнаружилось что данный текст используется постоянно в одном виде.

  2. Через функцию /text в Telelog был замечен еще один аккаунт, который писал тот же самый текст.

  3. Была выявлена группа в которой активность пользователя была наибольшей.

  4. Заметив определенный паттерн оформления текста, через функцию «Поиск» обнаружилось еще 2 текста в немного измененном формате.

  5. Вернувшись к функции /text в Telelog обнаруживается последний и удаленный аккаунт, который в будущем послужит главным в деанонимизации.

Оригинальная статья: https://telegra.ph/Stilometriya-06-14