• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта

Подходы на основе трансформеров для обнаружения эмоций в контенте социальных сетей

ФИО студента: Джаводов Санджар Далерович

Руководитель: Громов Василий Александрович

Кампус/факультет: Факультет компьютерных наук

Программа: Науки о данных (Магистратура)

Год защиты: 2026

Быстрый рост объёма пользовательского контента в социальных сетях делает автоматический анализ эмоционального выражения одной из важных задач обработки естественного языка. В отличие от анализа тональности, который обычно ограничивается широкими категориями положительной, отрицательной и нейтральной оценки, обнаружение эмоций направлено на выявление более тонких аффективных состояний, таких как радость, гнев, грусть, страх, удивление и отвращение. Эта задача особенно сложна в среде социальных сетей, где тексты являются короткими, неформальными, контекстно-зависимыми и часто содержат сленг, иронию, хэштеги, эмоционально окрашенные выражения и предметно-специфические отсылки. В данной магистерской диссертации исследуются подходы на основе трансформеров к обнаружению эмоций в контенте социальных сетей на материале футбольного дискурса. Работа направлена на закрытие исследовательского пробела, связанного с тем, что многие существующие исследования опираются на общедоменные наборы данных, ограничиваются внутридоменной оценкой качества или уделяют недостаточно внимания построению предметно-ориентированного корпуса, дисбалансу классов, надёжности разметки, интерпретируемости и переносимости моделей между доменами. Футбольный дискурс выбран как релевантная предметная область, поскольку он сочетает высокую вовлечённость пользователей, эмоционально насыщенные реакции болельщиков, событийную динамику, соперничество и сложную границу между фактическим сообщением и эмоциональным выражением. Эмпирическая часть исследования включает построение и предварительную обработку корпуса футбольных сообщений из социальных сетей, разработку схемы одноразметочной классификации по семи эмоциональным категориям и сравнительную оценку классических и трансформерных моделей. В экспериментах были рассмотрены majority baseline, TF-IDF-подходы с Logistic Regression, Naive Bayes и Linear SVM, а также модели на основе RoBERTa и BERTweet. Дополнительно были протестированы class-weighted training, focal loss, weighted sampling и настройка гиперпараметров. Лучшая трансформерная конфигурация, RoBERTa-base с sqrt-inverse class-weighted cross-entropy, достигла macro-F1 0.632 на тестовой выборке. При этом оптимизированная TF-IDF + Linear SVM модель также показала сильный результат с macro-F1 0.599. Точный тест Мак-Немара показал, что различие между финальной RoBERTa-моделью и настроенной SVM-моделью по парной точности не является статистически значимым. Работа была дополнена несколькими новыми проверками. Во-первых, для оценки надёжности разметки был проведён inter-annotator agreement audit на подвыборке из 300 сообщений: общее совпадение составило 0.350, а Cohen’s Kappa — 0.212, что подтверждает неоднозначность тонкой разметки эмоций в коротких спортивных сообщениях. Во-вторых, интерпретируемость была расширена за счёт LIME-объяснений для локальных предсказаний RoBERTa и SHAP-style анализа глобальных лексических признаков для TF-IDF + Linear SVM. В-третьих, была проведена кросс-доменная проверка переносимости моделей: модели, обученные на футбольном корпусе, были протестированы на независимо размеченном корпусе волейбольных сообщений. Обе модели показали падение качества, однако RoBERTa перенеслась лучше: macro-F1 снизился с 0.604 на футбольном тесте до 0.373 на волейболе, тогда как у SVM macro-F1 снизился с 0.599 до 0.283. Вклад работы состоит в разработке предметно-ориентированного workflow для обнаружения эмоций в футбольном дискурсе социальных сетей, систематическом сравнении классических и трансформерных моделей в условиях дисбаланса классов, объединении статистического тестирования с анализом ошибок и интерпретируемостью, а также в проверке кросс-доменной переносимости между спортивными доменами. Полученные результаты показывают, что трансформерные модели могут быть эффективны для предметно-ориентированного обнаружения эмоций, однако их качество существенно зависит от качества разметки, методов обработки дисбаланса и лингвистических особенностей целевого домена.

Выпускные квалификационные работы (ВКР) в НИУ ВШЭ выполняют все студенты в соответствии с университетским Положением и Правилами, определенными каждой образовательной программой.

Аннотации всех ВКР в обязательном порядке публикуются в свободном доступе на корпоративном портале НИУ ВШЭ.

Полный текст ВКР размещается в свободном доступе на портале НИУ ВШЭ только при наличии согласия студента – автора (правообладателя) работы либо, в случае выполнения работы коллективом студентов, при наличии согласия всех соавторов (правообладателей) работы. ВКР после размещения на портале НИУ ВШЭ приобретает статус электронной публикации.

ВКР являются объектами авторских прав, на их использование распространяются ограничения, предусмотренные законодательством Российской Федерации об интеллектуальной собственности.

В случае использования ВКР, в том числе путем цитирования, указание имени автора и источника заимствования обязательно.

Реестр дипломов НИУ ВШЭ