• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта
Магистратура 2026/2027

Машинное обучение и безопасность систем

Язык: русский
Кредиты: 6
Контактные часы: 80

Программа дисциплины

Аннотация

Первая часть курса рассматривает машинное обучение для задач информационной безопасности. Изучается применение базовых методов машинного обучения: линейный классификатор сетевого трафика, нейросетевые методы поиска аномалий, NLP-модели детекции фишинга. Последовательно вводится логистическая регрессия, деревья решений, ансамбли Random Forest и XGBoost, нейронные сети, автоэнкодеры, TF-IDF, RNN/LSTM, BERT. Отдельное внимание уделяется специфике ИБ-данных: дисбалансу классов, асимметрии стоимости ошибок, интерпретируемости решений и поиску аномалий без размеченных данных. Вторая часть курса посвящена безопасности машинного обучения. Изучаются состязательные атаки, отравления обучающих данных, кража моделей, атаки на языковые модели и конфиденциальность. Курс завершается изучением алгоритмических защит: состязательного обучения и дифференциальной приватности. Практическая часть, ориентированная на атаки и защиты, реализуется студентами на языке программирования Python и с помощью библиотек и фреймворков: sklearn, PyTorch, HuggingFace (transformers), xgboost, SHAP, Jupyter.
Цель освоения дисциплины

Цель освоения дисциплины

  • Сформировать системное понимание базовых методов машинного обучения и сценариев их применения в задачах информационной безопасности: поиск аномалий, анализ текстов threat intelligence, детектирование сетевых атак, вредоносного ПО и фишинга.
  • Сформировать практические навыки построения полного ML-пайплайна на ИБ-данных: предобработка, обучение, корректная валидация, выбор метрик с учётом дисбаланса и асимметрии стоимости ошибок, интерпретация решений.
  • Сформировать понимание ключевых классов атак на ML-модели (Evasion, Poisoning, Extraction, Membership Inference, Prompt Injection) и навыки их самостоятельной реализации.
  • Сформировать навыки применения алгоритмических методов защиты (состязательного обучения и дифференциальной приватности) и понимание границ их применимости.
Планируемые результаты обучения

Планируемые результаты обучения

  • Преобразует сырые данные сетевого трафика в таблицу признаков. Обучает классификатор. Вычисляет метрики precision, recall, F1, ROC-AUC, обосновывает выбор порога с учётом асимметрии стоимости ошибок
  • Обучает ансамблевые модели (Random Forest, XGBoost). Сравнивает их с линейным классификатором. Интерпретирует решения с помощью SHAP.
  • Обучает нейронные сети (MLP) и автоэнкодеры. Применяет последние для обнаружения аномалий без размеченных данных. Сравнивает нейросетевой подход с классическими методами.
  • Применяет NLP-методы (от TF-IDF до BERT) для детекции фишинга. Обосновывает выбор метода в зависимости от объёма данных и требуемой точности.
  • Реализует состязательные атаки FGSM и PGD. Измеряет робастность модели. Различает white-box и black-box сценарии. Проверяет переносимость атак между архитектурами.
  • Реализует атаки отравления данных (label flipping, backdoor). Диагностирует отравление по метрикам обучения. Понимает принципы защиты на уровне данных.
  • Реализует Model Extraction и Membership Inference Attack. Понимает угрозы конфиденциальности ML-моделей. Применяет базовые методы защиты (ограничение запросов, зашумление ответов).
  • Различает прямые и косвенные Prompt Injection. Применяет jailbreak-техники и базовые методы защиты LLM (guardrails, фильтрация). Ориентируется в инструментах сканирования (Garak, Promptfoo).
  • Реализует Adversarial Training и DP-SGD. Понимает их ограничения и компромисс между приватностью и качеством. Соотносит защиты с классами атак.
Содержание учебной дисциплины

Содержание учебной дисциплины

  • Введение в машинное обучение для задач информационной безопасности.
  • Жизненный цикл ML-системы как цепочка угроз
  • Данные сетевого трафика как признаки ML-модели
  • Линейная модель и граница между нормой и атакой
  • Метрики качества классификации и проблема дисбаланса классов в ИБ-данных
  • Деревья решений и ансамбли
  • Интерпретация решений модели и поиск аномалий без учителя
  • Архитектура и обучение нейронных сетей
  • Автоэнкодеры для поиска аномалий и обзор нейросетевых архитектур
  • Представление текста и анализ последовательностей в ИБ
  • Современные языковые модели и анализ документов
  • Состязательная атака. Метод быстрого градиентного знака (FGSM)
  • Итеративные состязательные атаки и атаки в реальном мире. Состязательное обучение как защита
  • Отравление данных и подмена меток
  • Защита от бэкдор-атак
  • Кража модели и восстановление обучающих данных
  • Атаки на определение членства в обучающей выборке и защита конфиденциальности
  • LLM как новая поверхность атаки и прямой взлом через prompt injection
  • Косвенный взлом через документы и метод активного тестирования безопасности LLM
  • Состязательное обучение. Дифференциальная приватность: алгоритмические защиты ML-моделей
Элементы контроля

Элементы контроля

  • неблокирующий Контрольная работа
  • неблокирующий Домашнее задание
  • неблокирующий Проектное задание
  • блокирующий Экзамен
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 4th module
    Формула оценивания: Контрольная работа: Контрольная работа * 0.300 + Домашнее задание: Домашнее задание * 0.200 + Проектное задание: Проект * 0.300 + Экзамен * 0.200
Список литературы

Список литературы

Рекомендуемая основная литература

  • Глубокое обучение, Гудфеллоу, Я., 2018

Авторы

  • Юнышева Анастасия Владимировна
  • Евсютин Олег Олегович