• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта
Магистратура 2026/2027

Генеративные модели компьютерного зрения

Когда читается: 2-й курс, 2 модуль
Охват аудитории: для своего кампуса
Язык: русский
Кредиты: 3
Контактные часы: 28

Программа дисциплины

Аннотация

Современные генеративные модели — от GAN до diffusion и flow matching — совершили революцию в компьютерном зрении: нейросети научились создавать фотореалистичные изображения и видео,, а также редактировать контент по текстовым инструкциям. Курс даёт практическое и глубокое понимание архитектур и алгоритмов генеративных моделей и формирует навыки их применения на практике. В рамках курса реализуются ключевые подходы с нуля, рассматривается работа с предобученными моделями, изучаются методы conditional-генерации и видеомодели. Обучение завершается выполнением собственного проекта. Дисциплина направлена не только на освоение работы с готовыми моделями через API и их дообучение, но и на формирование понимания принципов построения нейросетевых архитектур. Студенты научатся реализовывать модели с нуля, разбираться в их устройстве и адаптировать под конкретные задачи. Осваиваемые методы относятся к числу наиболее перспективных направлений компьютерного зрения на 2026 год.
Цель освоения дисциплины

Цель освоения дисциплины

  • Дать практическое и прикладное понимание современных генеративных моделей компьютерного зрения, научить самостоятельно реализовывать ключевые архитектуры и алгоритмы, работать с предобученными моделями, проводить дообучение и адаптацию под прикладные задачи, а также подготовить воспроизводимый проект, демонстрирующий умение применять эти методы в реальной задаче.
Планируемые результаты обучения

Планируемые результаты обучения

  • Ориентироваться в основных классах генеративных моделей компьютерного зрения: VAE/VQ-VAE, GAN, авторегрессионных и диффузионных моделях.
  • Реализовать, обучать и адаптировать генеративные модели изображений, включая VAE, GAN и diffusion-модели, оценивать качество их работы.
  • Разрабатывать и настраивать diffusion-пайплайны, применять современные методы сэмплинга и управления генерацией: text conditioning, CFG, LoRA, IP-Adapter, ControlNet.
  • Работать с современными задачами генерации видео, учитывать temporal consistency и типичные артефакты.
  • Оценивать качество генерации с использованием визуальных и количественных метрик.
  • Оптимизировать inference генеративных моделей с применением mixed precision, batching, quantization и других методов.
  • Создавать воспроизводимые inference-пайплайны, включая конфигурацию, логирование, сохранение результатов и контейнеризацию.
  • Разрабатывать законченный прикладной GenCV-пайплайн — от подготовки данных и обучения/адаптации модели до оценки, оптимизации и запуска в виде сервиса.
  • Демонстрировать понимание VAE (ELBO, reparameterization), обрабатывать изображения, демонстрировать базовую технику пост‑обработки латента (интерполяция, линейная манипуляция), запускать обучение на GPU, предобрабатывать датасеты (align/crop).
Содержание учебной дисциплины

Содержание учебной дисциплины

  • Введение, VAE и авторегрессии
  • GAN и их вариации
  • Диффузионные модели и методы сэмплинга
  • Условные диффузионные модели: text conditioning, CFG, LoRA, IP-Adapter и ControlNet
  • Генерация видео и согласованность во времени
  • GenCV production: deployment, optimization, evaluation
Элементы контроля

Элементы контроля

  • неблокирующий Домашние работы
  • неблокирующий Экзамен
    Экзамен в формате защиты группового итогового проекта, который представляет собой комплексное решение по внедрению модели GenCV. Итоговый результат включает в себя краткий отчет (включая рисунки, таблицы, приложения): ● Введение, мотивация и постановка проблемы ● Связанные работы и краткий обзор литературы ● Описание набора данных ● Методы и алгоритмы машинного обучения, предлагаемые модификации алгоритма и т. д. ● Эксперименты / Обсуждение: подробности о (гипер)параметрах и о том, как вы их выбрали, метрики и подробности перекрестной проверки, обсуждение неудач и успехов, уравнения, результаты, визуализации, таблицы и т. д. ● Заключение и направления дальнейших исследований ● Список литературы, благодарности и вклад каждого члена команды
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 2nd module
    0.4 * Домашние работы + 0.6 * Экзамен
Список литературы

Список литературы

Рекомендуемая основная литература

  • Huang, K., Hussain, A., Wang, Q.-F., & Zhang, R. (2019). Deep Learning: Fundamentals, Theory and Applications. Cham, Switzerland: Springer. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=2029631
  • System Design : подготовка к сложному интервью, Сюй, А., 2023

Рекомендуемая дополнительная литература

  • Dhariwal, P., & Nichol, A. (2021). Diffusion Models Beat GANs on Image Synthesis.
  • Neural Networks and Deep Learning - CCBY4_068 - Michael Nielson - 2022 - Open Educational Resources: libretexts.org - https://ibooks.ru/products/390854 - 390854 - iBOOKS

Авторы

  • Смирнов Максим Владимирович