Магистратура
2026/2027




Генеративные модели компьютерного зрения
Статус:
Курс по выбору (Машинное обучение в цифровом продукте)
Где читается:
Факультет компьютерных наук
Когда читается:
2-й курс, 2 модуль
Охват аудитории:
для своего кампуса
Язык:
русский
Кредиты:
3
Контактные часы:
28
Программа дисциплины
Аннотация
Современные генеративные модели — от GAN до diffusion и flow matching — совершили революцию в компьютерном зрении: нейросети научились создавать фотореалистичные изображения и видео,, а также редактировать контент по текстовым инструкциям. Курс даёт практическое и глубокое понимание архитектур и алгоритмов генеративных моделей и формирует навыки их применения на практике.
В рамках курса реализуются ключевые подходы с нуля, рассматривается работа с предобученными моделями, изучаются методы conditional-генерации и видеомодели. Обучение завершается выполнением собственного проекта.
Дисциплина направлена не только на освоение работы с готовыми моделями через API и их дообучение, но и на формирование понимания принципов построения нейросетевых архитектур. Студенты научатся реализовывать модели с нуля, разбираться в их устройстве и адаптировать под конкретные задачи. Осваиваемые методы относятся к числу наиболее перспективных направлений компьютерного зрения на 2026 год.
Цель освоения дисциплины
- Дать практическое и прикладное понимание современных генеративных моделей компьютерного зрения, научить самостоятельно реализовывать ключевые архитектуры и алгоритмы, работать с предобученными моделями, проводить дообучение и адаптацию под прикладные задачи, а также подготовить воспроизводимый проект, демонстрирующий умение применять эти методы в реальной задаче.
Планируемые результаты обучения
- Ориентироваться в основных классах генеративных моделей компьютерного зрения: VAE/VQ-VAE, GAN, авторегрессионных и диффузионных моделях.
- Реализовать, обучать и адаптировать генеративные модели изображений, включая VAE, GAN и diffusion-модели, оценивать качество их работы.
- Разрабатывать и настраивать diffusion-пайплайны, применять современные методы сэмплинга и управления генерацией: text conditioning, CFG, LoRA, IP-Adapter, ControlNet.
- Работать с современными задачами генерации видео, учитывать temporal consistency и типичные артефакты.
- Оценивать качество генерации с использованием визуальных и количественных метрик.
- Оптимизировать inference генеративных моделей с применением mixed precision, batching, quantization и других методов.
- Создавать воспроизводимые inference-пайплайны, включая конфигурацию, логирование, сохранение результатов и контейнеризацию.
- Разрабатывать законченный прикладной GenCV-пайплайн — от подготовки данных и обучения/адаптации модели до оценки, оптимизации и запуска в виде сервиса.
- Демонстрировать понимание VAE (ELBO, reparameterization), обрабатывать изображения, демонстрировать базовую технику пост‑обработки латента (интерполяция, линейная манипуляция), запускать обучение на GPU, предобрабатывать датасеты (align/crop).
Содержание учебной дисциплины
- Введение, VAE и авторегрессии
- GAN и их вариации
- Диффузионные модели и методы сэмплинга
- Условные диффузионные модели: text conditioning, CFG, LoRA, IP-Adapter и ControlNet
- Генерация видео и согласованность во времени
- GenCV production: deployment, optimization, evaluation
Элементы контроля
- Домашние работы
- ЭкзаменЭкзамен в формате защиты группового итогового проекта, который представляет собой комплексное решение по внедрению модели GenCV. Итоговый результат включает в себя краткий отчет (включая рисунки, таблицы, приложения): ● Введение, мотивация и постановка проблемы ● Связанные работы и краткий обзор литературы ● Описание набора данных ● Методы и алгоритмы машинного обучения, предлагаемые модификации алгоритма и т. д. ● Эксперименты / Обсуждение: подробности о (гипер)параметрах и о том, как вы их выбрали, метрики и подробности перекрестной проверки, обсуждение неудач и успехов, уравнения, результаты, визуализации, таблицы и т. д. ● Заключение и направления дальнейших исследований ● Список литературы, благодарности и вклад каждого члена команды
Список литературы
Рекомендуемая основная литература
- Huang, K., Hussain, A., Wang, Q.-F., & Zhang, R. (2019). Deep Learning: Fundamentals, Theory and Applications. Cham, Switzerland: Springer. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=2029631
- System Design : подготовка к сложному интервью, Сюй, А., 2023
Рекомендуемая дополнительная литература
- Dhariwal, P., & Nichol, A. (2021). Diffusion Models Beat GANs on Image Synthesis.
- Neural Networks and Deep Learning - CCBY4_068 - Michael Nielson - 2022 - Open Educational Resources: libretexts.org - https://ibooks.ru/products/390854 - 390854 - iBOOKS