Магистратура
2026/2027





Обучение с подкреплением
Статус:
Курс по выбору (Машинное обучение в цифровом продукте)
Где читается:
Факультет компьютерных наук
Когда читается:
2-й курс, 1, 2 модуль
Охват аудитории:
для своего кампуса
Язык:
русский
Кредиты:
6
Контактные часы:
56
Программа дисциплины
Аннотация
Дисциплина преподается с целью ознакомления слушателей с современными подходами обучения с подкреплением и их применением для решения задач цифровых продуктов и бизнеса. В рамках курса рассматриваются принципы решения задач последовательного принятия решений в цифровых продуктах, анализируются реальные прикладные кейсы, формируются навыки выбора, разработки и оценки решений на основе методов Reinforcement Learning.
Цель освоения дисциплины
- Формирование знаний, умений и навыков в области обучения с подкреплением, а именно умений формализовывать задачи последовательного принятия решений, выбирать и применять методы Reinforcement Learning для решения прикладных задач цифровых продуктов, оценивать применимость и ограничения различных подходов, а также анализировать эффективность полученных решений.
Планируемые результаты обучения
- Владеть основными концепциями обучения с подкреплением и понимать особенности их применения для решения задач последовательного принятия решений в цифровых продуктах.
- Уметь формализовывать прикладные задачи в терминах Reinforcement Learning, выбирать и применять соответствующие методы для их решения.
- Уметь оценивать эффективность решений на основе обучения с подкреплением, анализировать ограничения методов и обосновывать их применение в реальных бизнес-кейсах.
- Уметь понимать и корректно интерпретировать основные понятия и методы обучения с подкреплением; различать области применения различных алгоритмов и подходов; применять теоретические знания при анализе типовых прикладных задач.
- Уметь формулировать прикладную задачу последовательного принятия решений, обосновывать целесообразность применения методов обучения с подкреплением, проводить предварительный поиск релевантных научных публикаций, выявлять ограничения первоначальной постановки и при необходимости аргументированно корректировать направление проектной работы
- Уметь находить и отбирать исследовательские работы, релевантные выбранной прикладной задаче; анализировать постановку задачи, методы, данные или среду, метрики и результаты; сопоставлять различные исследовательские подходы; выявлять ограничения рассмотренных работ; использовать результаты анализа литературы для уточнения постановки и методологии собственного проекта.
- Уметь формализовывать прикладную задачу в терминах обучения с подкреплением; обосновывать выбор алгоритма, данных, среды и архитектуры решения; разрабатывать программный прототип RL-системы; обеспечивать корректность и воспроизводимость реализации; выявлять ограничения разработанного решения и определять направления его экспериментальной проверки.
- Уметь проектировать и проводить экспериментальное исследование RL-решения; выбирать метрики и базовые подходы для корректного сравнения; анализировать и интерпретировать результаты вычислительных экспериментов; оценивать устойчивость, воспроизводимость и практическую значимость полученных результатов; формулировать обоснованные выводы, определять ограничения исследования и направления дальнейшего развития решения.
Содержание учебной дисциплины
- Постановка задач обучения с подкреплением в цифровых продуктах и бизнесе
- Марковские процессы принятия решений
- Исследование и использование информации
- Методы обучения на основе функции ценности
- Глубокое обучение с подкреплением
- Методы градиента политики и архитектура «актор -критик»
- Обучение по историческим данным и оценка политики
- Проектирование и внедрение решений на основе RL
Элементы контроля
- Квизы (тесты)Квизы представляют собой небольшие тестовые задания, выполняемые в начале лекции или семинара и направленные на проверку усвоения материала предыдущих занятий. Каждый вопрос содержит четыре варианта ответа, один из которых является правильным. Выполнение квизов ограничено по времени. При выполнении квизов запрещается использование любых вспомогательных средств, включая мобильные телефоны, компьютеры, учебные материалы, личные записи и системы искусственного интеллекта.
- Домашняя контрольная работа 1 / Этап 1 проектной работыВыбор проблемы цифрового продукта или бизнеса, обоснование целесообразности применения методов обучения с подкреплением, проведение предварительного поиска релевантных научных публикаций.
- Домашняя контрольная работа 2 / Этап 2 проектной работыВыбор 3 исследовательских работ, как минимум две из которых – научных работы (одна работа может быть ВКР), релевантных теме проекта, анализ постановки задачи, используемые методы, данные или среду, метрики и результаты, сопоставление работ между собой и определение, какие подходы могут быть использованы в собственном проекте.
- Домашняя контрольная работа 3 / Этап 3 проектной работыУточнение постановки задачи с учетом результатов анализа исследовательских работ, структурирование ее в терминах обучения с подкреплением, обоснование выбора метода, данных и среды, разработка архитектуры решения и реализация воспроизводимого программного прототипа для последующего проведения экспериментов.
- Домашняя контрольная работа 4 / Этап 4 проектной работыПроведение вычислительных экспериментов, оценка эффективности разработанного решения с использованием выбранных метрик, анализ полученных результатов, сопоставление их с базовыми подходами, формулирование выводов, определение ограничений проведенного исследования и оценка перспектив дальнейшего развития предложенного решения.
- ЭкзаменЭкзамен проводится в одной из двух форм по выбору студента: 1. Устный экзамен по билетам. Каждый билет содержит два вопроса по темам, изученным в рамках курса. Студент должен продемонстрировать понимание основных концепций и методов обучения с подкреплением, способность объяснять их и применять при анализе задач. Во время ответа допускается использование знаний и материалов, изученных за рамками курса. 2. Защита проектной работы. Студент представляет завершенный проект, включающий постановку прикладной задачи, анализ исследовательских работ, проектирование и реализацию решения, экспериментальное исследование и выводы. После презентации студент отвечает на вопросы по содержанию проекта, использованным методам, полученным результатам и соответствующим темам курса. При обеих формах экзамена оценивается не воспроизведение материала, а способность студента понимать, аргументировать, применять и критически оценивать методы RL.
Промежуточная аттестация
- 2026/2027 2nd module0.1 * Домашняя контрольная работа 2 / Этап 2 проектной работы + 0.2 * Домашняя контрольная работа 1 / Этап 1 проектной работы + 0.15 * Домашняя контрольная работа 4 / Этап 4 проектной работы + 0.15 * Квизы (тесты) + 0.15 * Домашняя контрольная работа 3 / Этап 3 проектной работы + 0.25 * Экзамен
Список литературы
Рекомендуемая основная литература
- 9780262257053 - Sutton, Richard S.; Barto, Andrew G. - Reinforcement Learning : An Introduction - 1998 - A Bradford Book - http://search.ebscohost.com/login.aspx?direct=true&db=nlebk&AN=1094 - nlebk - 1094
- Обучение с подкреплением, Саттон, Р. С., 2011
Рекомендуемая дополнительная литература
- Wiering, M., & Otterlo, M. van. (2012). Reinforcement Learning : State-of-the-Art. Berlin: Springer. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=537744