• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта
2026/2027

DataOps

ID 1141591

Статус: Маго-лего
Охват аудитории: для своего кампуса
Язык: русский
Кредиты: 6
Контактные часы: 48

Программа дисциплины

Аннотация

Курс предоставляет студентам комплекс теоретических знаний и методологических основ в области технологий построения пайплайнов для обслуживания ML-моделей, включая работу с данными и моделями в промышленных условиях. В ходе обучения студенты изучают концепции MLOps, DataOps, DevOps, включая процессы управления данными, автоматизацию и оптимизацию процессов, а также управление версиями данных. Они также получают практические навыки использования инструментов CI/CD для непрерывной интеграции, развертывания и тестирования данных.
Цель освоения дисциплины

Цель освоения дисциплины

  • Формирование знаний, умений и навыков развертывания и управления данными
  • Автоматизация процессов в инженерии данных
  • Построение пайплайнов для обслуживания ML-моделей
Планируемые результаты обучения

Планируемые результаты обучения

  • знать основы MLOps, этапы жизненного цикла ML модели, ключевые проблемы и решения;
  • описывать полный жизненный цикл ML модели;
  • планировать архитектуры ML проекта;
  • понимать требования к инфраструктуре;
  • -знать основы MLOps, этапы жизненного цикла ML модели, ключевые проблемы и решения
  • -описывать полный жизненный цикл ML модели
  • -планировать архитектуры ML проекта
  • -понимать требования к инфраструктуре
  • -знать принципы организации ML проектов, основы управления зависимостями, Git workflow
  • -создавать структуру проекта, настраивать окружение с UV, работать с Git
  • -создавать baseline модели, управление зависимостями проекта
  • -знать принципы создания ML API, основы pytest, документирование API
  • -уметь создавать endpoints для ML модели, писать тесты, валидировать данные
  • -разрабатывать ML API, тестирование ML сервисов
  • -знать основы облачных технологий, принципы ценообразования
  • -выбирать подходящие облачные сервисы, планировать архитектуру
  • -работать с облачными платформами, планировать ресурсы
  • -знать основы работы с Yandex.Cloud, принципы управления доступом
  • -создавать и настраивать облачные ресурсы вручную, работать с веб-интерфейсом Yandex.Cloud
  • -знать принципы IaC, различия между Terraform и Ansible, best practices
  • -выбирать подходящие инструменты для автоматизации инфраструктуры
  • -понимать декларативный и императивный подходы к IaC
  • -знать синтаксис Terraform HCL, принципы работы с state
  • -писать Terraform конфигурации, планировать изменения
  • -навыки автоматизации создания облачной инфраструктуры
  • -знать синтаксис Ansible YAML, концепцию playbooks и roles
  • -уметь создавать playbooks для настройки окружения, навыки автоматизации конфигурации серверов
  • -знать принципы контейнеризации, особенности ML приложений в контейнерах
  • -уметь выбирать стратегии контейнеризации для ML проектов
  • -навыки планирования архитектуры контейнеризованных ML приложений
  • -знать синтаксис Dockerfile, принципы Docker Compose
  • -создавать эффективные Docker образы, настраивать локальное окружение
  • -навыки контейнеризаци ML приложений, оптимизации образов
  • -знать архитектуру GitLab, типы runners, принципы безопасности
  • -устанавливать и настраивать GitLab и runners
  • -навыки администрирования GitLab, настройки CI/CD инфраструктуры
  • -знать синтаксис GitLab CI, принципы pipeline as code
  • -создавать CI/CD пайплайны, интегрировать с Docker
  • -навыки автоматизация процессов разработки, DevOps практики
  • -знать основы Kubernetes
  • -навыки понимания Kubernetes как важного компонента в современном ML
  • -знать основные объекты Kubernetes, принципы сетевого взаимодействия
  • -уметь создавать и управлять Kubernetes ресурсами
  • -навыки деплой приложений в Kubernetes, диагностика проблем
  • -знать структуру Helm charts, синтаксис шаблонов
  • -уметь создавать переиспользуемые Helm charts
  • -навыки: пакетирование Kubernetes приложений
  • -знать принципы GitOps, возможности Argo CD
  • -уметь настраивать автоматический деплой через Git
  • -навыки: реализация GitOps workflow для ML проектов
  • -знать особенности версионирования в ML, принципы работы с данными
  • -уметь планировать стратегии версионирования и логирования
  • -навыки: управление данными в ML проектах
  • -знать принципы работы с БД в ML
  • -уметь настраивать БД для ML проектов, создавать миграции
  • -навыки: интеграция БД с ML сервисами, оптимизация производительности
  • -знать принципы версионирования данных, концепцию DVC pipeline
  • -уметь создавать воспроизводимые ML pipeline с DVC
  • -навыки: управление версиями данных и моделей
  • -знать возможности MLflow, принципы experiment tracking
  • -уметь логировать эксперименты, управлять моделями через Registry
  • -навыки: организация ML экспериментов, version control для моделей
  • -знать принципы потоковой обработки, подходы к автоматизации обучения
  • -уметь проектировать системы для real-time ML
  • -навыки: планирование архитектуры для streaming ML
  • -знать архитектуру Kafka, принципы работы с событиями
  • -уметь настраивать Kafka для ML проектов, интегрировать с API
  • -навыки: разработка event-driven архитектуры для ML
  • -знать принципы работы Airflow, возможности KubernetesPodOperator
  • -уметь создавать DAG для автоматизации ML workflow
  • -навыки: оркестрация ML pipeline в продакшен среде
  • -знать: возможности Streamlit, принципы создания ML интерфейсов
  • -уметь создавать пользовательские интерфейсы для ML моделей
  • -навыки: разработка полноценных ML приложений
  • -знать принципы мониторинга ML систем, типы метрик
  • -уметь планировать стратегию мониторинга и логирования
  • -навыки: проектирование observable ML систем
  • -знать принципы работы Prometheus и Grafana
  • -уметь настраивать системы мониторинга и алертинга
  • -навыки: реализация мониторинга качества ML моделей
  • -знать принципы централизованного логирования, возможности Graylog
  • -уметь настраивать централизованный сбор логов в Kubernetes
  • -навыки: управление логами в распределенных ML системах
  • -знать архитектуру Ollama, принципы оптимизации локального inference
  • -уметь развертывать LLM локально через Ollama, настраивать API endpoints, создавать кастомные конфигурации, интегрировать с приложениями
  • -навыки: выбор оптимальной платформы для задач, мониторинг ресурсов, troubleshooting локальных LLM
Содержание учебной дисциплины

Содержание учебной дисциплины

  • Введение в MLOps. Жизненный цикл ML.
  • Введение в MLOps. Жизненный цикл ML.
  • Организация исходного кода.
  • ML-сервис.
  • Облачная инженерия.
  • Развёртывания облачных ресурсов.
  • Инфраструктура как код. Terraform и Ansible.
  • Автоматизация развертывания ресурсов.
  • Конфигурация среды.
  • Контейнеризация и автоматизация доставки ML-приложений.
  • Сборка образов.
  • GitLab и GitLab Runner.
  • GitLab CI/CD.
  • Введение в Kubernetes.
  • k8s ресурсы.
  • Helm.
  • GitOps.
  • Версионирование, логирование и работа с данными.
  • Работа с БД в ML-проектах.
  • DVC.
  • MLflow.
  • Потоковая обработка и автоматизация обучения.
  • Kafka.
  • Airflow в k8s.
  • Полноценный ML-сервис.
  • Мониторинг и логирование.
  • Мониторинг. Prometheus и Grafana.
  • Логирование.
  • LLMOps.
Элементы контроля

Элементы контроля

  • неблокирующий Домашнее задание с самопроверкой по чек-листу
  • неблокирующий Итоговое задание
  • неблокирующий Тесты
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 3rd module
    0.2 * Тесты + 0.5 * Итоговое задание + 0.3 * Домашнее задание с самопроверкой по чек-листу
Список литературы

Список литературы

Рекомендуемая основная литература

  • Apache Airflow и конвейеры обработки данных - Харенслак Б., де Руйтер Дж. - Издательство "ДМК Пресс" - 978-5-97060-970-5 - 2022 - русский - https://e.lanbook.com/book/241133 - ЛАНЬ - 241133
  • Введение в автоматизированное машинное обучение (AutoML), Хуттер, Ф., 2023
  • Командная разработка программного обеспечения с помощью системы контроля версий Git: Конспект лекций - Рощин П. Г. - Национальный исследовательский ядерный университет «Московский инженерно-физический институт» - 978-5-7262-2846-4 - 2022 - русский - https://e.lanbook.com/book/355550 - ЛАНЬ - 355550
  • Методы машинного обучения - Татарникова Т. М., Боженко В. В. - Санкт-Петербургский государственный университет аэрокосмического приборостроения - 978-5-8088-1885-9 - 2023 - русский - https://e.lanbook.com/book/461489 - ЛАНЬ - 461489
  • Основы интеллектуального анализа данных и машинного обучения: Конспект лекций - Запечников С. В. - Национальный исследовательский ядерный университет «Московский инженерно-физический институт» - 978-5-7262-2856-3 - 2022 - русский - https://e.lanbook.com/book/355580 - ЛАНЬ - 355580

Рекомендуемая дополнительная литература

  • Docker на практике - Сейерс Э. Х. , Милл А. - Издательство "ДМК Пресс" - 978-5-97060-772-5 - 2020 - русский - https://e.lanbook.com/book/131719 - ЛАНЬ - 131719
  • Введение в технологию контейнеров и Kubernetes - Маркелов А. А. - Издательство "ДМК Пресс" - 978-5-97060-775-6 - 2019 - русский - https://e.lanbook.com/book/131702 - ЛАНЬ - 131702

Авторы

  • Ахмедова Гюнай Интигам кызы
  • Касьяненко Дарья Алексеевна