Бакалавриат
2026/2027





Введение в платформы данных
ID 1160077
Статус:
Курс по выбору (Прикладная математика и информатика)
Кто читает:
Базовая кафедра МТС
Где читается:
Факультет компьютерных наук
Когда читается:
4-й курс, 1, 2 модуль
Охват аудитории:
для своего кампуса
Преподаватели:
Гюльмамедов Саттар Алекперович
Язык:
русский
Кредиты:
5
Контактные часы:
56
Программа дисциплины
Аннотация
Прежде чем построить дашборд, провести аналитику или обучить ML-модель, данные необходимо собрать, загрузить в хранилище, обработать, проверить и подготовить для дальнейшего использования. Для решения этих задач компании создают платформы данных — инфраструктуру и набор инструментов, которые обеспечивают полный цикл работы с данными.
На курсе вы разберетесь, как устроены платформы данных, из каких компонентов они состоят и какие задачи решают. Основное внимание будет уделено технологиям экосистемы Hadoop и инструментам обработки больших данных.
В первой части курса вы изучите архитектуру Hadoop, работу HDFS, принципы MapReduce и YARN, а также познакомитесь с другими компонентами экосистемы. Затем научитесь работать с Hive и использовать HiveQL для организации и обработки данных.
Отдельный модуль посвящен Apache Spark: его архитектуре, развертыванию кластера, работе со Spark DataFrame API и Spark SQL API.
Цель освоения дисциплины
- Понимать принципы работы и структуры платформ данных
- Изучить архитектуры и компоненты систем обработки больших данных на примере экосистемы Hadoop, DataLake, DataWarehouse
- Научиться запускать, развертывать и управлять кластерами и платформами данных
- Освоить инструменты и методы работы с большими данными
- Понимать, как управлять качеством данных - Изучить современные инструменты бизнес-аналитики
Планируемые результаты обучения
- Понять основные концепции платформ данных
- Понять из каких компонентов состоят платформы данных
- Научиться запускать собственную платформу данных
- Понимание компонентов Hadoop и архитектуры кластера
- Знание системы HDFS, её свойств и интеграции с другими компонентами Hadoop
- Умение развертывать Hadoop и выполнять базовые операции файловой системы
- Понимание парадигмы MapReduce
- Знание системы управления ресурсами YARN
- Понимание форматов файлов в Hadoop
- Знание других проектов экосистемы Hadoop
- Понимание назначения, структуры и компонентов Hive
- Умение развертывать Hive и выполнять операции с ним
- Знание HiveQL и организации данных в Hive
- Сравнение Hive с традиционными RDBMS
- Понимание архитектуры и назначения Spark
- Умение развертывать кластер Spark
- Знание Spark DataFrame API
- Понимание взаимодействия между компонентами Hadoop
- Знание средств организации ETL-процессов
- Умение работать с DBT, Prefect и NiFi
- Сравнение различных инструментов ETL
- Понимание способов организации хранилищ: Data Lake, Data Warehouse, Lakehouse
- Знание систем Greenplum и Clickhouse
- Понимание использовани Kafka
- Знание принципов контроля качества данных (DQ)
- Понимание основ Data Governance (DatGov)
- Умение использовать инструменты бизнес-аналитики (BI)
Содержание учебной дисциплины
- Основные концепции платформ данных
- Хранение данных
- Загрузка данных в хранилище из различных источников. ETL и Streaming
- Построение витрин данных в хранилище. Модели данных
- Оптимизация работы пользователей с хранилищем. Оптимизация производительности
- Data Governance. Новый уровень доверия к данным
- Качество данных. Что это такое и как его измерять
- Каталог данных. Построение Data Mesh
- Аналитика данных. Способы работы с данными в хранилище. Data Virtualization
- Business intelligence и визуализация данных
- Введение в обработку больших данных и Hadoop
- Обработка данных в Hadoop
- Аналитика и обработка данных с использованием Hive
- Apache Spark и его применение
- Инструменты организации ETL-процессов
- Технологии хранения и обработки больших данных
- Управление качеством данных и бизнес-аналитика
Элементы контроля
- Домашнее задание 5
- Домашнее задание 6
- Домашнее задание 1
- Домашнее задание 2
- Домашнее задание 3
- Домашнее задание 4
Промежуточная аттестация
- 2026/2027 2nd moduleИтоговая оценка = сумма баллов за все домашние работы / 6. Таким образом, итоговая оценка рассчитывается как средний балл за домашние задания. За несвоевременную сдачу применяются штрафы: задержка от 1 дня до 1 недели включительно — минус 1 балл; задержка более чем на 1 неделю — минус 2 балла. Работы, содержащие плагиат, оцениваются в 0 баллов. Если студент не согласен с решением, проводится встреча с преподавателем, на которой необходимо объяснить ход решения и подтвердить самостоятельность выполнения работы.
Список литературы
Рекомендуемая основная литература
- 22373 - Работа с данными в любой сфере: Как выйти на новый уровень, используя аналитику - И. Интеллект; К.Еременко - Альпина Паблишер - 9785961472288 - 2021 - https://hse.alpinadigital.ru/audio/22373 - Alpina
- Adam Aspin. (2020). Pro Power BI Desktop : Self-Service Analytics and Data Visualization for the Power User: Vol. Third edition. Apress.
- Provost, F., & Fawcett, T. (2013). Data Science for Business : What You Need to Know About Data Mining and Data-Analytic Thinking (Vol. 1st ed). Beijing: O’Reilly Media. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=619895
Рекомендуемая дополнительная литература
- Kimball, R., & Ross, M. (2013). The Data Warehouse Toolkit : The Definitive Guide to Dimensional Modeling (Vol. 3rd edition). Hoboken, New Jersey: Wiley. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=605991
- Гордеев, С. И. Организация баз данных в 2 ч. Часть 1 : учебник для среднего профессионального образования / С. И. Гордеев, В. Н. Волошина. — 2-е изд., испр. и доп. — Москва : Издательство Юрайт, 2021. — 310 с. — (Профессиональное образование). — ISBN 978-5-534-11626-7. — Текст : электронный // Образовательная платформа Юрайт [сайт]. — URL: https://urait.ru/bcode/476351 (дата обращения: 04.07.2025).