Бакалавриат
2026/2027





Анализ данных, искусственный интеллект и генеративные модели
ID 1130805
Статус:
Курс обязательный (История)
Где читается:
Факультет компьютерных наук
Когда читается:
3-й курс, 2, 3 модуль
Онлайн-часы:
50
Охват аудитории:
для своего кампуса
Преподаватели:
Галушко Илья Николаевич
Язык:
русский
Кредиты:
3
Контактные часы:
36
Программа дисциплины
Аннотация
Данный курс направлен на формирование компетенций у студентов в области статистики и анализа данных. В курсе будут рассмотрены темы, которые необходимы для успешного освоения основных понятий и методов, связанных с анализом данных. Дисциплина реализуется с помощью онлайн-курса «Хендбук по Анализу данных. Начальный уровень» в SmartLMS (https://edu.hse.ru/course/view.php?id=236211).
Цель освоения дисциплины
- Целью освоения дисциплины «Анализ данных» является овладение студентами основами статистики и анализа данных для применения в решении различных практических задач.
Планируемые результаты обучения
- Способен загружать, структурировать, очищать и преобразовывать табличные данные средствами Python и библиотеки Pandas
- Способен фильтровать, сортировать, группировать и агрегировать данные, создавать новые признаки, частотные и сводные таблицы
- Способен выбирать способы визуального представления данных и строить основные типы статистических графиков
- Способен рассчитывать и содержательно интерпретировать описательные статистики, выявлять выбросы и обрабатывать пропущенные значения
- Способен собирать данные из веб-источников и программных интерфейсов API и преобразовывать полученные данные в формат, пригодный для анализа
- Способен подготавливать текстовые данные к количественному анализу, применять стемминг, лемматизацию и анализ N-грамм
- Способен применять методы анализа тональности, тематического моделирования и контекстуального представления текста с использованием моделей семейства BERT
- Способен представлять отношения между объектами в форме сетей и применять базовые методы сетевого анализа
- Способен использовать методы стилометрии и кластерного анализа для выявления сходств и различий между текстами
- Способен применять большие языковые модели для решения исследовательских задач, разрабатывать и оценивать промпты
- Способен взаимодействовать с большими языковыми моделями программно через API
- Способен создавать базовые RAG-системы, объединяющие поиск по коллекции документов и генерацию ответа большой языковой моделью
- Способен обосновывать выбор метода анализа в соответствии с исследовательским вопросом, интерпретировать результаты и учитывать ограничения используемых методов
Содержание учебной дисциплины
- Введение в анализ данных. Pandas и типы данных
- Фильтрация и сортировка данных
- Частотные таблицы, визуализация и создание новых признаков
- Агрегирование данных и сводные таблицы
- Описательные статистики, выбросы и пропущенные значения
- Корреляция и линейная регрессия
- Парсинг данных
- Работа с API
- Стемминг, лемматизация и N-граммы
- Анализ тональности текста
- BERT и контекстуальные представления текста
- Тематическое моделирование.
- Сетевой анализ.
- Стилометрия и кластерный анализ
- Большие языковые модели и промпт-инжиниринг
- Работа с большими языковыми моделями через API
- RAG-ассистент
- Защита проектов
Элементы контроля
- Практические работыПрактические работы выполняются в рамках семинарских занятий и направлены на применение изученных методов к учебным и исследовательским данным. Студенты начинают выполнение работы непосредственно на семинаре под руководством преподавателя и завершают ее самостоятельно в течение недели после занятия. Практические работы позволяют последовательно отрабатывать навыки программирования, обработки данных, применения статистических методов и анализа текстов. Выполнение практических заданий учитывается при выставлении оценки за активность на занятиях.
- Проект
- Самостоятельные работыСамостоятельные работы представляют собой задания по программированию, выполняемые студентами в LMS. Каждая работа включает набор задач, предполагающих написание кода для обработки, преобразования и анализа данных. Корректность решений проверяется автоматически с помощью системы автопроверки SmartLMS. Первые самостоятельные работы посвящены базовым операциям с табличными данными и статистическому анализу (СР 1–3). Последующие работы охватывают методы обработки и анализа текстовых данных (СР 4–5).
- Контрольная работаКонтрольная работа имеет кумулятивный характер и обобщает содержание всех самостоятельных работ курса. Она включает задания тех же типов, которые студенты последовательно осваивали в СР 1–5, но выполняются они на новых данных и объединяются в рамках одной комплексной работы.
Промежуточная аттестация
- 2026/2027 3rd module0.25 * Контрольная работа + 0.25 * Практические работы + 0.25 * Проект + 0.25 * Самостоятельные работы
Список литературы
Рекомендуемая основная литература
- Elementary statistics : a step by step approach, Bluman, A. G., 2018
Рекомендуемая дополнительная литература
- Comparative-historical methods, Lange, M., 2013
- Моделирование исторических процессов : от реконструкции реальности к анализу альтернатив, Бородкин, Л. И., 2016