• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта
Бакалавриат 2026/2027

Анализ данных, искусственный интеллект и генеративные модели

ID 1130805

Статус: Курс обязательный (История)
Когда читается: 3-й курс, 2, 3 модуль
Онлайн-часы: 50
Охват аудитории: для своего кампуса
Язык: русский
Кредиты: 3
Контактные часы: 36

Программа дисциплины

Аннотация

Данный курс направлен на формирование компетенций у студентов в области статистики и анализа данных. В курсе будут рассмотрены темы, которые необходимы для успешного освоения основных понятий и методов, связанных с анализом данных. Дисциплина реализуется с помощью онлайн-курса «Хендбук по Анализу данных. Начальный уровень» в SmartLMS (https://edu.hse.ru/course/view.php?id=236211).
Цель освоения дисциплины

Цель освоения дисциплины

  • Целью освоения дисциплины «Анализ данных» является овладение студентами основами статистики и анализа данных для применения в решении различных практических задач.
Планируемые результаты обучения

Планируемые результаты обучения

  • Способен загружать, структурировать, очищать и преобразовывать табличные данные средствами Python и библиотеки Pandas
  • Способен фильтровать, сортировать, группировать и агрегировать данные, создавать новые признаки, частотные и сводные таблицы
  • Способен выбирать способы визуального представления данных и строить основные типы статистических графиков
  • Способен рассчитывать и содержательно интерпретировать описательные статистики, выявлять выбросы и обрабатывать пропущенные значения
  • Способен собирать данные из веб-источников и программных интерфейсов API и преобразовывать полученные данные в формат, пригодный для анализа
  • Способен подготавливать текстовые данные к количественному анализу, применять стемминг, лемматизацию и анализ N-грамм
  • Способен применять методы анализа тональности, тематического моделирования и контекстуального представления текста с использованием моделей семейства BERT
  • Способен представлять отношения между объектами в форме сетей и применять базовые методы сетевого анализа
  • Способен использовать методы стилометрии и кластерного анализа для выявления сходств и различий между текстами
  • Способен применять большие языковые модели для решения исследовательских задач, разрабатывать и оценивать промпты
  • Способен взаимодействовать с большими языковыми моделями программно через API
  • Способен создавать базовые RAG-системы, объединяющие поиск по коллекции документов и генерацию ответа большой языковой моделью
  • Способен обосновывать выбор метода анализа в соответствии с исследовательским вопросом, интерпретировать результаты и учитывать ограничения используемых методов
Содержание учебной дисциплины

Содержание учебной дисциплины

  • Введение в анализ данных. Pandas и типы данных
  • Фильтрация и сортировка данных
  • Частотные таблицы, визуализация и создание новых признаков
  • Агрегирование данных и сводные таблицы
  • Описательные статистики, выбросы и пропущенные значения
  • Корреляция и линейная регрессия
  • Парсинг данных
  • Работа с API
  • Стемминг, лемматизация и N-граммы
  • Анализ тональности текста
  • BERT и контекстуальные представления текста
  • Тематическое моделирование.
  • Сетевой анализ.
  • Стилометрия и кластерный анализ
  • Большие языковые модели и промпт-инжиниринг
  • Работа с большими языковыми моделями через API
  • RAG-ассистент
  • Защита проектов
Элементы контроля

Элементы контроля

  • неблокирующий Практические работы
    Практические работы выполняются в рамках семинарских занятий и направлены на применение изученных методов к учебным и исследовательским данным. Студенты начинают выполнение работы непосредственно на семинаре под руководством преподавателя и завершают ее самостоятельно в течение недели после занятия. Практические работы позволяют последовательно отрабатывать навыки программирования, обработки данных, применения статистических методов и анализа текстов. Выполнение практических заданий учитывается при выставлении оценки за активность на занятиях.
  • неблокирующий Проект
  • неблокирующий Самостоятельные работы
    Самостоятельные работы представляют собой задания по программированию, выполняемые студентами в LMS. Каждая работа включает набор задач, предполагающих написание кода для обработки, преобразования и анализа данных. Корректность решений проверяется автоматически с помощью системы автопроверки SmartLMS. Первые самостоятельные работы посвящены базовым операциям с табличными данными и статистическому анализу (СР 1–3). Последующие работы охватывают методы обработки и анализа текстовых данных (СР 4–5).
  • неблокирующий Контрольная работа
    Контрольная работа имеет кумулятивный характер и обобщает содержание всех самостоятельных работ курса. Она включает задания тех же типов, которые студенты последовательно осваивали в СР 1–5, но выполняются они на новых данных и объединяются в рамках одной комплексной работы.
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 3rd module
    0.25 * Контрольная работа + 0.25 * Практические работы + 0.25 * Проект + 0.25 * Самостоятельные работы
Список литературы

Список литературы

Рекомендуемая основная литература

  • Elementary statistics : a step by step approach, Bluman, A. G., 2018

Рекомендуемая дополнительная литература

  • Comparative-historical methods, Lange, M., 2013
  • Моделирование исторических процессов : от реконструкции реальности к анализу альтернатив, Бородкин, Л. И., 2016

Авторы

  • Галушко Илья Николаевич
  • Борман Марина Юрьевна
  • Карпов Максим Евгеньевич
  • Сафарян Анастасия Романовна
  • Бурова Маргарита Борисовна
  • Перевышина Татьяна Олеговна