Бакалавриат
2026/2027





Автоматическая обработка естественного языка
Статус:
Курс по выбору (Фундаментальная и компьютерная лингвистика)
Кто читает:
Школа лингвистики
Где читается:
Факультет гуманитарных наук
Когда читается:
4-й курс, 2, 3 модуль
Охват аудитории:
для своего кампуса
Преподаватели:
Харламова Дарья Сергеевна
Язык:
русский
Кредиты:
6
Контактные часы:
66
Программа дисциплины
Аннотация
Курс охватывает теорию и практику использования больших языковых моделей для автоматической обработки естественного языка. Рассматриваются архитектура трансформера и ее математический аппарат, полный цикл обучения и дообучения моделей, специализированные архитектуры (смесь экспертов, агентные системы, модели с рассуждением), построение систем генерации с дополненной выборкой, вычислительная инфраструктура, экспериментальная методология, развёртывание приложений, интерпретируемость нейронных сетей, история области и методы синтаксического анализа текста. Лекции обеспечивают теоретическую базу, семинары ориентированы на практическую работу: реализацию компонентов моделей, программирование на PyTorch, построение конвейеров обучения и вывода, контейнеризацию и критический анализ научных публикаций
Цель освоения дисциплины
- По завершении курса обучающийся будет способен: (1) описывать архитектуру трансформера и лежащий в её основе математический аппарат; (2) планировать и выполнять полный цикл обучения и дообучения языковой модели с учётом ресурсных ограничений; (3) проектировать и реализовывать системы генерации с дополненной выборкой; (4) настраивать вычислительную инфраструктуру для обучения и вывода, применяя методы оптимизации ресурсов; (5) проектировать воспроизводимые эксперименты и критически оценивать методологическое качество научных работ; (6) развертывать и обслуживать приложения машинного обучения в контейнеризованной среде; (7) применять методы интерпретации к обученным моделям и оценивать границы их применимости; (8) реализовывать конвейеры синтаксического анализа текста для извлечения структурированной информации.
Планируемые результаты обучения
- Описать механизм самовнимания и его роль в блоке трансформера
- выполнять матричные операции, связанные с вычислением внимания по схеме «запрос — ключ — значение»
- определять математические операции, управляющие прямым и обратным проходами в нейронных сетях
- использовать большие языковые модели для прикладных задач обработки текста
- описать этапы конвейера предобучения большой языковой модели от сбора данных до сходимости
- объяснять принципы работы агентных и оснащённых рассуждением языковых моделей
- выбрать и обосновать стратегию дообучения с учётом спецификации задачи и бюджета ресурсов
- описать конвейер RLHF и его роль в согласовании выходов языковой модели с предпочтениями пользователей
- настроить и выполнить эксперимент по дообучению, включая подготовку набора данных и подбор гиперпараметров
- описать архитектуру и поток данных в системе генерации с дополненной выборкой
- выбрать и развернуть модель эмбеддингов, подходящую для данной коллекции документов
- настроить векторную базу данных и выполнить поиск по сходству
- построить и оценить сквозной конвейер RAG
- оценивать требования к памяти GPU при обучении и выводе для заданной конфигурации модели
- применять квантование и смежные методы компрессии для снижения ресурсоёмкости модели
- писать код на PyTorch для определения, обучения и оценки модели
- выбрать метрики оценки, соответствующие задаче, и обосновать этот выбор
- использовать инструменты отслеживания экспериментов для журналирования и сравнения запусков
- выявлять методологические слабости в опубликованной научной статье
- настроить конечную точку обслуживания модели
- организовать базовый мониторинг развёрнутой модели
- оценивать надёжность и ограничения различных методов интерпретации
- излагать результаты интерпретации в ясной и технически точной форме
- назвать ключевых исследователей и их вклад в развитие методов нейронных сетей
- настроить и применить стандартные библиотеки синтаксического анализа для решения сложных задач обработки текста
Содержание учебной дисциплины
- Раздел 1. Архитектура трансформера и математические основы
- Раздел 2. Обучение больших языковых моделей
- Раздел 3. Методы дообучения
- Раздел 4. Генерация с дополненной выборкой и модели эмбеддингов
- Раздел 5. Вычислительная инфраструктура для глубокого обучения
- Раздел 6. Экспериментальная методология и оценка
- Раздел 7. Развёртывание приложений
- Раздел 8. Интерпретируемость нейронных сетей
- Раздел 9. История нейронных сетей
- Раздел 10. Синтаксический анализ текста и извлечение структурированной информации
Элементы контроля
- КоллоквиумТеоретический устный экзамен по билетам на основании содержания курса.
- Проектзаконченная исследовательская или прикладная работа, включающая в себя две и больше тем, освещенных в рамках курса. Темы проекта подлежат обязательному согласованию с преподавателями. Согласовать тему можно в любое время с момента начала курса до начала третьего модуля.
- Домашние задания4 домашних задания, представляющих собой письменные работы, посвященные самостоятельному выполнению заданий, покрывающих материалы курса. Задания включают в себя написание кода и/или проведение анализа полученных результатов и описание их в соответствии с требованиями каждого задания.
- Посещаемостьоценка посещаемости проводится на основании письменных опросов, проводящихся на лекциях и семинарах.
Промежуточная аттестация
- 2026/2027 учебный год 3 модуль0.1 * Коллоквиум + 0.2 * Проект + 0.25 * Посещаемость + 0.45 * Домашние задания
Список литературы
Рекомендуемая основная литература
- Обработка естественного языка в действии - 978-5-4461-1371-2 - Лейн Хобсон, Хапке Ханнес, Ховард Коул - 2021 - Санкт-Петербург: Питер - https://ibooks.ru/products/371695 - 371695 - iBOOKS
Рекомендуемая дополнительная литература
- Обработка естественного языка. Python и spaCy на практике. - - 978-5-4461-1506-8 - Васильев Юлий - 2021 - Санкт-Петербург: Питер - https://ibooks.ru/products/376835 - 376835 - iBOOKS