• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта
Магистратура 2026/2027

Трансформеры и большие языковые модели

Статус: Курс по выбору (Современные компьютерные науки)
Когда читается: 1-й курс, 3 модуль
Охват аудитории: для своего кампуса
Язык: русский
Кредиты: 3
Контактные часы: 40

Программа дисциплины

Аннотация

Большие языковые модели (LLM) стали важным направлением в области искусственного интеллекта и компьютерной лингвистики. Они используются для генерации текста, перевода, ответов на вопросы и многих других задач обработки естественного языка. Современные LLM, такие как GPT-3, LLaMa, Mistral могут генерировать связные и качественные тексты. Одним из типичных сценариев использования LLM являются вопросно-ответные системы, в которых языковая модель выступает в качестве эксперта для ответа на вопросы пользователя. Однако, в порожденных моделью ответах на вопросы встречаются так называемые галлюцинации - случаи генерации выдуманных фактов, событий и концепций. Одним из способов борьбы с этими проблемами является использование информационно-поисковых систем, из которых извлекаются релевантные вопросу фрагменты текста, которые подаются в качестве подсказки / помощи в языковые модели. В курсе будут рассмотрены современные подходы к информационному поиску и поиску ответов на вопросы на основе LLM, а также современная технология комбинирования LLM .
Цель освоения дисциплины

Цель освоения дисциплины

  • • Знать устройство архитектуры Transformer и механизма внимания, уметь реализовать её ключевые компоненты. • Понимать различия между encoder-, decoder- и encoder-decoder-моделями и уметь выбирать архитектуру под задачу. • Знать основные этапы жизненного цикла языковой модели: токенизацию, предобучение, дообучение на инструкциях и выравнивание. • Уметь применять методы параметрически эффективной адаптации языковых моделей (LoRA, адаптеры, prompt tuning). • Знать стратегии декодирования и уметь управлять качеством и разнообразием генерации. • Знать классические и нейросетевые модели информационного поиска и уметь строить поисковый индекс по коллекции документов. • Уметь проектировать и реализовывать системы retrieval-augmented generation, включая разбиение документов, гибридный поиск и реранжирование. • Понимать природу галлюцинаций языковых моделей и знать способы их снижения и измерения. • Уметь оценивать качество генеративных и поисковых систем и корректно интерпретировать результаты бенчмарков. • Знать современные подходы к комбинированию языковых моделей: использование внешних инструментов, агентные и мультимодельные схемы.
Планируемые результаты обучения

Планируемые результаты обучения

  • Объясняет устройство механизма внимания и архитектуры Transformer и реализует её ключевые компоненты на PyTorch.
  • Различает encoder-, decoder- и encoder-decoder-модели и обосновывает выбор архитектуры для прикладной задачи.
  • Применяет токенизацию подсловными единицами и объясняет её влияние на качество и стоимость инференса.
  • Настраивает стратегии декодирования и объясняет их влияние на связность, фактичность и разнообразие текста.
Содержание учебной дисциплины

Содержание учебной дисциплины

  • Введение в курс. От рекуррентных моделей к трансформерам: узкие места RNN и seq2seq с вниманием. Механизм внимания: query–key–value, scaled dot-product attention, multi-head attention. Архитектура Transformer: encoder и decoder, self-attention и cross-attention, позиционное кодирование, masked self-attention, residual-связи и нормализация. Вычислительная сложность и её следствия для длины контекста.
  • Токенизация и предобучение языковых моделей. Подсловные алгоритмы токенизации: BPE, WordPiece, SentencePiece. Задачи предобучения: masked language modeling и causal language modeling. Семейства моделей: encoder (BERT), decoder (GPT), encoder-decoder (T5). Масштабирование моделей и данных, законы масштабирования, современные открытые модели (LLaMa, Mistral).
  • Генерация текста и инференс. Стратегии декодирования: greedy search, beam search, sampling с температурой, top-k и nucleus sampling, штрафы за повторы. Влияние стратегии на связность, разнообразие и фактичность. Инженерия инференса: KV-кеш, батчирование, квантизация, эффективные реализации внимания, ограничения контекстного окна.
Элементы контроля

Элементы контроля

  • неблокирующий Домашнее задание
  • неблокирующий Проект
Промежуточная аттестация

Промежуточная аттестация

  • 2026/2027 3rd module
    0.7 * Домашнее задание + 0.3 * Проект
Список литературы

Список литературы

Рекомендуемая основная литература

  • Transformers for machine learning : a deep dive, Kamath, U., 2022

Рекомендуемая дополнительная литература

  • Машинное обучение. От основ до продвинутых моделей, Принс, С., 2025

Авторы

  • Фисенко Анна Сергеевна
  • Яковлева Илона Александровна