Урок 0010 · Дообучение и элаймент: SFT, LoRA, DPO, PPO, GRPO

Что стоит за словами «fine-tune», «RLHF», «DPO», «GRPO» — и когда это вообще нужно в продуктовом AI. Формулы, пайплайны, подводные камни.

Цель урока Назвать лестницу дообучения (SFT → LoRA → DPO → PPO/GRPO), объяснить, чем DPO проще PPO, и сказать, когда дообучение НЕ нужно (а RAG — да).

1. Лестница дообучения: от простого к сложному

Дообучение — это не одна техника, а лестница с растущей сложностью и стоимостью. На собеседовании её надо уметь нарисовать:

ШагЧто делаетДанныеСтоимость
1. SFTУчим модель отвечать «как надо» на примерахДемонстрации (вход → идеальный ответ)Средне
2. LoRA/QLoRAДелаем SFT/дообучение дёшевымТе же, что у шага 1Дёшево
3. DPOУчим предпочтениям «это лучше, чем то»Пары (выбранный / отклонённый)Дёшево
4. PPO (RLHF)Учим через вознаграждение, как в RLРанги ответов → reward modelДорого, нестабильно
5. GRPOТо же, но без отдельной reward modelПравило/верификатор (напр., тесты)Средне, DeepSeek-R1

2. SFT — супервайзед-дообучение: основа всего

Что: берём предобученную модель и доучиваем на парах «запрос → идеальный ответ» обычным градиентным спуском (cross-entropy). Это то, что превратило GPT-3 в InstructGPT-подобных помощников.

Именно с SFT начинается InstructGPT: сначала лейблеры пишут желаемое поведение, и на этих демонстрациях модель дообучается супервайзедно.[100]

Когда нужно в продукте: у тебя стабильный формат выхода (JSON-поля, тон, язык домена), есть размеченные примеры, и промпт-инжиниринг упёрся в потолок.

Данные: 100–1000 качественных примеров могут дать больше, чем 100k мусорных. QLoRA-бумага: маленький качественный датасет → SoTA на бенчмарке.[105]

Проблема SFT: учит «как отвечать», но не «что лучше». Отсюда следующий шаг.

3. LoRA и QLoRA — как дообучать, не разоряясь

LoRA (Low-Rank Adaptation): замораживаем веса модели и добавляем в каждый Transformer-слой маленькие обучаемые матрицы низкого ранга. Обучается только ~0.01–1% параметров.

Цифры из бумаги: для GPT-3 175B — в 10 000 раз меньше обучаемых параметров и в 3 раза меньше памяти GPU, при качестве не хуже полного fine-tune.[104]

QLoRA: LoRA + замороженная модель в 4-битной квантизации (NF4). Позволяет дообучать 65B модель на ОДНОЙ 48GB GPU за 24 часа — Guanaco достиг 99.3% уровня ChatGPT на Vicuna-бенчмарке.[105]

Практический вывод: LoRA/QLoRA — дефолтный способ продуктового дообучения. Полный fine-tune — только когда нужен максимум и есть бюджет.

4. DPO — элаймент «бесплатно», без RL

Проблема RLHF (PPO): сложно и нестабильно — надо обучать отдельную reward model, потом гонять RL, настраивать кучу гиперпараметров.[101]

Идея DPO: оказывается, оптимальную политику можно вытащить в закрытой форме — reward model можно «схлопнуть» в саму модель. Тогда элаймент превращается в простую classification loss, без RL-цикла и без сэмплинга во время обучения.[101]

Данные DPO: пары ответов — (выбранный, отклонённый) на один запрос. Их проще собрать, чем писать идеальные ответы для SFT: достаточно ранжировать.

Результат из бумаги: DPO превосходит PPO в контроле сентимента и не хуже в суммаризации и диалоге — при кратно меньшей сложности.[101]

Интуиция: «модель — скрытая reward model» — вероятность, которую модель даёт ответу, уже содержит сигнал о том, насколько он хорош. DPO просто заставляет вероятности выбранных ответов расти, отклонённых — падать.

5. PPO / RLHF — классический элаймент (InstructGPT)

Трёхшаговый пайплайн из InstructGPT:[100]

  1. SFT: дообучение на демонстрациях лейблеров.
  2. Reward model: лейблеры ранжируют ответы модели → обучается отдельная модель, предсказывающая «насколько хорош ответ».
  3. PPO: модель дообучается через RL, максимизируя reward, но с KL-штрафом, чтобы не уходить далеко от SFT-модели (иначе «exploit» награды → бессвязный текст).

Ключевой факт из бумаги: InstructGPT 1.3B предпочитали 175B GPT-3 в 100 раз чаще — элаймент важнее размера.[100]

KL-штраф — термин, который стоит знать: без него RL «переобучается» на награду и ломает язык. Формула: добавляем −β·KL(policy || reference) к reward.

6. GRPO — элаймент без reward model (DeepSeek-R1)

Проблема PPO: нужна обученная reward model и она может быть «взломана» (reward hacking).

Идея GRPO (Group Relative Policy Optimization): для каждого запроса генерируем ГРУППУ ответов, оцениваем их ПРАВИЛОМ (rule-based verifier: тесты для кода, известный ответ для математики), и reward = относительное место ответа внутри группы (z-score). Никакой обученной reward model не нужно.[102]

DeepSeek-R1 показал: чистый RL на верифицируемых задачах (математика, кодинг) развивает рассуждения — self-reflection, проверку, адаптацию стратегии — без человеческих демонстраций рассуждений.[102]

Почему это важно для собеседования: GRPO — метод, на котором построен R1 и который сейчас де-факто стандарт для reasoning-дообучения. Если вакансия — AI-инженерия уровня Middle+, GRPO стоит знать по имени и с одной фразой: «RL на группе ответов с rule-based наградой вместо reward model».

7. RLAIF / Constitutional AI — элаймент без человеческих лейблов

Anthropic: вместо человеческих меток вредности — список принципов («конституция»). Модель сама генерирует критику и переписывает ответы; дальше preference model обучается на AI-предпочтениях, и RL идёт по нему.[103]

Итог: «безвредный, но не уклончивый» ассистент, который объясняет возражения вместо отказа. Ключевое: RLAIF — это способ масштабировать элаймент без дорогих человеческих лейблов.[103]

8. Когда дообучение НЕ нужно (важно для раунда!)

Твоя связка с RAG из урока 0002 — это и есть ответ:

Фраза для собеседования: «RAG — это факты, fine-tune — это форма и поведение. Сначала RAG + промпты, fine-tune только когда формат стабильно не садится и есть размеченные данные. А если задача — заставить модель следовать стилю или вести себя в домене — LoRA + DPO дешевле и стабильнее, чем полный RLHF».

Проверь себя

DPO проще PPO, потому что?

GRPO вместо reward model использует?

Тарифы банка меняются — что выбрать?

Видео и статьи по теме

Статьи (первоисточники)

Практика

Первоисточник урока DPO paper — ключевой инсайт «элаймент без RL». Для GRPO: DeepSeek-R1.

Sources: