Что стоит за словами «fine-tune», «RLHF», «DPO», «GRPO» — и когда это вообще нужно в продуктовом AI. Формулы, пайплайны, подводные камни.
Дообучение — это не одна техника, а лестница с растущей сложностью и стоимостью. На собеседовании её надо уметь нарисовать:
| Шаг | Что делает | Данные | Стоимость |
|---|---|---|---|
| 1. SFT | Учим модель отвечать «как надо» на примерах | Демонстрации (вход → идеальный ответ) | Средне |
| 2. LoRA/QLoRA | Делаем SFT/дообучение дёшевым | Те же, что у шага 1 | Дёшево |
| 3. DPO | Учим предпочтениям «это лучше, чем то» | Пары (выбранный / отклонённый) | Дёшево |
| 4. PPO (RLHF) | Учим через вознаграждение, как в RL | Ранги ответов → reward model | Дорого, нестабильно |
| 5. GRPO | То же, но без отдельной reward model | Правило/верификатор (напр., тесты) | Средне, DeepSeek-R1 |
Что: берём предобученную модель и доучиваем на парах «запрос → идеальный ответ» обычным градиентным спуском (cross-entropy). Это то, что превратило GPT-3 в InstructGPT-подобных помощников.
Именно с SFT начинается InstructGPT: сначала лейблеры пишут желаемое поведение, и на этих демонстрациях модель дообучается супервайзедно.[100]
Когда нужно в продукте: у тебя стабильный формат выхода (JSON-поля, тон, язык домена), есть размеченные примеры, и промпт-инжиниринг упёрся в потолок.
Данные: 100–1000 качественных примеров могут дать больше, чем 100k мусорных. QLoRA-бумага: маленький качественный датасет → SoTA на бенчмарке.[105]
Проблема SFT: учит «как отвечать», но не «что лучше». Отсюда следующий шаг.
LoRA (Low-Rank Adaptation): замораживаем веса модели и добавляем в каждый Transformer-слой маленькие обучаемые матрицы низкого ранга. Обучается только ~0.01–1% параметров.
Цифры из бумаги: для GPT-3 175B — в 10 000 раз меньше обучаемых параметров и в 3 раза меньше памяти GPU, при качестве не хуже полного fine-tune.[104]
QLoRA: LoRA + замороженная модель в 4-битной квантизации (NF4). Позволяет дообучать 65B модель на ОДНОЙ 48GB GPU за 24 часа — Guanaco достиг 99.3% уровня ChatGPT на Vicuna-бенчмарке.[105]
Практический вывод: LoRA/QLoRA — дефолтный способ продуктового дообучения. Полный fine-tune — только когда нужен максимум и есть бюджет.
Проблема RLHF (PPO): сложно и нестабильно — надо обучать отдельную reward model, потом гонять RL, настраивать кучу гиперпараметров.[101]
Идея DPO: оказывается, оптимальную политику можно вытащить в закрытой форме — reward model можно «схлопнуть» в саму модель. Тогда элаймент превращается в простую classification loss, без RL-цикла и без сэмплинга во время обучения.[101]
Данные DPO: пары ответов — (выбранный, отклонённый) на один запрос. Их проще собрать, чем писать идеальные ответы для SFT: достаточно ранжировать.
Результат из бумаги: DPO превосходит PPO в контроле сентимента и не хуже в суммаризации и диалоге — при кратно меньшей сложности.[101]
Интуиция: «модель — скрытая reward model» — вероятность, которую модель даёт ответу, уже содержит сигнал о том, насколько он хорош. DPO просто заставляет вероятности выбранных ответов расти, отклонённых — падать.
Трёхшаговый пайплайн из InstructGPT:[100]
Ключевой факт из бумаги: InstructGPT 1.3B предпочитали 175B GPT-3 в 100 раз чаще — элаймент важнее размера.[100]
KL-штраф — термин, который стоит знать: без него RL «переобучается» на награду и ломает язык. Формула: добавляем −β·KL(policy || reference) к reward.
Проблема PPO: нужна обученная reward model и она может быть «взломана» (reward hacking).
Идея GRPO (Group Relative Policy Optimization): для каждого запроса генерируем ГРУППУ ответов, оцениваем их ПРАВИЛОМ (rule-based verifier: тесты для кода, известный ответ для математики), и reward = относительное место ответа внутри группы (z-score). Никакой обученной reward model не нужно.[102]
DeepSeek-R1 показал: чистый RL на верифицируемых задачах (математика, кодинг) развивает рассуждения — self-reflection, проверку, адаптацию стратегии — без человеческих демонстраций рассуждений.[102]
Почему это важно для собеседования: GRPO — метод, на котором построен R1 и который сейчас де-факто стандарт для reasoning-дообучения. Если вакансия — AI-инженерия уровня Middle+, GRPO стоит знать по имени и с одной фразой: «RL на группе ответов с rule-based наградой вместо reward model».
Anthropic: вместо человеческих меток вредности — список принципов («конституция»). Модель сама генерирует критику и переписывает ответы; дальше preference model обучается на AI-предпочтениях, и RL идёт по нему.[103]
Итог: «безвредный, но не уклончивый» ассистент, который объясняет возражения вместо отказа. Ключевое: RLAIF — это способ масштабировать элаймент без дорогих человеческих лейблов.[103]
Твоя связка с RAG из урока 0002 — это и есть ответ:
Фраза для собеседования: «RAG — это факты, fine-tune — это форма и поведение. Сначала RAG + промпты, fine-tune только когда формат стабильно не садится и есть размеченные данные. А если задача — заставить модель следовать стилю или вести себя в домене — LoRA + DPO дешевле и стабильнее, чем полный RLHF».
DPO проще PPO, потому что?
GRPO вместо reward model использует?
Тарифы банка меняются — что выбрать?