Глава 4.5 — От базовой модели к ассистенту
Содержание
- Чего не хватает предобученной модели
- Обучение с учителем на инструкциях: обучение формату
- FLAN и аргументы в пользу многозадачного обучения инструкциям
- Модели вознаграждения и данные о предпочтениях
- RLHF: оптимизация политики против обученного вознаграждения
- InstructGPT: конкретизация полного конвейера
- DPO: сворачивание оптимизации предпочтений в единую функцию потерь
- Более дешёвые альтернативы: rejection sampling и GRPO
- Масштабирование данных о предпочтениях с помощью обратной связи от ИИ
- Взгляд с точки зрения интервью
- Вопросы для самопроверки
- Источники
1. Чего не хватает предобученной модели
Глава 4.4 занималась чисто инфраструктурной проблемой — как вообще обучить крупную модель; эта глава продолжает с моделью, которая преодолела этот барьер: она предобучена, при каком угодно масштабе и бюджете токенов, рекомендованном двумя предыдущими главами, на каузальной цели предсказания следующего токена из главы 1.1. Такая модель в реальном и вполне заслуженном смысле чрезвычайно хороша в одном: правдоподобно продолжать фрагмент текста в том стиле и регистре, который подразумевает предшествующий контекст. Это по-настоящему мощная способность, и она не то же самое, что «быть полезным диалоговым ассистентом». Сырая предобученная модель, получив запрос «Как отцентрировать div в CSS?», с равной вероятностью продолжит его списком из пяти других вопросов про CSS, которые кто-то мог бы задать следом, — ведь это вполне правдоподобное продолжение текста, похожего на форумный пост, — или же просто ответит на заданный вопрос. Модель выучила статистику текста в том виде, в каком он встречается в интернете, а «ответить на вопрос полезным образом и остановиться» — лишь один из множества паттернов, присутствующих в этом распределении, а не доминирующий.
Превращение такой модели в нечто, что надёжно ведёт себя как ассистент — отвечает именно на заданный вопрос, в полезном регистре, останавливается, когда закончило, отказывается выполнять запросы, которые не должно выполнять, — требует дополнительных этапов обучения, специально спроектированных, чтобы намеренно сузить поведение модели к этому единственному паттерну, а не надеяться, что он возникнет сам собой как побочный эффект масштаба. Эта глава охватывает два доминирующих этапа этого процесса в том виде, в каком он развивался: обучение с учителем на инструкциях (supervised fine-tuning), которое напрямую обучает диалоговому формату, и оптимизацию предпочтений (RLHF и его более современные альтернативы), которая дополнительно формирует поведение модели с помощью сравнительных суждений людей или ИИ о том, какой из нескольких кандидатных ответов лучше.
2. Обучение с учителем на инструкциях: обучение формату
Первый и наиболее прямой шаг — обучение с учителем на инструкциях, часто сокращаемое как SFT (supervised fine-tuning), также называемое инструктивным дообучением: взять предобученную модель и продолжить её обучение, используя ту же самую функцию потерь для предсказания следующего токена, но теперь на курируемом датасете пар (инструкция, ответ), написанных или отобранных специально, чтобы продемонстрировать желаемый формат и поведение, — вопрос или задача с одной стороны и качественный, полезный, уместно очерченный ответ с другой. Поскольку функция потерь по-прежнему остаётся просто предсказанием следующего токена, никакой новой архитектуры или цели не требуется; новым является исключительно данные. При достаточном числе примеров хорошо сформированных пар инструкция-ответ распределение модели над правдоподобными продолжениями существенно смещается в сторону «ответить на это полезным образом и остановиться» просто потому, что этот паттерн теперь доминирует в данных для дообучения, хотя в гораздо более обширном корпусе предобучения он был лишь одним паттерном среди многих.
Стоит точно понимать, что SFT достигает, а что нет, поскольку это частая точка путаницы. SFT чрезвычайно эффективно обучает формату и поверхностному поведению — именно поэтому дообученные модели надёжно выдают ответы в форме ассистента, а не продолжения в форме форумного поста, — но она сравнительно требовательна к данным как единственный механизм обучения более тонким поведенческим суждениям, например, какой из двух примерно одинаково правильных, но по-разному звучащих ответов на самом деле предпочтителен, поскольку написание достаточного числа размеченных демонстраций, покрывающих каждое такое различие в масштабе, дорого и не масштабируется так же хорошо, как сравнительные суждения. Именно это ограничение и мотивирует этап оптимизации предпочтений, описанный в остальной части главы.
3. FLAN и аргументы в пользу многозадачного обучения инструкциям
Работа Вэя (Wei) с соавторами над FLAN дала важную раннюю демонстрацию того, что преимущества инструктивного дообучения не ограничиваются конкретными задачами, которые вы случайно включили в набор для дообучения. Они дообучили предобученную языковую модель на большой коллекции задач, сформулированных как естественноязыковые инструкции, охватывающих множество разных типов задач, и обнаружили, что итоговая модель заметно лучше обобщается на совершенно новые, невиданные задачи при оценке в режиме zero-shot, чем предобученная модель без такого инструктивного дообучения, и часто лучше, чем дообучение под конкретную задачу изолированно на каждой отдельной задаче. Ключевой вывод, который стоит сформулировать точно, состоит в том, что именно разнообразие задач, оформленных как инструкции, во время дообучения, а не объём примеров для какой-либо одной задачи, стало движущей силой улучшения обобщения — модель, судя по всему, обучалась чему-то более общему — «как следовать инструкции», — переносимому между типами задач, а не запоминала узкие паттерны конкретных задач. Этот результат — одна из причин, по которой инструктивное дообучение теперь рассматривается как стандартный, почти повсеместный этап превращения предобученной модели в пригодного к использованию ассистента, а не как опциональное дополнение для конкретных сценариев использования.
4. Модели вознаграждения и данные о предпочтениях
SFT позволяет добиться от модели хорошо сформированных, полезных на вид ответов, но не даёт механизма для выражения градуированных предпочтений между ответами, которые оба правдоподобны, но не одинаково хороши, — а сбор такого рода градуированных, сравнительных суждений оказывается и более естественным для людей, и более информационно плотным на единицу труда разметчика, чем написание полных демонстраций с нуля. Человеку-разметчику гораздо легче и надёжнее посмотреть на два кандидатных ответа на один и тот же запрос и сказать, какой из них он предпочитает, чем написать с нуля единственный идеальный ответ, — сравнительные суждения дешевле получить и они менее подвержены непоследовательности, чем абсолютные оценки или демонстрации, написанные с нуля.
Это наблюдение мотивирует обучение отдельной модели вознаграждения: соберите датасет запросов, каждый из которых сопряжён с несколькими кандидатными сгенерированными моделью ответами, попросите людей-разметчиков указать, какой из пары кандидатов они предпочитают, и обучите модель — обычно инициализированную из той же предобученной/дообученной базы — предсказывать скалярную оценку для ответа таким образом, чтобы её оценки были согласованы с наблюдаемыми попарными предпочтениями. Обычно это формулируется как функция потерь классификационного типа над парами, следуя формулировке в духе Брэдли-Терри, использованной в основополагающей работе Кристиано (Christiano) с соавторами об обучении на человеческих предпочтениях: модель вознаграждения обучается так, чтобы вероятность, которую она приписывает предпочтению одного ответа над другим, выведенная из разности их предсказанных скалярных вознаграждений через сигмоиду, совпадала с эмпирической частотой человеческих предпочтений. После обучения эта модель вознаграждения может оценить любой кандидатный ответ на любой запрос, давая вам эффективно дифференцируемый, автоматически вычисляемый заменитель понятия «насколько хорош этот ответ» — именно тот сигнал, который нужен для оптимизации самой языковой модели против него, в масштабе, который не поддержала бы никакая прямая человеческая разметка каждого сгенерированного ответа.
Конкретно: пусть $y_w$ — ответ, который разметчик предпочёл («выигравший»), а $y_l$ — тот, который не предпочёл («проигравший»), для одного и того же запроса $x$. Модель Брэдли-Терри утверждает, что вероятность именно такого наблюдаемого предпочтения — это сигмоида от разности вознаграждений: $$P(y_w \succ y_l \mid x) = \sigma\big(r_\theta(x, y_w) - r_\theta(x, y_l)\big),$$ а модель вознаграждения обучается максимизировать логарифм правдоподобия наблюдаемых предпочтений, то есть минимизировать $$\mathcal{L}_R(\theta) = -\,\mathbb{E}_{(x,y_w,y_l)\sim D}\Big[\log \sigma\big(r_\theta(x,y_w) - r_\theta(x,y_l)\big)\Big].$$
5. RLHF: оптимизация политики против обученного вознаграждения
Обучение с подкреплением на основе обратной связи от человека, RLHF (Reinforcement Learning from Human Feedback), — это процедура, которая берёт эту обученную модель вознаграждения и использует её для дальнейшего обучения языковой модели — теперь рассматриваемой как политика в смысле обучения с подкреплением, чьи «действия» — это генерируемые ею токены, — чтобы производить ответы, получающие высокие оценки от модели вознаграждения. Исходная формулировка Кристиано с соавторами об обучении политик на основе сравнений человеческих предпочтений, разработанная изначально вне контекста языкового моделирования, установила базовую идею о том, что модель вознаграждения, обученная на попарных человеческих предпочтениях, может заменить вручную заданную функцию вознаграждения в стандартном цикле обучения с подкреплением; применение этого к языковым моделям означает использование оценки модели вознаграждения для сгенерированного ответа в качестве сигнала вознаграждения для обучения языковой модели методами градиента политики, чаще всего Proximal Policy Optimization, PPO, описанным Шульманом (Schulman) с соавторами, который стабилизирует обучение градиентом политики, ограничивая, насколько сильно политике разрешено меняться за одно обновление относительно политики, сгенерировавшей обучающие данные, избегая разрушительно больших обновлений политики, которым подвержены обычные методы градиента политики.
У механизма стабилизации PPO есть конкретная форма. Если обозначить отношение вероятностей между новой и старой политикой для сэмплированного токена как $r_t(\theta) = \pi_\theta(a_t \mid s_t) / \pi_{\theta_{\text{old}}}(a_t \mid s_t)$, а $\hat A_t$ — оценённое преимущество (advantage) этого токена, то PPO максимизирует клипированную суррогатную цель: $$L^{\text{CLIP}}(\theta) = \mathbb{E}_t\Big[\min\big(r_t(\theta)\,\hat A_t,\ \operatorname{clip}(r_t(\theta),\, 1-\epsilon,\, 1+\epsilon)\,\hat A_t\big)\Big],$$ которая берёт меньшее из неклипированной и клипированной оценок — так, что обновление политики, которое увело бы отношение слишком далеко от $1$ (в ту сторону, которая сейчас выгодна цели), перестаёт давать дополнительный градиентный сигнал за этой границей. Это и есть механическая причина, по которой PPO не может убежать от старой политики за одно обновление.
Критически важная, легко недооцениваемая деталь этого цикла — штраф за KL-дивергенцию: обучающая цель не просто максимизирует оценку модели вознаграждения, она максимизирует вознаграждение минус штрафной член, пропорциональный KL-дивергенции между текущей политикой и исходной SFT-политикой, из которой она стартовала. Если выписать явно, полная оптимизируемая цель RLHF выглядит так: $$\max_\pi\; \mathbb{E}_{x\sim D,\ y\sim \pi(\cdot\mid x)}\big[r_\theta(x,y)\big] \;-\; \beta\, D_{\mathrm{KL}}\big[\pi(\cdot\mid x)\,\|\,\pi_{\mathrm{SFT}}(\cdot\mid x)\big],$$ где $\beta$ определяет, насколько сильно штраф взвешен относительно сырого вознаграждения. Этот штраф существует потому, что оптимизация исключительно против обученной модели вознаграждения, без каких-либо ограничений, надёжно приводит к «взлому вознаграждения» (reward hacking) — политика находит способы генерировать текст, который получает очень высокую оценку от несовершенного, обученного приближения модели вознаграждения к понятию «хороший ответ», не будучи при этом на самом деле хорошим по тем стандартам, которые модель вознаграждения была обучена аппроксимировать, поскольку сама модель вознаграждения — лишь приближение, обученное на конечной, несовершенной выборке человеческих суждений, и уязвимо, если оптимизировать против неё достаточно агрессивно. Штраф за KL-дивергенцию удерживает политику достаточно близко к распределению исходной SFT-модели, чтобы она не могла уйти в эти вырожденные, эксплуатирующие модель вознаграждения области, жертвуя частью потенциальной оценки модели вознаграждения ради того, чтобы оставаться в области, где суждения модели вознаграждения с большей вероятностью всё ещё заслуживают доверия.
6. InstructGPT: конкретизация полного конвейера
Статья Оуян (Ouyang) с соавторами об InstructGPT — это работа, которая взяла этот трёхэтапный конвейер — обучение с учителем на инструкциях, обучение модели вознаграждения на сравнениях человеческих предпочтений и RLHF на основе PPO против этой модели вознаграждения со штрафом за KL-дивергенцию относительно SFT-политики — и продемонстрировала его конкретно и убедительно в значимом масштабе, показав, что итоговая модель значительно чаще предпочиталась людьми-оценщиками по сравнению с базовой предобученной моделью и даже с гораздо более крупными моделями, не прошедшими через этот конвейер, конкретно по критериям следования инструкциям и полезности. Эту статью стоит знать по-настоящему подробно, а не просто по названию в контексте интервью, поскольку это опорная точка, которую практически любое последующее обсуждение «конвейера RLHF» подразумевает как фон, и потому что она конкретизировала и сделала публичным именно тот конвейер, который описан в двух предыдущих разделах и который прежде существовал в более разрозненной, менее объединённой форме в литературе по обучению предпочтениям и RL.
7. DPO: сворачивание оптимизации предпочтений в единую функцию потерь
RLHF, как описано выше, работает, но операционно тяжеловесен: он требует обучения и поддержки отдельной модели вознаграждения и требует запуска настоящего цикла обучения с подкреплением — сэмплирования ответов из текущей политики, их оценки и применения обновлений PPO, — что, как известно, гораздо капризнее стабилизировать и воспроизводить, чем обычное обучение с учителем, с бо́льшим числом гиперпараметров, бо́льшим числом движущихся частей и бо́льшим числом режимов отказа, чем в прямолинейном прогоне дообучения градиентным спуском.
Прямая оптимизация предпочтений, DPO (Direct Preference Optimization), предложенная Рафаиловым (Rafailov) с соавторами, предлагает способ обойти большую часть этой машинерии, преследуя по существу ту же самую базовую цель. Ключевой математический ход состоит в том, чтобы показать, что цель RLHF — максимизировать ожидаемое вознаграждение по обученной модели вознаграждения при штрафе за KL-дивергенцию относительно референсной политики — имеет замкнутую форму связи между оптимальной политикой и функцией вознаграждения, которую она неявно оптимизирует, что позволяет перепараметризовать функцию вознаграждения напрямую через саму политику. Подстановка этой перепараметризации обратно в функцию потерь для обучения модели вознаграждения (ту же самую попарную функцию потерь в духе Брэдли-Терри, описанную ранее) даёт функцию потерь, которую можно оптимизировать напрямую по параметрам самой языковой модели, используя лишь датасет пар предпочтений и обычный градиентный спуск в стиле обучения с учителем, вообще без отдельной модели вознаграждения и без цикла обучения с подкреплением. Конкретно, этот лосс выглядит так: $$\mathcal{L}_{\mathrm{DPO}}(\theta) = -\,\mathbb{E}_{(x,y_w,y_l)\sim D}\left[\log \sigma\!\left(\beta \log\frac{\pi_\theta(y_w\mid x)}{\pi_{\mathrm{ref}}(y_w\mid x)} \;-\; \beta \log\frac{\pi_\theta(y_l\mid x)}{\pi_{\mathrm{ref}}(y_l\mid x)}\right)\right],$$ что является ровно тем же лоссом Брэдли-Терри из раздела 4, только с разностью вознаграждений, переписанной через отношения логарифмических вероятностей самой политики к референсной модели — модели вознаграждения нигде уже нет. Рафаилов с соавторами показывают, что эта функция потерь при разумных предположениях оптимизирует ту же самую базовую цель, что и RLHF — то же самое ограниченное KL-дивергенцией максимизирование вознаграждения, — просто через другой, более прямой и более стабильный путь оптимизации. Это по-настоящему изящный вывод, который стоит уметь набросать на интервью: DPO — это не эвристическое приближение к RLHF, а переформулировка, приходящая к той же самой цели через обычную оптимизацию в стиле обучения с учителем, что и объясняет, почему он стал популярной альтернативой везде, где операционная сложность полного цикла RL не оправдывает своей цены.
8. Более дешёвые альтернативы: rejection sampling и GRPO
DPO убирает цикл RL целиком, но стоит знать ещё два способа, которыми команды урезают стоимость этого конвейера, поскольку интервьюеры используют их, чтобы проверить, воспринимаете ли вы RLHF как фиксированный рецепт или как одну точку на реальном спектре «стоимость против качества».
Самый дешёвый вариант вовсе обходится без обучения с подкреплением: rejection sampling, иногда называемый дообучением best-of-$n$, сэмплирует несколько кандидатных ответов на каждый запрос из текущей SFT-модели, оценивает каждого кандидата моделью вознаграждения из раздела 4, а затем дообучается только на ответе с наивысшей оценкой на каждый запрос, используя ту же самую обычную функцию потерь предсказания следующего токена, что уже используется в SFT. Формально, целевой ответ для дообучения на каждый запрос — это просто argmax оценок модели вознаграждения по сэмплированным кандидатам: $$y^* = \arg\max_{i \in \{1,\dots,n\}} r_\theta(x, y_i),$$ и модель затем дообучается в сторону $y^*$ обычной функцией потерь предсказания следующего токена. Здесь вообще нет машинерии градиента политики — единственная задача модели вознаграждения состоит в том, чтобы выбрать, какому из уже сгенерированных кандидатов подражать, так что обновление стабильно ровно настолько же, насколько и обучение с учителем, — потому что это и есть обучение с учителем, просто на самостоятельно сгенерированных, отфильтрованных моделью вознаграждения данных, а не на написанных человеком демонстрациях. Опубликованный рецепт обучения Llama 2 использовал именно эту технику, наряду с PPO, как более ранний и более дешёвый этап оптимизации предпочтений. Ресэмплирование best-of-$n$ на этапе инференса — сгенерировать несколько кандидатов, использовать модель вознаграждения, чтобы выбрать лучший, прежде чем показать его пользователю, — та же самая идея, применённая на этапе обслуживания, а не обучения, и её стоит явно назвать на интервью: любой метод оптимизации предпочтений на этапе обучения должен окупать свою стоимость относительно этого сравнительно тривиального базового варианта на этапе инференса, иначе нет причин его предпочитать.
GRPO, Group Relative Policy Optimization, предложенный Шао (Shao) с соавторами в рамках работы DeepSeekMath, урезает стоимость именно на стороне RL, а не заменяет его целиком. Стандартному PPO нужна отдельная value-сеть — обучаемый критик, обычно примерно того же размера, что и сама политика, — чтобы оценить базовое решение, превращающее сырое вознаграждение в сигнал преимущества с меньшей дисперсией, что примерно удваивает вычисления и память, нужные для шага RL. GRPO убирает критика, сэмплируя группу из нескольких завершений для одного и того же запроса и используя собственное среднее вознаграждение этой группы как базовое решение: преимущество завершения — это просто то, насколько лучше или хуже оно оценено по сравнению со средним по своей же группе, нормированное на стандартное отклонение группы, вообще без отдельной сети, обучающейся предсказывать это базовое решение. Формально, для группы из $G$ завершений, сэмплированных на один и тот же запрос, с вознаграждениями $r_1,\dots,r_G$, преимущество завершения $i$ равно $$A_i = \frac{r_i - \operatorname{mean}(r_1,\dots,r_G)}{\operatorname{std}(r_1,\dots,r_G)},$$ что подставляется напрямую вместо $\hat A_t$ в ту же самую клипированную суррогатную цель, которую PPO использует в разделе 5, — с одним дополнительным отличием: GRPO добавляет свой KL-штраф относительно референсной политики отдельным слагаемым прямо в лосс, а не встраивает его в вознаграждение, как это делает цель RLHF в разделе 5. Это дешевле на шаг, проще держать стабильным и — как рассматривают последующие главы — оказывается особенно хорошо сочетается с целями, у которых есть чистое, проверяемое вознаграждение (проверяемый итоговый ответ, проходящий тест), а не более шумный скаляр обученной модели вознаграждения, — именно та обстановка, к которой обращается обсуждение DeepSeek-R1 в главе 5.1. Сквозная мысль этого раздела в том, что «конвейер RLHF» из разделов 4–6 — это одна точка среди нескольких на реальном спектре, обменивающем операционную сложность на то, насколько напрямую метод оптимизирует то, что вас на самом деле волнует: rejection sampling ближе всего к простому концу, полный PPO — к дорогому, а DPO и GRPO каждый убирает свою конкретную часть этих расходов, сохраняя большую часть выгоды.
9. Масштабирование данных о предпочтениях с помощью обратной связи от ИИ
Всё описанное до сих пор предполагает наличие поставки размеченных людьми сравнений предпочтений, и эта поставка сама по себе является узким местом: человеческая разметка медленная, дорогая и с трудом масштабируется до объёма сравнений, который крупный прогон оптимизации предпочтений мог бы продуктивно использовать. RLAIF, описанный Ли (Lee) с соавторами, решает это узкое место, подставляя сгенерированные ИИ метки предпочтений — используя отдельную языковую модель для суждения о том, какой из двух кандидатных ответов лучше согласно некоторым заданным критериям, — вместо по крайней мере части размеченных людьми данных о предпочтениях, которые иначе потребовал бы конвейер, и показывает, что оптимизация предпочтений с использованием этих сгенерированных ИИ меток может достичь результатов, сопоставимых с использованием размеченных людьми предпочтений, при малой доле стоимости разметки и с гораздо большей масштабируемостью. Эта идея — использование сгенерированных моделью суждений вместо человеческих или в дополнение к ним в конвейере данных о предпочтениях — тесно связана с подходом Constitutional AI, подробно рассмотренным в следующей главе, который развивает конкретную, принципиальную версию этой же общей стратегии для частного случая безвредности и связанных с безопасностью предпочтений, а не общей полезности.
Всё, что рассмотрено в этой главе — SFT, RLHF, DPO и данные о предпочтениях с помощью ИИ, — направлено на то, чтобы сделать модель полезной и хорошо себя ведущей в обычном смысле компетентного следования инструкциям и производства ответов, которые люди предпочитают. Пока что это сравнительно мало говорит об отдельной и более сложной проблеме: обеспечении того, чтобы модель вела себя приемлемо даже под состязательным давлением, при необычных или пограничных входных данных и запросах, специально спроектированных, чтобы вызвать вредное поведение, — это тема, которой напрямую посвящена следующая глава. Правда, эта глава — ещё не последняя остановка в этой части: после того как alignment и безопасность будут разобраны, глава 4.7 обратится к более узкой практической задаче — как вообще дообучать модель, если вы не можете позволить себе обновлять весь набор её параметров, — и лишь после этого часть передаст эстафету Части V.
10. Взгляд с точки зрения интервью
В: Что именно обучение с учителем на инструкциях даёт сверх одного предобучения и чего оно не достигает само по себе? Сильный ответ формулирует, что SFT смещает распределение выходов модели в сторону ответов в форме ассистента, следующих инструкциям, за счёт обучения на курируемых демонстрациях (инструкция, ответ) с той же функцией потерь для предсказания следующего токена, что и при предобучении, но сравнительно плохо обучает тонким сравнительным суждениям (какой из двух приемлемых ответов лучше), потому что написание достаточного числа демонстраций, покрывающих каждое такое различие, не масштабируется — именно этот пробел заполняет оптимизация предпочтений.
В: Зачем обучать отдельную модель вознаграждения вместо прямой оптимизации языковой модели против человеческих оценок? Сильный ответ объясняет, что сбор скалярной человеческой оценки для каждого кандидатного ответа в объёме, необходимом для оптимизации в стиле RL, непрактичен, тогда как попарные сравнения дёшево и надёжно собирать от людей; обучение модели вознаграждения на этих попарных сравнениях (с помощью функции потерь в духе Брэдли-Терри) даёт автоматически вычисляемый прокси для понятия «насколько хорош этот ответ», который можно запрашивать так часто, как нужно, во время цикла оптимизации политики, чего никакая разметка людьми в реальном времени поддержать не смогла бы.
В: Почему RLHF нуждается в штрафе за KL-дивергенцию относительно исходной SFT-политики и что конкретно идёт не так без него? Сильный ответ прямо называет «взлом вознаграждения»: без ограничения политика может дрейфовать в области пространства выходов, которые получают искусственно высокую оценку от несовершенной, обученной модели вознаграждения, не будучи на самом деле хорошими по стандартам, которые модель вознаграждения должна была аппроксимировать, поскольку модель вознаграждения — лишь приближение, обученное на конечных данных, и уязвимо. Штраф за KL-дивергенцию удерживает политику вблизи распределения SFT-модели, где суждения модели вознаграждения остаются более заслуживающими доверия, ценой некоторой потенциальной оценки модели вознаграждения.
В: Как DPO обходится без отдельной модели вознаграждения или цикла RL и действительно ли она решает ту же самую проблему, что и RLHF? Сильный ответ набрасывает перепараметризацию: цель максимизации вознаграждения с ограничением по KL-дивергенции имеет замкнутую связь между оптимальной политикой и её неявной функцией вознаграждения, так что подстановка этой связи в функцию потерь обучения модели вознаграждения даёт функцию потерь, выраженную напрямую через параметры самой политики, оптимизируемую обычным градиентным спуском в стиле обучения с учителем на парах предпочтений. Следует также чётко указать, что это не эвристический обходной путь: при предположениях статьи она нацелена на ту же самую базовую цель с ограничением по KL-дивергенции, что и RLHF, просто через более стабильный путь оптимизации.
В: Что на самом деле показывает результат FLAN об обобщении при инструктивном дообучении и почему это важно для того, как проектировать датасет для инструктивного дообучения? Сильный ответ формулирует, что обобщение на невиданные задачи улучшалось с разнообразием задач, оформленных как инструкции, в дообучении, а не просто с объёмом примеров для какой-либо одной задачи, из чего следует, что хорошо спроектированный датасет для инструктивного дообучения должен отдавать приоритет широкому покрытию типов задач, а не глубокому покрытию какой-либо узкой задачи, если цель — обобщение на новые инструкции на этапе развёртывания.
В: Зачем вообще возиться с PPO, если rejection sampling (дообучение best-of-$n$) настолько проще и стабильнее? Сильный ответ отмечает, что rejection sampling может лишь выбирать среди ответов, которым текущая политика уже приписывает некоторую вероятность, — он может подтянуть политику к её же лучшим выходам, но не может открыть по-настоящему лучшую стратегию ответа так, как в принципе может обновление RL, напрямую подстраивающее параметры политики по сигналу вознаграждения. На практике команды часто используют rejection sampling как более дешёвый первый этап, оставляя полноценный RL (или DPO) для выжимания дальнейших улучшений, а не считают один из них строго превосходящим другой сам по себе.
В: Что конкретно GRPO убирает из PPO и чем это приходится платить взамен? Сильный ответ называет value-сеть: PPO обучает отдельного критика для оценки базового решения в расчёте преимущества, что примерно удваивает вычисления и память шага RL; GRPO заменяет это обученное базовое решение эмпирическим средним вознаграждением сэмплированной группы завершений на один и тот же запрос, нормированным на стандартное отклонение группы. Цена — более шумная оценка преимущества для любого отдельного запроса, если не сэмплировать группу достаточного размера, то есть вычисления на шаг обмениваются на сигнал с несколько более высокой дисперсией.
11. Вопросы для самопроверки
- Почему «правдоподобно продолжает текст» — это содержательно иная способность, чем «полезно отвечает на вопрос и останавливается», даже если обе могут возникать из цели предсказания следующего токена?
- Какую функцию потерь фактически использует обучение с учителем на инструкциях и что конкретно меняется по сравнению с предобучением?
- Что эксперименты FLAN предполагают в качестве реальной движущей силы улучшенного обобщения в режиме zero-shot после инструктивного дообучения?
- Почему попарные сравнения — более практичная форма человеческой обратной связи для сбора в масштабе, чем скалярные оценки или полные письменные демонстрации?
- Объясните «взлом вознаграждения» в контексте RLHF и конкретный механизм (штраф за KL-дивергенцию), используемый для его смягчения.
- Каков ключевой математический ход, позволяющий DPO заменить модель вознаграждения и цикл RL единой функцией потерь в стиле обучения с учителем?
- Какое узкое место решает RLAIF и каков базовый механизм, который он для этого использует?
- Почему дообучение методом rejection sampling ровно настолько же стабильно, как обычное обучение с учителем, тогда как полный RLHF — известно как нет?
- Какой конкретный компонент GRPO убирает по сравнению с PPO и чем заменяет его для оценки преимущества?
12. Источники
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). Training Language Models to Follow Instructions with Human Feedback (InstructGPT). NeurIPS 2022. arXiv:2203.02155. https://arxiv.org/abs/2203.02155
- Rafailov, R., Sharma, A., Mitchell, E., Ermon, S., Manning, C. D., & Finn, C. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023. arXiv:2305.18290. https://arxiv.org/abs/2305.18290
- Christiano, P., Leike, J., Brown, T., Martic, M., Legg, S., & Amodei, D. (2017). Deep Reinforcement Learning from Human Preferences. NeurIPS 2017. arXiv:1706.03741. https://arxiv.org/abs/1706.03741
- Schulman, J., Wolski, F., Dhariwal, P., Radford, A., & Klimov, O. (2017). Proximal Policy Optimization Algorithms. arXiv:1707.06347. https://arxiv.org/abs/1707.06347
- Wei, J., Bosma, M., Zhao, V. Y., et al. (2022). Finetuned Language Models Are Zero-Shot Learners (FLAN). ICLR 2022. arXiv:2109.01652. https://arxiv.org/abs/2109.01652
- Lee, H., Phatale, S., Mansoor, H., et al. (2023). RLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267. https://arxiv.org/abs/2309.00267
- Touvron, H., Martin, L., Stone, K., et al. (2023). Llama 2: Open Foundation and Fine-Tuned Chat Models. arXiv:2307.09288. https://arxiv.org/abs/2307.09288
- Shao, Z., Wang, P., Zhu, Q., et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models (вводит GRPO). arXiv:2402.03300. https://arxiv.org/abs/2402.03300