Глава 5.1 — Рассуждение и вычисления на этапе инференса
Содержание
- Продолжение с того места, где заканчивается обучение
- Chain-of-thought: способность, которая уже существовала
- Самосогласованность: устранение шума в отдельной цепочке рассуждений
- От приёма промптинга к цели обучения
- Обучение с подкреплением на проверяемых наградах
- DeepSeek-R1: прозрачное практическое исследование
- o1 и публичное появление масштабирования вычислений на этапе инференса
- Взгляд с точки зрения собеседования
- Вопросы для самопроверки
- Источники
1. Продолжение с того места, где заканчивается обучение
Часть IV завершилась намеренно тревожной нотой: хорошо предобученная, хорошо выровненная модель «завершена» лишь для тех возможностей, которые существовали на момент заморозки её обучающих данных и завершения прохода RLHF или DPO. Всё, о чём говорилось в той части — токенизация, цель предобучения, законы масштабирования, распределённое обучение, оптимизация предпочтений, — описывает, как превратить вычисления и данные в фиксированный набор весов. Как только обучение останавливается, веса перестают меняться. Но оказывается, что веса кодируют больше, чем раскрывает единственный жадный прямой проход, и последние несколько лет разработки LLM были во многом посвящены другому рычагу, отличному от увеличения числа параметров или объёма предобучающих токенов: тому, сколько вычислений модели позволено потратить на этапе инференса, на один запрос, прежде чем она зафиксирует ответ. Эта глава — про этот рычаг и про то, как он превратился из любопытного приёма промптинга в полноценную цель обучения сама по себе.
Это важно по той же причине, по которой были важны законы масштабирования из главы 4.3: это меняет то, что значит «больше». Законы масштабирования описывают отношение между вычислениями на обучение, размером модели, данными и функцией потерь. Вычисления на этапе инференса описывают вторую, во многом независимую ось: для фиксированной модели насколько лучше она может справиться с задачей, если позволить ей «думать» дольше? Эти две оси дополняют, а не конкурируют друг с другом, и зрелое понимание возможностей передовых LLM теперь требует рассуждений об обеих сразу.
2. Chain-of-thought: способность, которая уже существовала
Первая наглядная демонстрация того, что одно лишь поведение на этапе инференса способно раскрыть значительный прирост возможностей без каких-либо изменений весов модели, пришла от промптинга chain-of-thought («цепочка рассуждений»). Wei и соавторы (2022) показали, что если промптировать достаточно большую языковую модель несколькими разобранными примерами, включающими явные промежуточные шаги рассуждения — а не просто вопросом, за которым сразу следует ответ, — точность модели на задачах многошаговой арифметики, здравого смысла и символьного рассуждения существенно возрастает, иногда с почти случайного уровня до значительно превышающего базовый. При этом в самой модели ничего не менялось. Изменилась только форма запрашиваемого вывода: вместо того чтобы сразу переходить к краткому итоговому ответу, модель побуждали сначала выписать правдоподобный ход рассуждения, токен за токеном, а затем сформулировать ответ.
Почему это вообще должно помогать, если параметры модели идентичны в обоих случаях? Авторегрессивная факторизация из главы 1.1 даёт механический ответ: $P(x_i \mid x_1, \ldots, x_{i-1})$ обусловлена всем сгенерированным до сих пор, включая собственные предыдущие токены модели. Когда модель вынуждена отвечать немедленно, ей нужно произвести правильный итоговый токен по сути «за один присест», без промежуточных вычислений, вынесенных в контекстное окно, на которое она затем могла бы опираться. Когда же ей разрешено сначала сгенерировать промежуточное рассуждение, каждый шаг рассуждения становится дополнительным контекстом, на который может опираться предсказание следующего шага, — модель, по сути, использует собственный вывод как черновое пространство, распределяя одно сложное предсказание с высокой дисперсией на множество более простых предсказаний следующего токена с низкой дисперсией. Это важно именно потому, что подразумевает: базовая способность предсказания следующего токена, заложенная в весах во время предобучения, уже содержала скрытую способность к рассуждению, которую краткий, «прямой» промптинг просто никогда не выявлял. Способность уже была; узким местом был метод её извлечения.
Этот вывод также переосмыслил само понятие «способности» применительно к языковой модели. Компетентность модели — не единственное фиксированное число, определяемое только весами, а функция весов и процедуры инференса вместе. Это переосмысление — концептуальное зерно всего остального в этой главе.
3. Самосогласованность: устранение шума в отдельной цепочке рассуждений
У промптинга chain-of-thought есть очевидная слабость: отдельная сэмплированная цепочка рассуждений может сбиться с пути на любом шаге, и один неверный шаг обычно портит итоговый ответ, даже если базовой компетентности модели было достаточно для решения задачи. Wang и соавторы (2022) предложили уточнение, рассматривающее это как проблему сэмплирования, а не проблему промптинга: вместо генерации одной цепочки рассуждений на вопрос, сэмплируется несколько независимых цепочек (с использованием температуры или nucleus-сэмплирования для разнообразия), из каждой цепочки извлекается итоговый ответ, и по ним проводится голосование большинством. Это называется самосогласованностью (self-consistency), и она существенно повысила точность на бенчмарках рассуждений по сравнению с жадным или однократным сэмплированием chain-of-thought.
Статистическая интуиция становится прозрачной, как только цепочку рассуждений рассматривают как скрытую переменную, которую нужно устранить суммированием (маргинализировать). Формально chain-of-thought трактует ответ $a$ как зависящий от вопроса $q$ через скрытый путь рассуждения $r$: $P(a \mid q) = \sum_r P(a \mid r, q) P(r \mid q)$. Одна жадная или сэмплированная цепочка — это одна выборка из $P(r \mid q)$, и обусловливание ответа этой единственной выборкой — оценка истинного маргинального распределения с высокой дисперсией. Сэмплирование множества цепочек и голосование по итоговым ответам напрямую аппроксимирует эту маргинализацию — это метод Монте-Карло, применённый к путям рассуждения вместо, скажем, оценки математического ожидания в градиенте политики. Ошибки, идиосинкратические для конкретного сэмплированного пути (арифметическая описка, неверное разбиение на случаи), как правило, не коррелируют между независимыми выборками, поэтому они гасятся при голосовании, тогда как «сигнал» — действительно валидные пути рассуждения — усиливает сам себя, поскольку несколько независимых валидных путей склонны сходиться к одному и тому же правильному ответу. Это та же логика, что заставляет работать ансамблирование или бэггинг в классической статистике, здесь применённая к собственному стохастическому рассуждению модели, а не к независимо обученным моделям.
Самосогласованность также — первое появление в этой книге паттерна, который становится центральным далее в главе: расходование большего количества вычислений на этапе инференса (больше сэмплов, больше сгенерированных токенов) как прямой, управляемый способ «купить» больше точности без переобучения. Это примитивная форма масштабирования вычислений на этапе инференса, обнаруженная как приём промптинга и сэмплирования ещё до того, как она была осмыслена как общая парадигма.
Tree-of-thought, предложенный Yao с соавторами, обобщает ту же самую интуицию — сэмплировать больше, не привязываться к одному пути — в явную процедуру поиска, а не в независимые цепочки, голосующие лишь в самом конце. Вместо генерации полных цепочек рассуждения и агрегации их итоговых ответов, tree-of-thought рассматривает рассуждение как поиск по дереву частичных мыслей: на каждом шаге модель генерирует несколько кандидатных продолжений уже имеющегося рассуждения, шаг оценки (модель, оценивающая собственный частичный прогресс, или эвристика) оценивает, насколько перспективным выглядит каждый частичный путь, и поиск дальше исследует более перспективные ветви, отсекая остальные, с возможностью отката назад, если ветвь, казавшаяся перспективной, оказывается тупиком. Это даёт то, чего не может дать структура самосогласованности «независимые цепочки, затем голосование»: возможность отказаться от плохого направления на полпути, а не только после генерации полной, возможно, впустую потраченной цепочки, — ценой необходимости в явной функции оценки и более дорогой процедуре поиска на задачу.
4. От приёма промптинга к цели обучения
Промптинг chain-of-thought и самосогласованность трактуют рассуждение как нечто, что извлекается из замороженной, уже обученной модели за счёт хитрой процедуры на этапе инференса — лучших промптов, лучшего сэмплирования и агрегации. Они не меняют то, для чего модель была обучена. Естественный следующий вопрос, определяющий нынешний передний край, таков: что если обучить модель специально производить длинные, эффективные, исследовательские цепочки рассуждений, вместо того чтобы полагаться на приёмы этапа инференса, наложенные поверх модели, изначально не оптимизированной для такого поведения?
Этот сдвиг важен потому, что промптинг способен извлечь только те паттерны рассуждения, которые уже скрыто присутствуют в предобученном распределении, примерно в той форме, в какой они выражены в обучающих данных. Написанный людьми текст в интернете в основном показывает завершённое рассуждение — чистые выводы, уверенные заключения, — а не запутанный, исследовательский процесс их получения: ложные старты, самокоррекцию, возврат назад, проверку промежуточного результата другим методом. Если некая способность действительно полезна (заметить собственную арифметическую ошибку в середине вывода, отказаться от бесперспективного подхода на полпути), но редко явно моделируется в данных предобучения, никакой промптинг не заставит модель делать это надёжно, потому что базовое распределение просто не выделяет этому большой вероятностной массы. Решение — сделать само длинное рассуждение модели объектом процесса оптимизации, а не чем-то, реконструированным из имитации написанного людьми текста.
5. Обучение с подкреплением на проверяемых наградах
Рецепт обучения, возникший для решения этой задачи, опирается на конкретное свойство определённых предметных областей: проверяемость. Для задач по математике и многих задач по программированию можно проверить, верен ли итоговый ответ — совпадает ли числовой ответ, проходит ли модульный тест, — дёшево, автоматически и однозначно, без необходимости в человеке-оценщике или обученной модели вознаграждения того рода, что используется в RLHF (глава 4.5). Это принципиальное отличие от постановки RLHF, где сигнал вознаграждения исходит от модели, обученной имитировать человеческие суждения о предпочтениях, и потому является шумным, дорогим для получения в большом масштабе и уязвимым для «взлома вознаграждения» (reward hacking). Проверяемая награда — скомпилировался ли код и прошёл ли тесты, равно ли итоговое число, заключённое в рамку, эталонному значению, — близка к истине по построению.
Стоит точно понимать, какого рода это проверяемая награда: это награда за итог (outcome reward), проверяющая только итоговый ответ, а каждый промежуточный шаг рассуждения получает оценку неявно и одинаково — через то, какой кредит доверия обновление RL относит назад от этого единственного финального сигнала. Модели вознаграждения за процесс (process reward models, PRM), детально изученные Lightman с соавторами, идут противоположным путём: обучают модель оценивать корректность каждого отдельного шага в цепочке рассуждения, а не только итоговый ответ, используя пометки корректности на уровне шагов, сделанные человеком или моделью, и используют этот более плотный, пошаговый сигнал для обучения вместо (или наряду с) разреженного сигнала за итог. Lightman с соавторами обнаружили, что супервизия процесса измеримо превосходит супервизию итога на сложных математических бенчмарках, — рассуждение в том, что плотная, пошаговая награда даёт модели полезный градиентный сигнал даже на траекториях, в конце концов приходящих к неверному итоговому ответу, вместо того чтобы считать всю длинную цепочку одинаково (не)вознаграждённой просто потому, что последнее число оказалось неверным. Цена в том, что PRM заново вносит ровно ту хрупкость, которой проверяемая награда за итог была призвана изначально избежать: это обученная модель пошаговой корректности, а не программно проверяемый оракул, так что её можно обмануть, и она требует дорогих пометок на уровне шагов для обучения, — именно поэтому RL с наградой за итог в областях с дешёвой, автоматической проверкой итогового ответа стало более масштабируемым выбором по умолчанию, который описывает этот раздел, а PRM остаются активной областью исследований там, где более плотный обучающий сигнал стоит этой цены.
Это открывает цикл обучения с подкреплением, структурно похожий на PPO-оптимизацию RLHF, но с моделью вознаграждения, заменённой оракулом, проверяемым программой: политика (языковая модель) генерирует длинную цепочку рассуждения, за которой следует итоговый ответ, эта цепочка вместе с ответом автоматически оценивается верификатором, и политика обновляется так, чтобы повысить вероятность траекторий, приводящих к проверенно верным ответам. Поскольку награда дешёвая и надёжная, этот цикл можно запускать в масштабе, недостижимом при моделировании вознаграждения с участием человека в цикле, и поскольку ничто в нём не зависит от имитации фиксированного набора человеческих демонстраций, модель свободна открывать собственные стратегии рассуждения — включая длинные цепочки с самокоррекцией, проверкой альтернативным методом и отказом от бесперспективных направлений — до тех пор, пока эти стратегии повышают вероятность в конечном счёте прийти к проверенно верному ответу. Что принципиально важно: после такого обучения модель больше не нужно промптировать для производства цепочек рассуждения на этапе инференса — их производство теперь просто то, что она делает по умолчанию, а длина цепочки становится естественной, усвоенной величиной, зависящей от сложности конкретной задачи, а не фиксированным шаблоном промптинга.
Это технический стержень парадигмы «масштабирования вычислений на этапе инференса»: размер модели и вычисления на предобучение (глава 4.3) определяют одну ось возможностей, а объём вычислений на этапе инференса, который модель решает потратить на генерацию цепочки рассуждения перед ответом, определяет вторую, во многом ортогональную ось. Меньшая модель, которой позволено рассуждать дольше, на некоторых задачах может сравняться с большей моделью, вынужденной отвечать немедленно, или превзойти её — а это имеет реальные последствия для того, как практикующий специалист должен рассматривать компромисс между размером, задержкой и точностью в продакшен-системах — тема, к которой книга вернётся в главе о проектировании систем в части VI.
6. DeepSeek-R1: прозрачное практическое исследование
DeepSeek-R1 (DeepSeek-AI, 2025) заслуживает пристального изучения, потому что это один из наиболее прозрачных публичных отчётов о том, как этот рецепт обучения реально работает на передовом масштабе, описанный достаточно подробно, чтобы рассуждать о нём конкретно, а не через язык рекламных постов в блогах. Заявленный рецепт применяет крупномасштабное обучение с подкреплением на проверяемых наградах — корректность решений математических и программистских задач, проверяемая автоматически — непосредственно к базовой модели, без промежуточного этапа supervised fine-tuning того рода, что обычно используется для того, чтобы сначала научить модель выдавать хорошо оформленный, следующий инструкциям вывод. Конкретный алгоритм RL — GRPO (глава 4.5), и это во многом объясняет, почему этот рецепт доступен по цене на том масштабе, на котором его запустила DeepSeek-AI: вся суть конструкции GRPO — устранить отдельную сеть значения PPO, оценивая преимущество токена по относительным вознаграждениям сэмплированной группы завершений на один и тот же промпт, а это имеет огромное значение именно здесь, поскольку такой цикл RL на проверяемых наградах уже и так генерирует и оценивает много длинных цепочек рассуждения на промпт, — GRPO получает свою базовую линию по сути бесплатно из той же самой партии сэмплов, вместо того чтобы требовать целую вторую обученную сеть для её предоставления. Поразительное эмпирическое утверждение состоит в том, что поведение, напоминающее осмысленное, исследовательское мышление — пересмотр моделью подхода, проверка ею собственной работы, выделение больше генерации на более сложные подзадачи, — возникает из самого этого процесса RL как следствие оптимизации проверенной корректности на длинных траекториях, а не задаётся вручную или дистиллируется из уже способной к рассуждению модели. DeepSeek-AI также сообщает об этапе дистилляции, переносящем паттерны рассуждения, усвоенные крупной моделью, обученной с помощью RL, в меньшие плотные модели посредством supervised fine-tuning на выводах большей модели, — и это само по себе важный практический момент: имея сильного «учителя» рассуждения, распространение этого поведения на меньшие, более дешёвые модели не требует повторения дорогостоящего процесса RL с нуля.
Для понимания на уровне собеседования важные выводы из DeepSeek-R1 — не конкретные цифры бенчмарков, а структурные утверждения: RL на проверяемых наградах, применённое напрямую и в большом масштабе, достаточно для того, чтобы вызвать длинные, эффективные цепочки рассуждения без вручную составленных демонстраций chain-of-thought; получившееся поведение переносится через дистилляцию; и весь рецепт представляет собой вложение на этапе обучения, окупающееся как управляемый бюджет вычислений на этапе инференса.
7. o1 и публичное появление масштабирования вычислений на этапе инференса
o1 от OpenAI — модель, сделавшая эту парадигму широко видимой за пределами исследовательского сообщества, во многом превратив «модель думает, прежде чем ответить, и видно, что на это уходит больше времени» из исследовательской сноски в массовый продуктовый опыт. Стоит быть точным, для целей собеседования, насчёт того, что здесь можно и что нельзя цитировать: исходное анонсирование o1 «Learning to Reason with LLMs» было постом в блоге, а не рецензируемой статьёй или статьёй, индексированной на arXiv, и его не следует цитировать как таковую. Цитируемый академический документ — это более поздний o1 System Card (OpenAI, 2024), который является уместной ссылкой при обсуждении заявленной оценки безопасности и характеристик возможностей o1 таким образом, чтобы за этим стоял реальный след цитирования. Это различие — между тем, что лаборатория объявляет публично, и тем, что реально доступно как проверяемый, цитируемый технический документ, — само по себе полезная вещь, о которой стоит помнить при обсуждении передовых возможностей на техническом собеседовании, поскольку ошибочное представление поста в блоге как «статьи об o1» — это лёгкая и вполне избегаемая неточность.
Конкретное эмпирическое утверждение, стоящее за «масштабированием вычислений на этапе инференса», сделанное конкретным в собственной отчётности OpenAI об o1, — это кривая, напрямую аналогичная законам масштабирования предобучения из главы 4.3: если отложить точность решения задачи против объёма вычислений, потраченных на этапе инференса (примерно — количества сэмплированных токенов рассуждения), связь оказывается гладкой и улучшающейся, а не ступенчатой функцией и не быстро выходящей на плато. Это и есть тот точный смысл, в котором вычисления на этапе инференса описываются как вторая, в значительной степени ортогональная ось масштабирования по отношению к вычислениям предобучения, — не просто «более длинные ответы иногда помогают», а кривая той же самой хорошо ведущей себя формы «продолжай платить больше — продолжай улучшаться», которая изначально и мотивировала вкладывать всё больше вычислений в предобучение, только теперь доступная как ручка, которую практик может крутить на каждый запрос по отдельности, а не только один раз, на этапе обучения, для всех будущих запросов, которые модель когда-либо обслужит.
Взятые вместе, промптинг chain-of-thought, самосогласованность, RL на проверяемых наградах и публичное появление таких моделей, как o1 и DeepSeek-R1, прослеживают единую линию развития: способность к рассуждению, которую изначально приходилось выманивать из замороженной модели с помощью хитрого промптинга, за несколько лет превратилась в нечто, тренируемое напрямую как поведение модели по умолчанию, причём объём «размышления» на этапе инференса стал осознанным, настраиваемым ресурсом. Этот сдвиг меняет то, как знания модели используются в момент ответа, но никак не меняет то, что модель знает изначально — её параметрическая память остаётся столь же замороженной и столь же ненадёжной, какой была в конце предобучения. Это ограничение и стандартное инженерное решение для него — тема, с которой начинается следующая глава.
8. Взгляд с точки зрения собеседования
Вопрос: Почему промптинг chain-of-thought повышает точность, если веса модели никогда не меняются? Сильный ответ прямо ссылается на авторегрессивную факторизацию: каждый сгенерированный токен обусловлен всеми предыдущими токенами, включая собственные ранее сгенерированные токены модели. Требование немедленного ответа предполагает получение верного вывода за один прямой проход без вынесенных наружу промежуточных вычислений; разрешение промежуточного рассуждения позволяет модели использовать собственный сгенерированный контекст как черновое пространство, превращая одно сложное предсказание в последовательность более простых, обусловленных предсказаний. Базовая способность уже была скрыто заложена в предобученном распределении; формат промптинга «прямой ответ» просто не мог её извлечь.
Вопрос: Чем самосогласованность отличается от простой просьбы к модели «перепроверить свою работу» за один проход? Сильный ответ формулирует это как маргинализацию скрытой переменной пути рассуждения методом Монте-Карло — несколько независимых цепочек, голосование большинством по извлечённому ответу, — в отличие от одной генерации с самокритикой, которая по-прежнему остаётся одной выборкой и наследует её идиосинкратические ошибки. Также стоит отметить компромисс по стоимости: самосогласованность умножает стоимость инференса на число сэмплированных цепочек.
Вопрос: В чём реальное отличие между chain-of-thought на основе промптинга и парадигмой «модели рассуждения», обученной с помощью RL (o1, DeepSeek-R1)? Сильный ответ различает извлечение и обучение: chain-of-thought и самосогласованность извлекают скрытое поведение модели исключительно через процедуру на этапе инференса, без обновлений градиента, и ограничены теми паттернами рассуждения, которые уже слабо присутствуют в предобученном распределении. RL на проверяемых наградах напрямую оптимизирует модель на производство эффективных длинных цепочек рассуждения как поведения по умолчанию, позволяя ей открывать стратегии рассуждения, слабо представленные в данных предобучения, и делает саму длину цепочки усвоенной, управляемой величиной, а не артефактом промптинга.
Вопрос: Почему проверяемый сигнал вознаграждения — это такое большое дело по сравнению с моделями вознаграждения, используемыми в RLHF? Сильный ответ отмечает, что модели вознаграждения RLHF сами являются обученными приближениями человеческих предпочтений, обученными на конечном, шумном наборе человеческих суждений, и уязвимы для взлома вознаграждения (материал глав 4.4–4.6 из части IV). Проверяемая награда — корректность математического ответа, прохождение набора тестов — близка к истине по построению, дёшева в вычислении в большом масштабе и не требует разметки с участием человека в цикле, что и делает возможным RL в масштабе, непрактичном при использовании одних лишь обученных моделей вознаграждения. Сильный ответ также отмечает компромисс: проверяемые награды существуют только для областей с проверяемой истиной, поэтому эта парадигма сильнее всего проявляется в математике и программировании и менее напрямую применима к открытой генерации.
Вопрос: Если у меня есть фиксированный бюджет задержки на инференс, как мне думать о размере модели против вычислений на этапе инференса? Сильный ответ рассматривает их как два отдельных рычага вдоль разных осей поверхности возможностей, описанной законами масштабирования из главы 4.3, и отмечает, что меньшая модель с большим бюджетом на рассуждение иногда может сравняться с большей моделью, отвечающей немедленно, что имеет прямые последствия для компромиссов между стоимостью, задержкой и точностью в продакшен-системе — тема, к которой книга вновь обращается в главе о проектировании систем части VI.
9. Вопросы для самопроверки
- Используя факторизацию по цепному правилу из главы 1.1, объясните механически, почему генерация промежуточных токенов рассуждения перед итоговым ответом может изменить вероятность, которую модель присваивает верному итоговому ответу, даже если веса не меняются.
- Какую скрытую переменную маргинализирует самосогласованность и с помощью какой процедуры оценивания?
- Почему промптинг chain-of-thought способен извлечь только те паттерны рассуждения, которые уже скрыто присутствовали в предобучающем распределении, и почему это ограничение, которое обучение на основе RL решает иначе?
- Что делает сигнал вознаграждения «проверяемым» и почему проверяемость важна для масштаба, в котором можно проводить обучение RL?
- В чём заключается ключевое структурное утверждение заявленного рецепта DeepSeek-R1, независимо от конкретных цифр бенчмарков?
- Почему неточно ссылаться на исходное анонсирование o1 как на академическую статью, и какой документ является правильным для цитирования?
- В каком смысле масштабирование вычислений на этапе инференса и законы масштабирования предобучения из главы 4.3 являются «ортогональными» осями возможностей?
10. Источники
- Wei, J., Wang, X., Schuurmans, D., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022. arXiv:2201.11903. https://arxiv.org/abs/2201.11903
- Wang, X., Wei, J., Schuurmans, D., et al. (2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR 2023. arXiv:2203.11171. https://arxiv.org/abs/2203.11171
- Yao, S., Yu, D., Zhao, J., Shafran, I., Griffiths, T. L., Cao, Y., & Narasimhan, K. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. NeurIPS 2023. arXiv:2305.10601. https://arxiv.org/abs/2305.10601
- Lightman, H., Kosaraju, V., Burda, Y., et al. (2023). Let's Verify Step by Step (модели вознаграждения за процесс). arXiv:2305.20050. https://arxiv.org/abs/2305.20050
- DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948. https://arxiv.org/abs/2501.12948
- OpenAI (2024). OpenAI o1 System Card. arXiv:2412.16720. https://arxiv.org/abs/2412.16720 (примечание: исходное анонсирование «Learning to Reason with LLMs» было только постом в блоге, не публиковалось на arXiv)