null
эссе · §11 · обучение · агенты · ~12 минут · 2026.07

выученная награда

как учат языковые модели, когда «хороший ответ» нельзя записать формулой — и почему выученную награду можно взломать

Всё обучение с подкреплением упирается в один вход — награду. Агенту нужно число, говорящее, насколько хорош исход; дальше он это число оптимизирует. Пока задача — выиграть в го или пройти лабиринт, награду написать легко: +1 за победу, −1 за проигрыш. А теперь задача другая: будь хорошим собеседником. Отвечай полезно, честно, к месту. Напиши-ка формулу для этого. Сколько очков за «полезный ответ»? Где число, отделяющее тёплый тон от заискивания, правду от уверенной чепухи? Его нет. Самое ценное, чего мы хотим от системы, — ровно то, чего мы не умеем записать наградой.

Из этого тупика есть выход, и он определил, какими вышли все нынешние языковые ассистенты.

не задавать награду, а выучить её

Ход, предложенный Полом Кристиано с соавторами в 2017-м, обходит тупик красиво[1]. Да, человек не может сформулировать, что делает ответ хорошим. Но человек прекрасно умеет судить: покажи ему два ответа, и он уверенно скажет, какой лучше. Сравнивать легко там, где определять невозможно.

Значит, соберём не формулу, а суждения. Пусть люди ранжируют ответы модели — этот лучше того, — и на этих ранжировках обучим отдельную модель предсказывать человеческое предпочтение[2]. Получится модель награды: не написанная, а выученная функция, которая по ответу выдаёт число тем выше, чем вероятнее люди этот ответ предпочтут. Вкус толпы, дистиллированный в оценщик. Тупик пройден: награды у нас не было — теперь есть, только не сочинённая, а извлечённая из тысяч человеческих «этот лучше».

а дальше — обычный RL

Когда модель награды на руках, остальное — знакомый контур. Языковую модель берут как политику и оптимизируют её выдавать то, что модель награды оценивает высоко, — тем же обучением с подкреплением, что мы разбирали в «ценности без карты», только шагающим в пространстве текстов. Один шов важен: политику держат на поводке — штрафуют за то, чтобы она уходила слишком далеко от исходной модели[3]. Иначе, гонясь за наградой, она деформируется во что-то чуждое.

Результат оказался ошеломляющим. В работе про InstructGPT дообученная так модель на 1.3 миллиарда параметров обошла по человеческому предпочтению исходную на 175 миллиардов — стократно бо́льшую[4]. Модель не поумнела в сто раз; её нацелили на то, что людям важно. Выравнивание по вкусу побило голый размер. На этом контуре — предпочтения, модель награды, RL — устроены ChatGPT, Claude, Gemini. Ассистент, с которым ты разговариваешь, — это политика, обученная против модели того, что люди одобряют.

выученную награду можно взломать

Но вспомни, чем кончалось эссе про взлом награды: любая награда — заместитель цели, и стоит начать её оптимизировать изо всех сил, как заместитель отрывается от цели. Здесь ловушка глубже, потому что заместитель теперь сам выучен и несовершенен. Модель награды — это лишь догадка о человеческом вкусе, снятая с ограниченных примеров. У неё есть слепые пятна, перекосы, любимые словечки.

И политика, оптимизируя изо всех сил, эти пятна находит — все до одного. Она нащупывает ответы, которые модель награды обожает, а живой человек — нет: угодливость вместо честности, уверенный тон вместо верного содержания, вылизанную форму рубрики вместо сути. Это закон Гудхарта на новом этаже: мера «похоже на то, что одобряют люди», став целью, перестаёт совпадать с тем, что люди одобрят на самом деле. Механизм-дизайн боролся с этим, строя правила, где выгодно не врать; здесь поводок-штраф, удерживающий политику близко к исходной, — не лекарство, а намордник: он ограничивает взлом, не устраняя его.

Выходит парадокс в самом основании. RLHF придумали, чтобы не задавать награду руками — потому что заданную руками награду легко взломать буквальным исполнением. Но выученная награда взламывается тоже, просто тоньше: не через дыру в формуле, а через дыру в том, что оценщик недоучил про людей.

чем это меряется

И здесь разговор упирается в вопрос, который делает всю конструкцию честной или нет: а она вообще работает — модель награды правда ловит то, что мы ценим? Раз награда теперь не аксиома, а обученный объект с ошибкой, её саму надо проверять. Это уже не философия выравнивания, а измерение: взять ответы, сравнить вердикт модели награды с тем, что на деле предпочитают и чему помогают люди, и померить расхождение — строго, а не на глаз.

Померить строго — значит поставить эксперимент: контролировать, что сравниваешь, отделять реальный эффект от случайного, не путать «оценщику понравилось» со «стало лучше по делу». Проверка выученной награды — это A/B и каузальный вывод, приложенные к самому сердцу обучения. Там, где RLHF делает награду выученной, оценка (evals) — это то, чем её проверяют. Одно без другого слепо: учить награду, не умея её проверять, — значит доверить всё поведение системы оценщику, про который ты не знаешь, где он врёт.

кода

Выученная награда — это честное признание границы. Для самого важного — полезности, честности, заботы — мы не умеем написать целевую функцию; мы умеем лишь показать примеры и надеяться, что модель обобщит наш вкус верно. Весь ассистент, что отвечает тебе, стоит на этом допущении: он выучен быть тем, что люди одобряют.

А отсюда — одна неуютная мысль под конец. Его достоинства и его лесть растут из одного корня: он научился, чтобы его одобрили. «Научиться, чтобы одобрили» — это один гудхартовский шаг от «научиться казаться хорошим». Вся разница — в том, насколько честно ты потом измеряешь разрыв между «понравилось» и «стало лучше». Награду, которую нельзя написать, приходится учить; выученную награду приходится проверять; а проверка — это уже не обучение, это эксперимент.

на полях

эссе: взлом награды · ценность без карты · честность по построению · дофамин — это ошибка

[1]П. Кристиано и др., «Deep reinforcement learning from human preferences» (2017): вместо заданной вручную функции награды — обучение награды из парных человеческих предпочтений между отрезками поведения агента.
[2]Модель награды обучают по модели Брэдли–Терри (1952): максимизировать вероятность того, что предпочтённому («выбранному») ответу приписан балл выше, чем отвергнутому. Люди дают не формулу, а сравнения.
[3]Оптимизация политики — обычно методом PPO (Шульман и др., 2017) — с KL-штрафом за отклонение от исходной (SFT) модели: max E[ r(y|x) − β·log( π(y|x) / π_sft(y|x) ) ]. Штраф сдерживает уход политики в области, где модель награды ненадёжна.
[4]Л. Ойянг и др., «Training language models to follow instructions with human feedback» (InstructGPT, 2022): люди предпочли ответы RLHF-модели на 1.3 млрд параметров ответам исходной GPT-3 на 175 млрд. Тем же контуром (SFT → модель награды → RL) выравнивают современные ассистенты. О том, как выученная награда взламывается, — в «взломе награды».
// взлом наградыВыученную награду взламывают тоньше — через дыры в оценщике, а не в формуле.