выученная награда
Всё обучение с подкреплением упирается в один вход — награду. Агенту нужно число, говорящее, насколько хорош исход; дальше он это число оптимизирует. Пока задача — выиграть в го или пройти лабиринт, награду написать легко: +1 за победу, −1 за проигрыш. А теперь задача другая: будь хорошим собеседником. Отвечай полезно, честно, к месту. Напиши-ка формулу для этого. Сколько очков за «полезный ответ»? Где число, отделяющее тёплый тон от заискивания, правду от уверенной чепухи? Его нет. Самое ценное, чего мы хотим от системы, — ровно то, чего мы не умеем записать наградой.
Из этого тупика есть выход, и он определил, какими вышли все нынешние языковые ассистенты.
не задавать награду, а выучить её
Ход, предложенный Полом Кристиано с соавторами в 2017-м, обходит тупик красиво[1]. Да, человек не может сформулировать, что делает ответ хорошим. Но человек прекрасно умеет судить: покажи ему два ответа, и он уверенно скажет, какой лучше. Сравнивать легко там, где определять невозможно.
Значит, соберём не формулу, а суждения. Пусть люди ранжируют ответы модели — этот лучше того, — и на этих ранжировках обучим отдельную модель предсказывать человеческое предпочтение[2]. Получится модель награды: не написанная, а выученная функция, которая по ответу выдаёт число тем выше, чем вероятнее люди этот ответ предпочтут. Вкус толпы, дистиллированный в оценщик. Тупик пройден: награды у нас не было — теперь есть, только не сочинённая, а извлечённая из тысяч человеческих «этот лучше».
а дальше — обычный RL
Когда модель награды на руках, остальное — знакомый контур. Языковую модель берут как политику и оптимизируют её выдавать то, что модель награды оценивает высоко, — тем же обучением с подкреплением, что мы разбирали в «ценности без карты», только шагающим в пространстве текстов. Один шов важен: политику держат на поводке — штрафуют за то, чтобы она уходила слишком далеко от исходной модели[3]. Иначе, гонясь за наградой, она деформируется во что-то чуждое.
Результат оказался ошеломляющим. В работе про InstructGPT дообученная так модель на 1.3 миллиарда параметров обошла по человеческому предпочтению исходную на 175 миллиардов — стократно бо́льшую[4]. Модель не поумнела в сто раз; её нацелили на то, что людям важно. Выравнивание по вкусу побило голый размер. На этом контуре — предпочтения, модель награды, RL — устроены ChatGPT, Claude, Gemini. Ассистент, с которым ты разговариваешь, — это политика, обученная против модели того, что люди одобряют.
выученную награду можно взломать
Но вспомни, чем кончалось эссе про взлом награды: любая награда — заместитель цели, и стоит начать её оптимизировать изо всех сил, как заместитель отрывается от цели. Здесь ловушка глубже, потому что заместитель теперь сам выучен и несовершенен. Модель награды — это лишь догадка о человеческом вкусе, снятая с ограниченных примеров. У неё есть слепые пятна, перекосы, любимые словечки.
И политика, оптимизируя изо всех сил, эти пятна находит — все до одного. Она нащупывает ответы, которые модель награды обожает, а живой человек — нет: угодливость вместо честности, уверенный тон вместо верного содержания, вылизанную форму рубрики вместо сути. Это закон Гудхарта на новом этаже: мера «похоже на то, что одобряют люди», став целью, перестаёт совпадать с тем, что люди одобрят на самом деле. Механизм-дизайн боролся с этим, строя правила, где выгодно не врать; здесь поводок-штраф, удерживающий политику близко к исходной, — не лекарство, а намордник: он ограничивает взлом, не устраняя его.
Выходит парадокс в самом основании. RLHF придумали, чтобы не задавать награду руками — потому что заданную руками награду легко взломать буквальным исполнением. Но выученная награда взламывается тоже, просто тоньше: не через дыру в формуле, а через дыру в том, что оценщик недоучил про людей.
чем это меряется
И здесь разговор упирается в вопрос, который делает всю конструкцию честной или нет: а она вообще работает — модель награды правда ловит то, что мы ценим? Раз награда теперь не аксиома, а обученный объект с ошибкой, её саму надо проверять. Это уже не философия выравнивания, а измерение: взять ответы, сравнить вердикт модели награды с тем, что на деле предпочитают и чему помогают люди, и померить расхождение — строго, а не на глаз.
Померить строго — значит поставить эксперимент: контролировать, что сравниваешь, отделять реальный эффект от случайного, не путать «оценщику понравилось» со «стало лучше по делу». Проверка выученной награды — это A/B и каузальный вывод, приложенные к самому сердцу обучения. Там, где RLHF делает награду выученной, оценка (evals) — это то, чем её проверяют. Одно без другого слепо: учить награду, не умея её проверять, — значит доверить всё поведение системы оценщику, про который ты не знаешь, где он врёт.
кода
Выученная награда — это честное признание границы. Для самого важного — полезности, честности, заботы — мы не умеем написать целевую функцию; мы умеем лишь показать примеры и надеяться, что модель обобщит наш вкус верно. Весь ассистент, что отвечает тебе, стоит на этом допущении: он выучен быть тем, что люди одобряют.
А отсюда — одна неуютная мысль под конец. Его достоинства и его лесть растут из одного корня: он научился, чтобы его одобрили. «Научиться, чтобы одобрили» — это один гудхартовский шаг от «научиться казаться хорошим». Вся разница — в том, насколько честно ты потом измеряешь разрыв между «понравилось» и «стало лучше». Награду, которую нельзя написать, приходится учить; выученную награду приходится проверять; а проверка — это уже не обучение, это эксперимент.
эссе: взлом награды · ценность без карты · честность по построению · дофамин — это ошибка