null
эссе · §12 · оценка · измерение · ~12 минут · 2026.07

оценка как эксперимент

всякая оценка — скрытый эксперимент; оценивать честно — значит подозревать собственный вердикт

В «выученной награде» всё кончилось одной строкой: проверить выученную награду — это уже эксперимент. Разверни её шире, и она накроет куда больше, чем языковые модели. Оценка чего угодно — ответа, модели, решения, кандидата, лекарства — ощущается как вердикт: ты смотришь, судишь, ставишь балл. Вот это ощущение и есть ловушка. Всякая оценка — это на самом деле скрытый эксперимент: утверждение, что вот это лучше вон того или что вот это работает, — и она тащит за собой все требования строгости, какие есть у экспериментов, и все способы, какими эксперименты врут.

оценить — значит оценить эффект

Приглядись к любой оценке, и под ней обнаружится оценка эффекта. «Хорош ли ответ?» — по сравнению с каким? «Стало ли лучше?» — чем было бы иначе? «Этот кандидат сильнее?» — сильнее кого при прочих равных? Оценка всегда меряет разницу — между «с» и «без», между этим и альтернативой. А разница без явной базы сравнения — это не измерение, это впечатление в костюме числа.

И вот первая, самая частая подмена: ты сравниваешь не с контролем, а со своим ожиданием. Балл, который ты ставишь, меряет не качество вещи, а зазор между вещью и тем, чего ты от неё ждал. Два оценщика с разными ожиданиями поставят разное одному и тому же — и оба будут звать это объективной оценкой.

как оценка врёт

Если оценка — эксперимент, то она проваливается ровно в тех же местах, что любой эксперимент, и все эти места на сайте уже описаны — просто под другими вывесками.

Нет контроля — и причины путаются. Поменял разом и промпт, и модель, увидел прирост — а что сработало, неизвестно; ты приписал эффект чему захотел[1]. Судья предвзят — и прибор искажает то, что мерит. Судья-модель систематически любит ответы подлиннее и те, что стоят первыми; судья-человек заякорен первым впечатлением и порядком показа. Оценивая, ты всегда подмешиваешь измеритель в измеряемое[2]. Метрику начинают оптимизировать — и она перестаёт мерить. Стоит сделать оценку целью, как её научатся набивать в обход качества: это закон Гудхарта, тот же, что взламывает награду[3]. Тропа ветвится — и случайность выдаёт себя за сигнал. Прогони достаточно вариантов оценки, нарежь данные достаточно способами — и один срез засияет великолепием просто по случайности[4]. И, наконец, оценка по исходу вместо оценки по существу: решение судят по тому, чем оно кончилось, а не по тому, было ли оно верным при том, что было известно тогда[5]. Удача выдаётся за качество, провал — за ошибку.

Каждая из этих ловушек превращает вердикт в самообман, надевший мантию строгости.

что значит оценивать всерьёз

Оценивать всерьёз — значит строить оценку как эксперимент, а не выносить её как приговор. Заранее объявить гипотезу: что именно должно оказаться лучше и на сколько. Задать базу — с чем честно сравнивать. Развести сравниваемое так, чтобы отличалось одно, а не всё сразу. Решить, что меришь, до того как посмотрел на результат, — иначе глаз сам найдёт, где выигрыш. Набрать достаточно, чтобы отличить разницу от шума, и прямо спросить статистику: а это точно не случайность? И держать под подозрением самого судью.

Тогда вердикт перестаёт быть «баллом». Он становится баллом за вычетом всего, что могло его подделать, — а это совсем другая, куда более скромная величина. Честная оценка почти всегда тише и осторожнее наивной; громкий однозначный вердикт — обычно признак того, что эксперимента не было, было впечатление.

кто оценит оценщика

Есть у этого и дно, к которому стоит спуститься хотя бы на шаг. Если что хорошо, а что плохо, решает судья — человек ли, модель ли, метрика ли, — то судья сам по себе непроверенный прибор. Откуда ты знаешь, что его вердикт вообще совпадает с реальной ценностью? Это не риторический вопрос, а ещё один эксперимент: взять случаи, где ценность видна независимо, и померить, насколько судья с ней расходится. Откалибровать оценщика.

Дальше — черепахи вниз: калибрует оценщика тоже какой-то оценщик, и его тоже стоило бы проверить. До конца эту лестницу не пройти, и не надо; но честная практика — спуститься хотя бы на этаж, а не принимать вердикт верхнего судьи за истину только потому, что он верхний. Большинство громких оценок обваливаются уже на первом вопросе «а судью-то кто мерил».

кода

Оценка кажется концом исследования — тем самым моментом, когда ты наконец знаешь, хорошо оно или нет. На деле всё наоборот: это ещё один эксперимент, и самый коварный из всех, потому что единственный носит маску готового ответа. Остальные эксперименты выглядят как вопросы; оценка выглядит как вердикт — и потому её реже всего перепроверяют.

Оценивать честно — значит держать собственное суждение за гипотезу и идти искать, чем оно неверно. Мера хорошего оценщика — не уверенность в своих баллах, а строгость, с которой он в них сомневается. Кто умеет усомниться в собственном вердикте и проверить его как чужой, тот и оценивает; остальные — впечатляются.

на полях

эссе: выученная награда · причинность · A/B-тест · взлом награды · калибровка

[1]О разделении причин и о честном сравнении с контролем — в «причинности» и «a/b-тесте». Прирост, у которого нет базы сравнения, приписывается на вкус наблюдателя.
[2]Систематические перекосы судьи: модель-оценщик предпочитает более длинные и стоящие первыми ответы; человек подвержен якорению и эффекту порядка. Прибор нельзя считать прозрачным окном — он часть измерения. Ср. «матрицу ошибок».
[3]Метрика, ставшая целью, перестаёт быть хорошей метрикой (закон Гудхарта). Как оптимизатор взламывает оценку изнутри — в «взломе награды»; как строить правила, устойчивые к этому, — в «честности по построению».
[4]Многократный выбор способа оценки и нарезки данных раздувает шанс ложного «успеха» — см. «ветвящиеся тропы» и кризис воспроизводимости. Защита — предрегистрация: фиксировать метрику и гипотезу до взгляда на данные.
[5]Оценка решения по исходу, а не по процессу, — в «хороших решениях». Верное при известном тогда решение может кончиться плохо, и наоборот; путать их — значит награждать удачу.
// выученная наградаПроверить выученную награду — это уже эксперимент; здесь — общая рамка оценки.