null
эссе · §11 · обучение · агенты · ~11 минут · 2026.07

дофамин — это ошибка

мозг бежит тот же алгоритм, что и q-learning

Во всём q-learning всё держалось на одной величине — на TD-ошибке, разнице между тем, что ты ожидал, и тем, что получил. Не на самой награде, а на её расхождении с прогнозом: именно на эту разницу агент подправлял свои оценки. Убери её — и учиться нечем. Так вот, у тебя в голове эту же величину кто-то считает. Химически, прямо сейчас. Её зовут дофамином.

Про дофамин ходит красивая и почти полностью неверная легенда: молекула удовольствия, гормон награды, то, что заливает мозг в миг кайфа. На этой легенде построена целая индустрия советов про «дофаминовые детоксы». Настоящий дофамин устроен и умнее, и холоднее. Он сигналит не награду. Он сигналит ошибку в её предсказании.

обезьяна, сок и три случая

Показал это Вольфрам Шульц, десятилетиями вживлявший электроды в дофаминовые нейроны бодрствующих обезьян[1]. Картина сложилась из трёх случаев, и она переворачивает легенду.

Случай первый: обезьяне без предупреждения дают каплю сока. Дофаминовые нейроны выдают всплеск. Пока всё как в легенде — награда, вспышка.

Случай второй: перед соком начинают включать сигнал — тон. Раз за разом тон, потом сок. И происходит странное: всплеск уезжает назад во времени. Нейроны загораются теперь на тон — а в момент, когда приходит сам сок, молчат. Награда та же, сок тот же, но дофамина на нём больше нет.

Случай третий: тон прозвучал, обезьяна ждёт сок — а его не дают. И тут дофамин не просто молчит: его уровень проваливается ниже обычного, ровно в тот миг, когда сок должен был появиться[2].

Сложи три случая. Дофамин отвечает не на награду, а на сюрприз: скачет вверх, когда вышло лучше ожидаемого; молчит, когда всё как ждали; падает вниз, когда вышло хуже. Это не детектор награды. Это детектор расхождения — насколько мир оказался лучше или хуже, чем ты про него думал.

это буквально TD-ошибка

Тут в историю вошли не нейробиологи, а вычислители. Питер Дайан и Рид Монтегю посмотрели на данные Шульца глазами информатики — и узнали фигуру[3]. Три знака дофаминового сигнала (вверх на неожиданном, ноль на предсказанном, вниз на несбывшемся) — это в точности три знака ошибки предсказания награды из обучения с подкреплением. Той самой TD-ошибки Саттона и Барто. Той самой скобки [ r + γ·V(s′) − V(s) ], на которую q-learning подправляет свои оценки.

И самая тонкая деталь сходится идеальнее всего — уезд сигнала на предвестник. В TD-обучении, когда состояние надёжно предсказывает будущую награду, ценность перетекает назад: сигнал ошибки смещается с награды на самый ранний намёк, который её предвещает. Обезьяний мозг сделал ровно это — перенёс вспышку с сока на тон. Не аналогия, не «похоже»: та же математика, шаг в шаг.

Вывод, от которого трудно отмахнуться: мозг — обучающийся с подкреплением. Он оценивает состояния, действует, ловит расхождение и правит оценки на эту ошибку. Дофамин — не радость и не приз, а та самая скобка, только из плоти: красный карандаш учителя, который говорит одно — «ты ошибся в прогнозе, подвинь оценку». Эволюция вписала TD-обучение в средний мозг за сотни миллионов лет до того, как Саттон записал его формулой.

почему радость выцветает

У этого есть следствия, которые ты чувствовал на себе, не зная механизма.

Первое — почему счастье не держится. Новая машина, новая должность, новая любовь бьют дофамином, пока они неожиданны. Но мозг быстро учится их предсказывать — и, как сок после тона, предсказанное благо перестаёт давать сигнал. Радость не убывает от того, что вещь испортилась; она убывает от того, что вещь стала ожидаемой. Ты гонишься не за наградой, а за сюрпризом, а сюрприз по определению нельзя запасти. Беговая дорожка удовольствия — это не изъян характера, это устройство сигнала: он считает разницу, а к разнице привыкают.

Второе — почему учишься именно на неожиданном. Там, где всё пошло по прогнозу, ошибка ноль — и правится нечего: мозг проходит мимо. Учит тебя не то, что случилось, а то, что случилось не так, как ты ждал. Ровно как агент, который не трогает оценку, если TD-ошибка обратилась в ноль. Скучное подтверждение известного не двигает ничего; двигает промах прогноза.

кода

Скобку, которую мы вывели для машины, — ожидаемое минус случившееся — твоя голова считает миллионы лет. Ты, на химическом уровне, и есть q-обучающийся агент, которого эволюция написала задолго до Уоткинса, и дофамин в тебе — не приз, а сигнал ошибки, велящий подвинуть оценку мира ближе к правде.

И в этом есть особая, почти суровая честность механизма. То, что ощущается как желание, как азарт, как беспокойный голод по следующему, — это не поломка и не жадность. Это учитель внутри, вечно считающий, насколько ты промахнулся. Он не обещает счастья. Он обещает обучение — и оплачивает его той самой валютой, которую нельзя накопить: удивлением. Когда этот сигнал захватывают извне — см. взлом награды.

на полях

эссе: ценность без карты · взлом награды · игры тренируют машины · разведка и эксплуатация

[1]В. Шульц, Университет Фрибурга: регистрация одиночных дофаминовых нейронов в среднем мозге бодрствующих макак (с 1980-х). Ключевая сводка — W. Schultz, P. Dayan, P. R. Montague, «A neural substrate of prediction and reward», Science 275 (1997): 1593–1599.
[2]Три отклика одного нейрона: активация на непредсказанную награду (положительная ошибка), отсутствие отклика на полностью предсказанную (нулевая ошибка), угнетение ниже базовой частоты при пропуске ожидаемой награды (отрицательная ошибка).
[3]П. Р. Монтегю, П. Дайан, Т. Сейновски, «A framework for mesencephalic dopamine systems based on predictive Hebbian learning», J. Neurosci. 16 (1996): 1936–1947. Отклик дофамина на предвещающий стимул — это TD-ошибка: намёк на будущую награду означает внезапный рост ожидаемой ценности. TD-обучение — Р. Саттон, Э. Барто.
// ценность без картыTD-ошибка в q-learning — та же скобка, что дофамин в мозге.