дофамин — это ошибка
Во всём q-learning всё держалось на одной величине — на TD-ошибке, разнице между тем, что ты ожидал, и тем, что получил. Не на самой награде, а на её расхождении с прогнозом: именно на эту разницу агент подправлял свои оценки. Убери её — и учиться нечем. Так вот, у тебя в голове эту же величину кто-то считает. Химически, прямо сейчас. Её зовут дофамином.
Про дофамин ходит красивая и почти полностью неверная легенда: молекула удовольствия, гормон награды, то, что заливает мозг в миг кайфа. На этой легенде построена целая индустрия советов про «дофаминовые детоксы». Настоящий дофамин устроен и умнее, и холоднее. Он сигналит не награду. Он сигналит ошибку в её предсказании.
обезьяна, сок и три случая
Показал это Вольфрам Шульц, десятилетиями вживлявший электроды в дофаминовые нейроны бодрствующих обезьян[1]. Картина сложилась из трёх случаев, и она переворачивает легенду.
Случай первый: обезьяне без предупреждения дают каплю сока. Дофаминовые нейроны выдают всплеск. Пока всё как в легенде — награда, вспышка.
Случай второй: перед соком начинают включать сигнал — тон. Раз за разом тон, потом сок. И происходит странное: всплеск уезжает назад во времени. Нейроны загораются теперь на тон — а в момент, когда приходит сам сок, молчат. Награда та же, сок тот же, но дофамина на нём больше нет.
Случай третий: тон прозвучал, обезьяна ждёт сок — а его не дают. И тут дофамин не просто молчит: его уровень проваливается ниже обычного, ровно в тот миг, когда сок должен был появиться[2].
Сложи три случая. Дофамин отвечает не на награду, а на сюрприз: скачет вверх, когда вышло лучше ожидаемого; молчит, когда всё как ждали; падает вниз, когда вышло хуже. Это не детектор награды. Это детектор расхождения — насколько мир оказался лучше или хуже, чем ты про него думал.
это буквально TD-ошибка
Тут в историю вошли не нейробиологи, а вычислители. Питер Дайан и Рид Монтегю посмотрели на данные Шульца глазами информатики — и узнали фигуру[3]. Три знака дофаминового сигнала (вверх на неожиданном, ноль на предсказанном, вниз на несбывшемся) — это в точности три знака ошибки предсказания награды из обучения с подкреплением. Той самой TD-ошибки Саттона и Барто. Той самой скобки [ r + γ·V(s′) − V(s) ], на которую q-learning подправляет свои оценки.
И самая тонкая деталь сходится идеальнее всего — уезд сигнала на предвестник. В TD-обучении, когда состояние надёжно предсказывает будущую награду, ценность перетекает назад: сигнал ошибки смещается с награды на самый ранний намёк, который её предвещает. Обезьяний мозг сделал ровно это — перенёс вспышку с сока на тон. Не аналогия, не «похоже»: та же математика, шаг в шаг.
Вывод, от которого трудно отмахнуться: мозг — обучающийся с подкреплением. Он оценивает состояния, действует, ловит расхождение и правит оценки на эту ошибку. Дофамин — не радость и не приз, а та самая скобка, только из плоти: красный карандаш учителя, который говорит одно — «ты ошибся в прогнозе, подвинь оценку». Эволюция вписала TD-обучение в средний мозг за сотни миллионов лет до того, как Саттон записал его формулой.
почему радость выцветает
У этого есть следствия, которые ты чувствовал на себе, не зная механизма.
Первое — почему счастье не держится. Новая машина, новая должность, новая любовь бьют дофамином, пока они неожиданны. Но мозг быстро учится их предсказывать — и, как сок после тона, предсказанное благо перестаёт давать сигнал. Радость не убывает от того, что вещь испортилась; она убывает от того, что вещь стала ожидаемой. Ты гонишься не за наградой, а за сюрпризом, а сюрприз по определению нельзя запасти. Беговая дорожка удовольствия — это не изъян характера, это устройство сигнала: он считает разницу, а к разнице привыкают.
Второе — почему учишься именно на неожиданном. Там, где всё пошло по прогнозу, ошибка ноль — и правится нечего: мозг проходит мимо. Учит тебя не то, что случилось, а то, что случилось не так, как ты ждал. Ровно как агент, который не трогает оценку, если TD-ошибка обратилась в ноль. Скучное подтверждение известного не двигает ничего; двигает промах прогноза.
кода
Скобку, которую мы вывели для машины, — ожидаемое минус случившееся — твоя голова считает миллионы лет. Ты, на химическом уровне, и есть q-обучающийся агент, которого эволюция написала задолго до Уоткинса, и дофамин в тебе — не приз, а сигнал ошибки, велящий подвинуть оценку мира ближе к правде.
И в этом есть особая, почти суровая честность механизма. То, что ощущается как желание, как азарт, как беспокойный голод по следующему, — это не поломка и не жадность. Это учитель внутри, вечно считающий, насколько ты промахнулся. Он не обещает счастья. Он обещает обучение — и оплачивает его той самой валютой, которую нельзя накопить: удивлением. Когда этот сигнал захватывают извне — см. взлом награды.
эссе: ценность без карты · взлом награды · игры тренируют машины · разведка и эксплуатация