null
эссе · §11 · обучение · агенты · ~13 минут · 2026.07

разведка и эксплуатация

дилемма всякого, кто учится: сорвать известное или искать лучшее

В q-learning было одно докучливое условие, без которого весь метод рушится: чтобы учиться, агент обязан иногда не брать лучший из известных ходов, а пробовать наугад. Условие кажется мелким, но за ним прячется самая общая дилемма всякого, кто действует в незнакомом мире. Дело в том, что любой твой выбор — это сразу две вещи, и они тянут в разные стороны. Это ставка: сделай то, что, насколько ты знаешь, приносит больше всего. И это опыт: сделай то, про что ты знаешь мало, чтобы узнать больше. Одно и то же действие не может быть и лучшей ставкой, и самым полезным опытом. Приходится выбирать, и выбор этот неустраним.

однорукие бандиты в ряд

Чистую форму дилеммы придумали называть задачей о многоруком бандите. Представь ряд игровых автоматов — «одноруких бандитов», — у каждого своя, неизвестная тебе щедрость. У тебя есть сколько-то попыток. Каждый раз ты решаешь одно: дёрнуть рычаг того автомата, что пока платил лучше всех, — или проверить тот, что ты почти не трогал.

Обе крайности проигрышны. Будешь только эксплуатировать лучшее известное — рискуешь до конца дёргать середняка, так и не узнав, что соседний автомат вдвое щедрее: ты закрепил первое приличное впечатление и ослеп к остальному. Будешь только разведывать — растратишь попытки на заведомых неудачников, хотя мог бы срывать с уже найденного хорошего. Правда посередине, но середина не статична: чем больше узнал, тем меньше нужно разведки. Гарри Роббинс придал этому строгую форму ещё в 1952-м[1], и с тех пор это один из краеугольных камней теории решений.

платить за знание нельзя перестать, можно лишь медленно

Насколько дорого обходится незнание? Мерят это сожалением — разницей между тем, что ты набрал, и тем, что набрал бы, дёргай ты с самого начала лучший автомат. И вот жёсткий результат: свести сожаление к нулю нельзя. Лай и Роббинс в 1985-м доказали, что у любой стратегии сожаление растёт по меньшей мере логарифмически с числом попыток[2]. Не линейно — это была бы катастрофа, — но и не останавливается никогда. Ты не можешь научиться бесплатно; можешь лишь платить за учёбу всё медленнее. Тот же логарифм, что в логарифме богатства превращает мультипликативную игру в честную, здесь ставит нижнюю цену на познание.

оптимизм как метод

Как же выбирать? Красивейший ответ звучит почти как жизненный совет: при равном отдавай предпочтение тому, о чём знаешь меньше. Формально это «оптимизм перед лицом неопределённости»[3]. У каждого автомата держи не одну оценку, а оценку с запасом на незнание: чем меньше ты его пробовал, тем выше поднимай его возможную щедрость. И выбирай по этой завышенной, оптимистичной оценке. Тогда сама его неизвестность толкает тебя проверить — не потому что он хорош, а потому что мог бы им оказаться, а ты ещё не убедился в обратном.

В этом есть тонкая мудрость. Сомнение здесь — не повод избегать, а повод попробовать. Незнание превращается из тормоза в приглашение: то, чего ты про мир не выяснил, автоматически получает фору, — и ты идёшь и выясняешь. Родственный приём, ещё старше, — просто тянуть автомат с вероятностью, равной твоей вере в то, что он лучший (Томпсон, 1933): веришь на треть, что он чемпион, — треть попыток ему и достаётся.

от клиники до карьеры

Родилась задача не в казино, а в больнице. Уильям Томпсон в 1933-м думал про клинические испытания: есть два лечения, какое лучше — неизвестно, а каждый пациент — это одновременно и шанс вылечить, и шанс узнать. Давать всем пока-лучшее — предаёшь тех, кому помогло бы второе, если оно на деле лучше. Испытывать поровну — сознательно недолечиваешь половину ради знания. Та же разведка против эксплуатации, только ценой человеческих исходов.

А дальше — она повсюду, стоит присмотреться. Любимый ресторан или новый. Знакомая профессия или поле, где ты, может, раскроешься сильнее. Поиск партнёра, где всякая новая встреча — и возможный выигрыш, и трата времени, которое утекает[4]. A/B-тест, в котором надо решить: докатить победивший вариант всем — или ещё поискать, вдруг есть лучше. Всякий раз, когда учишься на ходу, ты дёргаешь одноруких бандитов и платишь логарифмическую цену за то, чтобы узнать мир.

почему юным — разведка, а старым — добыча

У дилеммы есть поворот, объясняющий больше, чем ожидаешь. Сколько разведывать — зависит от того, сколько попыток у тебя ещё впереди. Нашёл автомат щедрее прежнего — выигрыш от находки ты собираешь всеми оставшимися попытками; чем их больше, тем сильнее окупается разведка.

Отсюда прямое следствие про жизнь. У молодого горизонт длинный — найденное лучшее он будет эксплуатировать десятилетиями, поэтому оптимально разведывать много: пробовать, менять, ошибаться. У старого горизонт короткий — на то, чтобы окупить новую находку, времени почти нет, поэтому оптимально держаться уже знакомого хорошего. Тяга юности к новому и любовь зрелости к привычному — не безрассудство против мудрости. Это одна и та же формула при разной длине остатка. Оптимальная доля разведки честно убывает с тем, сколько будущего у тебя ещё есть.

кода

Разведка — это цена не застрять. Она всегда чего-то стоит: каждая попытка, потраченная на неизвестное, — это упущенный верный выигрыш с уже найденного. Но отказаться платить эту цену ещё хуже: тогда ты будешь безупречно оптимизировать внутри мира, который так и не разглядел до конца, приняв первое приличное за лучшее.

У дилеммы нет решения начисто — есть только изящные. И все они, от оптимизма до Томпсона, делают в сердце один и тот же ход: считать неизвестное возможно прекрасным и потратить немного, чтобы проверить. Держать открытой догадку, что где-то есть автомат щедрее, — и время от времени дёргать его рычаг. Это та же опциональность: плата за то, чтобы дверь оставалась приоткрытой.

на полях

эссе: ценность без карты · опциональность · логарифм богатства

объекты: секретарь и оптимальная остановка

[1]Г. Роббинс, «Some aspects of the sequential design of experiments», Bull. Amer. Math. Soc. 58 (1952): 527–535 — формализация задачи о многоруком бандите и понятия сожаления. Ранее сэмплирующий подход предложил У. Томпсон (1933).
[2]Т. Лай, Г. Роббинс, «Asymptotically efficient adaptive allocation rules», Adv. Appl. Math. 6 (1985): 4–22: сожаление любой допустимой стратегии растёт не медленнее, чем логарифм числа шагов; существуют стратегии, эту нижнюю границу достигающие.
[3]«Оптимизм перед лицом неопределённости» — семейство методов верхней доверительной границы (UCB; П. Ауэр, Н. Чеза-Бьянки, П. Фишер, 2002). Оптимальную байесовскую стратегию для дисконтированного бандита даёт индекс Гиттинса (1979). Приём выбора по вероятности быть лучшим — сэмплирование Томпсона.
[4]Про исчерпание времени на поиск и оптимальный момент остановиться — в «секретаре и оптимальной остановке». Разведка ↔ эксплуатация роднится с ценностью держать опции открытыми (см. «опциональность»).
// ценность без картыБез разведки q-learning застревает в первом неплохом маршруте.