null
эссе · §05 · случайность · симуляция · ~12 минут · 2026.08

эффективная выборка

зависимость не отменяет сходимость — она меняет цену данных, и знак решает, в чью пользу

В 1913 году Марков сел считать буквы «Евгения Онегина» — двадцать тысяч штук, вручную, гласные и согласные[1]. Зачем он это делал, разобрано отдельно: он спорил с Некрасовым о том, обязателен ли для закона больших чисел независимый случай. Здесь другое. Опыт Маркова можно повторить, и это стоит сделать: сто лет спустя, на другом тексте, другого автора и другого века, машиной вместо руки. Взял «Золотого телёнка» — четыреста девяносто четыре тысячи букв против его двадцати тысяч.

тот же счёт, другая книга

Считается одно и то же: доля гласных и две условные вероятности — гласная после гласной и гласная после согласной.

текстдоля гласныхP(г|г)P(г|с)
«Онегин», 20 000 букв0.4320.1280.663
«Золотой телёнок», 494 0160.4190.1000.650

Стихи против прозы, 1833 против 1931, поэт против двух фельетонистов — а числа те же с точностью до второго знака. Это не про Пушкина и не про Ильфа с Петровым. Это свойство русского языка, и оно держится через век.

Сама возможность так проверить — уже кое-что. Столетний результат, полученный вручную на выборке в двадцать тысяч, воспроизводится на выборке в двадцать пять раз большей за секунду машинного времени. Повторяемость — единственное, что отличает измерение от впечатления, и здесь она предъявлена.

зависимость никуда не делась

Теперь посмотри на две условные вероятности внимательно. Будь буквы независимы, обе равнялись бы доле гласных — 0.419 и там, и там. А на деле после гласной гласная приходит в одном случае из десяти, после согласной — в двух из трёх.

Это очень сильная связь. Корреляция соседних букв — минус ноль пятьдесят пять. Знак отрицательный: язык чередует, буквы отталкиваются. Произнести подряд четыре гласных трудно, и статистика это знает.

Именно про такой случай Некрасов говорил, что закон больших чисел неприменим. Проверим.

и всё-таки сходится

Бегущее среднее — доля гласных в первых N буквах — ведёт себя послушно.

первых буквдоля гласныхотклонение
1 00017 ‰
10 0001.5 ‰
50 0000.15 ‰
494 0160.419

Садится на 0.419 и держится. Некрасов неправ, Марков прав, и это давно известно. Дальше начинается то, что известно меньше.

сходится быстрее, чем положено

Разбей текст на блоки по сто букв и посмотри, насколько разбросаны доли гласных внутри блоков. Для независимых величин разброс считается по формуле и даёт 0.049. Фактический — 0.023. Вдвое меньше.

Прочти это ещё раз. Зависимые данные дали не худшую точность, а лучшую, чем дали бы независимые. Сто букв романа говорят о языке больше, чем сказали бы сто букв, вытянутых из шляпы по одной.

Причина в знаке корреляции. Отрицательная связь гасит колебания: стоит случиться перекосу в сторону гласных, как следующая буква почти наверняка окажется согласной и перекос выправится сам. Последовательность обладает встроенным механизмом возврата к среднему. Положительная связь работала бы наоборот — перекос тянул бы за собой такой же перекос, и колебания копились бы.

сколько данных в данных

Величина, которая всё это описывает, называется эффективным размером выборки: сколько независимых наблюдений дало бы ту же точность, что твои зависимые.

n_эфф = n × (1 − ρ) / (1 + ρ)
ρ — корреляция соседних наблюдений

Для романа: ρ = −0.55, множитель 1.55 / 0.45 ≈ 3.4 — точность соответствует выборке во столько же раз большей. Триста букв работают как тысяча. При ρ = 0 множитель равен единице и формула исчезает — обычный случай независимости оказывается частным.

Обрати внимание, что происходит при положительной связи. При ρ = +0.55 множитель равен 0.45 / 1.55 ≈ 0.29: тысяча наблюдений работает как триста. Та же величина связи, тот же множитель — и противоположный смысл.

ρмножительтысяча наблюдений равна
−0.553.443 400 независимым
−0.201.501 500
01.001 000
+0.200.67670
+0.550.29290

где это встречается не в романах

Теперь неприятная часть. В тексте связь отрицательная и работает на тебя. Почти везде, где ты меряешь что-нибудь настоящее, связь положительная и работает против.

Пользователи в A/B-тесте зависимы: у одного человека несколько сессий, друзья попадают в одну группу, коллеги сидят за общим адресом. Наблюдения внутри такой группы похожи между собой сильнее, чем на случайные. Это положительная связь, и она означает, что твоя тысяча наблюдений — не тысяча.

Последствие конкретное. Доверительный интервал, посчитанный по формуле для независимых, окажется уже настоящего ровно на корень из множителя. Статистическая значимость, полученная так, завышена. Ты не подтасовывал — ты применил формулу, у которой не выполнено условие, и она честно ответила не на тот вопрос.

Хорошая новость в том, что множитель измерим. Корреляция внутри групп считается по тем же данным, и поправка на неё — арифметика в одну строку. Плохая в том, что её почти никогда не считают, потому что формула для независимых выглядит применимой всегда.

Та же история в наборе для оценки: если примеры в нём собраны из одного источника, они похожи, эффективный размер меньше номинального, и двести примеров дают точность полусотни. И в бутстрапе по временным рядам: перемешивать зависимые наблюдения как независимые — значит выбрасывать структуру, которая и определяет точность.

что доказал Марков

Вернёмся к спору. Некрасов утверждал, что закон больших чисел требует независимости. Марков ответил теоремой[2] и подтвердил её счётом.

Но теперь видно, что ответ был точнее спора. Закон требует не независимости, а затухающей памяти: чтобы далёкие члены последовательности переставали влиять друг на друга. Буква через сто позиций ничего не знает о текущей — этого достаточно. Ровно поэтому работают цепи Маркова, MCMC, бутстрап по блокам и всё, что считается на связанных данных.

А независимость оказалась не условием сходимости, а точкой отсчёта на шкале — той, где множитель равен единице. По одну сторону данные дешевле, чем кажутся, по другую дороже. Считать, что ты стоишь ровно в нуле, потому что так удобнее, — самый обычный способ ошибиться в цене.

поля
[1]А. А. Марков, «Пример статистического исследования над текстом „Евгения Онегина“, иллюстрирующий связь испытаний в цепь» (1913). Двадцать тысяч букв, размеченных и посчитанных вручную.
[2]А. А. Марков, «Распространение закона больших чисел на величины, зависящие друг от друга» (1906) — теорема; подсчёт по «Онегину» появился семью годами позже как её иллюстрация.
[3]Отношение фактической дисперсии среднего к дисперсии при независимой выборке того же объёма называют эффектом плана (design effect); понятие введено Лесли Кишем в работах по выборочным обследованиям, «Survey Sampling» (1965). Формула (1 + ρ)/(1 − ρ) — частный случай для последовательности с корреляцией только между соседями. Эффект плана — величина, обратная множителю из формулы n_эфф: при ρ = −0.55 множитель 3.44, эффект плана 0.29.
[4]Счёт по «Золотому телёнку» (1931): 494 016 букв кириллицы после нормализации, гласными считались а, е, ё, и, о, у, ы, э, ю, я.
// Андрей Марков и «Евгений Онегин»Зачем он считал буквы и с кем спорил.