эффективная выборка
В 1913 году Марков сел считать буквы «Евгения Онегина» — двадцать тысяч штук, вручную, гласные и согласные[1]. Зачем он это делал, разобрано отдельно: он спорил с Некрасовым о том, обязателен ли для закона больших чисел независимый случай. Здесь другое. Опыт Маркова можно повторить, и это стоит сделать: сто лет спустя, на другом тексте, другого автора и другого века, машиной вместо руки. Взял «Золотого телёнка» — четыреста девяносто четыре тысячи букв против его двадцати тысяч.
тот же счёт, другая книга
Считается одно и то же: доля гласных и две условные вероятности — гласная после гласной и гласная после согласной.
| текст | доля гласных | P(г|г) | P(г|с) |
|---|---|---|---|
| «Онегин», 20 000 букв | 0.432 | 0.128 | 0.663 |
| «Золотой телёнок», 494 016 | 0.419 | 0.100 | 0.650 |
Стихи против прозы, 1833 против 1931, поэт против двух фельетонистов — а числа те же с точностью до второго знака. Это не про Пушкина и не про Ильфа с Петровым. Это свойство русского языка, и оно держится через век.
Сама возможность так проверить — уже кое-что. Столетний результат, полученный вручную на выборке в двадцать тысяч, воспроизводится на выборке в двадцать пять раз большей за секунду машинного времени. Повторяемость — единственное, что отличает измерение от впечатления, и здесь она предъявлена.
зависимость никуда не делась
Теперь посмотри на две условные вероятности внимательно. Будь буквы независимы, обе равнялись бы доле гласных — 0.419 и там, и там. А на деле после гласной гласная приходит в одном случае из десяти, после согласной — в двух из трёх.
Это очень сильная связь. Корреляция соседних букв — минус ноль пятьдесят пять. Знак отрицательный: язык чередует, буквы отталкиваются. Произнести подряд четыре гласных трудно, и статистика это знает.
Именно про такой случай Некрасов говорил, что закон больших чисел неприменим. Проверим.
и всё-таки сходится
Бегущее среднее — доля гласных в первых N буквах — ведёт себя послушно.
| первых букв | доля гласных | отклонение |
|---|---|---|
| 1 000 | — | 17 ‰ |
| 10 000 | — | 1.5 ‰ |
| 50 000 | — | 0.15 ‰ |
| 494 016 | 0.419 | — |
Садится на 0.419 и держится. Некрасов неправ, Марков прав, и это давно известно. Дальше начинается то, что известно меньше.
сходится быстрее, чем положено
Разбей текст на блоки по сто букв и посмотри, насколько разбросаны доли гласных внутри блоков. Для независимых величин разброс считается по формуле и даёт 0.049. Фактический — 0.023. Вдвое меньше.
Прочти это ещё раз. Зависимые данные дали не худшую точность, а лучшую, чем дали бы независимые. Сто букв романа говорят о языке больше, чем сказали бы сто букв, вытянутых из шляпы по одной.
Причина в знаке корреляции. Отрицательная связь гасит колебания: стоит случиться перекосу в сторону гласных, как следующая буква почти наверняка окажется согласной и перекос выправится сам. Последовательность обладает встроенным механизмом возврата к среднему. Положительная связь работала бы наоборот — перекос тянул бы за собой такой же перекос, и колебания копились бы.
сколько данных в данных
Величина, которая всё это описывает, называется эффективным размером выборки: сколько независимых наблюдений дало бы ту же точность, что твои зависимые.
ρ — корреляция соседних наблюдений
Для романа: ρ = −0.55, множитель 1.55 / 0.45 ≈ 3.4 — точность соответствует выборке во столько же раз большей. Триста букв работают как тысяча. При ρ = 0 множитель равен единице и формула исчезает — обычный случай независимости оказывается частным.
Обрати внимание, что происходит при положительной связи. При ρ = +0.55 множитель равен 0.45 / 1.55 ≈ 0.29: тысяча наблюдений работает как триста. Та же величина связи, тот же множитель — и противоположный смысл.
| ρ | множитель | тысяча наблюдений равна |
|---|---|---|
| −0.55 | 3.44 | 3 400 независимым |
| −0.20 | 1.50 | 1 500 |
| 0 | 1.00 | 1 000 |
| +0.20 | 0.67 | 670 |
| +0.55 | 0.29 | 290 |
где это встречается не в романах
Теперь неприятная часть. В тексте связь отрицательная и работает на тебя. Почти везде, где ты меряешь что-нибудь настоящее, связь положительная и работает против.
Пользователи в A/B-тесте зависимы: у одного человека несколько сессий, друзья попадают в одну группу, коллеги сидят за общим адресом. Наблюдения внутри такой группы похожи между собой сильнее, чем на случайные. Это положительная связь, и она означает, что твоя тысяча наблюдений — не тысяча.
Последствие конкретное. Доверительный интервал, посчитанный по формуле для независимых, окажется уже настоящего ровно на корень из множителя. Статистическая значимость, полученная так, завышена. Ты не подтасовывал — ты применил формулу, у которой не выполнено условие, и она честно ответила не на тот вопрос.
Хорошая новость в том, что множитель измерим. Корреляция внутри групп считается по тем же данным, и поправка на неё — арифметика в одну строку. Плохая в том, что её почти никогда не считают, потому что формула для независимых выглядит применимой всегда.
Та же история в наборе для оценки: если примеры в нём собраны из одного источника, они похожи, эффективный размер меньше номинального, и двести примеров дают точность полусотни. И в бутстрапе по временным рядам: перемешивать зависимые наблюдения как независимые — значит выбрасывать структуру, которая и определяет точность.
что доказал Марков
Вернёмся к спору. Некрасов утверждал, что закон больших чисел требует независимости. Марков ответил теоремой[2] и подтвердил её счётом.
Но теперь видно, что ответ был точнее спора. Закон требует не независимости, а затухающей памяти: чтобы далёкие члены последовательности переставали влиять друг на друга. Буква через сто позиций ничего не знает о текущей — этого достаточно. Ровно поэтому работают цепи Маркова, MCMC, бутстрап по блокам и всё, что считается на связанных данных.
А независимость оказалась не условием сходимости, а точкой отсчёта на шкале — той, где множитель равен единице. По одну сторону данные дешевле, чем кажутся, по другую дороже. Считать, что ты стоишь ровно в нуле, потому что так удобнее, — самый обычный способ ошибиться в цене.