Почему всегда долго: парадокс инспекции
Содержание
Каждый вечер в супермаркете вы умудряетесь выбрать самую медленную кассу — ту, где кто-то достаёт кошелёк, потом монетку, потом купоны. И автобус, кажется, принципиально приходит «раз в полчаса», хотя по расписанию стоит каждые десять минут. Чувство, что мир ополчился против вас, знакомо каждому. Забавно, что у этого чувства есть точное математическое объяснение — парадокс инспекции, и оно куда увлекательнее теории заговора.
О чём статья
Разберёмся, почему наблюдатель систематически видит «худшую» сторону случайности: длинные интервалы, медленные кассы, переполненные лифты. Спойлер: дело не в вас — дело в том, как вы попадаете в выборку.
Как вы оказались «в самом худшем месте»
Представьте два способа измерить, как долго люди ждут лифт.
- Способ № 1 — «диспетчер»
- Сесть на 20-й этаж и смотреть на табло, записывая время ожидания при «вызове» из кабинета диспетчера.
- Способ № 2 — «наблюдатель»
- Нажать кнопку лифта и с секундомером ждать его на своём этаже, повторяя это много дней подряд.
Первый способ — дисциплинированная выборка: вы смотрите на все поездки равномерно. Второй — инспекционная: вы наблюдаете ровно тот интервал, в который случилось угодить. И интуиция подсказывает, что они должны давать одинаковый ответ. Это не так. Во втором случае вы с гарантией увидите больше, потому что сами выбираете интервал не случайно, а пропорционально его длине.
Строгое расписание: парадокса ещё нет
Начнём с честного случая — автобус приходит ровно каждые 10 минут, секунда в секунду. Если вы приходите на остановку в случайный момент времени, то с равной вероятностью попадёте в любую точку десятиминутного окна между рейсами:
Всё честно: среднее ожидание — половина интервала, а интервал — ровно «как по расписанию». Расписание строгое — парадокса нет, средние сходятся.
| Что измеряем | Как измеряем | Средний результат |
|---|---|---|
| Расписание «как видит диспетчер» | Равномерный сбор всех интервалов | 10 минут |
| Ожидание пассажира | Приход в случайный момент | 5 минут |
| Интервал «как видит пассажир» | В какой интервал попал | 10 минут |
Никакого разочарования. Проблема начинается, когда интервалы перестают быть одинаковыми.
Интервалы «плывут»: вот здесь появляется парадокс
Реальный город не соблюдает расписание. Пробка, красная волна светофоров, дождь — и интервалы становятся разной длины: один рейс через минуту, другой через двадцать. И вот тут кроется главный трюк инспекции:
Вы попадёте в интервал с вероятностью, пропорциональной его длине.
Если интервалов по 10 минут — десять штук, а один «везучий» длится 40 минут, то шанс оказаться именно в нём в четыре раза выше, чем в любом коротком. Именно поэтому кажется, что «всегда попадается самый длинный перерыв»: не потому что он длинный, а потому что длинный интервал занимает на временной оси больше места, и вы физически чаще «приземляетесь» в него.
Короткий интервал (1 мин) — маленькая мишень: вы успеете в него попасть только если придёте в его уникальную минуту.
Длинный интервал (20 мин) — огромная мишень: треть всего часа он доступен, шанс угодить в него выше в 20 раз.
Математически это называется смещение по длине (length bias) и описывается одной карточкой-формулой:
Средний интервал, который «застаёт» случайный наблюдатель:
Среднее арифметическое E[T] — это то, что видит «диспетчер». А E[T^2]/E[T] — то, что реально видит вы. Разница между ними — и есть парадокс инспекции.
Почему так? Когда вы приходите в случайный момент, шанс оказаться в конкретном интервале пропорционален времени, которое этот интервал занимает — то есть его длине. Усреднение идёт по длине, а не по числу интервалов: длинные в выборке весят больше. Следите за руками:
Для одинаковых интервалов T_1=\dots=T_n числитель равен n \cdot t^2, знаменатель — n \cdot t, и результат честные t. Но как только появляется разброс, E[T^2] > (E[T])^2 всегда, поэтому наблюдаемый интервал всегда длиннее среднего на бумаге. Парадокс не в том, что вас преследуют: парадокс в том, что выборка не может быть нечестной математически.
Хуже всего — поток Пуассона
Самый пессимистичный, но и самый реалистичный случай: рейсы приходят независимо — как, например, случайные звонки в колл-центр или сбои. Тогда интервалы распределены экспоненциально:
что на практике означает: 1) коротких интервалов большинство, 2) длинные хвосты случаются чаще, чем хотелось бы, 3) распределение не помнит прошлого.
Вот как это выглядит. Кривая «интервалы» — честное распределение промежутков между рейсами. «Попавший в интервал» — то, что видите вы. «Ожидание после прихода» — остаток до следующего рейса:
На графике две захватывающие вещи:
- Вы систематически попадаете в интервалы длиной около 20 минут — вдвое больше «бумажного» среднего в 10 минут (серая пунктирная линия). Красный горб не совпадает с синим: вы видите не то распределение, которое «реально есть».
- Оранжевая кривая совпадает с синей — печально-прекрасная ирония. Для пуассоновского потока среднее ожидание следующего рейса равно среднему интервалу (10 минут), как будто вы пришли ровно после отправления. У экспоненциального распределения нет памяти: сколько бы вы ни стояли, автобус «не помнит», что вы ждёте, и средний оставшийся срок всегда 1/\lambda.
Для экспоненты E[T^2] = 2/\lambda^2, поэтому:
— ровно вдвое больше среднего интервала. Вы не воображаете: при «случайном» расписании интервал, в который вы попадаете, в среднем в два раза длиннее того, что обещает расписание.
Остаток после прихода тоже экспоненциален. Свойство отсутствия памяти:
— сколько бы времени вы уже простояли, «свежее» ожидание не меняется. Именно поэтому бесконечное раздражение и автобус, который «специально» долго.
Парадокс инспекции вокруг вас
Это не только про лифты и автобусы. Смещение по длине встречается везде, где наблюдение «собирается» из процесса, а не диспетчерским мониторингом:
Перегруженные кассы — чем дольше люди стоят, тем дольше касса «видна». Мимо проходящие видят её занятой чаще, чем она занята на самом деле.
Популярные посты — «мнения людей» взвешены не по людям, а по просмотрам: длинные и громкие посты видят больше. Вы читаете «самые популярные», потому что они дольше висели в ленте.
Знакомства и интервью — на «сколько дольше всех держится пара» набираются те, кто дольше всех и держится: развод не успевает попасть в выборку.
А вот таблица «среднее на бумаге» против «среднее глазами наблюдателя» — обратите внимание, как расходятся числа:
| Процесс | «Диспетчер» видит | «Наблюдатель» видит | Разница |
|---|---|---|---|
| Автобус, Пуассон (1/10 мин) | 10 мин | 20 мин | ×2 |
| Сайт, случайная нагрузка | 1 запрос/с | всплески «всегда» | усиление |
| Друзья в сети | редко online | «вечно» online | ярче для активных |
| Очередь на кассе | 3 минуты | «вечно» | длиннее для медленных |
| Найм стажёров | 40% уходят за год | «никто не уходит» | скрыто для быстрых |
Внимание: парадокс — не сбой восприятия, а честная математика выборки. Интуиция «усредняй по людям» просто не совпадает с реальностью «усредняй по времени».
Что с этим делать
Смириться с автобусом — первый шаг. Второй — не давать парадоксу врать вам в делах, где он вредит:
flowchart LR
A[Процесс с разными длинами] --> B[Интервалы разных размеров на оси времени]
B --> C{Как собирается выборка?}
C -->|по времени - инспекция| D[Длинные - заметнее]
C -->|по событиям - диспетчер| E[Честное среднее]
D --> F[«Всегда самый худший вариант»]
E --> G[Объективная картина]
Как «чинить»
- Собирайте данные по событиям, а не по времени: не «что было, когда я пришёл», а «что случилось за сутки».
- Для метрик популярности смотрите на медиану и распределение, а не на среднее — среднее уже смещено длиной.
- Если измеряете время обслуживания — замеряйте каждую заявку, а не только те, что застали.
- И помните: «самая медленная касса» вполне может оказаться просто самой занятой — в неё чаще попадают те, кто успел разглядеть, что она медленная.
Ироничный пункт: совет «приходить к табло ровно к 10:00» перестаёт спасать ровно тогда, когда расписание перестаёт быть ровным. Ждать ровно «к рейсу» при случайном потоке — лотерея с нечестными ставками против вас.
Итог
Парадокс инспекции — это не про то, что мир против вас. Это про то, что выборка по времени смещает наблюдения в сторону длинных интервалов:
- Коротких интервалов обычно больше, но занимают они меньше времени
- Наблюдатель попадает в интервал пропорционально длине — и видит длинные
- Средний «застигнутый» интервал — \frac{E[T^2]}{E[T]} \ge E[T], равенство только при постоянной длине
- У пуассоновского потока среднее «до следующего» равно среднему «между» — память процесса отсутствует
- Мониторить по событиям, а не по времени — единственный способ увидеть честную картину
Так что в следующий раз, стоя в самой медленной очереди и глядя на «пустую» соседнюю, не вздыхайте. Улыбнитесь: вы наблюдаете не случайность, а математическую неизбежность парадокса инспекции. 
Комментарии
Пока нет комментариев.
Войдите, чтобы комментировать.