Почему всегда долго: парадокс инспекции

Почему всегда долго: парадокс инспекции
Содержание

Каждый вечер в супермаркете вы умудряетесь выбрать самую медленную кассу — ту, где кто-то достаёт кошелёк, потом монетку, потом купоны. И автобус, кажется, принципиально приходит «раз в полчаса», хотя по расписанию стоит каждые десять минут. Чувство, что мир ополчился против вас, знакомо каждому. Забавно, что у этого чувства есть точное математическое объяснение — парадокс инспекции, и оно куда увлекательнее теории заговора.

О чём статья

Разберёмся, почему наблюдатель систематически видит «худшую» сторону случайности: длинные интервалы, медленные кассы, переполненные лифты. Спойлер: дело не в вас — дело в том, как вы попадаете в выборку.

Как вы оказались «в самом худшем месте»

Представьте два способа измерить, как долго люди ждут лифт.

Способ № 1 — «диспетчер»
Сесть на 20-й этаж и смотреть на табло, записывая время ожидания при «вызове» из кабинета диспетчера.
Способ № 2 — «наблюдатель»
Нажать кнопку лифта и с секундомером ждать его на своём этаже, повторяя это много дней подряд.

Первый способ — дисциплинированная выборка: вы смотрите на все поездки равномерно. Второй — инспекционная: вы наблюдаете ровно тот интервал, в который случилось угодить. И интуиция подсказывает, что они должны давать одинаковый ответ. Это не так. Во втором случае вы с гарантией увидите больше, потому что сами выбираете интервал не случайно, а пропорционально его длине.

Строгое расписание: парадокса ещё нет

Начнём с честного случая — автобус приходит ровно каждые 10 минут, секунда в секунду. Если вы приходите на остановку в случайный момент времени, то с равной вероятностью попадёте в любую точку десятиминутного окна между рейсами:

E[\text{wait}] = \frac{0 + 10}{2} = 5\text{ min}

Всё честно: среднее ожидание — половина интервала, а интервал — ровно «как по расписанию». Расписание строгое — парадокса нет, средние сходятся.

Что измеряем Как измеряем Средний результат
Расписание «как видит диспетчер» Равномерный сбор всех интервалов 10 минут
Ожидание пассажира Приход в случайный момент 5 минут
Интервал «как видит пассажир» В какой интервал попал 10 минут

Никакого разочарования. Проблема начинается, когда интервалы перестают быть одинаковыми.

Интервалы «плывут»: вот здесь появляется парадокс

Реальный город не соблюдает расписание. Пробка, красная волна светофоров, дождь — и интервалы становятся разной длины: один рейс через минуту, другой через двадцать. И вот тут кроется главный трюк инспекции:

Вы попадёте в интервал с вероятностью, пропорциональной его длине.

Если интервалов по 10 минут — десять штук, а один «везучий» длится 40 минут, то шанс оказаться именно в нём в четыре раза выше, чем в любом коротком. Именно поэтому кажется, что «всегда попадается самый длинный перерыв»: не потому что он длинный, а потому что длинный интервал занимает на временной оси больше места, и вы физически чаще «приземляетесь» в него.

Короткий интервал (1 мин) — маленькая мишень: вы успеете в него попасть только если придёте в его уникальную минуту.

Длинный интервал (20 мин) — огромная мишень: треть всего часа он доступен, шанс угодить в него выше в 20 раз.

Математически это называется смещение по длине (length bias) и описывается одной карточкой-формулой:

Средний интервал, который «застаёт» случайный наблюдатель:

T_{\text{inspect}} = \frac{E[T^2]}{E[T]}

Среднее арифметическое E[T] — это то, что видит «диспетчер». А E[T^2]/E[T] — то, что реально видит вы. Разница между ними — и есть парадокс инспекции.

Почему так? Когда вы приходите в случайный момент, шанс оказаться в конкретном интервале пропорционален времени, которое этот интервал занимает — то есть его длине. Усреднение идёт по длине, а не по числу интервалов: длинные в выборке весят больше. Следите за руками:

E[T_{\text{inspect}}] = \sum p_i \, T_i = \sum \frac{T_i}{\sum_j T_j}\, T_i = \frac{\sum T_i^2}{\sum T_i} = \frac{E[T^2]}{E[T]}

Для одинаковых интервалов T_1=\dots=T_n числитель равен n \cdot t^2, знаменатель — n \cdot t, и результат честные t. Но как только появляется разброс, E[T^2] > (E[T])^2 всегда, поэтому наблюдаемый интервал всегда длиннее среднего на бумаге. Парадокс не в том, что вас преследуют: парадокс в том, что выборка не может быть нечестной математически.

Хуже всего — поток Пуассона

Самый пессимистичный, но и самый реалистичный случай: рейсы приходят независимо — как, например, случайные звонки в колл-центр или сбои. Тогда интервалы распределены экспоненциально:

f(t) = \lambda e^{-\lambda t}, \qquad E[T] = \frac{1}{\lambda}

что на практике означает: 1) коротких интервалов большинство, 2) длинные хвосты случаются чаще, чем хотелось бы, 3) распределение не помнит прошлого.

Вот как это выглядит. Кривая «интервалы» — честное распределение промежутков между рейсами. «Попавший в интервал» — то, что видите вы. «Ожидание после прихода» — остаток до следующего рейса:

На графике две захватывающие вещи:

  1. Вы систематически попадаете в интервалы длиной около 20 минут — вдвое больше «бумажного» среднего в 10 минут (серая пунктирная линия). Красный горб не совпадает с синим: вы видите не то распределение, которое «реально есть».
  2. Оранжевая кривая совпадает с синей — печально-прекрасная ирония. Для пуассоновского потока среднее ожидание следующего рейса равно среднему интервалу (10 минут), как будто вы пришли ровно после отправления. У экспоненциального распределения нет памяти: сколько бы вы ни стояли, автобус «не помнит», что вы ждёте, и средний оставшийся срок всегда 1/\lambda.

Для экспоненты E[T^2] = 2/\lambda^2, поэтому:

E[T_{\text{inspect}}] = \frac{2/\lambda^2}{1/\lambda} = \frac{2}{\lambda}

— ровно вдвое больше среднего интервала. Вы не воображаете: при «случайном» расписании интервал, в который вы попадаете, в среднем в два раза длиннее того, что обещает расписание.

Остаток после прихода тоже экспоненциален. Свойство отсутствия памяти:

P(T > s+t \mid T > s) = P(T > t)

— сколько бы времени вы уже простояли, «свежее» ожидание не меняется. Именно поэтому бесконечное раздражение и автобус, который «специально» долго.

Парадокс инспекции вокруг вас

Это не только про лифты и автобусы. Смещение по длине встречается везде, где наблюдение «собирается» из процесса, а не диспетчерским мониторингом:

Перегруженные кассы — чем дольше люди стоят, тем дольше касса «видна». Мимо проходящие видят её занятой чаще, чем она занята на самом деле.

Популярные посты — «мнения людей» взвешены не по людям, а по просмотрам: длинные и громкие посты видят больше. Вы читаете «самые популярные», потому что они дольше висели в ленте.

Знакомства и интервью — на «сколько дольше всех держится пара» набираются те, кто дольше всех и держится: развод не успевает попасть в выборку.

А вот таблица «среднее на бумаге» против «среднее глазами наблюдателя» — обратите внимание, как расходятся числа:

Процесс «Диспетчер» видит «Наблюдатель» видит Разница
Автобус, Пуассон (1/10 мин) 10 мин 20 мин ×2
Сайт, случайная нагрузка 1 запрос/с всплески «всегда» усиление
Друзья в сети редко online «вечно» online ярче для активных
Очередь на кассе 3 минуты «вечно» длиннее для медленных
Найм стажёров 40% уходят за год «никто не уходит» скрыто для быстрых

Внимание: парадокс — не сбой восприятия, а честная математика выборки. Интуиция «усредняй по людям» просто не совпадает с реальностью «усредняй по времени».

Что с этим делать

Смириться с автобусом — первый шаг. Второй — не давать парадоксу врать вам в делах, где он вредит:

flowchart LR
    A[Процесс с разными длинами] --> B[Интервалы разных размеров на оси времени]
    B --> C{Как собирается выборка?}
    C -->|по времени - инспекция| D[Длинные - заметнее]
    C -->|по событиям - диспетчер| E[Честное среднее]
    D --> F[«Всегда самый худший вариант»]
    E --> G[Объективная картина]

Как «чинить»

  • Собирайте данные по событиям, а не по времени: не «что было, когда я пришёл», а «что случилось за сутки».
  • Для метрик популярности смотрите на медиану и распределение, а не на среднее — среднее уже смещено длиной.
  • Если измеряете время обслуживания — замеряйте каждую заявку, а не только те, что застали.
  • И помните: «самая медленная касса» вполне может оказаться просто самой занятой — в неё чаще попадают те, кто успел разглядеть, что она медленная.

Ироничный пункт: совет «приходить к табло ровно к 10:00» перестаёт спасать ровно тогда, когда расписание перестаёт быть ровным. Ждать ровно «к рейсу» при случайном потоке — лотерея с нечестными ставками против вас.

Итог

Парадокс инспекции — это не про то, что мир против вас. Это про то, что выборка по времени смещает наблюдения в сторону длинных интервалов:

  • Коротких интервалов обычно больше, но занимают они меньше времени
  • Наблюдатель попадает в интервал пропорционально длине — и видит длинные
  • Средний «застигнутый» интервал — \frac{E[T^2]}{E[T]} \ge E[T], равенство только при постоянной длине
  • У пуассоновского потока среднее «до следующего» равно среднему «между» — память процесса отсутствует
  • Мониторить по событиям, а не по времени — единственный способ увидеть честную картину

Так что в следующий раз, стоя в самой медленной очереди и глядя на «пустую» соседнюю, не вздыхайте. Улыбнитесь: вы наблюдаете не случайность, а математическую неизбежность парадокса инспекции. 😉

Комментарии

Пока нет комментариев.

Войдите, чтобы комментировать.