Как читать свои шансы на симптом: 7 из 9 против 2 из 20

Единого процента на «завтра» не существует. Как сравнивать свои цифры — вроде «7 из 9» — с обычными днями, без которых эти цифры ничего не значат.

Откройте дневник симптомов и погоды спустя несколько недель ведения — и вопрос в голове почти всегда один и тот же: будет ли завтра плохо? Именно на этот вопрос — прогноз, число, привязанное к дню, который ещё не наступил, — ваши собственные данные, как и чьи-либо ещё, ответить на самом деле не могут. То, на что данные способны ответить, когда их накопится достаточно, — вопрос уже, но полезнее: в дни, похожие на сегодняшний, как часто вам становилось плохо — по сравнению с тем, как часто становится плохо в обычный день? Такой ответ выглядит не как заголовок, а скорее как пара дробей — плохо в 7 из последних 9 дней после резкого падения давления, плохо в 2 из последних 20 обычных дней, — и научиться правильно читать эту пару и есть, по сути, весь навык, который нужен, чтобы хорошо пользоваться любым личным дневником здоровья. Оговорка перед началом: это информационный материал, не медицинская консультация. MeteoHealth — это wellness-трекер, а не диагностический инструмент; если симптом новый, сильный или усиливается — это повод для разговора с врачом, а не для этой статьи.

Почему вердикт по популяции — не вердикт для вас

Одна из наиболее тщательных попыток разобраться с вопросом «погода и симптомы» на уровне популяции заслуживает того, чтобы на ней задержаться, — потому что результат идёт вразрез с тем, что ожидает услышать большинство людей, ведущих собственный дневник симптомов. Цебенхольцер и коллеги наблюдали 238 человек с мигренью, живущих в пределах 25 км от одной метеостанции в Вене, каждый из которых вёл ежедневный дневник на протяжении 90 дней, и сверили эти дневники с одиннадцатью метеорологическими показателями и семнадцатью категоризированными погодными ситуациями, зафиксированными за те же дни (Zebenholzer et al., 2011). Несколько сигналов, которые на первый взгляд выглядели многообещающими, — гребень высокого давления, снижение скорости ветра, сдвиг в продолжительности солнечного сияния, — не сохранили статистическую значимость в итоговом анализе. Собственный вывод исследователей был прямым: погода значительно переоценена как триггер головной боли — она заметно уступает более обыденным факторам вроде стресса и, для многих пациенток, менструации. Это неудобная фраза для приложения, построенного вокруг погоды и симптомов, — и она всё равно приведена здесь, потому что именно она объясняет, зачем нужна остальная часть этой статьи. Если бы погода была сильным, надёжным триггером для всей популяции, личную запись не нужно было бы внимательно читать — она просто подтверждала бы среднее. Она этого не подтверждает, и второе исследование делает это несоответствие ещё более резким. Среди 77 человек с мигренью, которых Принс и коллеги проверили на соответствие измеренным погодным условиям, примерно половина оказалась объективно чувствительна хотя бы к одному погодному фактору — но верили, что погода — их триггер, больше пациентов, чем это подтверждали измерения (Prince et al., 2004). Убеждение здесь опережает данные в обе стороны: у части людей, уверенных, что погода на них влияет, цифры этого не подтверждают, а вердикт «в среднем переоценено» не исключает, что для конкретного человека внутри этой «половины» всё реально. И средние показатели, и убеждения — оба неверный инструмент для вопроса об одном конкретном человеке, и на то есть конкретная причина. Фишер, Медалья и Иеронимус, проанализировав шесть исследований с повторными измерениями, обнаружили, что разброс вокруг ожидаемого значения внутри отдельных людей в два-четыре раза больше, чем внутри групп (Fisher, Medaglia & Jeronimus, 2018). Их более широкий аргумент таков: результат, полученный на уровне группы, чисто переносится на отдельного человека только для того, что статистики называют эргодическим процессом, — то есть процесса, где закономерность между людьми и закономерность внутри одного человека во времени имеют одинаковую форму, — а психологические процессы вроде колебаний симптомов, как правило, не эргодичны. Популяционное исследование, каким бы качественным оно ни было, никогда не создавалось для ответа на вопрос «что происходит именно со мной». Личная запись — не суррогат этого ответа похуже, а, по сути, единственный инструмент, способный его дать. За более полной картиной на уровне популяции, стоящей за этим вердиктом «переоценено», обратитесь к статьям метеозависимость: что говорит наука и атмосферное давление и головная боль — они подробнее разбирают спор о механизмах, а эта статья продолжает с того места, на котором останавливаются обе.

Естественные частоты: почему «7 из 9» лучше, чем «78%»

Даже когда человек соглашается, что искать ответ нужно именно в собственной записи, то, как эту запись подают, может свести на нет весь смысл упражнения. Гигеренцер и коллеги, разбирая, насколько плохо статистика здоровья доносится в медицине, прямо писали, что многие врачи, пациенты, журналисты и политики в равной мере не понимают, что означает статистика здоровья, или делают неверные выводы, сами того не замечая, — это коллективная статистическая безграмотность, широко распространённая неспособность понимать смысл чисел (Gigerenzer et al., 2007). Предложенное ими решение — конкретный, почти старомодный формат: естественные частоты, то есть способ, которым люди кодировали информацию ещё до изобретения математической вероятности в середине XVII века, — простые подсчёты, не нормированные относительно базовых частот, в отличие от относительных частот и условных вероятностей, и потому куда легче усваиваемые мозгом. Их стандартная иллюстрация — сценарий с маммографией: при распространённости рака 1%, чувствительности теста 90% и доле ложноположительных результатов 9% большинство людей, которых спрашивают, что означает положительный результат, сильно завышают вероятность рака. Если разложить это как естественные частоты на 1000 женщин, картина проясняется быстро. У 10 из 1000 рак действительно есть, и примерно у 9 из этих 10 тест окажется положительным. Из 990 женщин без рака положительный результат получат ещё примерно 89 — исключительно как ложные тревоги. Сложите обе группы — и в сумме положительный результат получат около 98 женщин, из которых рак реально есть только у 9, то есть примерно у 1 из 10. Эти четыре естественные частоты в сумме дают реальный итог в 1000, тогда как эквивалентные условные вероятности в сумме не дают 100% — каждая пара вместо этого отдельно нормируется относительно своей базовой частоты, и именно этот шаг скрывает суть происходящего. Формулировка вроде «положительный результат означает примерно 90%-ную вероятность рака» звучит точно, но никак не проверяется тем, кто её читает. «У 9 из 98 получивших положительный результат рак действительно есть» — это арифметика, которую любой может пересчитать сам. Та же логика напрямую переносится на личный погодный дневник. «Плохо в 7 из последних 9 дней с резким падением давления» — это естественная частота: два целых числа, девять реально прожитых дней, арифметика, которую можно сверить с собственным дневником. «78%-ная вероятность плохого дня при падении давления» — тот же самый факт, только в костюме, который прячет девятку, — и он словно приглашает перестать спрашивать, что за ним стоит.

Число, которое ничего не значит без пары

Даже чистая естественная частота вроде «7 из 9» сама по себе — незаконченное предложение, и именно здесь большая часть личного трекинга, что в приложении, что вне его, тихо идёт не так. Семь плохих дней из девяти дней с падением давления сами по себе звучат драматично. Говорит ли это вообще что-то о давлении, целиком зависит от числа, которое должно стоять рядом: как часто у того же человека бывает плохой день, когда ничего особенного не произошло, — обычный день, зафиксированный так же, без заметного изменения давления. Предположим, счёт по обычным дням даёт 2 плохих дня из 20. Поставьте две дроби рядом: примерно 78% дней с падением давления были плохими (7 из 9) против 10% обычных дней (2 из 20). Это реальный, заметный разрыв, и именно разрыв — а не сама по себе цифра «7 из 9» — и делает настоящую работу, указывая на закономерность. Теперь измените только счёт по обычным дням — и посмотрите, как вывод переворачивается. Предположим, что обычные дни вместо этого дают 15 плохих дней из 20 — человек в целом переживает трудный период по причинам, которые могут не иметь ничего общего с погодой. Доля по дням с падением давления по-прежнему 7 из 9, по-прежнему около 78%. Но доля по обычным дням теперь 75% — 15 из 20, — и это достаточно близко, чтобы между двумя группами практически не осталось зазора. Одна и та же заголовочная цифра — «плохо в 7 из 9 дней с падением давления» — описывает две совершенно разные ситуации в зависимости от того, как выглядели остальные дни: в первом случае она указывает на давление, во втором — почти ни на что, потому что у этого человека прямо сейчас плохих дней просто больше, чем хороших, независимо от погоды. Голая частота, приведённая для одного условия, — это ещё не результат. Она становится результатом, только когда её сопоставляют с соответствующей частотой для дней без этого условия, посчитанной одинаковым способом с обеих сторон. Представление о том, что вообще может значить «день с падением давления» в такого рода подсчётах, даёт японское дневниковое исследование: Окума и коллеги попросили 34 человека с мигренью вести ежедневные записи и обнаружили, что приступы группируются в дни, когда атмосферное давление опускалось примерно до 1003–1007 гПа — на 6–10 гПа ниже стандартных 1013 гПа (Okuma et al., 2015). Точная величина падения, которая имеет значение, у разных людей и в разные сезоны разная, но форма самого сравнения — дни с падением против обычных дней, посчитанные одинаковым способом, — это то, что обобщается.

Почему выбор самого теста становится значимым на этом масштабе

Есть ещё одна сложность на пути от «эти две дроби выглядят по-разному» к «отличаются настолько, что это, вероятно, не случайность». При тех объёмах выборки, которые реально есть у раннего личного дневника, — горстка дней с падением давления против нескольких десятков обычных, — статистический тест для сравнения двух подсчётов перестаёт быть формальностью, которую любой стандартный метод обрабатывает одинаково. Обзор Кэмпбелла, посвящённый критерию хи-квадрат и точному критерию Фишера–Ирвина на малых таблицах два на два, показал, что в целом лучше всего работает скорректированная версия хи-квадрат — так называемый тест «N−1», — если наименьшее ожидаемое значение в таблице составляет хотя бы 1, а ниже этого порога, по правилу Ирвина, стоит переходить на точный критерий Фишера–Ирвина (Campbell, 2007). На этом стоит задержаться: более старая, привычная рекомендация требовала минимум 5 ожидаемых наблюдений в каждой ячейке, прежде чем доверять обычному критерию хи-квадрат, — а дневник с 9 днями падения давления и ячейкой «плохой день» из двух-трёх записей долго не дотягивает до этой планки. Ничто из этого не означает, что обычный критерий хи-квадрат тайно неверен или что точный тест — единственно правильный выбор во всех случаях; это означает, что на 9 днях, или 20, или 30, выбор теста перестаёт быть фоновой деталью и становится решением с реальными последствиями для того, назовут ли разрыв между двумя дробями значимым. Склоняться к более консервативному варианту на этом масштабе — значит скорее недооценить закономерность, чем переоценить её, а это более безопасное направление для ошибки. Это ещё одна причина, по которой одинокий процент, приведённый без исходных подсчётов, заслуживает того же скепсиса, что и любое другое непроверенное арифметическое утверждение.

Дни, которые не записаны, не считаются

Есть один сбой, который никакой статистический тест не исправит задним числом, потому что он происходит раньше — в момент записи. Если дневник симптомов пополняется записями только в дни, которые и так ощущаются заметными, — сильная головная боль, тяжёлая ночь, день, о котором есть что рассказать, — сравнение с обычными днями из предыдущего раздела попросту не существует, и не потому, что обычные дни были редкостью, а потому, что их никто не записал. Какая бы частота ни получилась из дневника, устроенного таким образом, она будет систематически выглядеть хуже реальности, потому что в знаменателе не хватает его самой большой и самой скучной категории. Это лишь узкий срез более широкой дисциплины ведения дневника — что записывать, насколько близко к моменту, как не дать памяти тихо отредактировать запись, — которая подробно разобрана в статье как вести дневник симптомов, чтобы найти свои триггеры. Короткая версия здесь такая: обычный день, честно записанный, — такая же ценная запись, как и плохой, потому что только она превращает «7 плохих дней» в дробь, которая вообще что-то значит.

Когда ответ — «закономерности нет» — и почему это всё равно ответ

Когда обычных дней в записи накопилось достаточно, происходит одно из двух, и только один из этих исходов складывается в эффектный заголовок. Иногда доля по дням с падением давления и доля по обычным дням действительно расходятся — ближе к первому арифметическому примеру выше, чем ко второму, — и это реальный, лично полезный результат. Ничуть не реже недели аккуратных записей приводят ближе ко второму примеру: обе доли оказываются настолько близко друг к другу, что между ними нет значимого разрыва, — что простым языком означает: похоже, для этого конкретного человека падения давления особой роли не играют. Этот исход согласуется с тем, что Цебенхольцер и коллеги обнаружили на уровне популяции, где несколько сигналов, казавшихся реальными на первый взгляд, не пережили итоговый анализ, — и он заслуживает того, чтобы относиться к нему ровно так же серьёзно, как и к противоположному результату. Разрыв, который исчезает при внимательной проверке, — это не проваленный эксперимент, а тот же самый процесс, который отметил бы настоящий разрыв, — просто он корректно сообщает, что в этом случае разрыва нет. Воспринимать «закономерности нет» как разочарование, а не как информацию, — тот же самый настрой, который вообще позволяет иллюзорным корреляциям выживать: он продолжает искать ожидаемую закономерность вместо того, чтобы принять ту, которую на самом деле показывают подсчёты.

Что на самом деле показывает приложение

Роль MeteoHealth во всём этом сознательно узкая. Оно записывает симптомы рядом с погодой и данными Apple Health за тот же день, и как только истории накапливается достаточно, показывает личную частоту — плохие дни после падения давления — прямо рядом с соответствующей частотой для обычных дней, в виде подсчётов, а не одинокого процента. Пока дневник ещё короткий, приложение говорит, сколько ещё записей нужно, чтобы это сравнение имело смысл читать, — вместо того чтобы выдать число раньше времени и дать вам решить, что оно уже что-то значит. Арифметика выполняется прямо на устройстве, на данных, которым не нужно покидать телефон, чтобы быть полезными. Ничто из этого не равносильно диагнозу или прогнозу: приложение не диагностирует состояние, не предсказывает завтрашний день и не говорит, что именно вызвало плохой день. Оно показывает, как выглядели ваши собственные дни, рядом друг с другом, и оставляет чтение этого сравнения там, где ему и место, — с двумя числами и арифметикой, которую любой может пересчитать сам. Погода может быть связана с самочувствием конкретного человека, а может и не быть. Единственный способ узнать, что из этого верно для конкретного тела, — посмотреть на его собственные дни, посчитанные правильно, в сравнении с обычными днями, с которыми их сопоставляют.

Источники [1..6]
  1. Helping Doctors and Patients Make Sense of Health Statistics Gigerenzer et al., Psychological Science in the Public Interest, 2007.
  2. Lack of group-to-individual generalizability is a threat to human subjects research Fisher, Medaglia & Jeronimus, Proceedings of the National Academy of Sciences, 2018.
  3. Migraine and weather: A prospective diary-based analysis Zebenholzer et al., Cephalalgia, 2011.
  4. Chi-squared and Fisher–Irwin tests of two-by-two tables with small sample recommendations Campbell, Statistics in Medicine, 2007.
  5. The effect of weather on headache Prince et al., Headache, 2004.
  6. Examination of fluctuations in atmospheric pressure related to migraine Okuma et al., SpringerPlus, 2015.