Блог weather-sensitivity · symptom-tracking · self-tracking

Как вести дневник симптомов, чтобы найти свои триггеры

Память — плохой судья погодных триггеров. Как вести дневник так, чтобы статистика, а не ощущения, показала, есть ли в ваших данных реальная закономерность.

Каждая статья этого цикла приходила к одному и тому же честному, но немного неудобному выводу. Давление и головная боль: связь реальна, но скромна, и в неё вплетена вера, обгоняющая данные (метеозависимость: что говорит наука). Суставы и дождь: исследования по-настоящему противоречат друг другу, причём расхождение связано с дизайном исследований не меньше, чем с чем-либо ещё. Магнитные бури: небольшой сигнал на уровне популяции, лежащий на доказательной базе, слишком тонкой, чтобы сказать, что это значит для конкретного человека. Жара, влажность и усталость: единственная связь, достаточно надёжная, чтобы назвать её базовой физикой, — но и она разбивается о то, насколько сильно личный порог переносимости отличается от человека к человеку. Прочитайте все четыре статьи — и через них проходит одна и та же нить: ответ на уровне популяции никогда не звучит как чистое «да» или «нет», это всегда «слабо, у части людей, и зависит от обстоятельств». Это не уклонение от ответа. Это и есть честная форма этой науки, а значит, единственный полезный следующий вопрос — не «влияет ли погода на людей», а «влияет ли она на меня лично, и как я вообще могу это узнать». Эта статья — именно о том, как ответить на второй вопрос правильно: с помощью дневника, устроенного так, чтобы его проверяла статистика, а не память. Оговорка перед началом: это информационный материал, не медицинская консультация. Если симптом новый, сильный или тревожный — это повод обратиться к врачу, а не к приложению или таблице.

Почему память — плохой судья

Начнём с самого прямого эксперимента именно на эту тему. В 1996 году Дональд Редельмайер и Амос Тверски — врач и психолог, который вместе с Дэниелом Канеманом заложил основы изучения когнитивных искажений, — на протяжении более чем года наблюдали 18 пациентов с артритом, фиксируя их боль вместе с реальной местной погодой, которую каждый пациент считал влияющей на себя. Когда данные обработали, статистически значимой связи между болью любого пациента и «его» погодным фактором не нашлось — ни у одного человека в группе (Redelmeier & Tversky, 1996). Сам по себе этот результат мог бы означать просто, что погода на суставы и правда не влияет, — что согласуется со многим из уже разобранного в этом цикле. Но та же работа провела и второй, более чистый эксперимент: 97 студентам показали чисто случайные, сгенерированные компьютером последовательности двух переменных без какой-либо заложенной связи, и попросили оценить, коррелируют ли они. Люди устойчиво сообщали, что видят корреляцию в этом шуме, — закономерности, которых там по построению не было. Вывод авторов: вера в связь погоды и боли, вероятно, держится не потому, что её подтверждают данные, а потому, что человеческий разум устроен так, чтобы находить закономерности независимо от того, существуют они или нет, — это явление называют иллюзорной корреляцией.

У этой склонности есть хорошо задокументированный спутник: эффект подтверждения — привычка замечать и запоминать дни, которые вписываются в уже сложившуюся историю (буря на улице и сильная головная боль), тихо не придавая значения буре без последствий и вообще не регистрируя ясный день, который тоже случайно оказался плохим. Добавьте сюда обычное искажение памяти — тот факт, что восстановить «насколько сильно болела голова три недели назад» гораздо менее точно, чем оценить это прямо сейчас, — и получится система памяти, которая структурно плохо подходит именно для этого вопроса. Исследование, сравнившее ретроспективные опросники о головной боли у 181 ребёнка с дневниками этих же детей, которые велись в реальном времени на протяжении четырёх недель, нашло ровно эту закономерность на практике: по сравнению с дневником, ретроспективный опросник систематически завышал и интенсивность, и длительность головной боли, причём размер этой ошибки был связан с возрастом ребёнка, тяжестью головной боли и показателями депрессии (van den Brink, Bandell-Hoekstra & Abu-Saad, 2001). Ничто из этого не означает, что люди небрежны или нечестны в отношении собственных симптомов. Это означает, что память никогда не создавалась как измерительный прибор, а требовать от неё работы уровня статистики — значит требовать от неё работы, для которой она не предназначена.

Что должен уметь дневник

У решения, к которому обращаются исследователи, есть название: экологическая моментальная оценка, или EMA (ecological momentary assessment) — запись симптома близко к моменту, когда он происходит, в той же обстановке, где он происходит, а не восстановление его позже по памяти. Метод формализовали в основополагающей работе 1994 года Артур Стоун и Сол Шиффман, которые доказывали, что оценка симптомов, настроения и поведения в реальном времени и в реальной повседневной обстановке человека обходит проблемы вспоминания, которые подрывают ретроспективные отчёты (Stone & Shiffman, 1994). Применительно к личному дневнику погоды и симптомов этот принцип превращается в короткий список конкретных привычек, а не в расплывчатый совет «быть внимательнее»:

  1. Записывайте близко к моменту, а не в конце недели. Запись в тот же день — это измерение; воскресняя реконструкция всей недели уже сползает обратно к памяти и её искажениям.
  2. Записывайте и «промахи», а не только «попадания». Спокойный день с обычным давлением и без головной боли — такая же важная точка данных, как штормовой день с сильной болью; пропускать её — значит заниматься эффектом подтверждения с дополнительными шагами, просто нарядив его в дневник.
  3. Держите категории неизменными. Оценка симптома по одной и той же шкале от 0 до 10 или по одному и тому же короткому списку симптомов каждый день — вот что делает 3-й день сопоставимым с 60-м. Дневник, который на середине меняет собственные единицы измерения, вообще нельзя проанализировать.
  4. Пусть погода привязывается автоматически, где это возможно. Чем меньше дневник зависит от того, что вы отдельно вспомните проверить и записать давление или влажность дня, тем меньше места остаётся для искажения памяти, чтобы прокрасться обратно через боковую дверь.
  5. Продолжайте после того момента, когда кажется, что ответ уже понятен. Это самое трудное правило и то, которое большинство людей нарушают первым, — по причине, которую следующий раздел объясняет точно.

Почему для этого нужна статистика, а не взгляд на график

Предположим, гипотетически, что после месяца ежедневных записей ваши данные показывают корреляцию r = 0,34 между днями с низким давлением и тем, насколько сильно болела голова в этот день. Это реально выглядящая цифра — из тех аккуратных корреляций, что создают приятное ощущение «ага, вот оно». Но при всего 30 днях данных за спиной корреляция такого масштаба даёт p-значение порядка 0,07 по стандартному статистическому тесту для корреляций — а это не проходит общепринятый порог значимости 0,05. Проще говоря: при таком небольшом объёме данных корреляция такого размера вполне может оказаться совпадением, даже если на экране она выглядит осмысленно. Назвать это находкой на этом этапе — значит совершить ровно ту же ошибку, что совершили студенты в эксперименте Редельмайера и Тверски с чистым шумом: увидеть закономерность раньше, чем накопилось достаточно данных, чтобы отличить её от случайности.

А вот часть, которая объясняет, почему более долгое ведение дневника того стоит: продолжайте записи, и предположим, что та же связь r = 0,34 сохранится, когда вы дойдёте до 90 дней — это около трёх месяцев регулярных записей. Проведите тот же самый статистический тест на большей выборке — и корреляция того же размера даст p-значение порядка 0,001, что уверенно проходит порог значимости, потому что корреляцию заданного масштаба гораздо труднее объяснить случайностью, когда она измерена на втрое большем числе дней. Между 30-м и 90-м днём в самой связи ничего не изменилось — изменился только объём доказательств за ней. Вот честная, вовсе не эффектная причина, почему «дайте этому время» — не банальность: статистическая мощность обнаружить реальный эффект (или корректно отвергнуть ложный) растёт вместе с числом наблюдений, а месяца увлечённого трекинга обычно для этого недостаточно.

Ловушка множественных сравнений — и зачем нужна поправка FDR

Есть и вторая ловушка, которая открывается, как только вы начинаете проверять больше одного погодного фактора одновременно, — а именно так и поступает большинство людей: давление, температура, влажность, ветер и ещё что-то — всё сразу проверяется против симптома за один присест. Проверьте восемь разных погодных факторов против своих симптомов, используя обычный порог значимости 0,05 для каждого по отдельности, — и одна лишь случайность означает, что примерно один тест из двадцати покажется «значимым», даже если ни одна из проверяемых связей не реальна, а при восьми одновременных тестах это складывается в заметно повышенный шанс, что хотя бы одна ложная тревога всплывёт и будет выглядеть как открытие. Это проблема множественных сравнений, и это статистический аналог ловушки эффекта подтверждения из начала статьи: чем больше вопросов вы задаёте одним и тем же данным за раз, тем больше шансов у самой случайности подсунуть вам ложное срабатывание, неотличимое на вид от настоящего.

Стандартное решение — поправка на долю ложных находок, FDR (false discovery rate), метод, предложенный Йоавом Бенджамини и Йосефом Хохбергом в 1995 году специально для этой ситуации, когда проверяется много гипотез одновременно, а обычный, нескорректированный порог значимости пропустил бы слишком много ложных срабатываний (Benjamini & Hochberg, 1995). Вместо того чтобы требовать невозможно строгий порог для каждого отдельного теста — что обычно хоронит реальные эффекты вместе с ложными, — поправка FDR подстраивает порог в зависимости от того, сколько сравнений было проведено, так что среди всего, что в итоге помечено как «значимое», ожидаемая доля действительно ложных находок остаётся под контролем и известна, а не остаётся на волю случая. Применительно к личному погодному дневнику это разница между «давление оказалось значимым, значит, это мой триггер» и «давление осталось значимым даже с учётом семи других факторов, которые я тоже проверял» — второе утверждение и стоит того, чтобы ему доверять, и именно оно требует поправки, чтобы делаться честно.

Иллюстративный пример, не реальные данные: одна и та же корреляция r=0.34 незначима после 30 дней (p≈0.07), но значима после 90 (p≈0.001); а при одновременной проверке восьми погодных факторов настоящими считаются только связи, пережившие поправку на долю ложных находок (FDR).SIGNIFICANCE × DAYS · SAME_r=0.34p=0.05n=30·p≈.07n=90·p≈.001Незначимо — совпадение всё ещё вероятноЗначимо — вряд ли случайностьDAYS_LOGGED →8_FACTORS_TESTEDUNCORRECTED_p<.05AFTER_FDRНастоящими считаются только связи, пережившие FDRFIG.06 · SIGNIFICANCE + FDR · ILLUSTRATIVE_EXAMPLE · NOT_A_MEASUREMENT

Что это реально даёт: полноценная выборка размером в одного человека

Именно на этой логике строится исследовательский дизайн под названием n-of-1 trial: вместо вопроса, работает ли вмешательство или триггер для людей в целом, вы рассматриваете собственные повторяющиеся, последовательные наблюдения одного человека как набор данных, где сравнением служат его же другие дни — отдельная контрольная группа не нужна, потому что каждый человек служит собственным контролем во времени (Duan, Kravitz & Schmid, 2013). Именно так и устроен правильно веденный дневник симптомов и погоды: не замена популяционным исследованиям, а полноценный, значимый лично для вас набор данных — при условии, что он построен так, как описано выше: запись близко к моменту, включая обычные дни, на протяжении достаточного времени, с проверкой методом, который учитывает проверку сразу нескольких факторов.

Именно поэтому, если называть вещи своими именами, MeteoHealth существует как приложение, а не как шаблон таблицы. Оно отслеживает симптомы и настроение в два касания, сопоставляет каждую запись с местной погодой и метриками Apple Health, которые вы уже собираете, и запускает настоящую статистику на устройстве — корреляции Пирсона, ANOVA и поправку на долю ложных находок (FDR) по всем проверяемым погодным переменным, — так что то, что проявляется как закономерность в ваших данных, уже прошло ту же дисциплину, что описана в этой статье, а не просто взгляд на график. Оно не диагностирует и не предсказывает ничего; оно показывает вам ваши собственные цифры, честно сохраняя при них неопределённость, и построено полностью на устройстве, так что персональные данные о здоровье за этими цифрами никогда не должны покидать телефон. Всё остальное в этом цикле статей — слабые популяционные средние, разногласия между исследованиями, разрыв между верой и данными — и есть причина, по которой такой подход вообще необходим. Популяционное исследование может сказать, что в среднем верно для тысяч людей, которых оно никогда не узнает по отдельности. Оно не может сказать, отслеживает ли боль в вашем колене именно в этот вторник падение давления за окном. Это может сделать только ваша собственная запись, прочитанная статистикой, а не памятью.

Что в сухом остатке

На протяжении всего этого цикла честный ответ на вопрос «влияет ли погода на здоровье» звучал как некая версия «слабо, неравномерно, и зависит от человека» — никогда как чистое «да», никогда как чистое «нет». Это не неудовлетворительный итог — это правильный итог, и он прямо указывает, что делать дальше. Память — плохой судья в этих вопросах: она устойчиво находит закономерности в случайности и запоминает дни, подтверждающие историю, забывая те, что её опровергают. Дневник исправляет это, только если он ведётся близко к моменту, включает обычные дни наравне с примечательными и длится достаточно долго, чтобы дать настоящей статистике — а не взгляду на график — достаточно доказательств, чтобы отличить реальную закономерность от шума, корректно учитывая, что проверка нескольких погодных факторов одновременно повышает риск ложных тревог, если анализ к этому не готов. Сделайте это — и вы больше не гадаете и не доверяете памяти, которая устроена так, чтобы вводить вас в заблуждение именно в этом вопросе. Вы проводите полноценное исследование на одном человеке — того самого набора данных, который всегда и был самым важным: вашего собственного.

Источники [1..5]
  1. On the belief that arthritis pain is related to the weather Redelmeier & Tversky, Proceedings of the National Academy of Sciences, 1996.
  2. The occurrence of recall bias in pediatric headache: a comparison of questionnaire and diary data van den Brink, Bandell-Hoekstra & Abu-Saad, Headache, 2001.
  3. Ecological Momentary Assessment (EMA) in Behavioral Medicine Stone & Shiffman, Annals of Behavioral Medicine, 1994.
  4. Single-patient (n-of-1) trials: a pragmatic clinical decision methodology for patient-centered comparative effectiveness research Duan, Kravitz & Schmid, Journal of Clinical Epidemiology, 2013.
  5. Controlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing Benjamini & Hochberg, Journal of the Royal Statistical Society, Series B, 1995.