Как вести дневник симптомов, чтобы найти свои триггеры
Память — плохой судья погодных триггеров. Как вести дневник так, чтобы статистика, а не ощущения, показала, есть ли в ваших данных реальная закономерность.
Каждая статья этого цикла приходила к одному и тому же честному, но немного неудобному выводу. Давление и головная боль: связь реальна, но скромна, и в неё вплетена вера, обгоняющая данные (метеозависимость: что говорит наука). Суставы и дождь: исследования по-настоящему противоречат друг другу, причём расхождение связано с дизайном исследований не меньше, чем с чем-либо ещё. Магнитные бури: небольшой сигнал на уровне популяции, лежащий на доказательной базе, слишком тонкой, чтобы сказать, что это значит для конкретного человека. Жара, влажность и усталость: единственная связь, достаточно надёжная, чтобы назвать её базовой физикой, — но и она разбивается о то, насколько сильно личный порог переносимости отличается от человека к человеку. Прочитайте все четыре статьи — и через них проходит одна и та же нить: ответ на уровне популяции никогда не звучит как чистое «да» или «нет», это всегда «слабо, у части людей, и зависит от обстоятельств». Это не уклонение от ответа. Это и есть честная форма этой науки, а значит, единственный полезный следующий вопрос — не «влияет ли погода на людей», а «влияет ли она на меня лично, и как я вообще могу это узнать». Эта статья — именно о том, как ответить на второй вопрос правильно: с помощью дневника, устроенного так, чтобы его проверяла статистика, а не память. Оговорка перед началом: это информационный материал, не медицинская консультация. Если симптом новый, сильный или тревожный — это повод обратиться к врачу, а не к приложению или таблице.
Почему память — плохой судья
Начнём с самого прямого эксперимента именно на эту тему. В 1996 году Дональд Редельмайер и Амос Тверски — врач и психолог, который вместе с Дэниелом Канеманом заложил основы изучения когнитивных искажений, — на протяжении более чем года наблюдали 18 пациентов с артритом, фиксируя их боль вместе с реальной местной погодой, которую каждый пациент считал влияющей на себя. Когда данные обработали, статистически значимой связи между болью любого пациента и «его» погодным фактором не нашлось — ни у одного человека в группе (Redelmeier & Tversky, 1996). Сам по себе этот результат мог бы означать просто, что погода на суставы и правда не влияет, — что согласуется со многим из уже разобранного в этом цикле. Но та же работа провела и второй, более чистый эксперимент: 97 студентам показали чисто случайные, сгенерированные компьютером последовательности двух переменных без какой-либо заложенной связи, и попросили оценить, коррелируют ли они. Люди устойчиво сообщали, что видят корреляцию в этом шуме, — закономерности, которых там по построению не было. Вывод авторов: вера в связь погоды и боли, вероятно, держится не потому, что её подтверждают данные, а потому, что человеческий разум устроен так, чтобы находить закономерности независимо от того, существуют они или нет, — это явление называют иллюзорной корреляцией.
У этой склонности есть хорошо задокументированный спутник: эффект подтверждения — привычка замечать и запоминать дни, которые вписываются в уже сложившуюся историю (буря на улице и сильная головная боль), тихо не придавая значения буре без последствий и вообще не регистрируя ясный день, который тоже случайно оказался плохим. Добавьте сюда обычное искажение памяти — тот факт, что восстановить «насколько сильно болела голова три недели назад» гораздо менее точно, чем оценить это прямо сейчас, — и получится система памяти, которая структурно плохо подходит именно для этого вопроса. Исследование, сравнившее ретроспективные опросники о головной боли у 181 ребёнка с дневниками этих же детей, которые велись в реальном времени на протяжении четырёх недель, нашло ровно эту закономерность на практике: по сравнению с дневником, ретроспективный опросник систематически завышал и интенсивность, и длительность головной боли, причём размер этой ошибки был связан с возрастом ребёнка, тяжестью головной боли и показателями депрессии (van den Brink, Bandell-Hoekstra & Abu-Saad, 2001). Ничто из этого не означает, что люди небрежны или нечестны в отношении собственных симптомов. Это означает, что память никогда не создавалась как измерительный прибор, а требовать от неё работы уровня статистики — значит требовать от неё работы, для которой она не предназначена.
Что должен уметь дневник
У решения, к которому обращаются исследователи, есть название: экологическая моментальная оценка, или EMA (ecological momentary assessment) — запись симптома близко к моменту, когда он происходит, в той же обстановке, где он происходит, а не восстановление его позже по памяти. Метод формализовали в основополагающей работе 1994 года Артур Стоун и Сол Шиффман, которые доказывали, что оценка симптомов, настроения и поведения в реальном времени и в реальной повседневной обстановке человека обходит проблемы вспоминания, которые подрывают ретроспективные отчёты (Stone & Shiffman, 1994). Применительно к личному дневнику погоды и симптомов этот принцип превращается в короткий список конкретных привычек, а не в расплывчатый совет «быть внимательнее»:
- Записывайте близко к моменту, а не в конце недели. Запись в тот же день — это измерение; воскресняя реконструкция всей недели уже сползает обратно к памяти и её искажениям.
- Записывайте и «промахи», а не только «попадания». Спокойный день с обычным давлением и без головной боли — такая же важная точка данных, как штормовой день с сильной болью; пропускать её — значит заниматься эффектом подтверждения с дополнительными шагами, просто нарядив его в дневник.
- Держите категории неизменными. Оценка симптома по одной и той же шкале от 0 до 10 или по одному и тому же короткому списку симптомов каждый день — вот что делает 3-й день сопоставимым с 60-м. Дневник, который на середине меняет собственные единицы измерения, вообще нельзя проанализировать.
- Пусть погода привязывается автоматически, где это возможно. Чем меньше дневник зависит от того, что вы отдельно вспомните проверить и записать давление или влажность дня, тем меньше места остаётся для искажения памяти, чтобы прокрасться обратно через боковую дверь.
- Продолжайте после того момента, когда кажется, что ответ уже понятен. Это самое трудное правило и то, которое большинство людей нарушают первым, — по причине, которую следующий раздел объясняет точно.
Почему для этого нужна статистика, а не взгляд на график
Предположим, гипотетически, что после месяца ежедневных записей ваши данные показывают корреляцию r = 0,34 между днями с низким давлением и тем, насколько сильно болела голова в этот день. Это реально выглядящая цифра — из тех аккуратных корреляций, что создают приятное ощущение «ага, вот оно». Но при всего 30 днях данных за спиной корреляция такого масштаба даёт p-значение порядка 0,07 по стандартному статистическому тесту для корреляций — а это не проходит общепринятый порог значимости 0,05. Проще говоря: при таком небольшом объёме данных корреляция такого размера вполне может оказаться совпадением, даже если на экране она выглядит осмысленно. Назвать это находкой на этом этапе — значит совершить ровно ту же ошибку, что совершили студенты в эксперименте Редельмайера и Тверски с чистым шумом: увидеть закономерность раньше, чем накопилось достаточно данных, чтобы отличить её от случайности.
А вот часть, которая объясняет, почему более долгое ведение дневника того стоит: продолжайте записи, и предположим, что та же связь r = 0,34 сохранится, когда вы дойдёте до 90 дней — это около трёх месяцев регулярных записей. Проведите тот же самый статистический тест на большей выборке — и корреляция того же размера даст p-значение порядка 0,001, что уверенно проходит порог значимости, потому что корреляцию заданного масштаба гораздо труднее объяснить случайностью, когда она измерена на втрое большем числе дней. Между 30-м и 90-м днём в самой связи ничего не изменилось — изменился только объём доказательств за ней. Вот честная, вовсе не эффектная причина, почему «дайте этому время» — не банальность: статистическая мощность обнаружить реальный эффект (или корректно отвергнуть ложный) растёт вместе с числом наблюдений, а месяца увлечённого трекинга обычно для этого недостаточно.
Ловушка множественных сравнений — и зачем нужна поправка FDR
Есть и вторая ловушка, которая открывается, как только вы начинаете проверять больше одного погодного фактора одновременно, — а именно так и поступает большинство людей: давление, температура, влажность, ветер и ещё что-то — всё сразу проверяется против симптома за один присест. Проверьте восемь разных погодных факторов против своих симптомов, используя обычный порог значимости 0,05 для каждого по отдельности, — и одна лишь случайность означает, что примерно один тест из двадцати покажется «значимым», даже если ни одна из проверяемых связей не реальна, а при восьми одновременных тестах это складывается в заметно повышенный шанс, что хотя бы одна ложная тревога всплывёт и будет выглядеть как открытие. Это проблема множественных сравнений, и это статистический аналог ловушки эффекта подтверждения из начала статьи: чем больше вопросов вы задаёте одним и тем же данным за раз, тем больше шансов у самой случайности подсунуть вам ложное срабатывание, неотличимое на вид от настоящего.
Стандартное решение — поправка на долю ложных находок, FDR (false discovery rate), метод, предложенный Йоавом Бенджамини и Йосефом Хохбергом в 1995 году специально для этой ситуации, когда проверяется много гипотез одновременно, а обычный, нескорректированный порог значимости пропустил бы слишком много ложных срабатываний (Benjamini & Hochberg, 1995). Вместо того чтобы требовать невозможно строгий порог для каждого отдельного теста — что обычно хоронит реальные эффекты вместе с ложными, — поправка FDR подстраивает порог в зависимости от того, сколько сравнений было проведено, так что среди всего, что в итоге помечено как «значимое», ожидаемая доля действительно ложных находок остаётся под контролем и известна, а не остаётся на волю случая. Применительно к личному погодному дневнику это разница между «давление оказалось значимым, значит, это мой триггер» и «давление осталось значимым даже с учётом семи других факторов, которые я тоже проверял» — второе утверждение и стоит того, чтобы ему доверять, и именно оно требует поправки, чтобы делаться честно.
Что это реально даёт: полноценная выборка размером в одного человека
Именно на этой логике строится исследовательский дизайн под названием n-of-1 trial: вместо вопроса, работает ли вмешательство или триггер для людей в целом, вы рассматриваете собственные повторяющиеся, последовательные наблюдения одного человека как набор данных, где сравнением служат его же другие дни — отдельная контрольная группа не нужна, потому что каждый человек служит собственным контролем во времени (Duan, Kravitz & Schmid, 2013). Именно так и устроен правильно веденный дневник симптомов и погоды: не замена популяционным исследованиям, а полноценный, значимый лично для вас набор данных — при условии, что он построен так, как описано выше: запись близко к моменту, включая обычные дни, на протяжении достаточного времени, с проверкой методом, который учитывает проверку сразу нескольких факторов.
Именно поэтому, если называть вещи своими именами, MeteoHealth существует как приложение, а не как шаблон таблицы. Оно отслеживает симптомы и настроение в два касания, сопоставляет каждую запись с местной погодой и метриками Apple Health, которые вы уже собираете, и запускает настоящую статистику на устройстве — корреляции Пирсона, ANOVA и поправку на долю ложных находок (FDR) по всем проверяемым погодным переменным, — так что то, что проявляется как закономерность в ваших данных, уже прошло ту же дисциплину, что описана в этой статье, а не просто взгляд на график. Оно не диагностирует и не предсказывает ничего; оно показывает вам ваши собственные цифры, честно сохраняя при них неопределённость, и построено полностью на устройстве, так что персональные данные о здоровье за этими цифрами никогда не должны покидать телефон. Всё остальное в этом цикле статей — слабые популяционные средние, разногласия между исследованиями, разрыв между верой и данными — и есть причина, по которой такой подход вообще необходим. Популяционное исследование может сказать, что в среднем верно для тысяч людей, которых оно никогда не узнает по отдельности. Оно не может сказать, отслеживает ли боль в вашем колене именно в этот вторник падение давления за окном. Это может сделать только ваша собственная запись, прочитанная статистикой, а не памятью.
Что в сухом остатке
На протяжении всего этого цикла честный ответ на вопрос «влияет ли погода на здоровье» звучал как некая версия «слабо, неравномерно, и зависит от человека» — никогда как чистое «да», никогда как чистое «нет». Это не неудовлетворительный итог — это правильный итог, и он прямо указывает, что делать дальше. Память — плохой судья в этих вопросах: она устойчиво находит закономерности в случайности и запоминает дни, подтверждающие историю, забывая те, что её опровергают. Дневник исправляет это, только если он ведётся близко к моменту, включает обычные дни наравне с примечательными и длится достаточно долго, чтобы дать настоящей статистике — а не взгляду на график — достаточно доказательств, чтобы отличить реальную закономерность от шума, корректно учитывая, что проверка нескольких погодных факторов одновременно повышает риск ложных тревог, если анализ к этому не готов. Сделайте это — и вы больше не гадаете и не доверяете памяти, которая устроена так, чтобы вводить вас в заблуждение именно в этом вопросе. Вы проводите полноценное исследование на одном человеке — того самого набора данных, который всегда и был самым важным: вашего собственного.
- On the belief that arthritis pain is related to the weather — Redelmeier & Tversky, Proceedings of the National Academy of Sciences, 1996.
- The occurrence of recall bias in pediatric headache: a comparison of questionnaire and diary data — van den Brink, Bandell-Hoekstra & Abu-Saad, Headache, 2001.
- Ecological Momentary Assessment (EMA) in Behavioral Medicine — Stone & Shiffman, Annals of Behavioral Medicine, 1994.
- Single-patient (n-of-1) trials: a pragmatic clinical decision methodology for patient-centered comparative effectiveness research — Duan, Kravitz & Schmid, Journal of Clinical Epidemiology, 2013.
- Controlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing — Benjamini & Hochberg, Journal of the Royal Statistical Society, Series B, 1995.