Каждый день в ленту падает новый заголовок: «Учёные доказали, что кофе продлевает жизнь», «Добавка Х снижает риск инфаркта на 40%», «Исследование: голодание перезапускает иммунитет». Часть из этого правда, часть — пересказ эксперимента на двадцати мышах, часть — пресс-релиз производителя. Эта статья учит отличать одно от другого своими силами, без диплома биостатистика.

Представь, что ты стоишь у полки с БАДами, а в телефоне открыта статья с громким выводом. От того, умеешь ли ты за пару минут разложить это исследование по полочкам, зависит, потратишь ли ты деньги и надежду впустую. Ниже — тот самый внутренний фильтр, через который на 120DNK проходит любое утверждение, прежде чем мы напишем «доказано», «спорно» или «миф». Это не занудная теория, а рабочий инструмент. Освоишь его — и половина хайпа рассыплется на твоих глазах.

Пирамида доказательств: не все исследования равны

Первое, что нужно уложить в голове: слово «исследование» ничего не говорит о силе доказательства. Опыт на клетках в пробирке и мета-анализ на ста тысячах человек — оба «исследования», но доверия к ним отличается в тысячи раз. Учёные выстроили эти типы в иерархию, где выше стоит то, что труднее обмануть случайностью и предвзятостью.

Вот эта лестница снизу вверх:

Уровень Тип исследования Что он показывает Насколько доверять
Низ Мнение эксперта, обзор без системы Чью-то интерпретацию Минимум
Опыт in vitro (пробирка, клетки) Что вещество делает с клеткой Гипотеза, не более
Опыты на животных Что происходит с мышью или крысой Направление поиска
Наблюдательные (когорта, случай-контроль) Связь между А и Б у людей Корреляция, не причина
Рандомизированное контролируемое (RCT) Причинно-следственную связь у людей Высоко
Верх Систематический обзор и мета-анализ RCT Итог по всем качественным RCT Максимум

Ключевая мысль: наблюдательное исследование ловит связь, но не доказывает причину. Классический пример — люди, пьющие красное вино умеренно, в среднем здоровее. Значит ли это, что вино лечит сердце? Нет. Просто умеренно пьющие чаще имеют деньги, врача и спортзал. Связь есть, причины нет. Чтобы доказать причину, нужен эксперимент, где людей случайно поделили на группы, — то есть RCT.

Профессиональные врачи оценивают силу доказательств по системе GRADE, которую в 2008 году описал коллектив под руководством Гордона Гайатта: она ранжирует данные от «высокого качества» до «очень низкого» и учитывает сразу несколько вещей: тип исследования, его аккуратность, согласованность результатов, риск систематической ошибки. Тебе не нужно знать GRADE наизусть. Нужно помнить пирамиду и один вопрос: «на каком этаже стоит то, о чём мне рассказали?»

Что делает эксперимент честным: рандомизация, слепота, плацебо

RCT стоит высоко в пирамиде не из-за модной аббревиатуры, а из-за трёх защит, встроенных в его конструкцию.

Рандомизация. Участников делят на группу лечения и группу сравнения случайным образом — жребием, а не по выбору врача. Это выравнивает группы по возрасту, тяжести болезни, привычкам и тысяче факторов, о которых мы даже не подозреваем. Без жребия в «группу нового лекарства» легко попадут те, кто изначально здоровее, и препарат припишет себе чужую заслугу.

Слепой метод. Если пациент знает, что получает «прорывное средство», ему становится легче просто от ожидания. Если врач знает, кто в какой группе, он бессознательно мягче оценивает «своих». Поэтому в хорошем эксперименте не знает никто: ни пациент, ни врач, ни тот, кто считает результаты. Это называется двойным ослеплением.

Плацебо. Контрольная группа получает пустышку, неотличимую по виду. Эффект плацебо реален и силён, особенно там, где симптомы субъективны — боль, тревога, усталость, качество сна. Без группы плацебо ты не отличишь работу лекарства от работы веры в лекарство.

Когда видишь фразу «двойное слепое рандомизированное плацебо-контролируемое исследование» — это знак качества. Когда видишь «группа добровольцев принимала добавку и почувствовала себя лучше» — это не доказательство, а анкета. Именно на этом различии мы разбирали, работает ли коллаген в добавках и что реально показали адаптогены вроде ашваганды и родиолы: часть громких заявлений держится ровно на открытых опросах без контрольной группы.

«На мышах сработало» — почему это ещё ничего не значит

Огромная доля сенсаций в СМИ — это эксперименты на грызунах и клетках, поданные так, будто речь про людей. Между мышью и человеком лежит пропасть. Дозы, которые «омолаживают» мышь, в пересчёте на человека часто нереальны или токсичны. Метаболизм, продолжительность жизни, иммунитет различаются кардинально.

Насколько плохо переносятся результаты, показали Дэниел Хэкам и Дональд Редельмайер: из высокоцитируемых животных исследований, где лечение выглядело успешным, лишь около трети затем подтвердилось в испытаниях на людях, а до реального клинического применения дошла и вовсе десятая часть. Остальное отвалилось: на человеке эффект исчезал, оборачивался вредом или не воспроизводился.

Практическое правило простое. Читаешь про прорыв — найди, на ком он получен. Если в тексте (или хотя бы в подписи к исследованию) фигурируют mice, rats, «на грызунах», in vitro, «на клеточной культуре» — понижай градус восторга сразу на несколько ступеней. Это интересная гипотеза и повод для дальнейших опытов, но не инструкция для твоей аптечки. Многие модные «активаторы долголетия» застряли именно здесь, о чём мы писали в разборе что показывают исследования метформина.

p-value и доверительный интервал: два числа, которые все путают

Дальше начинается статистика, но не пугайся — тебе хватит понять смысл двух чисел.

Что на самом деле означает p < 0,05

p-value (уровень значимости) — самое недопонятое число в науке. Люди думают, что «p = 0,05» значит «есть 95% вероятность, что лекарство работает». Это неверно. p-value отвечает на другой, более узкий вопрос: если бы лекарство на самом деле не работало, какова вероятность случайно получить такой же или ещё более выраженный результат? Если эта вероятность мала (меньше 5%, то есть p < 0,05), результат считают «статистически значимым».

Порог 0,05 — договорённость, а не закон природы. Он не делит мир на «доказано» и «нет». Группа из семи известных статистиков во главе с Сандером Гринландом собрала 25 типичных заблуждений вокруг p-value и предупреждает: маленькое p не измеряет размер эффекта, не доказывает истинность гипотезы и легко получается случайно, если проверять много вариантов подряд. Отдельно стоит запомнить: «статистически значимо» не равно «важно для здоровья». Эффект может быть достоверным и при этом настолько крохотным, что в жизни его никто не заметит.

Доверительный интервал честнее одной цифры

Гораздо полезнее p-value — доверительный интервал (ДИ). Одна цифра «снижает риск на 20%» звучит уверенно, но это лишь оценка по одной выборке. Доверительный интервал показывает диапазон, в котором с высокой вероятностью лежит правда.

Сравни две записи об одном и том же «снижении риска на 20%»:

  • ДИ от 15% до 25% — эффект стабилен, реальная польза почти наверняка есть.
  • ДИ от 1% до 55% — данные настолько шаткие, что истинный эффект может быть как почти нулевым, так и огромным. Такому «прорыву» верить рано.

Есть простое правило для интервала. Если речь о разнице между группами и доверительный интервал пересекает ноль (например, «эффект от −3% до +12%»), значит, результат мог оказаться и нулевым, и даже обратным. Широкий интервал, залезающий в зону «никакой разницы», — красный флаг независимо от того, что написано в заголовке.

Относительный и абсолютный риск: где прячется обман

Это любимейший приём маркетинга и жёлтых заголовков, и именно на нём ловятся почти все. Есть два способа описать одну и ту же цифру, и они дают совершенно разное впечатление.

Представь лекарство, которое за пять лет снижает частоту инфаркта. В группе плацебо инфаркт случился у 2 человек из 100. В группе лекарства — у 1 из 100.

Как назвать Формулировка Что слышит читатель
Относительный риск «Снижает риск инфаркта на 50%» Огромная польза
Абсолютный риск «Снижает риск с 2% до 1%, то есть на 1 человека из 100» Скромная польза

Обе фразы описывают один и тот же результат. Первая — правда, которая раздувает эффект вдвое. Вторая — та же правда, но честная. Заголовки почти всегда берут относительный риск, потому что 50% продаёт лучше, чем «одного человека из ста».

Герд Гигеренцер с коллегами назвал это «коллективной статистической безграмотностью» и показал, что относительными процентами регулярно вводят в заблуждение и пациентов, и самих врачей с журналистами. Их рецепт совпадает с нашим: всегда переводи относительный риск в абсолютный и спрашивай «сколько это людей из ста (или из тысячи)?». Если абсолютную цифру в тексте спрятали или не привели вовсе — это повод насторожиться, а не восхититься. Тот же приём мы распутывали, когда разбирали что реально доказано про омега-3 и рыбий жир: громкие проценты снижения риска при переводе в абсолютные числа таяли до едва заметных.

Размер выборки и мощность: почему «прорыв на 20 добровольцах» — не прорыв

Чем меньше участников, тем легче получить случайный результат — и в плюс, и в минус. Исследование на 12 добровольцах может показать что угодно просто по игре случая. Крупный RCT на тысячах человек отсеивает шум.

Статистики называют это мощностью исследования: способностью поймать реальный эффект, если он есть. Маленькие выборки коварны вдвойне. Во-первых, они часто «не видят» настоящий, но умеренный эффект. Во-вторых, если такое исследование всё-таки выдаёт значимый результат, размер эффекта обычно преувеличен. Джон Иоаннидис отдельно подчёркивал: чем меньше исследования в области и чем меньше эффекты, которые они гоняются поймать, тем выше доля ложных «открытий».

Практический ориентир для читателя новостей:

  • Десятки участников — пилот, разведка боем. Интересно, но ничего не доказывает.
  • Сотни участников — уже серьёзно, если дизайн честный.
  • Тысячи участников в RCT или мета-анализ из многих таких работ — вот это вес.

Когда видишь «исследование показало», первым делом ищи число участников. Нет числа в тексте — почти наверняка оно маленькое, иначе им бы хвастались.

p-hacking, спин и ящик стола: как исчезают неудобные данные

Даже честные по замыслу исследования искажаются на этапе анализа и публикации. Три механизма стоит знать в лицо.

p-hacking. Исследователь измеряет два десятка показателей, а в статью выносит только тот, где случайно выскочило p < 0,05. Или пробует разные способы подсчёта, пока один не «сработает». Мегана Хэд с коллегами с помощью анализа текстов тысяч статей показала, что такое подкручивание распространено по всей науке. Хорошая защита от него — предрегистрация (о ней ниже), когда учёные заранее объявляют, что именно будут измерять.

Спин. Это когда результат нулевой, а выводы бодрые. Изабель Бутрон с коллегами разобрала испытания, где главная цель не была достигнута (лекарство не сработало по основному показателю), и обнаружила: примерно в половине таких статей в тексте и выводах всё равно рисовали успех, а в заголовках положительно подавали каждую пятую. Вывод для читателя: не верь абстракту и пресс-релизу на слово, ищи, что именно было главной целью исследования и достигнута ли она.

Ящик стола (публикационное смещение). «Скучные» исследования, где ничего не нашли, чаще не публикуют — они оседают в ящике стола. В итоге в журналах виден перекос в сторону «нашли эффект». Эрик Тёрнер с коллегами показал это на антидепрессантах: по опубликованным статьям выходило, что положительны 94% испытаний, а по полным данным регулятора FDA — лишь около половины. Половина неудобной правды просто не доехала до печатных страниц.

Кто заплатил и был ли план: конфликт интересов и предрегистрация

Два последних вопроса к любому исследованию — про деньги и про честность намерений.

Кто финансировал. Это не про злодеев в халатах, а про статистику. Кокрейновский обзор Андреаса Лунда и коллег свёл воедино десятки работ и обнаружил устойчивую закономерность: исследования, оплаченные производителем препарата или прибора, чаще приходят к выводам, выгодным этому производителю, чем независимые работы по той же теме. Причём разница не объясняется обычными огрехами методологии — это отдельное, «спонсорское» смещение. Ищи в статье раздел про финансирование и конфликт интересов (funding, conflicts of interest). Если добавку изучал её же продавец, читай выводы с поправкой.

Была ли предрегистрация. Честная команда заранее, до сбора данных, публикует план: какую гипотезу проверяет, что считает главным результатом, как будет анализировать. Тогда нельзя задним числом подогнать цель под то, что случайно получилось. Насколько это меняет картину, красиво показали Роберт Каплан и Вероника Ирвин: они посмотрели крупные кардиологические испытания, финансировавшиеся государственным институтом. До введения обязательной предрегистрации на сайте clinicaltrials.gov положительный результат давали 57% работ, а после — лишь 8%. Ничего в лекарствах не изменилось. Изменилось лишь то, что учёным перестало быть можно тихо переписывать цель под удачный итог.

«Большинство опубликованного — ложно»: что имел в виду Иоаннидис

Всё сказанное выше в 2005 году свёл в один знаменитый текст эпидемиолог Джон Иоаннидис. Его статья с провокационным названием «Почему большинство опубликованных научных результатов ложны» — самая цитируемая работа в своём жанре. Он показал математически: когда исследования маленькие, эффекты слабые, проверяемых гипотез много, а денег и амбиций в области хватает, ложных «открытий» будет больше, чем истинных.

Это подтвердилось на практике. Масштабный проект по воспроизведению (Open Science Collaboration) заново провёл 100 известных психологических экспериментов. Значимый результат исходно был у 97% из них, а повторно воспроизвести удалось лишь около 36%. Сила эффектов при повторе упала вдвое. В медицине картина не радужнее: множество «прорывов» тихо не подтверждается, когда их проверяют независимые команды на больших выборках.

Правильный вывод из этого — не «наука врёт». Наоборот: наука сама вычищает свои ошибки, и именно поэтому мета-анализ и воспроизведение стоят на вершине пирамиды, а одиночная сенсация — у подножия. Здоровый скепсис к единичному заголовку — это не цинизм, а грамотное чтение. На этом принципе построен весь наш подход: мы смотрим не на одно исследование, а на совокупность, о чём регулярно рассказываем в обзорах свежих исследований биохакинга и в базовом научном гайде по биохакингу.

Что делать: чек-лист на 2 минуты

Когда в следующий раз наткнёшься на громкий заголовок о здоровье, прогони его через семь вопросов. Двух минут хватает.

  1. На ком проведено? Люди, мыши или клетки в пробирке? Если не люди — это гипотеза, а не руководство к действию.
  2. Сколько участников? Десятки — пилот, сотни — серьёзно, тысячи или мета-анализ — вес. Числа нет в тексте — ищи подвох.
  3. Был ли контроль и жребий? Двойное слепое рандомизированное плацебо-контролируемое — знак качества. «Группа принимала и почувствовала улучшение» — анкета, не доказательство.
  4. Абсолютный риск или относительный? Переведи «минус 50%» в «сколько людей из ста». Если абсолютную цифру спрятали, эффект, скорее всего, скромный.
  5. Насколько широк доверительный интервал? Узкий и далёкий от нуля — надёжно. Широкий, задевающий «никакой разницы», — рано радоваться.
  6. Кто заплатил? Производитель, изучающий свой же продукт, — читай выводы с поправкой на интерес.
  7. Это одно исследование или итог многих? Одиночная сенсация ≠ мета-анализ. Дождись, пока результат повторят независимые команды.

Ни один пункт не требует знания формул. Требует только привычки задавать вопросы прежде, чем открывать кошелёк или менять образ жизни. Прежде чем принимать решение о добавках или обследованиях, полезно свериться и с нашим разбором, какие анализы реально стоит сдать, — там та же логика доказательности приложена к чек-апу.

Частые вопросы

Что важнее — один свежий RCT или старый мета-анализ?

Обычно мета-анализ, потому что он сводит вместе множество RCT и усредняет их ошибки. Но есть нюанс: если мета-анализ старый, а после него вышло крупное качественное испытание, меняющее картину, — свежий большой RCT может весить больше. Смотри не на дату, а на объём данных и качество. Один маленький свежий RCT почти никогда не перебивает хороший мета-анализ.

Если p меньше 0,05, значит, эффект доказан?

Нет. p < 0,05 означает лишь, что такой результат маловероятно получить случайно, если бы эффекта не было. Это не вероятность того, что гипотеза верна, и не размер пользы. Эффект может быть статистически значимым и при этом ничтожным по масштабу. Смотри сразу на три вещи: p, размер эффекта и доверительный интервал.

Как быстро понять, финансировал ли исследование производитель?

В самой статье ищи разделы Funding, Sponsor, Conflicts of interest или «Финансирование» и «Конфликт интересов» — обычно в конце. В новостном пересказе этого чаще нет, поэтому загляни в первоисточник. Финансирование производителем не делает работу автоматически ложной, но статистически повышает шанс выводов в его пользу, так что относись к таким итогам осторожнее.

Почему «доказано на мышах» так часто не срабатывает на людях?

Потому что мышь — не маленький человек. Различаются метаболизм, дозы, продолжительность жизни, устройство иммунитета. Из успешных опытов на животных до подтверждения у людей доходит меньшинство. Такие работы полезны как поиск направления, но переносить их выводы на свою аптечку рано.

Относительный риск снизился на 50% — это много или мало?

Само по себе неизвестно, пока не увидишь абсолютные числа. «Минус 50%» может означать снижение с 2% до 1% (одна спасённая жизнь на сто человек) или с 40% до 20% (двадцать на сто) — разница колоссальная. Всегда переспрашивай: с какого до какого процента и сколько это людей из ста или тысячи.

Медицинская оговорка. Материал образовательный и не заменяет консультацию врача. Умение читать исследования помогает задавать правильные вопросы, но не отменяет профессиональной оценки твоей конкретной ситуации. Не начинай и не бросай лечение, не меняй назначенные препараты и не откладывай визит к специалисту, опираясь только на самостоятельный разбор научных статей.

Источники

  1. Ioannidis JPA (2005). Why most published research findings are false. PLoS Medicine, 2(8), e124. PubMed: 16060722
  2. Guyatt GH, Oxman AD, Vist GE, et al. (2008). GRADE: an emerging consensus on rating quality of evidence and strength of recommendations. BMJ, 336(7650), 924–926. PubMed: 18436948
  3. Greenland S, Senn SJ, Rothman KJ, et al. (2016). Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations. European Journal of Epidemiology, 31(4), 337–350. PubMed: 27209009
  4. Gigerenzer G, Gaissmaier W, Kurz-Milcke E, et al. (2007). Helping doctors and patients make sense of health statistics. Psychological Science in the Public Interest, 8(2), 53–96. PubMed: 26161749
  5. Hackam DG, Redelmeier DA (2006). Translation of research evidence from animals to humans. JAMA, 296(14), 1731–1732. PubMed: 17032985
  6. Head ML, Holman L, Lanfear R, et al. (2015). The extent and consequences of p-hacking in science. PLoS Biology, 13(3), e1002106. PubMed: 25768323
  7. Boutron I, Dutton S, Ravaud P, Altman DG (2010). Reporting and interpretation of randomized controlled trials with statistically nonsignificant results for primary outcomes. JAMA, 303(20), 2058–2064. PubMed: 20501928
  8. Turner EH, Matthews AM, Linardatos E, et al. (2008). Selective publication of antidepressant trials and its influence on apparent efficacy. New England Journal of Medicine, 358(3), 252–260. PubMed: 18199864
  9. Lundh A, Lexchin J, Mintzes B, et al. (2017). Industry sponsorship and research outcome. Cochrane Database of Systematic Reviews, 2(2), MR000033. PubMed: 28207928
  10. Kaplan RM, Irvin VL (2015). Likelihood of null effects of large NHLBI clinical trials has increased over time. PLoS ONE, 10(8), e0132382. PubMed: 26244868
  11. Open Science Collaboration (2015). Estimating the reproducibility of psychological science. Science, 349(6251), aac4716. PubMed: 26315443

#120dnk #наука #биохакинг #здоровье #профилактика