Основы доказательной медицины: Гринхальх, Флетчер и аналитика
Гринхальх и Дийкстра, Флетчер и соавторы: проверенные издания, различия книг и три собственных примера оценки доказательств для продуктового аналитика.
Содержание статьи
Вам прислали исследование: новая программа связана с меньшей частотой нежелательного исхода, p выглядит убедительно, авторы рекомендуют внедрение. Прежде чем переносить вывод в свой продукт, нужно понять, кого сравнивали, что измеряли и кого потеряли по дороге. Книги по основам доказательной медицины полезны аналитику именно как школа таких вопросов. Сопоставим конкретные издания Гринхальх с Дийкстрой и Флетчер с соавторами, а затем проверим три собственных синтетических примера в Python.
Какие книги и издания сравниваем
«Основы доказательной медицины» Т. Гринхальх и П. Дийкстры: шестое русское издание, переработанное и дополненное, Москва, ГЭОТАР-Медиа, 2026; перевод В. И. Пар, редакция В. В. Власова, ISBN 978-5-9704-9808-8. Эти сведения подтверждены издательством. Оригинальное название — How to Read a Paper: The Basics of Evidence-Based Healthcare; авторы Trisha Greenhalgh и Paul Dijkstra указаны на Wiley. Нумерация русского и английского изданий различается, поэтому не переносим её автоматически.
Вторая книга — «Клиническая эпидемиология. Основы доказательной медицины» Роберта Флетчера, Сюзанны Флетчер и Эдварда Вагнера. Выбранное русское издание: Москва, «Медиа Сфера», 1998, перевод под общей редакцией С. Е. Бащинского и С. Ю. Варшавского. Библиография подтверждена каталогом РГБ. Оригинальное название Clinical Epidemiology: The Essentials и состав авторов сверены с записью Google Books соответствующего английского выпуска.
Это обзор доступных издательских описаний, библиографических записей и открытого оглавления Гринхальх и Дийкстры. Полные тексты обеих книг постранично не сопоставлялись. Поэтому мы не оцениваем точность каждого перевода или каждого примера и не обещаем, что все обсуждаемые ниже приёмы изложены авторами именно так. Наши расчёты — самостоятельный практикум по задачам оценки доказательств.
| Книга | Авторы | Издатель / год | Вход для читателя |
|---|---|---|---|
| Основы доказательной медицины | Т. Гринхальх, П. Дийкстра | ГЭОТАР-Медиа, 2026, 6-е русское | Чтение и оценка разных исследований |
| Клиническая эпидемиология. Основы доказательной медицины | Р. Флетчер, С. Флетчер, Э. Вагнер | Медиа Сфера, 1998 | Риск, прогноз, диагностика, источники смещения |
Как различаются точки входа
По доступному оглавлению Гринхальх и Дийкстра ведут читателя от поиска публикаций и оценки методологического качества к разным типам исследований. Есть разделы об испытаниях простых и комплексных вмешательств, диагностических тестах, обзорах, экономических оценках и качественных исследованиях. В новом выпуске также представлены искусственный интеллект, механистические доказательства и согласование экспертных мнений. Это карта вопросов для чтения работ, а не обещание, что каждый вид исследования сводится к одному чеклисту.
Описание Clinical Epidemiology в Google Books строится вокруг вопросов диагноза, прогноза и лечения и защиты выводов от случайности и смещения. Для аналитика такой вход полезен тем, что заставляет различать прогноз результата и эффект изменения условий. Мы не восстанавливаем полное оглавление выбранного русского выпуска по более новым редакциям: совпадение названия не гарантирует совпадения содержания.
Наша рекомендация по уровню для обеих книг: уверенное понимание процентов, сравнений групп и неопределённости. Сложные вычисления можно осваивать отдельно, но без базового языка числителей, знаменателей и выборок критическая оценка становится обменом общими словами. Медицинское образование помогает понимать контекст, однако продуктовый аналитик может тренировать методологические вопросы на своих данных, не делая клинических рекомендаций.
Выбор зависит от вашей рабочей задачи
Если вы регулярно читаете чужие публикации и хотите выстроить последовательность вопросов к тексту, начните с формата How to Read a Paper. Перед вами не только вычислительная задача: нужно найти подходящий источник, определить дизайн и понять применимость. Если интереснее происхождение риска, прогноза и диагностической информации, рассмотрите Clinical Epidemiology как дополнительный вход в эти понятия. Это выбор маршрута, а не соревнование книг по универсальной полезности.
Практический критерий: после чтения вы должны уметь объяснить, почему две статьи с одинаковым эффектом имеют разную убедительность. Возможно, в одной есть подходящая группа сравнения, в другой — только исторический контроль; в одной исход установлен одинаково, в другой — только у части участников. Хорошая работа с книгой заканчивается такой конкретной разницей, а не списком выученных названий дизайнов.
Ни одна из книг сама по себе не является современным курсом Python, SQL или проектирования событийной аналитики. Код ниже добавлен нами, чтобы проверить рассуждение на прозрачных данных. Для реализации сложной модели понадобится документация и профильная литература; для медицинского решения — соответствующая профессиональная оценка. Перенос в продукт относится к логике доказательств, а не к клиническим действиям.
Сначала сформулируйте вопрос, который допускает ответ
Фраза «работает ли новая программа» оставляет неопределёнными участников, сравнение, исход и срок. Перепишите её: среди какой группы, по сравнению с чем, какое событие и к какому моменту должно измениться? Если программа добровольная, отдельно спросите, хотите ли вы оценить эффект предложения, фактического участия или соблюдения условий. Эти параметры совпадают не всегда.
В продукте аналогичная ситуация — сравнить тех, кто воспользовался функцией, с теми, кто её проигнорировал. Первые могут быть активнее уже до появления функции. Поэтому эффект доступности функции в рандомизированном эксперименте и различие между добровольными пользователями отвечают разным вопросам. Обе таблицы могут быть полезны, но их нельзя подписывать одним и тем же словом «влияние».
Заранее назовите практически значимое изменение и решение, которое оно поддержит. Тогда статистический результат можно связать с действием: продолжить проверку, изменить процесс сбора или внедрить при определённых условиях. Если решение не определено, возникает соблазн просмотреть множество исходов и выбрать тот, который выглядит убедительно. Формулировка вопроса ограничивает этот поиск до появления данных.
Идея первая: состав групп может перевернуть вывод
В собственной синтетической наблюдательной когорте есть группы A и B и два исходных уровня риска. В A девяносто участников с низким уровнем и десять с высоким; событий у них 9 и 6. В B низкий уровень у десяти, высокий у девяноста; событий 1 и 36. Общая частота в A равна 15%, в B — 37%. Без разреза A кажется значительно благополучнее.
Внутри низкого уровня частоты одинаковы — по 10%. Внутри высокого уровня в A 60%, в B 40%. Общий результат объясняется разным составом: в A намного больше участников из благоприятного слоя. Если стандартизировать обе группы к условной смеси с равными долями слоёв, получим 35% для A и 25% для B. Направление сравнения меняется без изменения ни одного исхода.
Код показывает простую прямую стандартизацию, а не автоматически верную причинную оценку. Мы выбрали целевую смесь для демонстрации. В реальной задаче нужно обосновать её, измерить причины смешения до воздействия и проверить, что сравниваемые состояния представлены в нужных слоях. Неизмеренное смешение останется даже после красивого выравнивания известной переменной.
| Группа | Низкий исходный уровень | Высокий исходный уровень | Общая частота | Смесь 50/50 |
|---|---|---|---|---|
| A | 9/90 = 10% | 6/10 = 60% | 15% | 35% |
| B | 1/10 = 10% | 36/90 = 40% | 37% | 25% |
# Синтетическая наблюдательная когорта: события и все участники.
groups = {
"A": {"low": (9,90), "high": (6,10)},
"B": {"low": (1,10), "high": (36,90)},
}
for arm,g in groups.items():
crude = sum(a for a,n in g.values())/sum(n for a,n in g.values())
standardized = sum(.5*a/n for a,n in g.values())
print(arm,"within strata",[a/n for a,n in g.values()],
"crude",crude,"equal mix",standardized)Как читать такой результат в продуктовом отчёте
Подставьте вместо уровней риска каналы привлечения или исходную активность. Новый интерфейс мог чаще попадать опытным пользователям, старый — новичкам. Общая конверсия тогда смешивает свойства интерфейса и состав аудитории. Начните с дизайна назначения и базовых характеристик, затем решите, что означает корректное сравнение. Не добавляйте все доступные признаки в модель без временной и причинной логики.
Особенно опасно корректировать на поведение после воздействия. Если функция меняет активность, а вы сравниваете варианты только среди одинаково активных, можете удалить часть изучаемого эффекта или создать новое смещение. Переменная должна попадать в анализ по роли в вопросе, а не по доступности в базе. Схема временного порядка событий часто помогает больше, чем ещё одна таблица коэффициентов.
При рандомизации исходная сопоставимость обеспечивается процедурой в среднем, но конкретная небольшая выборка может иметь случайные различия. Это не повод выбирать анализ по наиболее выгодному разрезу. Сохраните заранее определённую основную оценку, а объясняющие анализы подпишите отдельно. Так читатель увидит, где проверялась исходная гипотеза, а где возникла новая.
Идея вторая: потери наблюдения меняют диапазон возможного
В другом условном исследовании в каждую группу назначено по 100 участников. В A исход известен у 90, благоприятный результат есть у 54. В B известен у 80, благоприятный — у 40. Среди наблюдённых доли равны 60% и 50%. Кажется, преимущество A составляет десять процентных пунктов. Но исходы остальных участников не установлены, и их отсутствие может быть связано с результатом.
Посчитаем крайние сценарии без попытки угадать пропуски. Если все отсутствующие в A не имели успеха, доля на всех назначенных составит 54%; если все имели — 64%. Для B границы равны 40% и 60%. Поэтому разность A−B совместима с диапазоном от −6 до +24 процентных пунктов в зависимости от неизвестных исходов. Это логические границы при данных количествах, не доверительный интервал.
Ширина сценария не доказывает, что эффект отрицателен, и не означает равную правдоподобность всех вариантов. Она показывает, какой информации не хватает для уверенного вывода. Дальше полезно выяснить причины потерь, сравнить доступные исходные характеристики и сформулировать реалистичные сценарии. Автоматическое исключение пропусков скрывает проблему, а автоматическое заполнение успехом или неуспехом подменяет её недоказанным предположением.
# Синтетический благоприятный исход; по 100 назначенных в группу.
observed = {"A":(54,90),"B":(40,80)}
for arm,(success,seen) in observed.items():
print(arm,"complete cases",success/seen,
"all missing fail",success/100,
"all missing succeed",(success+100-seen)/100)
print("worst A-B",54/100-60/100)
print("best A-B",64/100-40/100)Что забрать из этого примера в A/B-тест
В продуктовом эксперименте неизвестный исход часто маскируется под ноль: человек не прислал событие, значит не совершил действие. Иногда это верно, потому что надёжный источник наблюдал весь период. Иногда отсутствует трекинг, пользователь перешёл на другую платформу или окно ещё не завершилось. Отчёт должен различать отсутствие события и отсутствие возможности узнать о событии.
Сохранение групп по назначению не означает, что проблему неизвестных результатов можно игнорировать. Оно задаёт принцип сравнения воздействия назначения, а обращение с пропусками всё равно требует обоснования. Если новая версия сама ухудшает доставку событий, анализ только наблюдаемых пользователей может выбрать особую подгруппу. Проверка полноты измерения становится частью оценки эксперимента, а не необязательной технической задачей.
Полезный вопрос к любой статье: могут ли несколько неустановленных исходов изменить практическое решение? Если ответ да, это нужно вынести в основной вывод, даже при привлекательном p по доступным строкам. Сценарный анализ иногда оказывается понятнее сложной модели, потому что показывает руководителю конкретную цену недостающей информации и пользу дополнительного наблюдения.
Идея третья: одинаковый относительный эффект переносится по-разному
Предположим для учебной модели, что относительный риск при изменении условий равен 0,8. В популяции с исходным риском 10% новая вероятность составит 8%, абсолютное уменьшение — 2 процентных пункта. В популяции с исходным риском 1% получится 0,8%, уменьшение — 0,2 пункта. При пересчёте на тысячу это 20 и 2 ожидаемых предотвращённых события соответственно.
Все числа — следствие заданной модели, а не результаты медицинского исследования. Мы удержали RR постоянным, чтобы показать роль исходного риска. В реальности даже относительный эффект может отличаться между популяциями. Поэтому перенос должен проверять и состав, и механизм воздействия, и одинаковость исхода, и доступность реализации. Одна формула не обеспечивает внешнюю применимость.
В продукте скидочная механика может давать похожий относительный рост конверсии на двух рынках, но разные абсолютные объёмы, расходы и нагрузки. Решение зависит от масштаба базы и последствий, а не только от коэффициента. Добавьте стоимость внедрения, ограничения поддержки и возможные отрицательные эффекты, если они относятся к вашему решению. Статистическая оценка — вход в выбор, а не готовый выбор.
# Модель переноса: одинаковое предполагаемое RR при разных базовых рисках.
for baseline in [.10,.01]:
rr = .8
new_risk = baseline*rr
print("baseline,new risk,absolute decrease",baseline,new_risk,baseline-new_risk)
print("expected events avoided per 1000",1000*(baseline-new_risk))Почему иерархии дизайнов недостаточно
Тип исследования помогает понять угрозы выводу, но не освобождает от проверки исполнения. Рандомизация может быть нарушена, исход измерен по-разному, наблюдение потеряно неслучайно. Наблюдательная работа может отвечать на вопрос, который невозможно или неуместно изучать экспериментом. Поэтому вместо одного ярлыка «сильное доказательство» полезнее перечислить, какие альтернативные объяснения устраняет конкретный дизайн.
Систематический обзор тоже не становится автоматически убедительным из-за названия. Нужно понять вопрос, правила поиска и отбора, совместимость включённых работ и причины расхождений. Объединение смещённых исследований может сделать оценку точнее вокруг неправильной величины. Большой общий размер выборки не отменяет исходные ошибки измерения или неполноту публикаций.
Для аналитика это применимо к внутренней библиотеке экспериментов. Суммировать только удачные запуски и игнорировать остановленные проверки — способ получить оптимистичный обзор продукта. Сохраняйте протоколы, отрицательные и неопределённые результаты, различия аудиторий и версий. Тогда последующий анализ опыта будет опираться на более полный набор, а не на презентации победителей.
Что считать сильной стороной этих книг
По проверенной карте тем Гринхальх и Дийкстра предлагают широкий маршрут чтения исследований, включая вопросы, которые не сводятся к проверке среднего. Для нашей аудитории достоинство такого маршрута — привычка сначала распознавать задачу и дизайн. Это редакционная оценка пригодности формата, а не заключение о качестве каждой главы. Наличие темы в оглавлении подтверждает охват, но не глубину всех технических деталей.
Clinical Epidemiology интересна как фундаментальный вход в связь клинического вопроса, вероятности и источников искажения. Старое выбранное русское издание полезно оценивать именно по этой роли. Возраст книги не делает базовые понятия неверными, но примеры, источники поиска и конкретные практики требуют сопоставления с текущими материалами. Не используйте старое учебное описание как актуальное руководство по реальной клинической процедуре.
Обе книги разумнее сочетать с практикой чтения, чем использовать как список правильных ответов. Возьмите одну доступную исследовательскую работу и составьте карту: вопрос, дизайн, данные, оценка, ограничения, применимость. Затем попробуйте воспроизвести ключевое деление или таблицу. Если для этого не хватает сведений, запишите конкретный пробел вместо общего недоверия к авторам.
Кому не хватит такого обзора
Если требуется математическое доказательство состоятельности оценок, эти ориентиры не заменят курс теории. Если задача — реализовать конкретную модель в библиотеке, нужна её документация и проверка предпосылок. Если вы ищете индивидуальное решение о здоровье, учебная аналогия с продуктовыми данными не подходит. Уточнение границ экономит время и защищает от использования полезной книги для чужой задачи.
Для новичка без опыта таблиц начните с одного простого примера частот и интервала. Для аналитика с сильной технической базой полезнее сразу разбирать угрозы валидности и перенос между популяциями. Для руководителя хороший результат чтения — способность запросить недостающее сравнение и увидеть, где уверенность превышает данные. Не всем читателям нужен одинаковый порядок глав и одинаковая глубина вычислений.
Где заканчивается перенос аналогии
Пациент и пользователь продукта не взаимозаменяемы: различаются последствия ошибок, права участников, цели и условия принятия решений. Мы переносим способы рассуждения о сравнении и неизвестных исходах, а не медицинские протоколы в бизнес. Даже внутри одной предметной области одинаковая статистическая процедура может обслуживать разные ценности и ограничения. Их следует назвать отдельно от расчёта.
Например, среднее улучшение не сообщает, как распределились последствия между людьми. Для решения может быть существенен небольшой сегмент с выраженным ухудшением, если он определён содержательно и анализируется корректно. И наоборот, найденный постфактум удобный сегмент не доказывает универсальную стратегию персонализации. Критическое чтение требует одновременно внимания к неоднородности и защиты от произвольного выбора результата. Это хороший повод обсуждать анализ вместе с людьми, которые знают сам процесс, а не только таблицу.
Как организовать чтение без накопления конспектов
Выберите реальное рабочее решение и сформулируйте, какие данные могли бы его изменить. Затем найдите в доступной структуре книги соответствующий тип вопроса: эффект вмешательства, диагностика, прогноз или обобщение исследований. Выпишите несколько проверяемых условий и приложите их к одному материалу. Не пытайтесь оценить всё сразу: так легче заметить конкретную ошибку в знаменателе или сроке.
После чтения сделайте маленький собственный расчёт, подобный одному из трёх выше. Измените состав, потери или базовый риск и объясните, почему вывод меняется. Такие упражнения лучше обнаруживают непонимание, чем переписывание определения. Сохраняйте код и короткий текст результата вместе: будущий читатель должен видеть, какие числа заданы, какие получены и какие допущения остались непроверенными.
Завершите короткой запиской для коллеги: что известно, что остаётся неопределённым, какое следующее наблюдение наиболее полезно. Не подменяйте её списком общих ограничений. Если ключевая проблема — неизвестные исходы, скажите, какие именно нужно установить. Если проблема — состав групп, назовите сравнение, которое поможет отделить его влияние. Это и есть практический результат критического чтения.
Что почитать в паре
Для самого расчёта продолжите статьями об относительном риске, чувствительности и специфичности и анализе выживаемости. Они показывают, какие вопросы скрыты внутри привычных терминов. Обзор Ланга и Сесик пригодится для записи результата, а вводный материал по медицинской статистике — для восстановления общей карты методов. Эти внутренние связи составляют маршрут от вопроса к проверяемому сообщению.
Мы подтвердили конкретные издания и доступную структуру, но не сравнивали все редакции и не проверяли каждую ссылку внутри полных книг. Отдельные собственные советы выше не следует цитировать как дословную позицию авторов. Такой предел обзора оставляет читателю возможность осмысленно выбрать книгу, не создавая впечатления экспертизы, которой здесь не было.
Материал образовательный. Медицинские ситуации и данные синтетические; примеры посвящены оценке доказательств и не являются рекомендациями по диагностике или лечению.
Материалы по теме

Корреляция Спирмена и Пирсона: выбор, расчёт и ошибки
Корреляция Спирмена и Пирсона на условных медицинских данных: линейная и монотонная связь, выбросы, перестановочный тест в Python и перенос в продукт.

Относительный риск и отношение шансов: разница на примерах
Чем относительный риск отличается от отношения шансов: таблица 2×2, абсолютный эффект, доверительные интервалы, случай — контроль и A/B-тест в Python.

Чувствительность и специфичность теста: расчёт на примере
Чувствительность и специфичность теста, PPV и NPV на синтетических данных. Распространённость, пороги, интервалы и перенос в антифрод с кодом Python.