Все материалы
Продуктовая аналитикаматериалстарт

«Наглядная медицинская статистика» Петри и Сэбина: обзор

Обзор книги Петри и Сэбина: кому подходит краткий справочник, что проверено об издании и как закрепить идеи собственными расчётами в Python.

КейсПрактика24 сентября 2026 г.12 мин

Вы прочитали статистический раздел исследования и узнали все слова по отдельности, но не поняли, почему авторы выбрали именно этот анализ. В такой ситуации нужна короткая карта: тип данных, дизайн, оцениваемый эффект и подходящий метод. «Наглядная медицинская статистика» Петри и Сэбина выглядит подходящим кандидатом по заявленной структуре. Разберём, кому полезен такой формат, где его недостаточно и как проверить понимание на двух собственных примерах с Python. Это обзор доступных издательских материалов, а не заявление о постраничном прочтении всех редакций книги.

Кому рассмотреть этот справочник

Наше основание для этой рекомендации — описание формата и состава тем у издателей. Из него нельзя сделать вывод, что каждое объяснение одинаково удачно или что перевод лишён ошибок. Поэтому оценка ниже относится к способу использования книги. Собственные упражнения показывают, как превратить чтение короткого раздела в проверяемое действие. Они не воспроизводят книжные задачи и не выдаются за примеры авторов. Такая граница позволяет обсуждать пользу источника без выдуманного опыта знакомства с недоступными страницами.

  • Новичку, которому нужен обзор связей между темами перед более подробным изучением отдельных методов.
  • Читателю медицинских исследований, который хочет задавать вопросы к дизайну и представлению результатов.
  • Аналитику, которому удобны короткие тематические разделы для повторения, но который готов закреплять их самостоятельными расчётами.
  • Для сложного реального протокола одного краткого справочника недостаточно: нужна проверка предпосылок конкретной задачи.

Библиография: не смешиваем русские издания

Авторы — Авива Петри и Кэролайн Сэбин, Aviva Petrie и Caroline Sabin. Оригинальное название — Medical Statistics at a Glance. Для этого обзора выбрано четвёртое русское издание: «Наглядная медицинская статистика», Москва, ГЭОТАР-Медиа, 2021, перевод под редакцией В. П. Леонова, ISBN 978-5-9704-5904-1. Издательская карточка подтверждает год, редактора перевода и номер издания; запись НЭБ помогает идентифицировать книгу. Оригинальное название и имена авторов сверены по Wiley.

В выдаче встречаются другие годы и более ранние русские издания. Они не становятся автоматически тем же самым текстом только из-за совпадения названия. Если у вас уже есть экземпляр, посмотрите выходные данные и сопоставьте нужные темы с его содержанием. Номер русского издания также не стоит без проверки превращать в утверждение о полном соответствии конкретной англоязычной редакции. В обзоре мы не утверждаем такую постраничную эквивалентность, не оцениваем наличие в продаже и не приводим непроверенные сведения о тираже.

Проверенная карточка русского издания; уровень — наша редакционная оценка
ПолеСведения
АвторыАвива Петри, Кэролайн Сэбин / Aviva Petrie, Caroline Sabin
НазваниеНаглядная медицинская статистика / Medical Statistics at a Glance
Издание4-е русское; Москва: ГЭОТАР-Медиа, 2021
Редактор переводаВ. П. Леонов
ISBN978-5-9704-5904-1
ЧитательНовичок или практик, повторяющий карту методов
МатематикаДроби, проценты, базовая вероятность; далее по задаче

Сильная сторона формата: быстро восстановить вопрос

Wiley описывает короткие самостоятельные главы, перекрёстные связи и схемы выбора методов. Русский издатель указывает широкий набор тем, включая сравнения, регрессионные подходы и анализ времени до события. Редакционный вывод из такого устройства: книгу разумно использовать как карту, которая помогает заметить пропущенный вопрос. Например, после слов «сравнили две группы» читатель должен уточнить независимость, шкалу исхода и цель сравнения. Краткость полезна именно для восстановления связей, а не как гарантия, что любой анализ помещается в одну схему.

Есть и обратная сторона. Сжатое изложение легко прочитать быстро и переоценить понимание. Узнавание слов «чувствительность» и «доверительный интервал» ещё не означает, что вы сможете правильно истолковать результат. Поэтому после каждого небольшого раздела полезно закрыть книгу и решить собственный пример. Сначала предскажите ответ словами, затем посчитайте и объясните различие между результатом и ожиданием. Если ошиблись, вернитесь к определению. Этот цикл делает краткий справочник рабочим инструментом, а не коллекцией знакомых терминов.

Практика №1: одинаковые 60%, разная точность

Возьмём две условные выборки с бинарным результатом наблюдения. В первой событие зарегистрировано у 12 из 20 участников, во второй у 120 из 200. Обе доли равны 60%. Эти числа придуманы нами и не описывают лечение или реальную частоту заболевания. Вопрос упражнения: одинаково ли точно они характеризуют вероятность события? Для иллюстрации используем 95%-е интервалы Уилсона, которые вычисляет метод proportion_ci результата scipy.stats.binomtest при явно указанном method="wilson".

Получаются интервалы примерно 38,66–78,12% и 53,08–66,54%. Одинаковая точечная оценка скрывает разную неопределённость. В маленькой выборке ещё допустим широкий диапазон вероятностей, в большей оценка существенно точнее. Это не означает, что 95% людей попадают внутрь интервала: исход каждого человека бинарный. Уровень доверия относится к процедуре оценивания вероятности события по повторным выборкам при её предпосылках. Для отчёта полезно указывать числитель и знаменатель, а не только процент с несколькими знаками.

Теперь добавьте вопрос о происхождении выборки. Если ответили лишь самые заинтересованные участники, увеличение их числа не устраняет смещение. Узкий интервал вокруг доли ответивших может очень точно оценивать не ту популяцию, о которой говорит заголовок. Так одно упражнение связывает описание, неопределённость и дизайн отбора. После чтения темы об интервалах попробуйте объяснить оба ограничения: почему двадцати наблюдений мало для точности и почему двухсот наблюдений может быть недостаточно для переносимости вывода.

В продукте замените событие завершением онбординга за полное фиксированное окно. Из одинаковых 60% нельзя выбрать более успешный вариант: это две точечные оценки без непосредственного сравнения между группами. А непересечение или пересечение отдельных интервалов не следует использовать как универсальную замену интервалу разности. Если задача именно сравнить варианты, задайте дизайн и оцените разность соответствующим методом. Учебный пример здесь отвечает только на вопрос о точности каждой отдельной доли, и эту границу стоит сохранить.

Одна доля, два уровня точности; данные условные
Событий / участниковДоля95%-й интервал Уилсона
12 / 2060%38,66–78,12%
120 / 20060%53,08–66,54%
pythonИнтервалы Уилсона, без сравнения групп между собой
from scipy import stats

for events, total in [(12,20), (120,200)]:
    ci = stats.binomtest(events, total).proportion_ci(confidence_level=.95, method="wilson")
    print(events, total, events/total, ci.low, ci.high)

Практика №2: чувствительность не равна вероятности после теста

Представим условный диагностический тест с чувствительностью 90% и специфичностью 95%. Это придуманные параметры, не характеристика медицинского изделия. В первой воображаемой популяции из 10 000 человек состояние есть у 1%, то есть у 100. Тест даёт 90 истинно положительных результатов. Среди 9900 без состояния ложноположительная доля 5% даёт 495 результатов. Всего положительных 585, из них истинных 90: положительная прогностическая ценность около 15,38%.

Теперь изменим только распространённость в условной модели до 10%, сохранив чувствительность и специфичность. Из 1000 людей с состоянием получим 900 истинно положительных, из 9000 без него — 450 ложноположительных. Среди 1350 положительных истинных 900, то есть прогностическая ценность около 66,67%. Разница между 15,38% и 66,67% вызвана составом популяции. Это арифметическая иллюстрация зависимости от базовой частоты, а не утверждение, что чувствительность и специфичность реального теста обязательно постоянны при переносе.

В реальных данных характеристики теста тоже могут меняться вместе с составом обследуемых, спектром состояний, порогом и способом подтверждения результата. Поэтому пример не предназначен для расчёта личной вероятности по произвольному медицинскому анализу. Его учебная задача — различить P(положительный результат | состояние) и P(состояние | положительный результат). Переставить условие и событие без учёта базовой частоты нельзя. Простая таблица количеств часто делает эту ошибку заметнее длинного объяснения формулы.

Условная популяция из 10 000 человек; чувствительность 90%, специфичность 95%
РаспространённостьИстинно +Ложно +Всего +PPV
1%9049558515,38%
10%900450135066,67%
pythonДве искусственные популяции; характеристики теста фиксированы только в модели
n = 10000
sensitivity, specificity = .90, .95
for prevalence in (.01, .10):
    affected = round(n*prevalence)
    unaffected = n-affected
    tp = round(affected*sensitivity)
    fn = affected-tp
    tn = round(unaffected*specificity)
    fp = unaffected-tn
    print("prevalence, TP, FN, FP, TN, PPV:", prevalence, tp, fn, fp, tn, tp/(tp+fp))

Перенос второй задачи в продукт и машинное обучение

Для продуктового аналитика аналог — система обнаружения подозрительных событий. Если редкий класс встречается нечасто, даже небольшой процент ложных срабатываний на многочисленном обычном классе создаёт большую очередь ручной проверки. Чувствительность соответствует recall, положительная прогностическая ценность — precision в заданной популяции и при выбранном пороге. Но хорошая метрика на собранном датасете не гарантирует такой же результат в продакшене, где базовая частота и механизм отбора могут отличаться. Именно это удобно обсуждать на двух синтетических таблицах.

Практическое решение зависит от цены ошибок и нагрузки. Команда может выбрать другой порог, дополнительный этап проверки или изменить аудиторию применения. Нельзя просто заявить, что модель «точна на 95%», и оставить неопределённым, какую характеристику назвали точностью. После чтения темы составьте таблицу четырёх исходов и пересчитайте показатели самостоятельно. Если знаменатель каждой метрики можно объяснить словами, вы понимаете больше, чем при механическом запоминании английского сокращения. Подробности продуктовых метрик моделей разбираем в отдельном материале.

Как читать схемы выбора методов без автоматизма

Схема помогает быстро вспомнить вопросы, но не может знать механизм появления строк в вашей выгрузке. Два столбца могут быть независимыми группами или визитами одних людей. Числовая шкала может оказаться порядковым кодом категорий. Нули могут обозначать отсутствие события или ошибочно заполненный пропуск. Перед переходом по стрелке остановитесь и приведите один конкретный пример наблюдения. Если невозможно рассказать его историю от включения до результата, проблема находится раньше выбора критерия и не решается названием теста.

То же относится к форме распределения. Не превращайте проверку нормальности в единственный переключатель между средними и рангами. Вопрос о средней нагрузке остаётся вопросом о среднем даже при длинном хвосте. Вопрос о порядке оценок может естественно вести к ранговому эффекту. Короткий справочник полезен, если помогает держать эти различия в голове; опасен, если читатель использует его как автоматический калькулятор выбора. Это ограничение способа чтения, а не установленный нами дефект конкретного разворота книги.

Чего не заменит краткое изложение

Компактный вводный формат не стоит делать единственным источником для сложного плана с кластерным назначением, множественными исходами и информативными потерями наблюдения. Наличие темы в оглавлении помогает её обнаружить, но не подтверждает, что всех деталей хватит для вашей модели. Для ответственного реального исследования нужны предметный протокол и статистическая экспертиза. В учебной работе достаточно честно назвать вопросы, которые вы пока не умеете закрыть, и выбрать следующий источник под них. Это нормальный результат первого прохода по карте методов.

Книга также не заменяет актуальную документацию Python. Наши примеры проверены в NumPy 2.4.6 и SciPy 1.16.3; названия аргументов и значения по умолчанию нужно сверять с установленной версией. По доступным описаниям нельзя честно вынести приговор всему программному содержанию русского издания, поэтому мы не объявляем его устаревшим целиком. Практическая рекомендация уже: воспроизводите расчёт современным кодом и проверяйте, совпадает ли статистическая процедура, а не только её краткое название.

Для математики формата «понять, что оцениваем» достаточно процентов, дробей, базовой вероятности и готовности разбирать обозначения. Если нужны доказательства свойств оценок и распределений, потребуется более строгий курс. Если пока трудно отличить процент от процентного пункта, лучше сначала решить несколько маленьких числовых задач. Уровень книги и уровень читателя не определяются одним ярлыком «для начинающих»: посмотрите доступный пример и проверьте, удаётся ли объяснить его без повторения формулировок автора.

Петри и Сэбин или Гланц: как выбрать маршрут

Если ваша ближайшая задача — быстро восстановить карту тем и находить нужный раздел, краткий формат Петри и Сэбина выглядит подходящим. Если хотите строить более протяжённый маршрут обсуждения статистических решений, рассмотрите Гланца вместе с собственными упражнениями. Это сравнение учебных способов по доступным описаниям, а не рейтинг качества каждой страницы. Можно использовать обе книги последовательно: сначала найти незнакомый вопрос, затем разобрать его подробнее и проверить на данных. Не нужно покупать несколько источников только ради накопления библиографии.

В качестве практического дополнения возьмите наши разборы нормального распределения и Манна — Уитни. Там есть явные массивы, настройки и результаты, которые можно изменить и пересчитать. После книжного раздела полезно решить аналогичную, но не идентичную задачу: поменять объём, добавить пропуск, заменить независимые группы парами. Если вы замечаете, когда прежняя процедура больше не подходит, обучение переносится за пределы конкретного примера. Если только повторяете код с теми же числами, стоит задержаться на смысле метода.

План чтения с двумя проверяемыми результатами

Первый результат — короткая записка о доле: числитель, знаменатель, популяция, окно, интервал и ограничение отбора. Используйте упражнение с 12/20 и 120/200, затем замените данные своими условными числами. Второй результат — таблица диагностического или классификационного решения с четырьмя ячейками и объяснением каждого знаменателя. Сначала предскажите влияние базовой частоты, потом запустите код. Оба результата можно показать коллеге: он должен понять задачу без вашей устной презентации и без доступа к скрытому файлу.

После этого вернитесь к реальному отчёту, с которого начинали. Отметьте, где названа популяция, сохранены ли пары, описаны ли потери и показана ли точность эффекта. Не пытайтесь по одному введению самостоятельно перепроверить сложное исследование целиком. Задача первого этапа скромнее и полезнее: увидеть, какой информации не хватает для доверия конкретному выводу, и сформулировать вопрос автору или статистику. Краткая карта методов хороша, если помогает сделать именно это.

Все примеры обзора синтетические и созданы для обучения статистике. Они не являются медицинскими рекомендациями и не предназначены для диагностики, оценки личного риска или выбора лечения.

Продолжить чтение
Вся библиотека