Поправка Бонферрони (Bonferroni correction) — классический способ снизить риск ложноположительных выводов, когда в одном исследовании делают несколько статистических сравнений. В запросах рядом — «множественные сравнения», «поправка на множественные сравнения», «ошибка множественных сравнений».
Суть проблемы: при α = 0,05 каждый отдельный тест ошибочно «находит» различие примерно в 5% случаев, когда его нет. Если сравнений много, вероятность хотя бы одной такой ошибки растёт. Алгоритм выбора базового критерия — в «Как выбрать статистический критерий»; для 3+ групп — ANOVA и Краскел-Уоллис.
Когда множественные сравнения завышают ошибку I рода
Типичные ситуации в клинических данных:
- Попарные тесты между k группами без глобального ANOVA/Краскела (для 4 групп это уже 6 пар).
- Post-hoc после значимого глобального теста — пары всё равно нужно корректировать.
- Много исходов (СРБ, лейкоциты, длительность госпитализации…) с отдельным p для каждого.
- Много подгрупп («только мужчины», «только сахарный диабет»…) без априорного плана.
Без коррекции растёт FWER (family-wise error rate) — вероятность хотя бы одного ложного отклонения H₀ в семействе тестов. Подробнее о смысле одного p — в статье о p-value.
Как работает поправка Бонферрони
Идея простая: вместо порога α используют α / m, где m — число сравнений в «семействе».
| Параметр | Обозначение | Пример |
|---|---|---|
| Номинальный уровень | α | 0,05 |
| Число сравнений | m | 5 |
| Скорректированный порог | α_adj = α / m | 0,01 |
| Решение | значимо, если p < α_adj | p = 0,03 → нет при m = 5 |
Эквивалентная запись: сравнивают скорректированные p′ = min(1, m · p) с исходным α.
Бонферрони консервативен: хорошо контролирует FWER, но снижает мощность — реальные различия чаще «не дотягивают» до значимости. Поэтому при большом m часто предпочитают Холма или контроль FDR (Бенджамини–Хохберг) — см. таблицу ниже.
Бонферрони, Холм и FDR: что выбрать
| Метод | Что контролирует | Мощность | Когда уместен |
|---|---|---|---|
| Бонферрони | FWER (жёстко) | Ниже | Малое m (2–5), нужна максимальная осторожность |
| Холм–Бонферрони | FWER | Выше Бонферрони | Post-hoc пар при умеренном m |
| FDR (BH) | Доля ложных среди «значимых» | Обычно выше | Много исходов / скрининг, допустим контролируемый FDR |
Для диссертаций и журналов с жёсткими требованиями к ошибке I рода чаще ожидают FWER (Бонферрони или Холм). Для разведочного скрининга десятков маркеров — FDR уместнее, если это заявлено в методах.
Пример: три группы и поправка Бонферрони
Сравниваем медиану длительности госпитализации (дни) в трёх схемах терапии (независимые группы).
Шаг 1. Описание и глобальный тест. Me [Q1; Q3] по группам; критерий Краскела-Уоллиса значим (p < 0,001) — среди групп есть различие. См. ANOVA / Краскел-Уоллис.
Шаг 2. Попарные сравнения. Три пары: A–B, A–C, B–C → m = 3. При α = 0,05 порог Бонферрони: 0,05 / 3 ≈ 0,017.
| Пара | «Сырой» p | p′ = min(1, 3·p) | Значимо при α = 0,05? |
|---|---|---|---|
| A–B | 0,040 | 0,120 | Нет |
| A–C | 0,002 | 0,006 | Да |
| B–C | 0,010 | 0,030 | Нет |
Шаг 3. Интерпретация. Без поправки казалось бы «значимы» все три пары с p < 0,05; после Бонферрони остаётся отличие A–C. В статье указывают метод коррекции и скорректированные p (или α_adj).
Сравнить 3+ групп с коррекцией
Загрузите Excel с группой (3+ уровня) и показателем — MedStat.Pro рассчитает ANOVA или Краскел-Уоллис и поможет оформить post-hoc сравнения для статьи.
Рассчитать в MedStat.Pro →Как описывать в «Материалах и методах»
«Межгрупповые сравнения выполняли критерием Краскела-Уоллиса с последующими попарными сравнениями; уровень значимости корректировали поправкой Бонферрони (m = …). Данные — Me [Q1; Q3].»
Для двух заранее запланированных гипотез коррекция может не понадобиться — но тогда m и план сравнений фиксируют до анализа, а не после просмотра p-value.
Частые ошибки
- Попарные t / MW на все пары без глобального теста. Нужны ANOVA / Краскел + post-hoc.
- «У нас ANOVA значима — поправка не нужна». Глобальный тест ≠ список пар.
- Корректировать всё подряд, включая описательную статистику. Коррекция относится к проверкам гипотез, не к Me и %.
- Считать Бонферрони единственно верным. При большом m Холм или FDR часто уместнее — укажите выбранный метод.
- Игнорировать клинический смысл. Скорректированный p по-прежнему не равен величине эффекта — см. p-value и ДИ.
Множественные сравнения — про контроль ложных «открытий», а не про то, что «p после Бонферрони всегда лучше».
Частые вопросы
Что такое поправка Бонферрони?
Контроль FWER: порог α делят на число сравнений m (α_adj = α / m), либо умножают p на m.
Когда нужна поправка на множественные сравнения?
При нескольких гипотезах на одних данных: post-hoc после ANOVA/Краскела, много исходов или подгрупп.
Бонферрони или Холм?
Оба контролируют FWER; Холм обычно мощнее. Бонферрони проще и жёстче.
ANOVA значима — можно без поправки?
Нет для попарных выводов: post-hoc всё равно корректируют.
Где учесть это онлайн?
В MedStat.Pro при сравнении 3+ групп; логику выбора теста — в choosing-test.
Что дальше
Pillar: выбор критерия. Глобальные тесты: ANOVA и Краскел-Уоллис. Две группы: t, Манна-Уитни. Интерпретация: p-value.
Рассчитайте сравнение групп в MedStat.Pro.
Интенсив по медицинской статистике — множественные сравнения и оформление для журнала.
