p-value (p-значение, уровень значимости результата) — центральная, но чаще всего неправильно понимаемая метрика в медицинской статистике. Оно отвечает на узкий вопрос: насколько наблюдаемый результат совместим с нулевой гипотезой (отсутствие эффекта, различия или связи).
В статье разберём, что такое p-value в статистике, что можно и нельзя из него выводить, как интерпретировать p в t-критерии, критерии Манна-Уитни и корреляции Спирмена.
Что означает p-value
Формальное определение:
p-value — вероятность при условии истинности H₀ получить статистику не менее экстремальную, чем наблюдаемая, только из-за случайной вариабельности.
Практическая схема:
- Формулируете H₀ (например: «средние в группах равны»).
- Считаете тест (t-критерий, U, ρ).
- Получаете p.
- Сравниваете с α (обычно 0,05): p < α → отвергаете H₀ на этом уровне.
Что p-value не означает
| Неверная интерпретация | Почему неверно |
|---|---|
| «Вероятность, что H₀ верна» | p считается при условии H₀ |
| «Вероятность ошибки» | Это не P(ошибка I рода) в байесовском смысле |
| «Размер эффекта» | p зависит от n: на 10 000 наблюдениях значим ρ = 0,05 |
| «Клиническая важность» | Статистическая ≠ клиническая значимость |
| «Доказательство причинности» | Только дизайн исследования доказывает причину |
p-value в разных критериях: сравнительная таблица
| Метод | Нулевая гипотеза H₀ | Что даёт малый p |
|---|---|---|
| t-критерий Стьюдента | Средние групп равны | Средние различаются |
| Манна-Уитни | Стохастическое равенство групп | Ранги систематически смещены |
| Спирмен ρ | Монотонной связи нет | Есть монотонная связь |
| ROC AUC | AUC = 0,5 | Тест лучше случайного |
Выбор строки таблицы — по алгоритму выбора критерия, не по желаемому p.
Пример интерпретации p-value (3 шага)
Сравнение АД после терапии (мм рт. ст.) — группы A и B, применён критерий Манна-Уитни.
Шаг 1. Описательная статистика:
| Группа | Me [Q1; Q3] |
|---|---|
| A | 142 [135; 148] |
| B | 128 [122; 134] |
Шаг 2. Результат теста: U = 312, p = 0,002.
Шаг 3. Вывод. При α = 0,05 отвергаем H₀: различие систолического АД между схемами статистически значимо. Это не означает автоматически, что разница 14 мм клинически критична — оцените размер эффекта, доверительный интервал и контекст лечения.
Посчитать p-value по вашим данным
MedStat.Pro подберёт критерий, рассчитает p-value, размер эффекта и сформулирует результат для «Материалы и методы». Загрузите Excel — без SPSS.
Рассчитать в MedStat.Pro →p-value и размер выборки
Одна и та же клиническая разница даёт разный p:
- n = 30, разница средних 5 ед. → p может быть 0,12 (не значимо).
- n = 300, та же разница 5 ед. → p < 0,001 (значимо).
Поэтому в статьях обязательны описательная статистика и размер эффекта (Cohen's d, r, ρ, AUC), а не только «p < 0,05».
Частые ошибки
- «p = 0,06 — тренд» — при фиксированном α 0,05 это незначимый результат, не «пограничная значимость» без поправки.
- p-hacking — перебор тестов и подвыборок до p < 0,05; при множественных сравнениях контролируйте FWER — поправка Бонферрони.
- Только «звёздочки» (*, **) без точного p.
- Игнорирование предпосылок — неверный тест даёт «красивый» p с неверным смыслом.
Частые вопросы
Что такое p-value простыми словами?
Вероятность «таких же или более сильных» данных, если эффекта на самом деле нет (H₀ верна).
p-value — вероятность H₀?
Нет. Условная вероятность данных, не гипотезы.
p < 0,05 — клинически важно?
Не обязательно. Смотрите эффект и n.
Нужно ли точное p в статье?
Да, по возможности p = 0,023, не только знак «<».
Как p связан с выбором теста?
Любой тест выдаёт p для своей H₀. Метод выбирают по данным — см. choosing-test.
Что дальше
Разбор p на примерах: Манна-Уитни, Вилкоксон, Спирмен, t-критерий.
Дополните p-value доверительным интервалом и планируйте n заранее — расчёт размера выборки.
Рассчитайте тест и p-value в MedStat.Pro.
Интенсив по медицинской статистике — интерпретация результатов для публикаций.
