Метка p ниже 0,05 не означает «метод полезен на 95%» или «у клиента почти наверняка будет результат». P-value относится к статистической проверке и зависит от принятой модели. Размер изменения, точность его оценки и ценность для конкретной задачи нужно рассматривать отдельно. Для решения о программе занятий одной звёздочки рядом с числом недостаточно.
Что проверяет p-value
В распространённой проверке различий исходная гипотеза предполагает отсутствие определённого эффекта. P-value показывает, насколько необычны полученные или более экстремальные данные при этой гипотезе и остальных предположениях анализа. Это не вероятность истинности самой гипотезы.
Американская статистическая ассоциация отдельно подчёркивает: p-value не измеряет размер эффекта или важность результата; решения не должны зависеть только от пересечения порога. Малое p также не доказывает отсутствие ошибок дизайна, измерения или выборочного представления результатов.
Дорогой метод получил маленькое p, но что приобрёл клиент?
Вымышленный тренер Антон читает условный отчёт о двух способах проведения силовой программы. В отчёте p = 0,01, и продавец дополнительного оборудования называет преимущество «доказанным». Антон опасается отстать от коллег и рассматривает покупку для своих занятий.
Он возвращается к показателю: в придуманном отчёте преимущество по среднему приросту результата теста составляет 0,3 кг. Числа здесь учебные; они не взяты из реального исследования и не описывают конкретное устройство. Увидев величину, Антон уже не может обосновать покупку одним словом «значимо». Ему нужно выяснить точность оценки, измерительную процедуру и то, чего стоит внедрение.
Если новый вариант требует дополнительных поездок или делает программу недоступной по цене, небольшое преимущество в узком тесте само по себе не решает вопрос. Антон не объявляет метод бесполезным, но просит данные о нужном клиентам результате и формулирует, какую прибавку считал бы достаточной для этих затрат. Значение p остаётся частью прочитанного отчёта, а не расчётом окупаемости покупки.
«Не значимо» превратилось в «обе программы одинаковые»
Другая учебная ситуация: тренер Ольга нашла небольшое сравнение двух расписаний тренировок. Авторы не получили p ниже 0,05. Она хочет успокоить клиента: «Разницы нет, выбирайте любое». Клиент при этом боится потерять прогресс после перехода на менее удобное для него расписание.
В условной таблице разница средних приростов равна +2 кг, а 95% доверительный интервал - от −3 до +7 кг. Эти числа придуманы для примера. Диапазон включает отсутствие разницы, но также допускает различия в обе стороны. Из такого результата нельзя вывести доказанное равенство программ.
Ольга меняет формулировку: «В этом сравнении преимущество убедительно не установлено; оценка остаётся неточной». Для клиента она обсуждает доступное расписание и сопоставимые контрольные измерения, не обещая равенства результатов. Чтобы обосновать эквивалентность, нужны специально сформулированный вопрос, допустимые границы различия и подходящий анализ, а не просто большое p.
Почему 0,049 и 0,051 не разделяют методы на хорошие и плохие
Порог 0,05 используется по соглашению; его пересечение не создаёт резкого скачка практической пользы. Читая две работы с близкими значениями p по разные стороны порога, не ранжируйте программы только по этой детали. Сравните величины эффектов, диапазоны неопределённости, изучавшихся людей и качество методов.
В разделе 15.3.2 Cochrane Handbook рекомендуется не сводить интерпретацию к паре «значимо / незначимо», а рассматривать оценку эффекта и доверительный интервал. Большое исследование может выявить малое различие, несущественное для получателя вмешательства. Поэтому размер выборки и маленькое p не заменяют разговора о величине результата.
Как тренеру закончить разбор статьи
Запишите вывод с названием исхода и сравнением: «В этой работе оценивали различие прироста конкретного теста между двумя программами». Затем добавьте величину, её неопределённость и предел переноса на своих клиентов. Это не требует превращать каждую консультацию в лекцию по статистике; достаточно не подменять числом p то, что оно не измеряет.
Если сложность в понимании самих участников и протокола, начните с чтения методов научной статьи. Если две публикации кажутся взаимоисключающими, полезнее сопоставить их исследовательские вопросы, чем выбрать ту, где p меньше.
Частые ошибки в коротких ответах
P = 0,03 означает вероятность случайности 3%? Нет. Такое прочтение убирает условия статистической модели и приписывает числу другую задачу.
Можно совсем не смотреть p? Его можно учитывать вместе с остальными результатами, понимая, какая гипотеза проверялась. Ошибка не в наличии числа, а в использовании его как единственного доказательства.
Большое p разрешает утверждать отсутствие эффекта? Нет. Сначала оцените, какие размеры эффекта остаются совместимы с данными. Неточное исследование и точное исключение практически существенной разницы - разные ситуации.