После самого слабого результата за месяц тренер меняет разминку. Следующая попытка заметно лучше, и хочется записать это в заслуги новой схеме. Но стартовая точка выбрана не случайно: это был именно провал. Такое сравнение особенно уязвимо к регрессии к среднему.
Что скрывается за словом «регрессия»
В разборе статистика Мартина Бланда показано: когда отбирают крайние значения изменчивого показателя, повторные измерения в среднем оказываются менее крайними. Это возможно и без полезного вмешательства. Речь о статистической закономерности, а не об обязательном исходе у каждого человека.
Поэтому рост после плохого теста не доказывает, что новая разминка бесполезна. Он лишь не позволяет автоматически приписать ей весь рост. Реальное изменение и колебания результата могут присутствовать одновременно.
Антон сделал вывод по двум попыткам
Придуманный эпизод: Антон наблюдает результаты одного и того же короткого теста у клиента. В журнале стоят 18, 19, 18, затем 13 повторений. После последней попытки он меняет разминку, а при следующем тестировании получает 18. Все числа здесь условные, не норматив и не результат исследования.
Если показать только пару 13 → 18, новая разминка выглядит убедительно. Если вернуть предыдущие записи, видно, что 18 уже встречалось до замены. Антон не стирает неудачную попытку, но убирает из отчёта фразу «новая разминка добавила пять повторений».
Он сохраняет наблюдение точнее: после изменения разминки результат вернулся к ранее наблюдавшемуся уровню; причина по этой паре тестов не установлена. Чтобы дальше сравнивать попытки, тренер записывает одинаковое задание, способ подсчёта и условия выполнения в дневник тренировок. Это улучшает сопоставимость, но само по себе не создаёт контрольного эксперимента.
Отбор только отстающих усиливает ловушку
Марина в другом учебном примере выбирает для дополнительной программы участников, показавших самые низкие результаты на одном контрольном занятии. Через некоторое время средний показатель этой группы растёт. Она собирается рекламировать программу как особенно эффективную для отстающих.
Однако группа сформирована именно по низкому измерению. Марина не знает, кто стабильно показывает такой уровень, а у кого в тот день был необычный результат. Прежде чем делать рекламный вывод, она возвращается к критерию отбора и ищет предыдущие сопоставимые измерения. Если их нет, прямо отмечает это ограничение.
Её отчёт теперь описывает изменение в отобранной группе, а не доказанный эффект программы. Для проверки причинного эффекта нужен соответствующий исследовательский дизайн. Нельзя просто взять другую группу, которая изначально показывала лучшие результаты, и объявить её равноценным контролем.
Что искать в статье о тренировочном методе
Посмотрите, набирали ли участников по необычно высокому или низкому значению, было ли измерение повторено до начала и с чем сравнивали дальнейшую динамику. Бланд рассматривает параллельную контрольную группу в рандомизированном исследовании как способ учесть эту проблему дизайном. О принципе распределения участников можно прочитать в материале о рандомизации.
Одна кривая «до — после» не сообщает, что произошло бы без вмешательства. Не превращайте её ни в обещание эффекта, ни в доказательство отсутствия эффекта: обоим выводам не хватает сравнения.
Можно ли вычесть из результата поправку?
Универсальной скидки вроде «минус 20% на регрессию» здесь нет. Бланд описывает оценки, зависящие от доступных данных и связи измерений. Тренеру не стоит придумывать поправку по одной паре чисел. Практическое решение проще: не выбирать для красивого отчёта только самый плохой старт и не скрывать остальные наблюдения.
Если результат ухудшился на фоне боли или другого тревожного состояния, статистический термин не объясняет причину и не разрешает продолжать тест. Этот материал касается интерпретации данных, а не оценки медицинской безопасности.