Одно значение сильно отличается от остальной группы. Это повод проверить наблюдение, но не разрешение убрать его из таблицы. В руководстве NIST о выбросах различаются ошибочные данные и необычные значения без установленной ошибки. Во втором случае автоматическое удаление может лишить анализ реальной информации. Для отчёта тренера важно сначала понять происхождение числа.
Аркадий потерял запятую при переносе прыжка
В вымышленной учебной работе Аркадий переносит высоту прыжка из первичного листа в таблицу. Большинство значений записано в сантиметрах, но одна строка содержит 240. Он хочет удалить её, чтобы среднее выглядело правдоподобно. Проверка листа показывает 24,0 см: при вводе пропала десятичная запятая. Основание для исправления найдено в исходной записи, а не в необычности результата.
Аркадий исправляет значение на 24,0 см и сохраняет заметку: какая строка изменена и по какому первичному документу. Участник не исчезает из анализа из-за ошибки переноса. Если первичный лист недоступен, нельзя просто догадаться, что имелось в виду 24,0: в таком случае число остаётся непроверенным, а решение требует дополнительного основания.
Лида боится, что сильный участник испортит среднее
В другой вымышленной группе Лида видит результаты прыжка в диапазоне 20–28 см и один результат 42 см. Эти числа придуманы для примера, не являются нормами. Она опасается, что единственный высокий результат сделает отчёт о группе слишком оптимистичным. Первичная запись, однако, подтверждает 42 см; единицы совпадают, установленной ошибки ввода нет.
Лида проверяет, одинаковым ли был протокол: не взято ли число из другого теста, не перепутан ли участник, не изменились ли условия измерения. Само отличие от соседних строк ещё не отвечает на эти вопросы. Если нарушение не найдено, она не превращает фразу «слишком высоко» в установленную ошибку. Необычное значение также не доказывает талант или эффект программы по одной попытке.
Отметить подозрение и решить судьбу строки — разные действия
Пометка «проверить» нужна для поиска причины. Она не означает, что наблюдение уже признано недействительным. Если после проверки значение подтверждено, вопрос может касаться подходящего способа анализа неоднородных данных, а не их очистки от неудобных участников. Для статистического решения Лида обращается к преподавателю с исходным набором и описанием протокола, не с заранее сокращённой таблицей.
Разброс и точность среднего тоже нельзя смешивать: их различие раскрыто в статье SD и SEM в исследовании тренировок. Ни название показателя, ни желание укоротить полосу погрешности не служат причиной исключения строки. В заметке об анализе отдельно указывают, что именно было исправлено, исключено или оставлено после проверки.
Почему кнопка «найти выбросы» не заменяет проверку
NIST обращает внимание на предположения статистической модели: необычность зависит от распределения данных. Кроме того, тест, рассчитанный на один выброс, нельзя просто повторять для удаления нескольких значений подряд. Поэтому Лида не выбирает правило отсечения задним числом ради желаемого среднего. Для её отчёта сначала нужны проверяемые причины и описание анализа; автоматическая метка программы остаётся поводом разобраться, а не приговором наблюдению.