Для начала посмотрим на кривые нормального распределения (по центральной предельной теореме можно предположить, что разницы будут приблизительно нормально распределены). Кривая слева показывает результаты меньше нулевой гипотезы: между двумя группами нет существенной разницы. Вот почему эта левая кривая центрирована на 0 %. Даже в этом случае разница время от времени будет случайно составлять больше или меньше нуля, но чем больше разница, тем менее она вероятна. То есть из-за базовой изменчивости, даже если приложение и не обладает реальным эффектом, разница все равно будет обнаружена между двумя группами, потому что люди засыпают за случайные периоды времени.
Другая кривая нормального распределения (справа) представляет собой альтернативную гипотезу, на правдивость которой надеются разработчики: количество людей, которые засыпают в течение 10 минут при использовании приложения, увеличится на 15 % по сравнению с людьми, которые не пользуются им. Опять же, даже если эта гипотеза верна, из-за изменчивости разница иногда все равно будет меньше 15 %, а иногда больше 15 %. Вот почему правая кривая центрирована на 15 %.
Пунктирная линия представляет собой порог статистической значимости. Все значения, превышающие этот порог (справа), будут опровергать нулевую гипотезу, поскольку такая большая разница вряд ли возникнет, если нулевая гипотеза верна.
На самом деле вероятность ее возникновения была бы меньше 5 % – такой процент ложноположительного результата изначально установили разработчики.
Последняя мера, к которой часто прибегают, чтобы выявить статистическую значимость результата, называется
Например,
Теперь обратите внимание, как две кривые накладываются друг на друга, показывая, что некоторая разница между двумя группами согласуется с обеими гипотезами (одновременно под обоими колоколами кривых). Эти серые области показывают, где могут возникнуть два типа ошибки. Светло-серая область – это ложноположительный, а темно-серая – ложноотрицательный результат.
Ложноположительный результат получится, если между двумя группами обнаружится большая разница (как там, где
И наоборот, ложноотрицательный результат получится, если приложение на самом деле помогает людям уснуть быстрее, но наблюдаемая разница слишком мала, чтобы обладать статистической значимостью. Если исследование имеет типичную мощность 80 %, этот ложноотрицательный сценарий будет происходить в 20 % случаев.
Предположим, что размер выборки остается фиксированным. Снижение вероятности ложноположительной ошибки эквивалентно переносу пунктирной линии вправо с сокращением светло-серой области. Но при этом шанс сделать ложноотрицательную ошибку возрастает (сравните верхний рисунок с оригиналом).
Если хотите уменьшить процент одной из ошибок, не увеличивая другую, придется увеличить размер выборки. При этом каждая из кривых нормального распределения станет у́же (сравните нижний рисунок также с оригиналом).
Увеличение размера выборки и сужение кривых нормального распределения уменьшают наложение двух кривых, в процессе сокращая общую серую область. Конечно, это привлекательно, потому что уменьшается вероятность совершить ошибку. Но, как мы отметили в начале раздела, есть множество причин, по которым увеличение размера выборки может оказаться нецелесообразным (время, деньги, риск для участников и т. д.).
В таблице показано, как изменяется размер выборки для разных пределов уровня ошибки в исследовании приложения для сна. Вы увидите, что, если процент ошибок понизится, размер выборки придется увеличить.