Альфа и бета ошибки

razmer_viborki

Размер выборки и искусство баланса между возможными ошибками.

Перед исследователем, планирующим изучение проблемы с использованием статистических методов так или иначе встает вопрос о необходимости расчета размера выборки для контроля между ошибкой первого и второго рода (о них читайте далее). Не стоит скрывать, что для большинства обсервационных исследований с клиническими данными достаточность объема выборки – достаточно болезненный вопрос, правильный ответ на который могут дать не многие. Мало кто понимает, что вопрос размеры выборки – дело не одной формулы, а достаточно сложная тема, требующая понимания собственных исследовательских задач, понимая, имеющихся данных в распоряжении исследователя, а также чувствительность и специфичность самих статистических критериев, имеющихся в распоряжении биометрики. Предлагаем читателю разобраться с этим важным вопросом.
В наиболее общих чертах стоит отметить, что ответ на вопрос о достаточности данных в исследуемой выборке зависит от четырех характеристик исследования: величины различия и частоте исходов между группами, р (ошибки первого рода альфа), и тип данных. Эти характеристики должен учитывать исследователь, планирующий эксперимент, а также читатель, решающий, следует ли доверять публикации.

Величина эффекта

Размер выборки зависит от того, какова же ожидаемая величина различий, которые предстоит выявить. В принципе можно искать различия любой величины и, конечно, исследователь надеется, что сможет обнаружить даже самые небольшие различия. Однако при прочих равных условиях для выявления малых различий требуется большее число пациентов. Поэтому лучше ставить вопрос таким образом:
Какое число больных достаточно, чтобы выявить наименьший клинически значимый эффект?
В случае если нас интересуют только очень большие различия между экспериментальной группой и группой сравнения (т.е. очень сильный лечебный эффект), то допустимо меньшее число пациентов.

Ошибка первого рода (Альфа-ошибка)

Размер выборки зависит также от риска альфа-ошибки (вывода об эффективности лечения, которое на самом деле неэффективно). Приемлемая величина такого риска выбирается произвольно — от 1 до 0. Если исследователь готов к последствиям высокой вероятности ложного вывода об эффективности метода, то он может взять небольшое число пациентов. Если же он стремится сделать риск ошибочного вывода достаточно малым, то потребуется увеличить число больных. Как обсуждалось выше, обычно ра устанавливается на уровне 0,05 (1 из 20), а иногда 0,01 (1 из 100).

Ошибка второго рода (Бета-ошибка)

Другой фактор, определяющий размер выборки, — это выбранный риск бета-ошибки, который тоже произволен. Вероятность бета-ошибки часто устанавливается на уровне 0,20, т.е. допускается 20% вероятность не выявить существующие в действительности различия. Общепринятые допустимые величины бета- ошибок гораздо больше, чем альфа-ошибок, т.е. мы относимся более требовательно к утверждениям об эффективности лечения. Если говорят, что лечение эффективно, оно должно быть эффективным в действительности.

Тип данных и их однородность

Статистическая мощность исследования определяется еще и типом данных. Когда исходы выражены качественными при- знаками и описываются частотой событий, статистическая мощность исследования зависит от этой частоты. Чем больше число событий, тем выше статистическая мощность исследования для данного числа испытуемых. Например, исследование 100 больных, 50 из которых умерли, имеет примерно такую же чувствительность (мощность), что и исследование 1000 больных, из которых умерли те же 50 пациентов.
Если исход выражается непрерывной количественной переменной (например, артериальное давление или уровень холестерина в сыворотке), то мощность исследования определяется степенью различий пациентов внутри каждой группы (дисперсией). Чем больше различия между пациентами по изучаемым характеристикам, тем меньше уверенности в том, что наблюдаемая разница (или ее отсутствие) между группами обусловлена истинными различиями в эффективности методов лечения. Другими словами, чем больше различия между пациентами внутри групп, тем ниже статистическая мощность исследования.

При планировании исследования автор выбирает такие величины клинической значимости лечебного эффекта, уровни ошибок, которые сам считает приемлемыми. Он может спланировать исследование таким образом, чтобы сделать его мощность максимальной для данного размера выборки, например путем отбора больных с высокой вероятностью развития исходов или с одинаковыми характеристиками (разумеется, в пределах поставленной задачи). Однако, получив данные и имея конкретную научную задачу, исследователь уже не может повлиять на статистическую мощность исследования, поскольку она определяется характеристиками полученных данных.

Взаимосвязь характеристик исследования

Обсуждавшиеся выше взаимоотношения носят характер взаимного компромисса. В принципе для любого числа включенных в исследование пациентов существует определенный баланс между ошибками первого и второго рода. При прочих равных условиях, чем больше допускаемая величина ошибки одного рода, тем меньше должен быть риск ошибки другого рода. При этом по сути своей ни одна из них не «хуже» другой. Последствия принятия ошибочной информации за истинную зависят от клинической ситуации. Если имеется острая необходимость в более эффективном методе лечения (например, болезнь очень опасна и нет эффективного альтернативного метода лечения) и предлагаемое лечение не опасно, то разумнее предпочесть относительно высокий риск вывода о том, что вмешательство эффективно, когда в действительности это не так (большая альфа-ошибка), минимизируя вероятность отвергнуть эффективный метод (бета-ошибка мала). С другой стороны, если болезнь менее серьезна и существуют альтернативные методы лечения либо новый метод лечения более дорог или опасен, следует минимизировать риск применения нового вмешательства, которое может быть неэффективным (альфа-ошибка мала), даже за счет относительно высокой вероятности упустить действительно эффективное лечения (большая бета-ошибка). Конечно, можно уменьшить обе ошибки — если число исследуемых больных велико, частота исходов высока, изучаемый показатель внутри групп варьирует мало, а предполагаемый лечебный эффект значителен.

Пример 1. Согласно наблюдениям серий случаем, нестероидный противовоспалительный препарат Сулипдак эффективен при полипах толстой кишки. Это предположение было промерено в рандомизированном испытании на 22 больных с семейным аденоматозным полппозом, 11 из которых получали сулипдак, а другие 11 плацебо. Через 9 мес у получавших сулипдак среднее число полипов было на 44% меньше, чем у получавших плацебо; различие статистически значимое (p<0,05). Поскольку лечебный эффект значителен, а на каждого пациента приходилось большое количество полипов (у некоторых более 100), для доказательства того, что лечебный эффект неслучаен, достаточно небольшого числа больных.

Пример 2. Исследование 2, было спланировано таким образом, чтобы при включении 41 000 пациентов оно с вероятностью 90% обеспечивало бы обнаружение снижения летальности в экспериментальной группе на 15% или частоты летальных исходов на 1% по сравнению с контрольной группой, в зависимости от того, какой из этих показателей будет больше. При этом допустимый уровень 0,05, а предполагаемая летальность в контрольной группе не ниже 8%. Здесь необходим большой объем выборки, так как доля больных с неблагоприятным исходом (смерть) относительно мала, величина лечебного эффекта невелика (15%) и авторы хотели иметь относительно высокую вероятность обнаружить эффект терапии, если он все-таки присутствует (90%).

Проиллюстрируем также, как задачу расчета объема выборки на примере использования статистического пакета Stata. Для этого воспользуемся командной строкой. Для определения мощности и размера выборки существует команда sampsi.

Предположим, что для сравнения средних мы решили применить t-Критерий Стьюдента для парных выборок. Стандартное отклонение исследуемого показателя одинаково в обеих группах и составляет 20 мм рт. ст. Сами группы также равны по размеру. Тогда следует записать следующую команду:

sampsi 150 135, sd1(20) sd2(20) p(0.8) a(0.05)

Здесь 150 и 135 – это средние величины артериального давления, выраженные в мм рт ст. sd1() и sd2() – стандартные отклонения, p() и a() – целевые мощность (ошибка второго рода) и уровень значимости (ошибка первого рода) соответственно.

В результате работы команды мы выясним, что для решения поставленной задачи необходимо набрать группы по 28 человек.

Необходимо всегда иметь в виду, что приведённые в примере значения мощности и уровня значимости могут изменяться в зависимости от особенностей исследования. Однако любое повышение мощности будет даваться довольно дорого. Так, если в нашем примере увеличить целевую мощность до 90%, то при сохранении всех прочих параметров размер выборки придётся увеличить до 38 испытуемых в каждой группе, что скажется на стоимости планируемой работы.

Вместо заключения

Для получения ответов на большинство возникающих в наше время вопросов относительно эффективности того или иного вмешательства требуется изучение результатов лечения очень большого числа больных. Вместе с тем эффективность таких действенных вмешательств, как введение инсулина при диабетическом кетоацидозе или хирургической операции при аппендиците, можно установить при анализе данных небольшого числа больных. Однако подобные методы лечения появляются редко и многие из них уже хорошо изучены. Теперь нам приходится рассматривать патологию с хроническим течением и с множественными взаимодействующими этиологическими факторами; эффективность предлагаемых новых методов лечения таких заболеваний, в общем, невелика. В подобной ситуации необходимо обращать особое внимание на то, достаточна ли численность больных в клиническом испытании для того, чтобы отличить истинный лечебный эффект от случайного результата.

Автор сайта: Кирилл Мильчаков
Источник:
Флетчер Р., Флетчер С., Вагнер Э. Клиническая эпидемиология: Основы доказательной медицины/ М.: Медиа Сфера, 1998. — 352 с.

Если Вам понравилась статья и оказалась полезной, Вы можете поделиться ею с коллегами и друзьями в социальных сетях:

В 1 — е и 2 — й типа ошибка , также называемый альфа-ошибку (альфа-ошибкой) и бета-ошибки (бета-ошибка) (или α- / β- риска ), обозначают статистически неправильное решение. Они относятся к методу математической статистики, так называемой проверке гипотез . При проверке гипотезы возникает ошибка типа I, если нулевая гипотеза отклоняется, когда она действительно верна (на основе случайного увеличения или уменьшения числа положительных результатов). Напротив, ошибка типа 2 означает, что тест неправильно не отклоняет нулевую гипотезу, хотя альтернативная гипотеза верна. Ошибки 1 — го и 2 — го типа часто упоминается в статистическом контроле качества (см инспекционных много ) в качестве производителя риска и потребительского риска. При управлении технологическим процессом с помощью карт контроля качества для этого используются термины « слепая сигнализация» и « пропущенная сигнализация» . Ошибки типа 1 и 2 также известны как частотные концепции . Тем не менее, ошибки типа 1 и типа 2 всегда являются условными вероятностями . Понятие ошибок типа 1 и 2 было введено Нейманом и Пирсоном .

Таблица решений

реальность
H 0 верно H 1 верно
Решение
теста …
… для H 0 Правильное решение (специфичность)
( справа отрицательное ) Вероятность: 1 — α
Ошибка 2-го типа ( ложноотрицательный )
Вероятность: β
… для H 1 Ошибка типа 1 ( ложное срабатывание )
Вероятность: α
Правильное решение
Вероятность: 1-β ( правильный положительный результат ) ( избирательность теста , чувствительность)

Формальное представительство

Статистический тест — это проблема решения, которая включает неизвестный параметр, который должен находиться в определенном пространстве параметров . Пространство параметров можно разбить на два непересекающихся подмножества и . Проблема решения теперь состоит в том, чтобы решить, лежит ли оно в или . Определите нулевую гипотезу и альтернативную гипотезу . Поскольку и не пересекаются, только одна из двух гипотез может быть верной. Поскольку гипотетический тест всегда требует решения, существует вероятность того, что вы примете неверное решение. Будь и . После определения диапазона отклонения и статистики испытаний можно определить вероятность отклонения для каждого из них . Пусть , где отклоняется, если статистика теста попадает в критический диапазон ( ). Функцию также называют функцией качества . Обычно существует другая вероятность отклонения нулевой гипотезы , даже если она верна (это называется ошибкой типа I). При проверке гипотез обычно процедуры тестирования разрабатываются только таким образом, чтобы эта вероятность ограничивалась константой, называемой уровнем значимости теста. То есть уровень значимости — это наибольшее значение для каждого значения, которое соответствует действительности . В отличие от ошибки 1-го типа, ошибка 2-го типа не контролируется заданным пределом . Это я. A. Невозможно минимизировать обе вероятности ошибки одновременно. Следовательно, среди всех тестов значимости (тестов, проверяющих наличие ошибки типа I) ищется тот, который минимизирует вероятность ошибки . Другими словами: если уровень значимости или ошибка типа 1 был определен априори , то человек заинтересован в максимальном увеличении степени различения всех соответствующих альтернатив. Селективность теста равно 1 минус вероятность сделать ошибку типа 2, т.е. ЧАС. . Вероятность ошибки типа 2 не считается предопределенной, а скорее зависит от параметра, присутствующего в генеральной совокупности. Таким образом, следующее относится к вероятности совершения ошибки типа 1 или типа 2.
 theta Омега Омега  Omega_0{ displaystyle  Omega _ {1}} theta  Omega_0{ displaystyle  Omega _ {1}}{ displaystyle  theta  in  Omega _ {0}}{ displaystyle  theta  in  Omega _ {1}} Omega_0{ displaystyle  Omega _ {1}}{ displaystyle H_ {0}:  theta  in  Omega _ {0}}{ displaystyle H_ {1}:  theta  in  Omega _ {1}} А. ТH_ {0}{ displaystyle  theta  in  Omega}{ displaystyle  Pi ( theta) =  operatorname {P} (T  in A |  theta)}H_ {0}А.{ displaystyle T  in A}{ Displaystyle  Пи ( тета)}{ displaystyle 0}H_ {0}альфа { Displaystyle  Пи ( тета)} theta H_ {0}{ displaystyle  theta  in  Omega _ {0}}альфа { displaystyle 1-  beta}{ displaystyle 1-  operatorname {P} ({ text {Ошибка 2-го типа}}  mid  theta)}

{ displaystyle  operatorname {P} ({ text {Ошибка 1-го типа}}) =  operatorname {P} (T  in A  mid H_ {0} ; { text {is true}})  leq  альфа  quad}и .{ displaystyle  beta =  operatorname {P} ({ text {Ошибка 2-го типа}}  mid  theta) =  operatorname {P} (T  not  in A  mid H_ {1} ; { text {верно}}) = 1-  Pi ( theta)  quad  mathrm {f { ddot {u}} r ; ;}  theta  in  Omega _ {1}}

В случае «простых» гипотез (таких как, например, vs. ), только знак равенства применяется к вероятности совершения ошибки типа 1. ЧАС. . В общем, уменьшение увеличивает вероятность ошибок 2-го типа и наоборот. Также можно определить путем сложных расчетов .
{ displaystyle H_ {0}:  theta _ {i} = 0}{ displaystyle H_ {1}:  theta _ {i}  neq 0}{ displaystyle  operatorname {P} (T  in A  mid H_ {0} ; { text {true}}) =  alpha}альфа { Displaystyle  Пи ( тета)}

Ошибка типа 1

При проверке гипотезы возникает ошибка типа I, если нулевая гипотеза отклоняется, когда она действительно верна (на основе ложных срабатываний ).

Исходная гипотеза (нулевая гипотеза) — это предположение, что тестовая ситуация находится в «нормальном состоянии». Если это «нормальное состояние» не распознается, хотя оно действительно существует, возникает ошибка типа 1. Примеры ошибок типа 1:
H_ {0}

  • пациент считается больным, хотя на самом деле он здоров (нулевая гипотеза: пациент здоров ),
  • обвиняемый признан виновным, хотя на самом деле он невиновен (нулевая гипотеза: обвиняемый невиновен ),
  • человеку не предоставлен доступ, хотя у него есть разрешение на доступ (нулевая гипотеза: у человека есть разрешение на доступ )

Уровень значимости или вероятности ошибки максимальной вероятность , определяется перед гипотезой теста, что нулевая гипотеза будет отвергнута на основании результатов испытаний , даже если нулевая гипотеза верна. Как правило, выбирается уровень значимости 5% (значительный) или 1% (очень значимый).

Другое возможное неправильное решение, а именно отклонение альтернативной гипотезы, даже если она верна, называется ошибкой типа II.
H_ {1}

Примеры

  • Перед тестером стоит урна, в которую он не может заглянуть. Внутри есть красные и зеленые шары. Для тестирования из урны можно вынуть только один шар.
    Альтернативная гипотеза: «В урне больше красных шаров, чем зеленых».
    Чтобы иметь возможность судить о содержимом урны, тестер несколько раз удаляет шарики из урны для целей тестирования. Если затем он приходит к выводу, что альтернативная гипотеза может быть верной, т. Е. Он считает, что в урне больше красных, чем зеленых шаров, хотя в действительности нулевая гипотеза верна, а именно, что столько же красных, сколько зеленых или зеленых шаров. меньше красных, чем Если в урне есть зеленые шары, он совершает ошибку 1-го типа.
  • Мы хотим проверить, увеличивает ли новый метод обучения успеваемость учащихся. Для этого мы сравниваем группу студентов, обучавшихся по новому методу обучения, с выборкой студентов, которые обучались по старому методу.
    Альтернативная гипотеза: «Студенты, которые обучались по новому методу обучения, имеют более высокую успеваемость, чем студенты, которые обучались по старому методу».
    Предполагая, что в нашем исследовании, выборка студентов, которые обучались в соответствии с новым методом обучения, на самом деле показывает лучший результат обучения на. Возможно, эта разница возникла случайно или по другим причинам. Таким образом, если на самом деле между двумя популяциями нет никакой разницы, и мы ошибочно отвергаем нулевую гипотезу — то есть считаем несомненным, что новый метод улучшает обучение, — тогда мы совершаем ошибку типа I. Это, конечно, может иметь фатальные последствия, если мы z. Например, перевод всего обучения на новый метод обучения с большими затратами и усилиями, хотя на самом деле это совсем не дает лучших результатов.
  • Фильтр спама для входящей электронной почты : фильтр должен распознавать, является ли электронное письмо спамом или нет.
    Нулевая гипотеза: это обычная электронная почта, а не спам.
    Альтернативная гипотеза: это спам.
    Если электронное письмо классифицируется как спам, но на самом деле это не спам, т.е. сообщение ошибочно классифицируется как спам, мы говорим об ошибке первого типа (ложное срабатывание).

Ошибка 2-го типа

В отличие от ошибки 1-го типа ошибка 2-го типа означает, что тест неверно подтверждает нулевую гипотезу, даже если альтернативная гипотеза верна.

Трудности определения ошибки Art

Ошибка 1-го типа синим цветом, ошибка 2-го типа красным. Представление возможных значений вероятности ошибки 2-го типа (красный) на примере теста значимости с использованием ожидаемого значения μ. Поскольку ошибка типа 2 зависит от положения параметра нецентральности (здесь ), но при условии альтернативной гипотезы i. d. Обычно неизвестно, вероятность ошибки типа 2, в отличие от ошибки типа 1 (синий цвет), не может быть определена заранее. mu _ {1} mu _ {1}

В отличие от риска 1-го типа ошибочного отклонения данной нулевой гипотезы, хотя он действительно применяется, риск 2-го типа, то есть вероятность ошибки 2-го типа, обычно не может быть определен заранее. Причиной этого является способ, которым устанавливаются гипотезы статистических тестов: в то время как нулевая гипотеза всегда представляет собой конкретное утверждение, такое как «среднее значение» , альтернативная гипотеза состоит в том, что она в основном охватывает все другие возможности, так что i. d. Обычно только довольно неопределенного или глобального характера (например : «среднее значение »).
H_ {0} mu = 0H_ {1}{ displaystyle  mu  neq 0}

График справа иллюстрирует эту зависимость вероятности ошибки 2-го типа ; (красный) от неизвестного среднего значения , если «уровень значимости», т.е. ЧАС. максимальный риск первого вида ; (синий) в обоих случаях выбрано одно и то же значение. Как можно видеть, существует также парадоксальная ситуация, когда вероятность ошибки второго типа тем больше, чем ближе истинное значение к значению, утвержденному нулевой гипотезой , вплоть до того, что для риска второй тип ; предельное значение ; принимает. Другими словами, чем меньше отклонение фактического значения от заявленного значения , тем парадоксальным образом выше вероятность ошибки, если кто-то продолжает верить заявленному значению на основании результата теста (хотя разница между двумя значениями может быть практически неактуальными из-за своей незначительности больше пьес). Как показывает это противоречие, рассмотрение проблемы ошибок 2-го типа чисто формально-логическим образом может легко стать основанием для неправильных решений. В биометрических и медицинских статистических приложениях вероятность принятия решения для H 0, если H 0 верна, называется специфичностью . Вероятность принятия решения для H 1, если H 1 верна, называется чувствительностью . Желательно, чтобы метод тестирования обладал высокой чувствительностью и высокой специфичностью и, следовательно, малой вероятностью ошибок первого и второго типа.
бета  mu _ {1}альфа  mu _ {1} mu _ {0}{ displaystyle  mu _ {1}  to  mu _ {o}}бета (1-  альфа){ displaystyle  mu _ {o}} mu _ {0}

Примеры

  • В управлении проектами « Шесть сигм »: ошибка типа 1: в конце проекта вы замечаете, что аспекты были упущены во время первоначального планирования («сделано слишком мало»). Ошибка 2-го типа здесь будет заключаться в том, что весь проект был посвящен вещам, которые в конечном итоге оказываются излишними или несущественными для успеха проекта («сделано слишком много»).
  • Перед тестером стоит урна, в которую он не может заглянуть. Внутри есть красные и зеленые шары. Для тестирования из урны можно вынуть только один шар.
    Альтернативная гипотеза : «В урне больше красных шаров, чем зеленых».
    Чтобы иметь возможность сделать суждение о содержимом урны, тестер несколько раз извлекает из урны шары для целей тестирования. Нулевая гипотеза в нашем примере, что есть либо как много красных шаров как зеленые шарики или более зеленые шарики , чем красные шары в урне (противоположность альтернативной гипотезы ). Если на основе своей выборки тестировщик приходит к выводу, что нулевая гипотеза верна или альтернативная гипотеза неверна, хотя на самом деле альтернативная гипотеза верна, то он делает ошибку 2-го типа.
  • Мы хотели бы исследовать влияние диеты на умственное развитие детей в детских домах. Для этого мы сравниваем две группы детей в отношении их результатов в когнитивных тестах: одна группа детей питается по общепринятому плану, другая получает особенно здоровую диету. Мы подозреваем, что здоровая диета положительно влияет на когнитивные способности. .
    Альтернативная гипотеза: «Дети, которые питаются особенно здоровой диетой, обладают лучшими когнитивными способностями, чем дети, которых кормят обычным способом».
    Если мы теперь сравним когнитивные характеристики наших двух выборок, мы не обнаружим разницы в когнитивных способностях. В результате мы считаем альтернативную гипотезу ложной и подтверждаем нулевую гипотезу. Однако, если на самом деле здоровое, питающееся население работает лучше, тогда мы делаем ошибку типа 2.
    Но мы не обнаружили разницы в нашей выборке, не так ли? Однако это равенство может быть также связано со случайным разбросом результатов измерений или с неблагоприятным составом наших образцов.
    Совершение ошибки типа 2 обычно менее «плохо», чем ошибка типа 1. Однако это зависит индивидуально от предмета исследования. В нашем примере ошибка типа II имеет очень негативные последствия: хотя здоровая диета улучшает работоспособность, мы решаем придерживаться традиционной диеты. Ошибка первого рода, то есть введение здорового питания для всех детей, хоть и не приводит к улучшению работоспособности, но имела бы здесь меньше негативных последствий.

Противоположное обозначение

В некоторых источниках для обозначения ошибки 2-го типа и серьезности теста используются совершенно противоположные обозначения. Здесь вероятность совершения ошибки 2-го типа обозначается значением 1-β, тогда как сила или мощность теста обозначается β.

Агностические тесты

В мае 2018 года Виктор Кострато , Рафаэль Избицки и Рафаэль Басси предложили метод, с помощью которого можно управлять ошибками как 1-го, так и 2-го типа. Они называют такую ​​процедуру «проверкой агностика». В дополнение к ошибкам 1-го и 2-го типа в независимых тестах определяется еще одна так называемая ошибка 3-го типа. Это происходит, когда результат теста не поддерживает ни нулевую гипотезу ( ), ни альтернативную гипотезу ( ) , а скорее его результат остается агностическим.H_ {0}H_ {1}

Смотри тоже

  • Функция качества или рабочая характеристика
  • Проверить силу
  • Накопление альфа-ошибок
  • p-значение

веб ссылки

  • Интерактивная иллюстрация

Индивидуальные доказательства

  1. a b Денес Сукс, Джон Иоаннидис : Когда проверка значимости нулевой гипотезы непригодна для исследования: переоценка. В: Границы нейробиологии человека , том 11, 2017 г., стр. 390, doi: 10.3389 / fnhum.2017.00390 , PMID 28824397 , PMC 5540883 (полный текст) (обзор).
  2. Филип Сиббертсен и Хартмут отдыхают: Статистика: Введение для экономистов и социологов. , С. 379.
  3. Ежи Нейман и Эгон Пирсон : Об использовании и интерпретации определенных критериев испытаний для целей статистического вывода: Часть I . В: Биометрика , Том 20А, № 1/2 (июль 1928 г.). Издательство Оксфордского университета. Страницы 175-240.
  4. ^ Людвиг Фармейр , художник Риты, Ирис Пигеот , Герхард Тутц : Статистика. Путь к анализу данных. 8., перераб. и дополнительное издание. Springer Spectrum, Берлин / Гейдельберг, 2016 г., ISBN 978-3-662-50371-3 , стр. 385.
  5. Байер, Хакель: Расчет вероятностей и математическая статистика , стр. 154
  6. Примечание : и бета (и альфа) представляют собой условные вероятности.
  7. Джордж Джадж, Р. Картер Хилл, В. Гриффитс, Гельмут Люткеполь , Т.С. Ли. Введение в теорию и практику эконометрики. 2-е издание. John Wiley & Sons, Нью-Йорк / Чичестер / Брисбен / Торонто / Сингапур 1988, ISBN 0-471-62414-4 , стр. 96 и далее.
  8. Джеффри Марк Вулдридж : Вводная эконометрика: современный подход. 4-е издание. Nelson Education, 2015, с. 779.
  9. Джордж Джадж, Р. Картер Хилл, В. Гриффитс, Гельмут Люткеполь , Т.С. Ли. Введение в теорию и практику эконометрики. 2-е издание. John Wiley & Sons, Нью-Йорк / Чичестер / Брисбен / Торонто / Сингапур 1988, ISBN 0-471-62414-4 , стр. 96 и далее.
  10. Джеймс Л. Джонсон: вероятность и статистика для компьютерных наук. С. 340 и сл.
  11. Эрвин Крейсциг: Статистические методы и их приложения . 7-е издание. Göttingen 1998, p. 209 ff.
  12. Виктор Коскрато, Рафаэль Избицки, звезда Рафаэля Басси: Агностические тесты могут контролировать ошибки типа I и типа II одновременно . Май 11, 2018, Arxiv : 1805,04620 .


5.3. Ошибки первого и второго рода

Ошибка первого рода состоит в том, что гипотеза  будет отвергнута, хотя на самом деле она правильная. Вероятность

допустить такую ошибку называют уровнем значимости и обозначают буквой  («альфа»).  

Ошибка второго рода состоит в том, что гипотеза  будет принята, но на самом деле она неправильная. Вероятность

совершить эту ошибку обозначают буквой  («бета»). Значение  называют мощностью критерия – это вероятность отвержения неправильной

гипотезы.

В практических задачах, как правило, задают уровень значимости, наиболее часто выбирают значения .

И тут возникает мысль, что чем меньше «альфа», тем вроде бы лучше. Но это только вроде: при уменьшении

вероятности

отвергнуть правильную гипотезу растёт вероятность  — принять неверную гипотезу (при прочих равных условиях).

Поэтому перед исследователем стоит задача грамотно подобрать соотношение вероятностей  и , при этом учитывается тяжесть последствий, которые

повлекут за собой та и другая ошибки.

Понятие ошибок 1-го и 2-го рода используется не только в статистике, и для лучшего понимания я приведу пару

нестатистических примеров.

Петя зарегистрировался в почтовике. По умолчанию,  – он считается добропорядочным пользователем. Так считает антиспам

фильтр. И вот Петя отправляет письмо. В большинстве случаев всё произойдёт, как должно произойти – нормальное письмо дойдёт до

адресата (правильное принятие нулевой гипотезы), а спамное – попадёт в спам (правильное отвержение). Однако фильтр может

совершить ошибку двух типов:

1) с вероятностью  ошибочно отклонить нулевую гипотезу (счесть нормальное письмо

за спам и Петю за спаммера) или
2) с вероятностью  ошибочно принять нулевую гипотезу (хотя Петя редиска).

Какая ошибка более «тяжелая»? Петино письмо может быть ОЧЕНЬ важным для адресата, и поэтому при настройке фильтра

целесообразно уменьшить уровень значимости , «пожертвовав» вероятностью  (увеличив её). В результате в основной ящик будут попадать все

«подозрительные» письма, в том числе особо талантливых спаммеров. …Такое и почитать даже можно, ведь сделано с любовью :)

Существует примеры, где наоборот – более тяжкие последствия влечёт ошибка 2-го рода, и вероятность  следует увеличить (в пользу уменьшения

вероятности ). Не хотел я

приводить подобные примеры, и даже отшутился на сайте, но по какой-то мистике через пару месяцев сам столкнулся с непростой

дилеммой. Видимо, таки, надо рассказать:

У человека появилась серьёзная болячка. В медицинской практике её принято лечить (основное «нулевое» решение). Лечение

достаточно эффективно, однако не гарантирует результата и более того опасно (иногда приводит к серьёзному пожизненному

увечью). С другой стороны, если не лечить, то возможны осложнения и долговременные функциональные нарушения.

Вопрос: что делать? И ответ не так-то прост – в разных ситуациях разные люди могут принять разные

решения (упаси вас).

Если болезнь не особо «мешает жить», то более тяжёлые последствия повлечёт ошибка 2-го рода – когда человек соглашается

на лечение, но получает фатальный результат (принимает, как оказалось, неверное «нулевое» решение). Если же…, нет, пожалуй,

достаточно, возвращаемся к теме:

5.4. Процесс проверки статистической гипотезы

5.2. Нулевая и альтернативная гипотезы

| Оглавление |



17. Альфа- и бета- уровни, ошибки разного рода при отвержении- неотвержении «Нуль-гипотезы».

Правило
статистического решения. Три рассмотренных
выше возможных заключения из результатов
эксперимента делаются на основе правила
статистического решения. Здесь оно
состояло в том, что нуль-гипотеза может
быть отвергнута только в случае, если
вероятность получения различия,
удовлетворяющего нуль-гипотезе, меньше,
чем 0,05 (т. е. меньше 1 из 20).

Основа
статистического вывода. Если бы Флинер
и Кернс многократно повторяли свой
эксперимент на новых группах детей той
же возрастной категории, они бы не
получали в каждом эксперименте разницу
между средними для ухода матери и для
ухода ассистентки, в точности равную
3,40. Из-за случайных вариаций эта разница
была бы то больше, то меньше. Если бы для
бесконечного числа повторений общая
средняя разница равнялась в точности
0, это означало бы справедливость
нуль-гипотезы. Однако для каждого
отдельного эксперимента можно было бы
ожидать значение, отличное от нуля.

Итак,
разность «мать — ассистент» будет
варьировать от эксперимента к эксперименту.
Величина разброса этих разностей зависит
от надежности каждого эксперимента.
Как мы видели в главе 2, надежность выше
и, следовательно, разброс от эксперимента
к эксперименту меньше, чем больше число
наблюдений и чем меньше случайных
вариаций. Поэтому разброс разностей
«мать — ассистент» был бы меньше, если
бы каждый эксперимент проводился на
большом числе испытуемых и имел небольшое
стандартное отклонение.

Из
числа испытуемых и стандартного
отклонения можно вывести величину
различия, которая при справедливости
нуль-гипотезы может быть превышена лишь
с вероятностью 0,05. Нахождение этой
величины назы вается статистическим
выводом. Такая величина для эксперимента
Флинера и Кернса оказалась порядка ±3.
(Она была определена с помощью
статистической процедуры нахождения
так называемого t-критерия. Описание ее
можно найти в статистическом приложении
к данной главе. Это один из многих
критериев статистической значимости,
используемых экспериментаторами.)

Диаграмма
на с. 241 показывает, как в эксперименте
Флинера и Кернса применялось правило
статистического решения для получения
одного из трех возможных выводов.

Как
видно, различие +3,40 для старших детей
попадает в одну из двух областей
отвержения нуль-гипотезы. Если бы
нуль-гипотеза была верна, только 0,05
части всех экспериментов дала бы
различия, попадающие в ту или другую
область отвержения. Для данного
эксперимента вероятность (р) для каждой
области отвержения будет 0,025 и для
области «неотвержения» нуль-гипотезы
— 0,95. Используя правило решения 0,05, мы
говорим, что полученное различие значимо,
поскольку мы можем отвергнуть
нуль-гипотезу. Меньшее различие +0,93, как
это видно, не попадает в область
отвержения. Следовательно, статистическое
решение в этом случае состоит в том,
чтобы не отвергать нуль-гипотезу. Этот
результат мог бы быть получен с
вероятностью более высокой, чем 0,05, если
бы нуль-гипотеза была верна.

Итак,
мы можем заключить, что старшие дети.
плачут сильнее, если уходит мать. Что
касается младшей группы, то мы не можем
сделать ни этого, ни противоположного
вывода (что они плачут сильнее с уходом
ассистентки).Поскольку нам известно,
что реальные эксперименты не бывают ни
идеальными, ни бесконечными, мы знаем,
что некоторые из наших решений окажутся
ошибочными независимо от применявшегося
правила решения. Может быть, Флинер и
Кернс не следовало отвергать нуль-гипотезу
для старшей группы. Может быть,
нуль-гипотеза была верна. Если бы они
использовали 0,01 альфа-уровень, они не
смогли бы отвергнуть нуль-гипотезу. И
было бы прекрасно, если бы нуль-гипотеза
и в самом деле была правильной. Ну а что,
если нет? При обоих альфа-уровнях они
рисковали бы — но противоположным
образом.

Ошибки
I типа
. Первый
риск состоит в возможности ошибки I
типа: отвержение нуль-гипотезы, когда
она верна. Если исследователь использует
в правиле решения уровень 0,05, это
означает, что он готов сделать такую
ошибку не более чем в пяти процентах
его экспериментов. Когда он затем
принимает отвержение нуль-гипотезы в
качестве подтверждения экспериментальной
гипотезы (например плач более сильный
при уходе матери), это показывает его
чрезмерный оптимизм. Ведь существует
1 шанс из 20, что такое доказательство
ошибочно.

В
любом эксперименте, направленном на
проверку совершенно новой гипотезы,
противоречащей общепринятому
представлению, можно посоветовать быть
более осторожным. Ломать научные традиции
— вещь очень серьезная, и для этого
нужно быть абсолютно уверенным в своих
фактах. В таких случаях рекомендуется
использовать более строгое правило
решения, с 0,01 альфа-уровнем. Наука еще
может выдержать 1 процент результатов,
которые ошибочно приняты за подтверждающие
экспериментальную гипотезу, но 5 процентов
— это уж слишком!

Ошибки
II типа
. Если
мы настаиваем на 0,01 альфа-уровне (или
даже более строгом уровне, таком, как
0,001), появляется новый риск: наше желание
быть абсолютно уверенными может привести
нас к ошибочному неотвержению
нуль-гипотезы, когда она на самом деле
неверна. Вполне естественно, что это
называют ошибкой II типа. Если нуль-гипотеза
ошибочна, верна должна быть какая-то
другая гипотеза. Риск не отвергнуть
нуль-гипотезу, когда верна другая
гипотеза (например определенное различие
в плаче при уходе матери и ассистента),
может быть также выражен через вероятность,
называемую бета-уровнем.

Для
данной совокупности экспериментальных
результатов уменьшение альфа-уровня
означает увеличение бета-вероятности
для любой ненулевой гипотезы. Использование
очень строгого правила решения означает,
что экспериментатор готов пойти на
значительный риск, заключающийся в
неотвержении нулевой гипотезы, когда
верна какая-то другая гипотеза. Таким
образом, при низком альфа-уровне
экспериментатор будет часто ошибочно
заключать, что результаты не подтверждают
экспериментальную гипотезу. В отличие
от альфа-уровня, для бета-уровня невозможно
задать некоторое общее значение
вероятности; она различается для каждой
конкретной ненулевой гипотезы о различии
между условиями. Так, если окажется
верной гипотеза о большом различии
между условиями (скажем, разница в
интенсивности плача +5 ед.), вероятность
не отвергнуть нуль-гипотезу (бета) будет
низкой даже при использовании строгого
альфа-уровня 0,01. С другой стороны, если
действительная разность окажется
небольшой (скажем, + 1,0), вероятность
ошибочного решения не отвергнуть
нуль-гипотезу будет намного больше.
Однако, логика отношений сохраняется:
при одних и тех же данных уменьшение
альфа-уровня увеличивает бета-вероятность
для всех статистических гипотез, отличных
от нуль-гипотезы.

О
статистической проверке экспериментальных
результатов говорят как об имеющей силу
в той степени, в какой бета-величина
остается низкой для ненулевых гипотез.
При хорошей силе выявляются реальные
различия. Конечно, сила автоматически
повышается с использованием нестрогого
правила решения (например 0,10 альфа-уровня),
но это увеличивает риск ошибки I типа.
Существует два более удачных способа
увеличения силы. Один состоит в увеличении
надежности данных. Как мы видели на рис.
6.1 (в), даже при небольшом различии между
условиями оказывается возможным
отвергнуть нуль-гипотезу либо путем
увеличения числа испытуемых, либо путем
уменьшения случайных вариаций. Другой
способ состоит в использовании наиболее
эффективных экспериментальных схем и
проверок. Те и другие описаны в специальной
литературе (см., например, Коэн, 1977).

В
предыдущем параграфе уже говорилось,
что ошибки I типа следует избегать в том
случае, когда отвержение нуль-гипотезы
связано с отрицанием существующих идей
или результатов предыдущих экспериментов.
С другой стороны, если экспериментатор
не обнаруживает значимых различий между
условиями, которые обычно признаются
эффективными, это его заключение должно
основываться на использовании высокого
(или нестрогого) альфа-уровня, чтобы
уменьшить риск ошибки II типа. Почти
любой полученный ранее правильный
результат может быть «опровергнут»
путем ошибочного неотвержения
нуль-гипотезы: либо через использование
ненадежных данных, либо через применение
слишком строгого правила решения, либо
(самый худший вариант) через то и другое
вместе.

Теперь
давайте рассмотрим, какие выводы должен
сделать экспериментатор при отвержении
нуль-гипотезы.

Заключения
при неотвержении нуль-гипотезы.
Пожалуйста, заметьте: в отношении
нуль-гипотезы принимается только два
статистических решения — отвергнуть
ее или не отвергнуть. Никогда не бывает
решения принять нуль-гипотезу. Все же
для экспериментатора иногда полезно
заключить, что независимая переменная
не оказывает никакого влияния. Как видно
из диаграммы на с. 241, неотвержение
нуль-гипотезы привело бы к заключению,
что не подтверждается ни экспериментальная
гипотеза, ни противоположная ей гипотеза.
Например, для младшей группы детей
небольшое различие в интенсивности
плача не благоприятствует ни гипотезе
о более сильном плаче при уходе матери,
ни противоположной гипотезе о более
сильном плаче при уходе ассистентки.
Однако из подобных неподтверждений
можно вывести различные заключения.

Во-первых,
экспериментатор может сделать вывод,
что он не знает, оказывает ли независимая
переменная вообще какое-либо влияние
на поведение. Этот вывод особенно
подходит к случаю, когда надежность
низка из-за небольшого количества
испытуемых или из-за большей, чем
ожидалось, вариабельности поведения.
Так, Флинер и Кернс могли бы решить
продолжить эксперимент на новых детях,
относящихся к той же младшей группе, и
попытаться уменьшить случайные вариации,
насколько это возможно.

Во-вторых,
экспериментатор может заключить, что
надежность была вполне удовлетворительной
и что неотвержение нуль-гипотезы
означает, что исследовавшиеся условия
действительно не различаются. Это
заключение может оказаться наиболее
справедливым, особенно если более ранние
эксперименты показали неэффективность
независимой переменной.

Итак,
статистическое решение снова состоит
в неотвержении нуль-гипотезы. Однако
обстоятельства эксперимента заставляют
сделать вывод, что независимая переменная
оказалась недейственной.

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]

  • #
  • #
  • #
  • #
  • #
  • #
  • #
  • #
  • #
  • #
  • #

Проверка корректности А/Б тестов

Хабр, привет! Сегодня поговорим о том, что такое корректность статистических критериев в контексте А/Б тестирования. Узнаем, как проверить, является критерий корректным или нет. Разберём пример, в котором тест Стьюдента не работает.

Меня зовут Коля, я работаю аналитиком данных в X5 Tech. Мы с Сашей продолжаем писать серию статей по А/Б тестированию, это наша третья статья. Первые две можно посмотреть тут:

  • Стратификация. Как разбиение выборки повышает чувствительность A/Б теста

  • Бутстреп и А/Б тестирование

Корректный статистический критерий

В А/Б тестировании при проверке гипотез с помощью статистических критериев можно совершить одну из двух ошибок:

  • ошибку первого рода – отклонить нулевую гипотезу, когда на самом деле она верна. То есть сказать, что эффект есть, хотя на самом деле его нет;

  • ошибку второго рода – не отклонить нулевую гипотезу, когда на самом деле она неверна. То есть сказать, что эффекта нет, хотя на самом деле он есть.

Совсем не ошибаться нельзя. Чтобы получить на 100% достоверные результаты, нужно бесконечно много данных. На практике получить столько данных затруднительно. Если совсем не ошибаться нельзя, то хотелось бы ошибаться не слишком часто и контролировать вероятности ошибок.

В статистике ошибка первого рода считается более важной. Поэтому обычно фиксируют допустимую вероятность ошибки первого рода, а затем пытаются минимизировать вероятность ошибки второго рода.

Предположим, мы решили, что допустимые вероятности ошибок первого и второго рода равны 0.1 и 0.2 соответственно. Будем называть статистический критерий корректным, если его вероятности ошибок первого и второго рода равны допустимым вероятностям ошибок первого и второго рода соответственно.

Как сделать критерий, в котором вероятности ошибок будут равны допустимым вероятностям ошибок?

Вероятность ошибки первого рода по определению равна уровню значимости критерия. Если уровень значимости положить равным допустимой вероятности ошибки первого рода, то вероятность ошибки первого рода должна стать равной допустимой вероятности ошибки первого рода.

Вероятность ошибки второго рода можно подогнать под желаемое значение, меняя размер групп или снижая дисперсию в данных. Чем больше размер групп и чем ниже дисперсия, тем меньше вероятность ошибки второго рода. Для некоторых гипотез есть готовые формулы оценки размера групп, при которых достигаются заданные вероятности ошибок.

Например, формула оценки необходимого размера групп для гипотезы о равенстве средних:

n > frac{left[ Phi^{-1} left( 1-alpha / 2 right) + Phi^{-1} left( 1-beta right) right]^2 (sigma_A^2 + sigma_B^2)}{varepsilon^2}

где alpha и beta – допустимые вероятности ошибок первого и второго рода, varepsilon – ожидаемый эффект (на сколько изменится среднее), sigma_A и sigma_B – стандартные отклонения случайных величин в контрольной и экспериментальной группах.

Проверка корректности

Допустим, мы работаем в онлайн-магазине с доставкой. Хотим исследовать, как новый алгоритм ранжирования товаров на сайте влияет на среднюю выручку с покупателя за неделю. Продолжительность эксперимента – одна неделя. Ожидаемый эффект равен +100 рублей. Допустимая вероятность ошибки первого рода равна 0.1, второго рода – 0.2.

Оценим необходимый размер групп по формуле:

import numpy as np
from scipy import stats

alpha = 0.1                     # допустимая вероятность ошибки I рода
beta = 0.2                      # допустимая вероятность ошибки II рода
mu_control = 2500               # средняя выручка с пользователя в контрольной группе
effect = 100                    # ожидаемый размер эффекта
mu_pilot = mu_control + effect  # средняя выручка с пользователя в экспериментальной группе
std = 800                       # стандартное отклонение

# исторические данные выручки для 10000 клиентов
values = np.random.normal(mu_control, std, 10000)

def estimate_sample_size(effect, std, alpha, beta):
    """Оценка необходимого размер групп."""
    t_alpha = stats.norm.ppf(1 - alpha / 2, loc=0, scale=1)
    t_beta = stats.norm.ppf(1 - beta, loc=0, scale=1)
    var = 2 * std ** 2
    sample_size = int((t_alpha + t_beta) ** 2 * var / (effect ** 2))
    return sample_size

estimated_std = np.std(values)
sample_size = estimate_sample_size(effect, estimated_std, alpha, beta)
print(f'оценка необходимого размера групп = {sample_size}')
оценка необходимого размера групп = 784

Чтобы проверить корректность, нужно знать природу случайных величин, с которыми мы работаем. В этом нам помогут исторические данные. Представьте, что мы перенеслись в прошлое на несколько недель назад и запустили эксперимент с таким же дизайном, как мы планировали запустить его сейчас. Дизайн – это совокупность параметров эксперимента, таких как: целевая метрика, допустимые вероятности ошибок первого и второго рода, размеры групп и продолжительность эксперимента, техники снижения дисперсии и т.д.

Так как это было в прошлом, мы знаем, какие покупки совершили пользователи, можем вычислить метрики и оценить значимость отличий. Кроме того, мы знаем, что эффекта на самом деле не было, так как в то время эксперимент на самом деле не запускался. Если значимые отличия были найдены, то мы совершили ошибку первого рода. Иначе получили правильный результат.

Далее нужно повторить эту процедуру с мысленным запуском эксперимента в прошлом на разных группах и временных интервалах много раз, например, 1000.

После этого можно посчитать долю экспериментов, в которых была совершена ошибка. Это будет точечная оценка вероятности ошибки первого рода.

Оценку вероятности ошибки второго рода можно получить аналогичным способом. Единственное отличие состоит в том, что каждый раз нужно искусственно добавлять ожидаемый эффект в данные экспериментальной группы. В этих экспериментах эффект на самом деле есть, так как мы сами его добавили. Если значимых отличий не будет найдено – это ошибка второго рода. Проведя 1000 экспериментов и посчитав долю ошибок второго рода, получим точечную оценку вероятности ошибки второго рода.

Посмотрим, как оценить вероятности ошибок в коде. С помощью численных синтетических А/А и А/Б экспериментов оценим вероятности ошибок и построим доверительные интервалы:

def run_synthetic_experiments(values, sample_size, effect=0, n_iter=10000):
    """Проводим синтетические эксперименты, возвращаем список p-value."""
    pvalues = []
    for _ in range(n_iter):
        a, b = np.random.choice(values, size=(2, sample_size,), replace=False)
        b += effect
        pvalue = stats.ttest_ind(a, b).pvalue
        pvalues.append(pvalue)
    return np.array(pvalues)

def print_estimated_errors(pvalues_aa, pvalues_ab, alpha):
    """Оценивает вероятности ошибок."""
    estimated_first_type_error = np.mean(pvalues_aa < alpha)
    estimated_second_type_error = np.mean(pvalues_ab >= alpha)
    ci_first = estimate_ci_bernoulli(estimated_first_type_error, len(pvalues_aa))
    ci_second = estimate_ci_bernoulli(estimated_second_type_error, len(pvalues_ab))
    print(f'оценка вероятности ошибки I рода = {estimated_first_type_error:0.4f}')
    print(f'  доверительный интервал = [{ci_first[0]:0.4f}, {ci_first[1]:0.4f}]')
    print(f'оценка вероятности ошибки II рода = {estimated_second_type_error:0.4f}')
    print(f'  доверительный интервал = [{ci_second[0]:0.4f}, {ci_second[1]:0.4f}]')

def estimate_ci_bernoulli(p, n, alpha=0.05):
    """Доверительный интервал для Бернуллиевской случайной величины."""
    t = stats.norm.ppf(1 - alpha / 2, loc=0, scale=1)
    std_n = np.sqrt(p * (1 - p) / n)
    return p - t * std_n, p + t * std_n

pvalues_aa = run_synthetic_experiments(values, sample_size, effect=0)
pvalues_ab = run_synthetic_experiments(values, sample_size, effect=effect)
print_estimated_errors(pvalues_aa, pvalues_ab, alpha)
оценка вероятности ошибки I рода = 0.0991
  доверительный интервал = [0.0932, 0.1050]
оценка вероятности ошибки II рода = 0.1978
  доверительный интервал = [0.1900, 0.2056]

Оценки вероятностей ошибок примерно равны 0.1 и 0.2, как и должно быть. Всё верно, тест Стьюдента на этих данных работает корректно.

Распределение p-value

Выше рассмотрели случай, когда тест контролирует вероятность ошибки первого рода при фиксированном уровне значимости. Если решим изменить уровень значимости с 0.1 на 0.01, будет ли тест контролировать вероятность ошибки первого рода? Было бы хорошо, если тест контролировал вероятность ошибки первого рода при любом заданном уровне значимости. Формально это можно записать так:

Для любого alpha in [0, 1] выполняется mathbb{P}(pvalue < alpha | H_0) = alpha.

Заметим, что в левой части равенства записано выражение для функции распределения p-value. Из равенства следует, что функция распределения p-value в точке X равна X для любого X от 0 до 1. Эта функция распределения является функцией распределения равномерного распределения от 0 до 1. Мы только что показали, что статистический критерий контролирует вероятность ошибки первого рода на заданном уровне для любого уровня значимости тогда и только тогда, когда при верности нулевой гипотезы p-value распределено равномерно от 0 до 1.

При верности нулевой гипотезы p-value должно быть распределено равномерно. А как должно быть распределено p-value при верности альтернативной гипотезы? Из условия для вероятности ошибки второго рода mathbb{P}(pvalue geq alpha | H_1) = beta следует, что mathbb{P}(pvalue < alpha | H_1) = 1 - beta.

Получается, график функции распределения p-value при верности альтернативной гипотезы должен проходить через точку [alpha, 1 - beta], где alpha и beta – допустимые вероятности ошибок конкретного эксперимента.

Проверим, как распределено p-value в численном эксперименте. Построим эмпирические функции распределения p-value:

import matplotlib.pyplot as plt

def plot_pvalue_distribution(pvalues_aa, pvalues_ab, alpha, beta):
    """Рисует графики распределения p-value."""
    estimated_first_type_error = np.mean(pvalues_aa < alpha)
    estimated_second_type_error = np.mean(pvalues_ab >= alpha)
    y_one = estimated_first_type_error
    y_two = 1 - estimated_second_type_error
    X = np.linspace(0, 1, 1000)
    Y_aa = [np.mean(pvalues_aa < x) for x in X]
    Y_ab = [np.mean(pvalues_ab < x) for x in X]

    plt.plot(X, Y_aa, label='A/A')
    plt.plot(X, Y_ab, label='A/B')
    plt.plot([alpha, alpha], [0, 1], '--k', alpha=0.8)
    plt.plot([0, alpha], [y_one, y_one], '--k', alpha=0.8)
    plt.plot([0, alpha], [y_two, y_two], '--k', alpha=0.8)
    plt.plot([0, 1], [0, 1], '--k', alpha=0.8)

    plt.title('Оценка распределения p-value', size=16)
    plt.xlabel('p-value', size=12)
    plt.legend(fontsize=12)
    plt.grid()
    plt.show()

plot_pvalue_distribution(pvalues_aa, pvalues_ab, alpha, beta)

P-value для синтетических А/А тестах действительно оказалось распределено равномерно от 0 до 1, а для синтетических А/Б тестов проходит через точку [alpha, 1 - beta].

Кроме оценок распределений на графике дополнительно построены четыре пунктирные линии:

  • диагональная из точки [0, 0] в точку [1, 1] – это функция распределения равномерного распределения на отрезке от 0 до 1, по ней можно визуально оценивать равномерность распределения p-value;

  • вертикальная линия с x=alpha – пороговое значение p-value, по которому определяем отвергать нулевую гипотезу или нет. Проекция на ось ординат точки пересечения вертикальной линии с функцией распределения p-value для А/А тестов – это вероятность ошибки первого рода. Проекция точки пересечения вертикальной линии с функцией распределения p-value для А/Б тестов – это мощность теста (мощность = 1 — beta). 

  • две горизонтальные линии – проекции на ось ординат точки пересечения вертикальной линии с функцией распределения p-value для А/А и А/Б тестов.

График с оценками распределения p-value для синтетических А/А и А/Б тестов позволяет проверить корректность теста для любого значения уровня значимости.

Некорректный критерий

Выше рассмотрели пример, когда тест Стьюдента оказался корректным критерием для случайных данных из нормального распределения. Может быть, все критерии всегда работаю корректно, и нет смысла каждый раз проверять вероятности ошибок?

Покажем, что это не так. Немного изменим рассмотренный ранее пример, чтобы продемонстрировать некорректную работу критерия. Допустим, мы решили увеличить продолжительность эксперимента до 2-х недель. Для каждого пользователя будем вычислять стоимость покупок за первую неделю и стоимость покупок за второю неделю. Полученные стоимости будем передавать в тест Стьюдента для проверки значимости отличий. Положим, что поведение пользователей повторяется от недели к неделе, и стоимости покупок одного пользователя совпадают.

def run_synthetic_experiments_two(values, sample_size, effect=0, n_iter=10000):
    """Проводим синтетические эксперименты на двух неделях."""
    pvalues = []
    for _ in range(n_iter):
        a, b = np.random.choice(values, size=(2, sample_size,), replace=False)
        b += effect
        # дублируем данные
        a = np.hstack((a, a,))
        b = np.hstack((b, b,))
        pvalue = stats.ttest_ind(a, b).pvalue
        pvalues.append(pvalue)
    return np.array(pvalues)

pvalues_aa = run_synthetic_experiments_two(values, sample_size)
pvalues_ab = run_synthetic_experiments_two(values, sample_size, effect=effect)
print_estimated_errors(pvalues_aa, pvalues_ab, alpha)
plot_pvalue_distribution(pvalues_aa, pvalues_ab, alpha, beta)
оценка вероятности ошибки I рода = 0.2451
  доверительный интервал = [0.2367, 0.2535]
оценка вероятности ошибки II рода = 0.0894
  доверительный интервал = [0.0838, 0.0950]

Получили оценку вероятности ошибки первого рода около 0.25, что сильно больше уровня значимости 0.1. На графике видно, что распределение p-value для синтетических А/А тестов не равномерно, оно отклоняется от диагонали. В этом примере тест Стьюдента работает некорректно, так как данные зависимые (стоимости покупок одного человека зависимы). Если бы мы сразу не догадались про зависимость данных, то оценка вероятностей ошибок помогла бы нам понять, что такой тест некорректен.

Итоги

Мы обсудили, что такое корректность статистического теста, посмотрели, как оценить вероятности ошибок на исторических данных и привели пример некорректной работы критерия.

Таким образом:

  • корректный критерий – это критерий, у которого вероятности ошибок первого и второго рода равны допустимым вероятностям ошибок первого и второго рода соответственно;

  • чтобы критерий контролировал вероятность ошибки первого рода для любого уровня значимости, необходимо и достаточно, чтобы p-value при верности нулевой гипотезы было распределено равномерно от 0 до 1.

Ошибки первого и второго рода

Выдвинутая гипотеза
может быть правильной или неправильной,
поэтому возникает необходимость её
проверки. Поскольку проверку производят
статистическими методами, её называют
статистической. В итоге статистической
проверки гипотезы в двух случаях может
быть принято неправильное решение, т.
е. могут быть допущены ошибки двух родов.

Ошибка первого
рода состоит в том, что будет отвергнута
правильная гипотеза.

Ошибка второго
рода состоит в том, что будет принята
неправильная гипотеза.

Подчеркнём, что
последствия этих ошибок могут оказаться
весьма различными. Например, если
отвергнуто правильное решение «продолжать
строительство жилого дома», то эта
ошибка первого рода повлечёт материальный
ущерб: если же принято неправильное
решение «продолжать строительство»,
несмотря на опасность обвала стройки,
то эта ошибка второго рода может повлечь
гибель людей. Можно привести примеры,
когда ошибка первого рода влечёт более
тяжёлые последствия, чем ошибка второго
рода.

Замечание 1.
Правильное решение может быть принято
также в двух случаях:

  1. гипотеза принимается,
    причём и в действительности она
    правильная;

  2. гипотеза отвергается,
    причём и в действительности она неверна.

Замечание 2.
Вероятность совершить ошибку первого
рода принято обозначать через
;
её называют уровнем значимости. Наиболее
часто уровень значимости принимают
равным 0,05 или 0,01. Если, например, принят
уровень значимости, равный 0,05, то это
означает, что в пяти случаях из ста
имеется риск допустить ошибку первого
рода (отвергнуть правильную гипотезу).

Статистический
критерий проверки нулевой гипотезы.
Наблюдаемое значение критерия

Для проверки
нулевой гипотезы используют специально
подобранную случайную величину, точное
или приближённое распределение которой
известно. Обозначим эту величину в целях
общности через
.

Статистическим
критерием

(или просто критерием) называют случайную
величину
,
которая служит для проверки нулевой
гипотезы.

Например, если
проверяют гипотезу о равенстве дисперсий
двух нормальных генеральных совокупностей,
то в качестве критерия
принимают отношение исправленных
выборочных дисперсий:.

Эта величина
случайная, потому что в различных опытах
дисперсии принимают различные, наперёд
неизвестные значения, и распределена
по закону Фишера – Снедекора.

Для проверки
гипотезы по данным выборок вычисляют
частные значения входящих в критерий
величин и таким образом получают частное
(наблюдаемое) значение критерия.

Наблюдаемым
значением
называют значение критерия, вычисленное
по выборкам. Например, если по двум
выборкам найдены исправленные выборочные
дисперсиии,
то наблюдаемое значение критерия.

Критическая
область. Область принятия гипотезы.
Критические точки

После выбора
определённого критерия множество всех
его возможных значений разбивают на
два непересекающихся подмножества:
одно из них содержит значения критерия,
при которых нулевая гипотеза отвергается,
а другая – при которых она принимается.

Критической
областью называют совокупность значений
критерия, при которых нулевую гипотезу
отвергают.

Областью принятия
гипотезы (областью допустимых значений)
называют совокупность значений критерия,
при которых гипотезу принимают.

Основной принцип
проверки статистических гипотез можно
сформулировать так: если наблюдаемое
значение критерия принадлежит критической
области – гипотезу отвергают, если
наблюдаемое значение критерия принадлежит
области принятия гипотезы – гипотезу
принимают.

Поскольку критерий
— одномерная случайная величина, все её
возможные значения принадлежат некоторому
интервалу. Поэтому критическая область
и область принятия гипотезы также
являются интервалами и, следовательно,
существуют точки, которые их разделяют.

Критическими
точками (границами)
называют точки, отделяющие критическую
область от области принятия гипотезы.

Различают
одностороннюю (правостороннюю или
левостороннюю) и двустороннюю критические
области.

Правосторонней
называют критическую область, определяемую
неравенством
>,
где— положительное число.

Левосторонней
называют критическую область, определяемую
неравенством
<,
где— отрицательное число.

Односторонней
называют правостороннюю или левостороннюю
критическую область.

Двусторонней
называют критическую область, определяемую
неравенствами
где.

В частности, если
критические точки симметричны относительно
нуля, двусторонняя критическая область
определяется неравенствами ( в
предположении, что
>0):

,
или равносильным неравенством
.

Отыскание
правосторонней критической области

Как найти критическую
область? Обоснованный ответ на этот
вопрос требует привлечения довольно
сложной теории. Ограничимся её элементами.
Для определённости начнём с нахождения
правосторонней критической области,
которая определяется неравенством
>,
где>0.
Видим, что для отыскания правосторонней
критической области достаточно найти
критическую точку. Следовательно,
возникает новый вопрос: как её найти?

Для её нахождения
задаются достаточной малой вероятностью
– уровнем значимости
.
Затем ищут критическую точку,
исходя из требования, чтобы при условии
справедливости нулевой гипотезы
вероятность того, критерийпримет значение, большее,
была равна принятому уровню значимости:
Р(>)=.

Для каждого критерия
имеются соответствующие таблицы, по
которым и находят критическую точку,
удовлетворяющую этому требованию.

Замечание 1.
Когда
критическая точка уже найдена, вычисляют
по данным выборок наблюдаемое значение
критерия и, если окажется, что
>,
то нулевую гипотезу отвергают; если же<,
то нет оснований, чтобы отвергнуть
нулевую гипотезу.

Пояснение. Почему
правосторонняя критическая область
была определена, исходя из требования,
чтобы при справедливости нулевой
гипотезы выполнялось соотношение

Р(>)=?
(*)

Поскольку вероятность
события
>мала (— малая вероятность), такое событие при
справедливости нулевой гипотезы, в силу
принципа практической невозможности
маловероятных событий, в единичном
испытании не должно наступить. Если всё
же оно произошло, т.е. наблюдаемое
значение критерия оказалось больше,
то это можно объяснить тем, что нулевая
гипотеза ложна и, следовательно, должна
быть отвергнута. Таким образом, требование
(*) определяет такие значения критерия,
при которых нулевая гипотеза отвергается,
а они и составляют правостороннюю
критическую область.

Замечание 2.
Наблюдаемое значение критерия может
оказаться большим
не потому, что нулевая гипотеза ложна,
а по другим причинам (малый объём выборки,
недостатки методики эксперимента и
др.). В этом случае, отвергнув правильную
нулевую гипотезу, совершают ошибку
первого рода. Вероятность этой ошибки
равна уровню значимости.
Итак, пользуясь требованием (*), мы с
вероятностьюрискуем совершить ошибку первого рода.

Замечание 3. Пусть
нулевая гипотеза принята; ошибочно
думать, что тем самым она доказана.
Действительно, известно, что один пример,
подтверждающий справедливость некоторого
общего утверждения, ещё не доказывает
его. Поэтому более правильно говорить,
«данные наблюдений согласуются с нулевой
гипотезой и, следовательно, не дают
оснований её отвергнуть».

На практике для
большей уверенности принятия гипотезы
её проверяют другими способами или
повторяют эксперимент, увеличив объём
выборки.

Отвергают гипотезу
более категорично, чем принимают.
Действительно, известно, что достаточно
привести один пример, противоречащий
некоторому общему утверждению, чтобы
это утверждение отвергнуть. Если
оказалось, что наблюдаемое значение
критерия принадлежит критической
области, то этот факт и служит примером,
противоречащим нулевой гипотезе, что
позволяет её отклонить.

Отыскание
левосторонней и двусторонней критических
областей***

Отыскание
левосторонней и двусторонней критических
областей сводится (так же, как и для
правосторонней) к нахождению соответствующих
критических точек. Левосторонняя
критическая область определяется
неравенством
<(<0).
Критическую точку находят, исходя из
требования, чтобы при справедливости
нулевой гипотезы вероятность того, что
критерий примет значение, меньшее,
была равна принятому уровню значимости:
Р(<)=.

Двусторонняя
критическая область определяется
неравенствами
Критические
точки находят, исходя из требования,
чтобы при справедливости нулевой
гипотезы сумма вероятностей того, что
критерий примет значение, меньшееили большее,
была равна принятому уровню значимости:

.
(*)

Ясно, что критические
точки могут быть выбраны бесчисленным
множеством способов. Если же распределение
критерия симметрично относительно нуля
и имеются основания (например, для
увеличения мощности) выбрать симметричные
относительно нуля точки (-
(>0),
то

Учитывая (*), получим
.

Это соотношение
и служит для отыскания критических
точек двусторонней критической области.
Критические точки находят по соответствующим
таблицам.

Дополнительные
сведения о выборе критической области.
Мощность критерия

Мы строили
критическую область, исходя из требования,
чтобы вероятность попадания в неё
критерия была равна
при условии, что нулевая гипотеза
справедлива. Оказывается целесообразным
ввести в рассмотрение вероятность
попадания критерия в критическую область
при условии, что нулевая гипотеза неверна
и, следовательно, справедлива конкурирующая.

Мощностью критерия
называют вероятность попадания критерия
в критическую область при условии, что
справедлива конкурирующая гипотеза.
Другими словами, мощность критерия есть
вероятность того, что нулевая гипотеза
будет отвергнута, если верна конкурирующая
гипотеза.

Пусть для проверки
гипотезы принят определённый уровень
значимости и выборка имеет фиксированный
объём. Остаётся произвол в выборе
критической области. Покажем, что её
целесообразно построить так, чтобы
мощность критерия была максимальной.
Предварительно убедимся, что если
вероятность ошибки второго рода (принять
неправильную гипотезу) равна
,
то мощность равна 1-.
Действительно, если— вероятность ошибки второго рода, т.е.
события «принята нулевая гипотеза,
причём справедливо конкурирующая», то
мощность критерия равна 1 —.

Пусть мощность 1

возрастает; следовательно, уменьшается
вероятностьсовершить ошибку второго рода. Таким
образом, чем мощность больше, тем
вероятность ошибки второго рода меньше.

Итак, если уровень
значимости уже выбран, то критическую
область следует строить так, чтобы
мощность критерия была максимальной.
Выполнение этого требования должно
обеспечить минимальную ошибку второго
рода, что, конечно, желательно.

Замечание 1.
Поскольку вероятность события «ошибка
второго рода допущена» равна
,
то вероятность противоположного события
«ошибка второго рода не допущена» равна
1 —,
т.е. мощности критерия. Отсюда следует,
что мощность критерия есть вероятность
того, что не будет допущена ошибка
второго рода.

Замечание 2. Ясно,
что чем меньше вероятности ошибок
первого и второго рода, тем критическая
область «лучше». Однако при заданном
объёме выборки уменьшить одновременно
иневозможно; если уменьшить,
тобудет возрастать. Например, если принять=0,
то будут приниматься все гипотезы, в
том числе и неправильные, т.е. возрастает
вероятностьошибки второго рода.

Как же выбрать
наиболее целесообразно? Ответ на этот
вопрос зависит от «тяжести последствий»
ошибок для каждой конкретной задачи.
Например, если ошибка первого рода
повлечёт большие потери, а второго рода
– малые, то следует принять возможно
меньшее.

Если
уже выбрано, то, пользуясь теоремой Ю.
Неймана и Э.Пирсона, можно построить
критическую область, для которойбудет минимальным и, следовательно,
мощность критерия максимальной.

Замечание 3.
Единственный способ одновременного
уменьшения вероятностей ошибок первого
и второго рода состоит в увеличении
объёма выборок.

Соседние файлы в папке Лекции 2 семестр

  • #
  • #
  • #
  • #

Ошибки I и II рода при проверке гипотез, мощность

Общий обзор

Принятие неправильного решения

Мощность и связанные факторы

Проверка множественных гипотез

Общий обзор

Большинство проверяемых гипотез сравнивают между собой группы объектов, которые испытывают влияние различных факторов.

Например, можно сравнить эффективность двух видов лечения, чтобы сократить 5-летнюю смертность от рака молочной железы. Для данного исхода (например, смерть) сравнение, представляющее интерес (напри­мер, различные показатели смертности через 5 лет), называют эффектом или, если уместно, эффектом лечения.

Нулевую гипотезу выражают как отсутствие эффекта (например 5-летняя смертность от рака мо­лочной железы одинаковая в двух группах, получаю­щих разное лечение); двусторонняя альтернативная гипотеза будет означать, что различие эффектов не равно нулю.

Критериальная проверка гипотезы дает возможность определить, достаточно ли аргументов, чтобы отвергнуть нулевую гипотезу. Можно принять только одно из двух решений:

  1. отвергнуть нулевую гипотезу и принять альтер­нативную гипотезу
  2. остаться в рамках нулевой гипотезы

Важно: В литературе достаточно часто встречается понятие «принять нулевую гипотезу». Хотелось бы внести ясность, что со статистической точки зрения принять нулевую гипотезу невозможно, т.к. нулевая гипотеза представляет собой достаточно строгое утверждение (например, средние значения в сравниваемых группах равны ).

Поэтому фразу о принятии нулевой гипотезы следует понимать как то, что мы просто остаемся в рамках гипотезы.

Принятие неправильного решения

Возможно неправильное решение, когда отвергают/не отвергают нулевую гипотезу, потому что есть только выборочная информация.

  Верная гипотеза
H0 H1
Результат

 применения 

критерия

H0 H0 верно принята H0 неверно принята 

(Ошибка второго рода)

H1 H0 неверно отвергнута 

(Ошибка первого рода)

H0 верно отвергнута

Ошибка 1-го рода: нулевую гипотезу отвергают, когда она истинна, и делают вывод, что имеется эффект, когда в действительности его нет. Максимальный шанс (вероятность) допустить ошибку 1-го рода обозначается α (альфа). Это уровень значимости критерия; нулевую гипотезу отвергают, если наше значение p ниже уровня значимости, т. е., если p < α.

Следует принять решение относительно значения а прежде, чем будут собраны данные; обычно назначают условное значение 0,05, хотя можно выбрать более ограничивающее значение, например 0,01.

Шанс допустить ошибку 1-го рода никогда не превысит выбранного уровня значимости, скажем α = 0,05, так как нулевую гипотезу отвергают только тогда, когда p< 0,05. Если обнаружено, что p > 0,05, то нулевую гипотезу не отвергнут и, следовательно, не допустят ошибки 1-го рода.

Ошибка 2-го рода: не отвергают нулевую гипотезу, когда она ложна, и делают вывод, что нет эффекта, тогда как в действительности он существует. Шанс возникновения ошибки 2-го рода обозначается β (бета); а величина (1-β) называется мощностью критерия.

Следовательно, мощность — это вероятность отклонения нулевой гипотезы, когда она ложна, т.е. это шанс (обычно выраженный в процентах) обнаружить реальный эффект лечения в выборке данного объема как статистически значимый.

В идеале хотелось бы, чтобы мощность критерия составляла 100%; однако это невозможно, так как всегда остается шанс, хотя и незначительный, допустить ошибку 2-го рода.

К счастью, известно, какие факторы влияют на мощность и, таким образом, можно контролировать мощность критерия, рассматривая их.

Мощность и связанные факторы

Планируя исследование, необходимо знать мощность предложенного критерия. Очевидно, можно начинать исследование, если есть «хороший» шанс обнаружить уместный эффект, если таковой существует (под «хорошим» мы подразумеваем, что мощность должна быть по крайней мере 70-80%).

Этически безответственно начинать исследование, у которого, скажем, только 40% вероятности обнаружить реальный эффект лечения; это бесполезная трата времени и денежных средств.

Ряд факторов имеют прямое отношение к мощности критерия.

Объем выборки: мощность критерия увеличивается по мере увеличения объема выборки. Это означает, что у большей выборки больше возможностей, чем у незначительной, обнаружить важный эффект, если он существует.

Когда объем выборки небольшой, у критерия может быть недостаточно мощности, чтобы обнаружить отдельный эффект. Эти методы также можно использовать для оценки мощности критерия для точно установленного объема выборки.

Вариабельность наблюдений: мощность увеличивается по мере того, как вариабельность наблюдений уменьшается.

Интересующий исследователя эффект: мощность критерия больше для более высоких эффектов. Критерий проверки гипотез имеет больше шансов обнаружить значительный реальный эффект, чем незначительный.

Уровень значимости: мощность будет больше, если уровень значимости выше (это эквивалентно увеличению допущения ошибки 1-го рода, α, а допущение ошибки 2-го рода, β, уменьшается).

Таким образом, вероятнее всего, исследователь обнаружит реальный эффект, если на стадии планирования решит, что будет рассматривать значение р как значимое, если оно скорее будет меньше 0,05, чем меньше 0,01.

Обратите внимание, что проверка ДИ для интересующего эффекта указывает на то, была ли мощность адекватной. Большой доверительный интервал следует из небольшой выборки и/или набора данных с существенной вариабельностью и указывает на недостаточную мощность.

Проверка множественных гипотез

Часто нужно выполнить критериальную проверку значимости множественных гипотез на наборе данных с многими переменными или существует более двух видов лечения.

Ошибка 1-го рода драматически увеличивается по мере увеличения числа сравнений, что приводит к ложным выводам относительно гипотез. Следовательно, следует проверить только небольшое число гипотез, выбранных для достижения первоначальной цели исследования и точно установленных априорно.

Можно использовать какую-нибудь форму апостериорного уточнения значения р, принимая во внимание число выполненных проверок гипотез.

Например, при подходе Бонферрони (его часто считают довольно консервативным) умножают каждое значение р на число выполненных проверок; тогда любые решения относительно значимости будут основываться на этом уточненном значении р.

Связанные определения:
p-уровень
Альтернативная гипотеза, альтернатива
Альфа-уровень
Бета-уровень
Гипотеза
Двусторонний критерий
Критерий для проверки гипотезы
Критическая область проверки гипотезы
Мощность
Мощность исследования
Мощность статистического критерия
Нулевая гипотеза
Односторонний критерий
Ошибка I рода
Ошибка II рода
Статистика критерия
Эквивалентные статистические критерии

В начало

Содержание портала

5.6. Вероятность ошибки р

Если следовать подразделению статистики на описательную и аналитическую, то задача аналитической статистики — предоставить методы, с помощью которых можно было бы объективно выяснить,
например, является ли наблюдаемая разница в средних значениях или взаимосвязь (корреляция) выборок случайной или нет.

Например, если сравниваются два средних значения выборок, то можно сформулировать две предварительных гипотезы:

  • Гипотеза 0 (нулевая): Наблюдаемые различия между средними значениями выборок находятся в пределах случайных отклонений.

  • Гипотеза 1 (альтернативная): Наблюдаемые различия между средними значениями нельзя объяснить случайными отклонениями.

В аналитической статистике разработаны методы вычисления так называемых тестовых (контрольных) величин, которые рассчитываются по определенным формулам на основе данных,
содержащихся в выборках или полученных из них характеристик. Эти тестовые величины соответствуют определенным теоретическим распределениям
(t-pacnpeлелению, F-распределению, распределению X2 и т.д.), которые позволяют вычислить так называемую вероятность ошибки. Это вероятность равна проценту ошибки,
которую можно допустить отвергнув нулевую гипотезу и приняв альтернативную.

Вероятность определяется в математике, как величина, находящаяся в диапазоне от 0 до 1. В практической статистике она также часто выражаются в процентах. Обычно вероятность обозначаются буквой р:

0 < р < 1

Вероятности ошибки, при которой допустимо отвергнуть нулевую гипотезу и принять альтернативную гипотезу, зависит от каждого конкретного случая.
В значительной степени эта вероятность определяется характером исследуемой ситуации. Чем больше требуемая вероятность, с которой надо избежать ошибочного решения,
тем более узкими выбираются границы вероятности ошибки, при которой отвергается нулевая гипотеза, так называемый доверительный интервал вероятности.
Обычно в исследованиях используют 5% вероятность ошибки.

Существует общепринятая терминология, которая относится к доверительным интервалам вероятности:

  • Высказывания, имеющие вероятность ошибки р <= 0,05 — называются значимыми.
  • Высказывания с вероятностью ошибки р <= 0,01 — очень значимыми,
  • А высказывания с вероятностью ошибки р <= 0,001 — максимально значимыми.

В литературе такие ситуации иногда обозначают одной, двумя или тремя звездочками.

Вероятность ошибки Значимость Обозначение
р > 0.05 Не значимая ns
р <= 0.05 Значимая *
р <= 0.01 Очень значимая **
р <= 0.001 Максимально значимая ***

В SPSS вероятность ошибки р имеет различные обозначения; звездочки для указания степени значимости применяются лишь в немногих случаях. Обычно в SPSS значение р обозначается Sig. (Significant).

Времена, когда не было компьютеров, пригодных для статистического анализа, давали практикам по крайней мере одно преимущество. Так как все вычисления надо было выполнять вручную,
статистик должен был сначала тщательно обдумать, какие вопросы можно решить с помощью того или иного теста. Кроме того, особое значение придавалось точной формулировке нулевой гипотезы.

Но с помощью компьютера и такой мощной программы, как SPSS, очень легко можно провести множество тестов за очень короткое время. К примеру, если в таблицу сопряженности свести 50 переменных
с другими 20 переменными и выполнить тест X2, то получится 1000 результатов проверки значимости или 1000 значений р. Некритический подбор значимых величин может
дать бессмысленный результат, так как уже при граничном уровне значимости р = 0,05 в пяти процентах наблюдений, то есть в 50 возможных наблюдениях, можно ожидать значимые результаты.

Этим ошибкам первого рода (когда нулевая гипотеза отвергается, хотя она верна) следует уделять достаточно внимания. Ошибкой второго рода называется ситуация,
когда нулевая гипотеза принимается, хотя она ложна. Вероятность допустить ошибку первого рода равна вероятности ошибки р. Вероятность ошибки второго рода тем меньше, чем больше вероятность ошибки р.


Определим выражение для вычисления ошибки второго рода и мощности теста, построим в

MS

EXCEL

кривые оперативной характеристики (Operating-characteristic curves).

Тема этой статьи – вычисление

ошибки второго рода

(type II error) при

проверке гипотез

. Основная статья про

проверку гипотез

находится здесь

.

Напомним, что процедура

проверки гипотез

состоит из следующих шагов:

  • из исследуемого распределения берется

    выборка

    ;
  • на основании значений

    выборки

    вычисляется

    тестовая статистика

    ;
  • значение

    тестовой статистики

    сравнивается со значениями, соответствующим заданному

    уровню значимости (ошибке первого рода)

    ;

  • по результату сравнения делается вывод об отклонении (или не отклонении)

    нулевой гипотезы

    .

Обычно с

проверкой гипотез

связывают 2 типа ошибок. Если

нулевая гипотеза

отклоняется, когда она верна – это

ошибка первого рода

(обозначается α,

альфа

). Если нулевая гипотеза не отклоняется, когда она неверна, то это

ошибка второго рода

(обозначается β,

бета

).

Ошибка первого рода

часто называется риском производителя. Это осознанный риск, на который идет производитель продукции, т.к. он определяет вероятность того, что годная продукция может быть забракована, хотя на самом деле она таковой не является. Величина

ошибки первого рода

задается перед

проверкой гипотезы

, таким образом, она контролируется исследователем напрямую и может быть задана в соответствии с условиями решаемой задачи. После этого, процедура проверки гипотезы составляется таким образом, чтобы вероятность

ошибки второго рода

была как можно меньше.


Ошибка второго рода

β

зависит от размера

выборки

n и

уровня значимости α

, и поэтому контролируется косвенно. Чем больше размер

выборки

, тем меньше

ошибка второго рода

(при прочих равных).

Часто также используют величину

1-β

, которая называется

мощностью статистического критерия

(мощностью теста, мощностью исследования, англ. power of a statistical test).

Мощность статистического критерия

— это вероятность правильно отклонить нулевую гипотезу. Чем ближе эта величина к единице, тем меньше у нас шансов ошибиться при проверке гипотезы (тем лучше критерий различает гипотезы Н

0

и Н

1

).


Ошибку второго рода

вычисляют для каждого вида

проверки гипотез

по-разному. Получим выражение для вычисления

ошибки второго рода

для

проверки двусторонней гипотезы о равенстве среднего значения распределения некоторой величине (стандартное отклонение известно)

.

Для

проверки гипотезы

этого типа используется

тестовая статистика

Z

0

:

которая имеет

стандартное нормальное распределение

.

Чтобы найти

Ошибку второго рода

необходимо предположить, что гипотеза Н

0

: μ=μ

0

не верна, и соответственно истинное

среднее значение распределения

μ=μ

0

+Δ, где Δ>0. В этом случае,

тестовая статистика

Z

0

будет иметь

нормальное распределение

N(Δ√n/σ;1), т.е. будет смещено вправо на Δ√n/σ (см.

файл примера на листе Бета

).

Согласно определения,

ошибка второго рода

равна вероятности, принять нулевую гипотезу, если на самом деле справедлива Н

1

. Эта вероятность соответствует выделенной на рисунке области.

Статистика

Z

0

, в этом случае, примет значение между -Z

α/2

и Z

α/2

(эти значения соответствуют границам

доверительного интервала

). Z

α/2

– это

верхний α/2-квантиль стандартного нормального распределения

.

Определим

ошибку второго рода

в терминах

стандартного нормального распределения

:

Это выражение будет работать и для Δ<0. Как видно из выражения,

ошибка второго рода

является функцией от α, Δ и n. В

файле примера на листе Бета

можно быстро рассчитать β и

мощность теста

в зависимости от этих параметров. Диаграмма, приведенная выше, будет автоматически перестроена.

Для заданного значения α часто строят семейство кривых, которые иллюстрируют зависимость

ошибки второго рода

от Δ и n. Такие кривые называются

операционными характеристиками

(Operating-characteristic curves).

Как видно из рисунка, чем дальше истинное значение

среднего

от μ

0

, т.е. чем больше Δ, тем меньше

ошибка второго рода.

Таким образом, для заданных α и n, тест легче определит большие отклонения от

среднего

, чем малые (тест обладает, в данном случае, большей

мощностью

). При росте n

мощность теста

также растет.


Кривые

операционных характеристик

используются для оценки размера

выборки

, достаточного для определения заданной разницы между истинным значением

среднего

μ

от μ

0

с требуемой вероятностью.

В

файле примера на листе ОХ

создана форма для определения размера

выборки

, достаточного для обеспечения заданной

мощности теста

.

Например, Н

0

: μ

0

=20, истинное значение μ=20,05,

стандартное отклонение

=0,1, α=0,05. Чтобы вероятность правильно отклонить гипотезу H

0

была равна 0,9 (

мощность теста

), размер

выборки

должен быть 42 или более.


Примечание

:

Для нахождения размера

выборки

потребуется использование инструмента MS EXCEL

Подбор параметра

.

Понравилась статья? Поделить с друзьями:

Не пропустите эти материалы по теме:

  • Яндекс еда ошибка привязки карты
  • Альфа банк произошла ошибка попробуйте повторить позднее
  • Альфа банк произошла ошибка пожалуйста запросите пароль повторно
  • Альфа банк ошибка сбп
  • Альфа банк ошибка при переводе

  • 0 0 голоса
    Рейтинг статьи
    Подписаться
    Уведомить о
    guest

    0 комментариев
    Старые
    Новые Популярные
    Межтекстовые Отзывы
    Посмотреть все комментарии