Апостериорная ошибка выборки

Как мы уже знаем, репрезентативность — свойство выборочной совокупности представлять характеристику генеральной. Если совпадения нет, говорят об ошибке репрезентативности — мере отклонения статистической структуры выборки от структуры соответствующей генеральной совокупности. Предположим, что средний ежемесячный семейный доход пенсионеров в генеральной совокупности составляет 2 тыс. руб., а в выборочной — 6 тыс. руб. Это означает, что социолог опрашивал только зажиточную часть пенсионеров, а в его исследование вкралась ошибка репрезентативности. Иными словами, ошибкой репрезентативности называется расхождение между двумя совокупностями — генеральной, на которую направлен теоретический интерес социолога и представление о свойствах которой он хочет получить в конечном итоге, и выборочной, на которую направлен практический интерес социолога, которая выступает одновременно как объект обследования и средство получения информации о генеральной совокупности.

Наряду с термином «ошибка репрезентативности» в отечественной литературе можно встретить другой — «ошибка выборки». Иногда они употребляются как синонимы, а иногда «ошибка выборки» используется вместо «ошибки репрезентативности» как количественно более точное понятие.

Ошибка выборки — отклонение средних характеристик выборочной совокупности от средних характеристик генеральной совокупности.

На практике ошибка выборки определяется путем сравнения известных характеристик генеральной совокупности с выборочными средними. В социологии при обследованиях взрослого населения чаще всего используют данные переписей населения, текущего статистического учета, результаты предшествующих опросов. В качестве контрольных параметров обычно применяются социально-демографические признаки. Сравнение средних генеральной и выборочной совокупностей, на основе этого определение ошибки выборки и ее уменьшение называется контролированием репрезентативности. Поскольку сравнение своих и чужих данных можно сделать по завершении исследования, такой способ контроля называется апостериорным, т.е. осуществляемым после опыта.

В опросах Института Дж. Гэллапа репрезентативность контролируется по имеющимся в национальных переписях данным о распределении населения по полу, возрасту, образованию, доходу, профессии, расовой принадлежности, месту проживания, величине населенного пункта. Всероссийский центр изучения общественного мнения (ВЦИОМ) использует для подобных целей такие показатели, как пол, возраст, образование, тип поселения, семейное положение, сфера занятости, должностной статус респондента, которые заимствуются в Государственном комитете по статистике РФ. В том и другом случае генеральная совокупность известна. Ошибку выборки невозможно установить, если неизвестны значения переменной в выборочной и генеральной совокупностях.

Специалисты ВЦИОМ обеспечивают при анализе данных тщательный ремонт выборки, чтобы минимизировать отклонения, возникшие на этапе полевых работ. Особенно сильные смещения наблюдаются по параметрам пола и возраста. Объясняется это тем, что женщины и люди с высшим образованием больше времени проводят дома и легче идут на контакт с интервьюером, т.е. являются легко достижимой группой по сравнению с мужчинами и людьми «необразованными»35.

Ошибка выборки обусловливается двумя факторами: методом формирования выборки и размером выборки.

Ошибки выборки подразделяются на два типа — случайные и систематические. Случайная ошибка — это вероятность того, что выборочная средняя выйдет (или не выйдет) за пределы заданного интервала. К случайным ошибкам относят статистические погрешности, присущие самому выборочному методу. Они уменьшаются при возрастании объема выборочной совокупности.

Второй тип ошибок выборки — систематические ошибки. Если социолог решил узнать мнение всех жителей города о проводимой местными органами власти социальной политике, а опросил только тех, у кого есть телефон, то возникает предумышленное смещение выборки в пользу зажиточных слоев, т.е. систематическая ошибка.

Таким образом, систематические ошибки — результат деятельности самого исследователя. Они наиболее опасны, поскольку приводят к довольно значительным смещениям результатов исследования. Систематические ошибки считаются страшнее случайных еще и потому, что они не поддаются контролю и измерению.

Они возникают, когда, например:

  1. выборка не соответствует задачам исследования (социолог решил изучить только работающих пенсионеров, а опросил всех подряд);
  2. налицо незнание характера генеральной совокупности (социолог думал, что 70% всех пенсионеров не работает, а оказалось, что не работает только 10%);
  3. отбираются только «выигрышные» элементы генеральной совокупности (например, только обеспеченные пенсионеры).

Внимание! В отличие от случайных ошибок систематические ошибки при возрастании объема выборки не уменьшаются.

Обобщив все случаи, когда происходят систематические ошибки, методисты составили их реестр. Они полагают, что источником неконтролируемых перекосов в распределении выборочных наблюдений могут быть следующие факторы:

  • нарушены методические и методологические правила проведения социологического исследования;
  • выбраны неадекватные способы формирования выборочной совокупности, методы сбора и расчета данных;
  • произошла замена требуемых единиц наблюдения другими, более доступными;
  • отмечен неполный охват выборочной совокупности (недополучение анкет, неполное их заполнение, труднодоступность единиц наблюдения).

Намеренные ошибки социолог допускает редко. Чаще ошибки возникают из-за того, что социологу плохо известна структура генеральной совокупности: распределение людей по возрасту, профессии, доходам и т.д.

Систематические ошибки легче предупредить (по сравнению со случайными), но их очень трудно устранить. Предупреждать систематические ошибки, точно предвидя их источники, лучше всего заранее — в самом начале исследования.

Вот некоторые способы избежать ошибок выборки:

  • каждая единица генеральной совокупности должна иметь равную вероятность попасть в выборку;
  • отбор желательно производить из однородных совокупностей;
  • надо знать характеристики генеральной совокупности;
  • при составлении выборочной совокупности надо учитывать случайные и систематические ошибки.

Если выборочная совокупность (или просто выборка) составлена правильно, то социолог получает надежные результаты, харастеризующие всю генеральную совокупность. Если она составлена неправильно, то ошибка, возникшая на этапе составления выборки, на каждом следующем этапе проведения социологического исследования приумножается и достигает в конечном счете такой величины, которая перевешивает ценность проведенного исследования. Говорят, что от такого исследования больше вреда, нежели пользы.

Подобные ошибки могут произойти только с выборочной совокупностыо. Чтобы избежать или уменьшить вероятность ошибки, самый простой способ — увеличивать размеры выборки (в идеале до объема генеральной: когда обе совокупности совпадут, ошибка выборки вообще исчезнет). Экономически такой метод невозможен. Остается другой путь — совершенствовать математические методы составления выборки. Они то и применяются на практике. Таков первый канал проникновения в социологию математики. Второй канал — математическая обработка данных.

Особенно важной проблема ошибок становится в маркетинговых исследованиях, где используются не очень большие выборки. Обычно они составляют несколько сотен, реже — тысячу респондентов. Здесь исходным пунктом расчета выборки выступает вопрос об определении размеров выборочной совокупности. Численность выборочной совокупности зависит от двух факторов:

  1. стоимости сбора информации,
  2. стремления к определенной степени статистической достоверности результатов, которую надеется получить исследователь.

Конечно, даже не искушенные в статистике и социологии люди интуитивно понимают, что чем больше размеры выборки, т.е. чем ближе они к размерам генеральной совокупности в целом, тем более надежны и достоверны полученные данные. Однако выше мы уже говорили о практической невозможности сплошных опросов в тех случаях, когда они проводятся на объектах, численность которых превышает десятки, сотни тысяч и даже миллионы. Понятно, что стоимость сбора информации (включающая оплату тиражирования инструментария, труда анкетеров, полевых менеджеров и операторов по компьютерному вводу) зависит от той суммы, которую готов выделить заказчик, и слабо зависит от исследователей. Что же касается второго фактора, то мы остановимся на нем чуть подробнее.

Итак, чем больше величина выборки, тем меньше возможная ошибка. Хотя необходимо отметить, что при желании увеличить точность вдвое вам придется увеличить выборку не в два, а в четыре раза. Например, чтобы сделать в два раза более точной оценку данных, полученных путем опроса 400 человек, вам потребуется опросить не 800, а 1600 человек. Впрочем, вряд ли маркетинговое исследование испытывает нужду в стопроцентной точности. Если пивовару необходимо узнать, какая часть потребителей пива предпочитает именно его марку, а не сорт его конкурента, — 60% или 40%, то на его планы никак не повлияет разница между 57%, 60 или 63%.

Ошибка выборки может зависеть не только от ее величины, но и от степени различий между отдельными единицами внутри генеральной совокупности, которую мы исследуем. Например, если нам нужно узнать, какое количество пива потребляется, то мы обнаружим, что внутри нашей генеральной совокупности нормы потребления у различных людей существенно различаются (гетерогенная генеральная совокупность). В другом случае мы будем изучать потребление хлеба и установим, что у разных людей оно различается гораздо менее существенно {гомогенная генеральная совокупность). Чем больше различия (или гетерогенность) внутри генеральной совокупности, тем больше величина возможной ошибки выборки. Указанная закономерность лишь подтверждает то, что нам подсказывает простой здравый смысл. Таким образом, как справедливо утверждает В. Ядов, «численность (объем) выборки зависит от уровня однородности или разнородности изучаемых объектов. Чем более они однородны, тем меньшая численность может обеспечить статистически достоверные выводы».

Определение объема выборки зависит также от уровня доверительного интервала допустимой статистической ошибки. Здесь имеются в виду так называемые случайные ошибки, которые связаны с природой любых статистических погрешностей. В.И. Паниотто приводит следующие расчеты репрезентативной выборки с допущением 5%-ной ошибки:
Это означает,что если вы, опросив, предположим, 400 человек в районном городе, где численность взрослого платежеспособного населения составляет 100 тыс. человек, выявили, что 33% опрошенных покупателей предпочитают продукцию местного мясокомбината, то с 95%-ной вероятностью можете утверждать, что постоянными покупателями этой продукции являются 33+5% (т.е. от 28 до 38%) жителей этого города.

Можно также воспользоваться расчетами института Гэллапа для оценки соотношения размеров выборки и ошибки выборки.


Апостериорная вероятность — это обновленная вероятность некоторого события, происходящего после учета новой информации.

Например, нас может заинтересовать определение вероятности того, что какое-то событие «А» произойдет после того, как мы учтем какое-то событие «В», которое только что произошло. Мы могли бы рассчитать эту апостериорную вероятность, используя следующую формулу:

Р(А|В) = Р(А) * Р(В|А) / Р(В)

куда:

P(A|B) = вероятность события A при условии, что событие B произошло. Обратите внимание, что «|» означает «дано».

P(A) = вероятность того, что событие A произойдет.

P(B) = вероятность того, что событие B произойдет.

P(B|A) = вероятность наступления события B при условии, что событие A произошло.

Пример: расчет апостериорной вероятности

Лес состоит из 20% дубов и 80% кленов. Предположим, известно, что 90 % дубов здоровы, а здоровы лишь 50 % клёнов. Предположим, что на расстоянии можно сказать, что конкретное дерево здорово. Какова вероятность того, что это дуб?

Напомним, что вероятность наступления события А при условии, что произошло событие В, равна:

Р(А|В) = Р(А) * Р(В|А) / Р(В)

В этом примере вероятность того, что дерево является дубом, при условии, что дерево здоровое, составляет:

P(Дуб|Здоровый) = P(Дуб) * P(Здоровый|Дуб) / P(Здоровый)

P(Дуб) = Вероятность того, что данное дерево является дубом, равна 0,2 , потому что 20% всех деревьев в лесу являются дубами.

P(Healthy) = Вероятность того, что данное дерево является здоровым, можно рассчитать как (0,20)*(0,9) + (0,8)*(0,5) = 0,58 .

P(Здоровый|Дуб) = Вероятность того, что дерево здоровое, учитывая, что это дуб, равна 0,9 , поскольку нам сказали, что 90% дубов здоровы.

Используя эти три числа, мы можем найти вероятность того, что дерево является дубом при условии, что оно здоровое:

P(Дуб|Здоровый) = P(Дуб) * P(Здоровый|Дуб) / P(Здоровый) = (0,2) * (0,9) / (0,58) = 0,3103 .

Для интуитивного понимания этой вероятности предположим, что следующая сетка представляет этот лес со 100 деревьями. Ровно 20 деревьев дубы и 18 из них здоровые. Остальные 80 деревьев — это клены, и 40 из них — здоровые.

(O = дуб, M = клен, зеленый = здоровый, красный = нездоровый)

Пример апостериорной вероятности

Из всех деревьев ровно 58 здоровых и 18 из этих здоровых дубов. Таким образом, если мы знаем, что выбрали здоровое дерево, то вероятность того, что это дуб, составляет 18/58 = 0,3103 .

Когда следует использовать апостериорную вероятность?

Апостериорная вероятность используется в самых разных областях, включая финансы, медицину, экономику и прогнозирование погоды.

Весь смысл использования апостериорных вероятностей состоит в том, чтобы обновить предыдущее убеждение, которое у нас было о чем-то, как только мы получим новую информацию.

Напомним, что в предыдущем примере мы знали, что вероятность того, что данное дерево в лесу является дубом, составляет 20 %. Это известно как априорная вероятность.Если бы мы просто выбрали дерево наугад, то знали бы, что вероятность того, что это дуб, равна 0,20.

Однако, как только мы получили новую информацию о том, что выбранное нами дерево было здоровым, мы смогли использовать эту новую информацию, чтобы определить, что апостериорная вероятность того, что это дерево является дубом, вместо этого равнялась 0,3103.

В реальном мире люди постоянно сталкиваются с новой информацией. Эта новая информация помогает нам обновить наши прежние убеждения. С точки зрения статистики это означает, что мы можем генерировать апостериорные вероятности происходящих событий, что помогает нам получить более точное представление о мире и позволяет делать более точные прогнозы будущих событий.

x
– набор выборок сигнала(результат
наблюдений);

s
– состояние сигнала;

P
– вероятность наступления события;

П
– плата за ошибку;

W(x|sj)
– Условный закон распределения (закон
распределения вероятности того, что
приняли выборку х при состоянии sj);

В
условиях, когда известно
априорное (до-опытное) распределение
состояний
sj,
но нет каких-либо обоснованных соображений
относительно величин потерь
Пjk
может быть использован несколько иной
подход к выработке правил выбора решений.
Найдем, используя формулу Байеса

апостериорную
вероятность состояния sj,
когда наблюдается выборка х
= (x1,
…, хn):

(1)

P(sj
| х) — вероятность гипотезы о состоянии
sj
при принятии выборки х (апостериорная
вероятность);

Pj
— априорная вероятность гипотезы о
состоянии sj;

W(х
| sj)
— закон распределения вероятности
принятия выборки х при истинности
гипотезы о состоянии sj;

—полная
вероятность принятия выборки х.

Апостериорные
вероятности P{sj|x},
j=
0, …, m,
представляют наиболее полную характеристику
состояний sj
при располагаемых априорных данных.
Поэтому естественно принять следующее
правило:
истинным
является то состояние
sj,
для которого апостериорная вероятность
(1) при наблюдаемом х максимальна.

Критерием качества рассматриваемого
правила является максимум апостериорной
вероятности.

Из
этого критерия следует правило разбиения
пространства выборок. К области xj
относят те выборки х, для которых при
всех

В
случае
всего двух
состояний
s1
и
s0
получаем:


(2)

Установим
следующее правило
выбора решения
:
принимается гипотеза H1,
если P{ s1
| х } ≥ P{
s0
| х } (решение γ1)
и отвергается эта гипотеза, если P{
s0
| х } > P{ s1
| х } (решение γ0).

Так
как P{
s0
| х } + P{ s1
| х } = 1, то это равносильно принятию той
гипотезы, для которой апостериорная
вероятность больше 1/2 (а при равенстве
1/2 принимается гипотеза H1).

Используя
(2), можно правило выбора решения выразить
через отношение правдоподобия: принимается
решение γ1
(отвергается гипотеза
H1),
если для наблюдаемой выборки х выполняется
неравенство

l(x)
≥ μ

(3)

и
принимается решение γ0
(справедлива гипотеза H0),
если выполняется

неравенство,
противоположное (3).

Таким
образом, максимуму апостериорной
вероятности соответствует такая
критическая область пространства
выборок, точки которой удовлетворяют
неравенству (3). Процедура проверки
простой гипотезы H0
сводится в этом случае к вычислению
отношения правдоподобия l(x)

и сравнению его с величиной μ.

*Теория
статистической радиотехники. Левин.
Том 2. 1975г. стр.17-18,24-25.

26. Критерий Неймана—Пирсона.

Для
оптимизации правила выбора решений при
отсутствии априорной информации о
потерях и вероятностях состояний
применяют критерий Неймана—Пирсона.
В ряде случаев оказывается достаточно
трудно, а иногда и невозможно определить
даже хотя бы приблизительно не только
априорные вероятности гипотез, но и
цены решений. Классическим примером
такой ситуации является обнаружение
сигналов в радиолокации. То же самое
имеет место и в системах передачи
дискретных сообщений при обнаружении
начала информационной последовательности
(радиограммы, команды и т.п.).

В
этих условиях обычно приходится
задаваться некоторым значением
вероятности ошибочного решения при
справедливости одной из гипотез.

Согласно
этому критерию выбирается такое правило,
которое обеспечивает минимально
возможную величину β вероятности ошибок
второго рода (пропуск сигнала) при
условии, что вероятность ошибки первого
рода не больше заданной величины α(ложная
тревога). Иначе говоря, правило выбора
решения по критерию Неймана—Пирсона
имеет наибольшую мощность среди всех
других правил, для которых уровень
значимости не превосходит α.

Вероятности:

α
— ложной тревоги,

β-
пропуска сигнала.

Рассмотрим
задачу проверки гипотезы Н0
против альтернативы H1
в ситуации априорной неопределенности,
когда априорные вероятности гипотез,
а также матрицы потерь неизвестны. Для
указанной бинарной (одноальтернативной)
задачи проверки гипотез при использовании
любого правила выбора решения возможны
два ошибочных решения

,

и два правильных

и

.
Условные вероятности

называют
вероятностями ошибок первого и второго
рода соответственно.

Ясно,
что вероятности правильных решений

Алгоритм



называется оптимальным по критерию
Неймана — Пирсона, если при его
использовании достигается минимальное
значение ошибки второго рода

при
заданном ограничении вероятности ошибки
первого рода


.

Задача
синтеза оптимального алгоритма принятия
решения по указанному критерию состоит
в определении минимума функционала

в
котором вероятность β зависит от правила
выбора решения, вероятность α фиксирована
и с — неопределенный множитель Лагранжа.

Для
того чтобы применить критерий
Неймана-Пирсона на практике необходимо
для выборок сигнала х = (х1,
…, хn),
найти отношение правдоподобия и сравнить
с порогом:

причем
порог с выбирается из условия

l(x)


отношения
правдоподобия

;

c
– порог.

s0
– состояние сигнала;

W(х
| s0)
— закон распределения вероятности
принятия выборки х при истинности
гипотезы о состоянии sj;

Таким
образом, мы задаем значение α и находим
порог с.

*Теория статистической
радиотехники. Левин. Изд 3е. 1989г.
стр.319-320, 330-331.

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]

  • #
  • #
  • #
  • #
  • #
  • #
  • #
  • #
  • #
  • #
  • #

Понравилась статья? Поделить с друзьями:

Не пропустите эти материалы по теме:

  • Яндекс еда ошибка привязки карты
  • Апекс ошибка сервера не найдены
  • Апл тв ошибка 3905
  • Апекс ошибка при запуске приложения 0xc000005
  • Апекс ошибка при запуске приложения 0xc00000142

  • 0 0 голоса
    Рейтинг статьи
    Подписаться
    Уведомить о
    guest

    0 комментариев
    Старые
    Новые Популярные
    Межтекстовые Отзывы
    Посмотреть все комментарии