Equal var false что означает

от admin

Проверка статистических гипотез. Часть 1.

Проверка статистических гипотез при помощи функций библиотеки scipy.stats.

  1. если нулевая нулевая гипотеза отвергается, когда на самом деле она верна, то совершается ошибка первого рода (ложно-отрицательный ответ).
  2. если нулевая нулевая гипотеза принимается, когда на самом деле она не верна, то совершается ошибка второго рода (ложно-положительный ответ).

Вероятность совершить ошибку первого рода называется уровнем значимости и обычно обозначается как \(\alpha\). Вероятность совершить ошибку второго рода обозначается как \(\beta\), а вероятность не допустить ошибку второго рода \(1 — \beta\) называется мощностью критерия. При проверке статистических гипотез уровень значимости обычно принимают равным 0.1 0.05 или 0.01.

Для проверки гипотезы используют специально-подобранную случайную величину, которая называется статистический критерий. Наблюдаемым значением критерия называют значение критерия, вычисленное по выборке. Критическая область это совокупность значений критерия, при которых нулевая гипотеза отвергается. Критическими точками называют точки, отделяющие критическую область от областей принятия гипотезы.

Функции пакета scipy.stats для проверки гипотез обычно возвращают значение критерия и p-значение, которое сравнивается с уровнем значимости. Если р-значение больше уровня значимости, то нет основания отвергнуть нулевую гипотезу.

Сравнение средних значений двух нормальных генеральных совокупностей

  1. Генеральные совокупности X и Y распределены нормально и известны их дисперсии
  2. По независимым выборкам объемами n и m найдены выборочные средние \(\hat\) и \(\hat\).
  3. Требуется по выборочным средним оценить нулевую гипотезу о том, что генеральные средние рассматриваемых совокупностей равны:

Для проверке гипотезы о равенстве средних генеральных совокупностей используется функция scipy.stats.ttest_ind.

  • выборка 1
  • выборка 2
  • equal_var — принимается ли допущение о равенстве дисперсий двух выборок (True/False)
  • alternative альтернативная гипотеза (‘greater’, ‘less’, ‘two-sided’)

Альтернативная гипотеза \(H_1: M(X) \neq M(Y)\). alternative=’two-sided’

Предположим, что принятый уровень значимости равен 0,05. Полученное p-значение велико — гораздо больше уровня значимости, следовательно нет оснований отвергнуть нулевую гипотезу о равенстве средних двух генеральных совокупностей. Ожидаемый результат, с учетом того, что массивы a и b сгенерированы с одинаковыми математическими ожиданиями.

Альтернативная гипотеза \(H_1: M(X) > M(Y)\). alternative=’greater’

Полученное p-значение велико — гораздо больше уровня значимости, следовательно нет оснований отвергнуть нулевую гипотезу о равенстве средних двух генеральных совокупностей в пользу альтернативной гипотезы.

Альтернативная гипотеза \(H_1: M(X) < M(Y)\). alternative=’less’

Полученное p-значение велико — гораздо больше уровня значимости, следовательно нет оснований отвергнуть нулевую гипотезу о равенстве средних двух генеральных совокупностей в пользу альтернативной гипотезы.

Сравнение выборочной средней с гипотетической генеральной средней нормальной совокупности

Пусть генеральная совокупность Х распределена нормально, при это генеральная средняя \(m\) неизвестна, но есть основания полагать, что она равна \(m_0\). Для проверки этой гипотезы определяется средняя выборки из генеральной совокупности \(\hat m\) и устанавливают значимо или незначимо различаются \(\hat m\) и \(m_0\).

Гипотеза: \[H_0: \hat = m_0\]

Альтернативная гипотеза: \(H_1: \hat \neq m_0\)

или \[H_1: \hat > m_0\]

или \[H_1: \hat < m_0\]

Для проверки гипотезы о равенстве математического ожидания генеральной совокупности некоторому значения, по результатам оценки математичексого ожидания выборки используется функция scipy.stats.ttest_1samp.

  • выборка
  • popnmean: предполагаемое математическое ожидание генеральной совокупности
  • alternative: вид альтернативной гипотезы (‘two-sided’, ‘less’, ‘greater’)

Для оценки гипотезы используется критерий \[k = \frac<\hat-a>\]

где \(\hat\) — среднее значение выборки, \(a\) — гипотетическое математическое ожидание генеральной совокупности, \(s\) — стандартное отклонение выборки.

Полученное p-значение велико — гораздо больше уровня значимости, следовательно нет оснований отвергнуть нулевую гипотезу о равенстве математического ожидания генеральной совокупности, из которой взята выборка a, значения test_4_mean = 0.

Сравнение двух дисперсий нормальных генеральных совокупностей

На практике задача сравнения двух дисперсий возникает, когда необходимо сравнить точность приборов, методов измерений или инструментов. Пусть генеральные совокупности X и Y распределены нормально. По независимым выборкам с объемом \(n_1\) и \(n_2\) определены исправленные выборочные дисперсии \(s_x^2\) и \(s_y^2\). Требуется по исправленным дисперсиям при заданном уровне значимости $\alpha$ проверить нулевую гипотезу о том, что генеральные дисперсии рассматриваемых совокупностей равны между собой \[H_0: D(X)=D(Y)\]

В качестве критерия для проверки нулевой гипотезы используется отношение дисперсии: \[F = \frac\]

Эта величина при справедливости нулевой гипотезы имеет распределение Фишера-Снедекора со степенями свободы \(k_1 = n_1-1\), \(k_2 = n_2-1\). В зависимости от альтернативной гипотезы определяют правостороннюю, левостороннюю или двухстороннюю критическую области.

При \(H_1: D(X)>D(Y)\) критическую точку находят из условия \[P[F>F_<\text<кр>>(\alpha,k_1,k_2)] = \alpha\]

Пример. Пусть даны две выборки размером 12 и 15. Найдем с уровнем значимости 0,05 правую границу критической области для альтернативной гипотезы \(H_1: D(X)>D(Y)\):

Если наблюдаемое значение критерия, определенного по выборкам, больше критического значения, то нулевую гипотезу отвергают.

Для альтернативной гипотезы $H_1: D(X)<D(Y)$ критическую точку находят из условия \[P[F<F_<\text<кр>>(\alpha,k_1,k_2)] = \alpha\]

Если наблюдаемое значение критерия, определенного по выборкам, меньше критического значения, то нулевую гипотезу отвергают в пользу альтернативной.

Для альтернативной гипотезы $H_1: D(X) \neq D(Y)$ находят двухстороннюю критическую область \[P[F < F_<\text<кр,лев>>(\alpha/2,k_1,k_2)] = \alpha/2\] \[P[F < F_<\text<кр,пр>>(\alpha/2,k_1,k_2)] = \alpha/2\]

Нулевая гипотеза отвергается, если наблюдаемое значение критерия, определенного по выборкам, не принадлежит определенному интервалу.

Пример

Наблюдаемое значение 0,57 меньше критического 1,61, поэтому нет оснований отвергнуть нулевую гипотезу в пользу альтернативной \(H_1: D(A)>D(B)\).

Тест Бартлетта проверяет нулевую гипотезу о том, что все входные выборки взяты из популяций с одинаковыми дисперсиями. Для выборок из значительно ненормальных популяций тест Левена более надежен.

p-значение больше уровня значимости 0.05, нулевая гипотеза не может быть отвергнута.

p-значение больше уровня значимости 0.05, нулевая гипотеза не может быть отвергнута.

Сравнение двух дисперсий нормальных генеральных совокупностей

На практике задача сравнения двух дисперсий возникает, когда необходимо сравнить точность приборов, методов измерений или инструментов. Пусть генеральные совокупности X и Y распределены нормально. По независимым выборкам с объемом \(n_1\) и \(n_2\) определены исправленные выборочные дисперсии \(s_x^2\) и \(s_y^2\). Требуется по исправленным дисперсиям при заданном уровне значимости $\alpha$ проверить нулевую гипотезу о том, что генеральные дисперсии рассматриваемых совокупностей равны между собой \[H_0: D(X)=D(Y)\]

В качестве критерия для проверки нулевой гипотезы используется отношение дисперсии: \(F = \frac\)

Эта величина при справедливости нулевой гипотезы имеет распределение Фишера-Снедекора со степенями свободы \(k_1 = n_1-1\), \(k_2 = n_2-1\). В зависимости от альтернативной гипотезы определяют правостороннюю, левостороннюю или двухстороннюю критическую области.

При \(H_1: D(X)>D(Y)\) критическую точку находят из условия \[P[F>F_<\text<кр>>(\alpha,k_1,k_2)] = \alpha\]

Сравнение выборочной (исправленной) дисперсии с гипотетической генеральной дисперсией нормальной совокупности

Пусть генеральная совокупность распределена нормально, при этом генеральная дисперсия неизвестна, но имеются основания полагать, что она равна предполагаемому значения \(\sigma_0^2\). Из генеральной совокупности извлекается выборка объема n и по этой выборке определяется исправленная дисперсия \(s^2\). Требуется по исправленной выборочной дисперсии при заданном уровне значимости проверить нулевую гипотезу: \[H_0: M(s^2) = \sigma_0^2\]

Т.е. необходимо установить, значимо или нет различаются исправленная выборочная и гипотетическая генеральная дисперсии.

Критерий для проверки нулевой гипотезы: \[\chi^2 = (n-1) \frac<\sigma_0^2>\]

где \(s\) — исправленное стандартное отклонение выборки, \(\sigma_0\) — предполагаемое стандартное отклонение генеральной совокупности.

Критическая область строится в зависимости от вида альтернативной гипотезы.

Если \[H_1: \sigma > \sigma_0,\]

то строят правостороннюю критическую область и критическая точка определяется при помощи функции scipy.stats.chi2.ppf. Нулевая гипотеза принимается, если \(\chi^2<\chi_<крит>^2\)

Если наблюдаемое значение меньше критического, то нет оснований отвергнуть нулевую гипотезу.

Если конкурирующая гипотеза: \[H_1: \sigma \neq \sigma_0,\]

то строят двухстороннюю критическую область. Нулевая гипотеза принимается, если \(\chi^2<\chi_<крит, прав>^2\) и \(\chi^2>\chi_<крит, лев>^2\).

Нулевая гипотеза не отвергается, если наблюдаемое значение лежит внутри этого интервала.

Если конкурирующая гипотеза \[H_1: \sigma < \sigma_0,\]

то строят левостороннюю критическую область. Нулевая гипотеза принимается, если \(\chi^2>\chi_<крит, лев>^2\).

Русские Блоги

T-тест — это тип теста гипотезы, также называемый t-тестом Стьюдента (t-критерий Стьюдента), который в основном используется для данных нормального распределения с небольшим размером выборки (например, n <30) и неизвестным стандартным отклонением популяции σ.
T-тест используется для проверки того, является ли разница между средними значениями для двух групп населения значимой.

Т статистика:t=\frac<|\overline<X>-\mu_0|><S_<\overline<X>>>=\frac<\bar<X>-\mu_0><s/\sqrt<n>>» /></p>
<p>Степени свободы: v = n-1</p>
<p>(1) Учитывая среднее значение по населению;</p>
<p>(2) Среднее значение выборки и стандартная ошибка выборки могут быть получены;</p>
<p>(3) Выборка происходит из нормальной или почти нормальной популяции.</p>
<h3>Классификация т-теста</h3>
<p>t-тест делится на t-критерий с одной популяцией и t-критерий с двойной популяцией</p>
<h4>T-критерий одиночной популяции</h4>
<p>Проверьте, отличается ли среднее значение по выборке от известного среднего по населению. <br />Применимые условия: <br />1. Обычно общее распределение <br />2. Размер выборки меньше 30 (когда размер выборки больше 30, используется статистика Z) <br />Статистика:</p>
<p>x¯x¯ —— Пример среднего <br />μμ — общее среднее <br />стандартное отклонение образца SS <br />размер nn-выборки <br />Пример 1 является примером t-критерия с одним образцом.</p>
<h4>T-критерий двойной популяции</h4>
<p>Проверьте, является ли среднее значение популяции, представленной двумя образцами, существенно отличающимся, включая t-тест независимой выборки и t-тест парной выборки</p>
<p>Независимый образец t-теста</p>
<p>Проверьте, является ли разница между средними значениями совокупности, представленными двумя независимыми выборками, значительной. <br />Применимые условия: <br />1. Оба образца взяты из нормальной популяции <br />2. Два примера не зависят друг от друга <br />3. Соблюдайте однородность дисперсии (две популяции имеют одинаковую дисперсию) <br />Статистика:</p>
<p>x¯x¯ —— Первый пример означает <br />y¯y¯ — среднее значение второго образца <br />мм — первый размер выборки <br />nn-второй размер выборки <br />S21S12 — первый пример дисперсии <br />S22S22 — вторая выборка дисперсии</p>
<p>T-тест парного образца</p>
<p>Проверьте, является ли разница между средними значениями совокупности, представленными двумя парными выборками, значимой. <br />Соответствующий образец в основном включает следующие две ситуации: <br />1. Сопоставление гомологий, то есть однородные объекты получают две разные обработки. Например: чтобы проверить, эффективен ли определенный метод памяти для улучшения памяти словарного запаса детей, 40 учеников выбираются случайным образом, а затем случайным образом делятся на две группы. Одна группа использует метод обучения, другая — не использует его, а через три месяца для получения данных проводится проверка словарного запаса учащихся этих двух групп. В. Эффективен ли этот метод обучения для улучшения словарной памяти? <br />2. Соедините себя <br />2.1. Группа однородных объектов допускает две различные обработки. Например, компания продвигает новый метод продвижения и подсчитывает объем бизнеса сотрудников до и после внедрения для получения данных. Эффективен ли этот метод стимулирования сбыта? <br />Применимые условия: <br />Разница между каждой парой данных должна соответствовать нормальному распределению <br />Статистика:</p>
<p>Новый сэмпл, образованный разницей между соответствующими элементами двух парных сэмплов <br />xd¯xd¯ —— Новое среднее значение выборки <br />SdSd — новое стандартное отклонение образца <br />nn-новый размер выборки</p>
<h4>Используйте scipy для непосредственного тестирования гипотез</h4>
<p>Scipy предлагает два метода решения задачи t-критерия Стьюдента для двух образцов с одинаковой дисперсией: <br />1. scipy.stats.ttest_ind <br />2. scipy.stats.ttest_ind_from_stats <br />Первый метод требует ввода данных исходной выборки, а второй метод напрямую вводит описательную статистику (среднее значение, стандартное отклонение, количество выборок) выборки. Так что здесь мы используем второй метод напрямую.</p>
<p>import numpy as np from scipy import stats mean1 = 30.97 mean2 = 21.79 std1 = 26.7 std2 = 12.1 nobs1 = 10 nobs2 = 10 modified_std1 = np.sqrt(np.float32(nobs1)/np.float32(nobs1-1)) * std1 modified_std2 = np.sqrt(np.float32(nobs2)/np.float32(nobs2-1)) * std2 (statistic, pvalue) = stats.ttest_ind_from_stats(mean1=mean1, std1=modified_std1, nobs1=10, mean2=mean2, std2=modified_std2, nobs2=10) print "t statistic is: ", statistic print "pvalue is: ", pvalue</p>
<p>Предположим, что наш уровень значимости α = 0,05α = 0,05, а значение pvalue значительно больше 0,05, поэтому мы не можем отвергнуть нулевую гипотезу, то есть нет существенной разницы в результатах двух культур.</p>
<p>Результаты парных образцов доказывают, что</p>
<p>α меньше 0,05, что указывает на значительную корреляцию</p>
<p>Ttest_1sampResult(statistic=array([ 4.51858295]), pvalue=array([ 8.49191658e-05]))</p>
<p>from scipy import stats import numpy as np</p>
<p>Создать 50 строк х 2 столбца данных</p>
<ul>
<li>1</li>
<li>2</li>
<li>3</li>
</ul>
<p>Проверьте, является ли разница между средним числом двух столбцов и 1 и 2 значительным</p>
<p>Ttest_1sampResult(statistic=array([ 2.0801775 , 2.44893711]), pvalue=array([ 0.04276084, 0.01795186]))</p>
<p>Показать t-статистику и p-значения двух номеров столбцов соответственно. Значения p равны 0,042 и 0,018, соответственно. Когда значение p меньше 0,05, разность считается значительной, то есть среднее значение номера первого столбца не равно 1, а среднее значение номера второго столбца не равно 2.</p>
<p>Не отвергайте нулевую гипотезу — среднее значение равно 5</p>
<p>Ttest_1sampResult(statistic=array([-0.68014479, -0.04323899]), pvalue=array([ 0.49961383, 0.96568674]))</p>
<p>Отклонить нулевую гипотезу — среднее не равно 5</p>
<p>Ttest_1sampResult(statistic=array([ 2.77025808, 4.11038784]), pvalue=array([ 0.00789095, 0.00014999]))</p>
<p>Среднее значение первого столбца равно 5, среднее значение второго столбца не равно 0</p>
<p>Ttest_1sampResult(statistic=array([-0.68014479, 4.11038784]), pvalue=array([ 4.99613833e-01, 1.49986458e-04]))</p>
<p>Среднее значение первой строки равно 5, среднее значение второй строки не равно 0</p>
<ul>
<li>1</li>
<li>2</li>
</ul>
<p>Ttest_1sampResult(statistic=array([-0.68014479, 4.11038784]), pvalue=array([ 4.99613833e-01, 1.49986458e-04]))</p>
<p>Сравните среднее из двух столбцов данных с 5.0 и 0.0 соответственно и получите статистику за 4 т и значения p</p>
<p>Ttest_1sampResult(statistic=array([[-0.68014479, -0.04323899], <br />[ 2.77025808, 4.11038784]]), pvalue=array([[ 4.99613833e-01, 9.65686743e-01], <br />[ 7.89094663e-03, 1.49986458e-04]]))</p>
<h4>Два независимых образца t test-ttest_ind</h4>
<ul>
<li>1</li>
<li>2</li>
<li>3</li>
<li>4</li>
</ul>
<p>Когда дисперсии двух популяций равны, они имеют «однородность дисперсии» и могут быть непосредственно проверены. <br />Не отвергайте нулевую гипотезу — две совокупности имеют одинаковое среднее значение</p>
<p>Если вы не уверены, равны ли дисперсии двух популяций, сначала следует использовать тест Левена, чтобы проверить, являются ли эти две популяции однородными.</p>
<p>Значение р намного больше, чем 0,05, и две популяции считаются однородными по дисперсии.</p>
<p>Если две популяции не имеют однородности дисперсии, для параметра equal_val необходимо установить значение «False».</p>
<p>Что следует отметить:</p>
<p>Если две популяции имеют однородность дисперсии, неправильно установив значение equal_var в False, значение p становится больше</p>
<p>Когда дисперсии двух совокупностей не равны, если для параметра equal_var не задано значение False, функция по умолчанию имеет значение equ_var равным True, что приведет к недооценке значения p</p>
<ul>
<li>1</li>
<li>2</li>
</ul>
<p>Правильное значение p <br />Ttest_indResult(statistic=-0.46580283298287956, pvalue=0.64149646246568737)</p>
<p>Недооцененное значение p <br />Ttest_indResult(statistic=-0.46580283298287956, pvalue=0.64145827413435608)</p>
<p>Когда две выборки не равны, изменение equal_val приведет к изменению статистики t <br />rvs1: из среднего значения по населению 5, дисперсия 10, номер выборки 500 <br />rvs2: из среднего значения по населению 5, дисперсия 20, выборка 100 <br />Две популяции не имеют однородной дисперсии, и необходимо установить equal_var = False</p>
<ul>
<li>1</li>
<li>2</li>
</ul>
<p>Неправильная статистика <br />Ttest_indResult(statistic=-0.99882539442782847, pvalue=0.31828327091038783)</p>
<p>Правильная статистика <br />Ttest_indResult(statistic=-0.69712570584654354, pvalue=0.48716927725401871)</p>
<p>Т-тест с другим средним значением, разной дисперсией и разными размерами выборки <br />Проверка ошибки: равный_варусу не задано значение False</p>
<ul>
<li>1</li>
<li>2</li>
</ul>
<h4>T-тест парного образца</h4>
<p>Не отвергайте нулевую гипотезу и думайте, что общее среднее значение, представленное rvs1 и rvs2, равно</p>
<ul>
<li>1</li>
<li>2</li>
<li>3</li>
</ul>
<p>Откажитесь от нулевой гипотезы и подумайте, что общее среднее значение, представленное rvs1 и rvs3, не равно</p>
<ul>
<li>1</li>
<li>2</li>
</ul>
<p>2. Проверка хи-квадрат</p>
<p><strong>Что такое тест хи-квадрат</strong></p>
<p>Критерий хи-квадрат является широко используемым методом проверки гипотез для подсчета данных. Он относится к категории непараметрических тестов, главным образом для сравнения корреляционного анализа двух или более частот выборки (соотношение композиции) и двух категориальных переменных. Основная идея состоит в том, чтобы сравнить степень соответствия или соответствия между теоретической частотой и фактической частотой.</p>
<p>Его применение в статистическом выводе секретных данных включает в себя: критерий хи-квадрат для сравнения двух скоростей или двух составляющих соотношений, критерий хи-квадрат для сравнения нескольких скоростей или множественных составляющих и Связанный анализ секретных данных и т. Д.</p>
<p><strong>Пример 1: тест хи-квадрат с четырьмя квадратами</strong></p>
<p>Ниже приведен типичный критерий хи-квадрат с четырьмя квадратами, мы хотим знать, влияет ли употребление молока на частоту простудных заболеваний:</p>
<div class=

Количество простудных заболеваний Нет холода общий Холодный курс
Группа питьевого молока 43 96 139 30.94%
Нет молочной группы 28 84 112 25.00%
общий 71 180 251 28.29%

Используя простую статистику, мы можем сделать вывод, что показатели холода в группах, употребляющих и не употребляющих молоко, составляют 30,94% и 25,00%. Разница между этими показателями может быть вызвана ошибкой выборки или тем, что молоко оказывает реальное влияние на норму холода.

Чтобы определить истинную причину, мы сначала предполагаем, что питьевое молоко не влияет на частоту простудных заболеваний, то есть питьевое молоко и простудные заболевания являются независимыми и независимыми, поэтому мы можем сделать вывод, что заболеваемость простудой на самом деле (43 + 28) / (43 + 28). + 96 + 84) = 28,29%

Поэтому теоретическая таблица из четырех сеток должна быть такой, как показано в следующей таблице:

Количество простудных заболеваний Нет холода общий
Группа питьевого молока =139*0.2829 =139*(1-0.2829) 139
Нет молочной группы =112*0.2829 =112*(1-0.2829) 112

— это следующая таблица:

Количество простудных заболеваний Нет холода общий
Группа питьевого молока 39.3231 99.6769 139
Нет молочной группы 31.6848 80.3152 112
общий 71 180 251

Если питье молока и простуду действительно независимы, тогда разница между теоретическими и фактическими значениями в четырех таблицах должна быть небольшой.

Тест хи-квадрат

Формула расчета критерия хи-квадрат:

Среди них А является фактическим значением, Т является теоретическим значением.

x2 используется для измерения разницы между фактическим значением и теоретическим значением (то есть основной идеей теста хи-квадрат) и содержит следующие две информации:
1. Абсолютное отклонение фактического значения от теоретического значения (из-за наличия квадрата разница усиливается)
2. Относительная величина разности и теоретическое значение

Пример 1: тест хи-квадрат

В соответствии с формулой теста хи-квадрат, мы можем сделать вывод, что значение хи-квадрат в примере 1:

Хи-квадрат = (43-39.3231) квадрат / 39.3231 + (28-31.6848) квадрат / 31.6848 + (96-99.6769) квадрат / 99.6769 + (84-80.3152) квадрат / 80.3152 = 1.077

Критическое значение распределения хи-квадрат:

На предыдущем шаге мы получили значение хи-квадрат, но как судить, действительно ли питье молока и холода не зависит от значения хи-квадрат? Другими словами, как вы узнаете, является ли предположение о несоответствии надежным?

Ответ заключается в запросе таблицы критических значений распределения хи-квадрат.

Здесь используется понятие степеней свободы. Степени свободы равны V = (количество строк-1) * (количество столбцов-1). Для таблицы с четырьмя сетками степень свободы V = 1.

Для V = 1 критическая вероятность распределения хи-квадрат с вероятностью 95% употребления молока и простуды составляет 3,84. То есть, если хи-квадрат больше 3,84, считается, что существует 95% вероятность того, что питье молока и простуда не связаны.

Очевидно, 1,077 <3,84, что не достигает критического значения распределения хи-квадрат, поэтому предположение о том, что питье молока и холода независимо друг от друга не является независимым, не соответствует действительности.

Вышесказанное дает простое понимание теста хи-квадрат на небольшом примере. Ниже приводится стандартная практика теста хи-квадрат:

Пример 2. Стандартная практика теста хи-квадрат с четырьмя квадратами

Мы хотели бы знать, влияет ли пропуск на ужин на потерю веса:

Потеря веса Без потери веса общий Потеря веса
Ужин группа 123 467 590 20.85%
Пропустить ужин группы 45 106 151 29.80%
общий 168 573 741 22.67%

1. Установить проверку гипотезы:

H0: r1 = r2, ни один ужин не влияет на потерю веса, то есть скорость потери веса без ужина равна
H1: r1 ≠ r2, пропуск обеда оказывает существенное влияние на потерю веса, то есть коэффициент потери веса не одинаков между пропусками ужина. α = 0,05

2. Рассчитайте теоретическое значение

Потеря веса Без потери веса общий
Ужин группа 133.765 456.234 590
Пропустить ужин группы 34.2348 116.765 151
общий 168 573 741

3. Рассчитайте значение хи-квадрат

Рассчитать значение хи-квадрат составляет 5,498

4. Проверьте таблицу хи-квадрат, чтобы найти значение P

Знайте степень свободы этого вопроса прежде, чем искать стол. Согласно степени свободы теста хи-квадрат v = (количество строк -1) (количество столбцов -1), затем степень свободы задачи v = (2-1) (2-1) = 1, проверьте таблицу граничных значений хи-квадрат, Найдите 3,84 и хи-квадрат = 5,498 в этом вопросе, хи-квадрат> 3,84, P <0,05, разница статистически значима, согласно уровню α = 0,05, отклоните H0, можно считать, что существует существенная разница в скорости потери веса между двумя группами.

Посредством примера расчета базовая формула хи-квадрата понимается следующим образом: если разница между теоретическим числом и соответствующим фактическим числом меньше, значение хи-квадрата меньше, если два одинаковых, значение хи-квадрат должно быть равно нулю.

Python реализует распределение хи-квадрат

Ученый предсказывает, что шанс бросить кости одинаков во всех направлениях. Чтобы проверить правильность своей теории, ученый бросил монету 600 раз. Результат был 102 раза в одной точке, 102 раза в двух точках, 96 раз в трех точках, 105 раз в четырех точках, 95 раз в пяти точках и 100 раз в шести точках. Очевидно, что этот результат не совсем совпадает с теоретическим ожиданием, так что теория ученого неверна? Давайте проверим это с помощью Python.

экспорт
(0.73999999999999999, 0.98070147251964801)

Исходя из результатов, значение p составляет 0,98, и можно считать, что наблюдаемое значение и ожидаемое значение являются аналогичными или «подходящими». Теория ученых не ошибается: разница между наблюдаемым значением и теоретическим значением вызвана случайной ошибкой. (Как правило, значение р должно быть больше 0,95)

Equal var false что означает

Т статистика:t=\frac<|\overline<X>-\mu_0|><S_<\overline<X>>>=\frac<\bar<X>-\mu_0><s/\sqrt<n>>» /></p> <p>Степени свободы: v = n-1</p> <p>(1) Учитывая среднее значение по населению;</p> <p>(2) Среднее значение выборки и стандартная ошибка выборки могут быть получены;</p> <p>(3) Выборка происходит из нормальной или почти нормальной популяции.</p> <h3>Классификация т-теста</h3> <p>t-тест делится на t-критерий с одной популяцией и t-критерий с двойной популяцией</p> <h4>T-критерий одиночной популяции</h4> <p>Проверьте, отличается ли среднее значение по выборке от известного среднего по населению. <br />Применимые условия: <br />1. Обычно общее распределение <br />2. Размер выборки меньше 30 (когда размер выборки больше 30, используется статистика Z) <br />Статистика:</p> <p>x¯x¯ —— Пример среднего <br />μμ — общее среднее <br />стандартное отклонение образца SS <br />размер nn-выборки <br />Пример 1 является примером t-критерия с одним образцом.</p> <h4>T-критерий двойной популяции</h4> <p>Проверьте, является ли среднее значение популяции, представленной двумя образцами, существенно отличающимся, включая t-тест независимой выборки и t-тест парной выборки</p> <p>Независимый образец t-теста</p> <p>Проверьте, является ли разница между средними значениями совокупности, представленными двумя независимыми выборками, значительной. <br />Применимые условия: <br />1. Оба образца взяты из нормальной популяции <br />2. Два примера не зависят друг от друга <br />3. Соблюдайте однородность дисперсии (две популяции имеют одинаковую дисперсию) <br />Статистика:</p> <p>x¯x¯ —— Первый пример означает <br />y¯y¯ — среднее значение второго образца <br />мм — первый размер выборки <br />nn-второй размер выборки <br />S21S12 — первый пример дисперсии <br />S22S22 — вторая выборка дисперсии</p> <p>T-тест парного образца</p> <p>Проверьте, является ли разница между средними значениями совокупности, представленными двумя парными выборками, значимой. <br />Соответствующий образец в основном включает следующие две ситуации: <br />1. Сопоставление гомологий, то есть однородные объекты получают две разные обработки. Например: чтобы проверить, эффективен ли определенный метод памяти для улучшения памяти словарного запаса детей, 40 учеников выбираются случайным образом, а затем случайным образом делятся на две группы. Одна группа использует метод обучения, другая — не использует его, а через три месяца для получения данных проводится проверка словарного запаса учащихся этих двух групп. В. Эффективен ли этот метод обучения для улучшения словарной памяти? <br />2. Соедините себя <br />2.1. Группа однородных объектов допускает две различные обработки. Например, компания продвигает новый метод продвижения и подсчитывает объем бизнеса сотрудников до и после внедрения для получения данных. Эффективен ли этот метод стимулирования сбыта? <br />Применимые условия: <br />Разница между каждой парой данных должна соответствовать нормальному распределению <br />Статистика:</p> <p>Новый сэмпл, образованный разницей между соответствующими элементами двух парных сэмплов <br />xd¯xd¯ —— Новое среднее значение выборки <br />SdSd — новое стандартное отклонение образца <br />nn-новый размер выборки</p> <h4>Используйте scipy для непосредственного тестирования гипотез</h4> <p>Scipy предлагает два метода решения задачи t-критерия Стьюдента для двух образцов с одинаковой дисперсией: <br />1. scipy.stats.ttest_ind <br />2. scipy.stats.ttest_ind_from_stats <br />Первый метод требует ввода данных исходной выборки, а второй метод напрямую вводит описательную статистику (среднее значение, стандартное отклонение, количество выборок) выборки. Так что здесь мы используем второй метод напрямую.</p> <p>import numpy as np from scipy import stats mean1 = 30.97 mean2 = 21.79 std1 = 26.7 std2 = 12.1 nobs1 = 10 nobs2 = 10 modified_std1 = np.sqrt(np.float32(nobs1)/np.float32(nobs1-1)) * std1 modified_std2 = np.sqrt(np.float32(nobs2)/np.float32(nobs2-1)) * std2 (statistic, pvalue) = stats.ttest_ind_from_stats(mean1=mean1, std1=modified_std1, nobs1=10, mean2=mean2, std2=modified_std2, nobs2=10) print

Python и статистический вывод: часть 3

Для статистиков и исследователей данных проверка статистической гипотезы представляет собой формальную процедуру. Стандартный подход к проверке статистической гипотезы подразумевает определение области исследования, принятие решения в отношении того, какие переменные необходимы для измерения предмета изучения, и затем выдвижение двух конкурирующих гипотез. Во избежание рассмотрения только тех данных, которые подтверждают наши субъективные оценки, исследователи четко констатируют свою гипотезу заранее. Затем, основываясь на данных, они применяют выборочные статистики с целью подтвердить либо отклонить эту гипотезу.

Проверка статистической гипотезы подразумевает использование тестовой статистики, т.е. выборочной величины, как функции от результатов наблюдений. Тестовая статистика (test statistic) — это вычисленная из выборочных данных величина, которая используется для оценивания прочности данных, подтверждающих нулевую статистическую гипотезу и служит для выявления меры расхождения между эмпирическими и гипотетическими значениями. Конкретные методы проверки называются тестами, например, z-тест, t-тест (соответственно z-тест Фишера, t-тест Студента) и т.д. в зависимости от применяемых в них тестовых статистик.

Примечание. В отечественной статистической науке используется «туманный» термин «статистика критерия». Туманный потому здесь мы снова наблюдаем мягкую подмену: вместо теста возникает критерий. Если уж на то пошло, то критерий — это принцип или правило. Например, выполняя z-тест, t-тест и т.д., мы соответственно используем z-статистику, t-статистику и т.д. в правиле отклонения гипотезы. Это хорошо резюмируется следующей ниже таблицей:

Тестирование гипотезы

Тестовая статистика

Правило отклонения гипотезы

Если тестовая статистика ≥ z или ≤ -z, то отклонить нулевую гипотезу H0.

Если тестовая статистика ≥ t или ≤ -t, то отклонить нулевую гипотезу H0.

Анализ дисперсии (ANOVA)

Если тестовая статистика ≥ F, то отклонить нулевую гипотезу H0.

Если тестовая статистика ≥ χ, то отклонить нулевую гипотезу H0.

Для того, чтобы помочь сохранить поток посетителей веб-сайта, дизайнеры приступают к работе над вариантом веб-сайта с использованием всех новейших методов по поддержанию внимания аудитории. Мы хотели бы удостовериться, что наши усилия не напрасны, и поэтому стараемся увеличить время пребывания посетителей на обновленном веб-сайте.

Отсюда главный вопрос нашего исследования состоит в том, «приводит ли обновленный вид веб-сайта к увеличению времени пребывания на нем посетителей»? Мы принимаем решение проверить его относительно среднего значения времени пребывания. Теперь, мы должны изложить две наши гипотезы. По традиции считается, что изучаемые данные не содержат того, что исследователь ищет. Таким образом, консервативное мнение заключается в том, что данные не покажут ничего необычного. Все это называется нулевой гипотезой и обычно обозначается как H0.

При тестировании статистической гипотезы исходят из того, что нулевая гипотеза является истинной до тех пор, пока вес представленных данных, подтверждающих обратное, не сделает ее неправдоподобной. Этот подход к поиску доказательств «в обратную сторону» частично вытекает из простого психологического факта, что, когда люди пускаются на поиски чего-либо, они, как правило, это находят.

Затем исследователь формулирует альтернативную гипотезу, обозначаемую как H1. Она может попросту заключаться в том, что популяционное среднее отличается от базового уровня. Или же, что популяционное среднее больше или меньше базового уровня, либо больше или меньше на некоторую указанную величину. Мы хотели бы проверить, не увеличивает ли обновленный дизайн веб-сайта время пребывания, и поэтому нашей нулевой и альтернативной гипотезами будут следующие:

H0: Время пребывания для обновленного веб-сайта не отличается от времени пребывания для существующего веб-сайта

H1: Время пребывания для обновленного веб-сайта больше по сравнению с временем пребывания для существующего веб-сайта

Наше консервативное допущение состоит в том, что обновленный веб-сайт никак не влияет на время пребывания посетителей на веб-сайте. Нулевая гипотеза не обязательно должна быть «нулевой» (т.е. эффект отсутствует), но в данном случае, у нас нет никакого разумного оправдания, чтобы считать иначе. Если выборочные данные не поддержат нулевую гипотезу (т.е. если данные расходятся с ее допущением на слишком большую величину, чтобы носить случайный характер), то мы отклоним нулевую гипотезу и предложим альтернативную в качестве наилучшего альтернативного объяснения.

Указав нулевую и альтернативную гипотезы, мы должны установить уровень значимости, на котором мы ищем эффект.

Статистическая значимость

Проверка статистической значимости изначально разрабатывалась независимо от проверки статистических гипотез, однако сегодня оба подхода очень часто используются во взаимодействии друг с другом. Задача проверки статистической значимости состоит в том, чтобы установить порог, за пределами которого мы решаем, что наблюдаемые данные больше не поддерживают нулевую гипотезу.

Следовательно, существует два риска:

Мы можем принять расхождение как значимое, когда на самом деле оно возникло случайным образом

Мы можем приписать расхождение случайности, когда на самом деле оно показывает истинное расхождение с популяцией

Эти две возможности обозначаются соответственно, как ошибки 1-го и 2-го рода:

Ошибка 1-го рода (ложноположительный исход)

Ошибка 2-го рода (ложноотрицательный исход)

Чем больше мы уменьшаем риск совершения ошибок 1-го рода, тем больше мы увеличиваем риск совершения ошибок 2-го рода. Другими словами, с чем большей уверенностью мы хотим не заявлять о наличии расхождения, когда его нет, тем большее расхождение между выборками нам потребуется, чтобы заявить о статистической значимости. Эта ситуация увеличивает вероятность того, что мы проигнорируем подлинное расхождение, когда мы с ним столкнемся.

В статистической науке обычно используются два порога значимости. Это уровни в 5% и 1%. Расхождение в 5% обычно называют значимым, а расхождение в 1% — крайне значимым. В формулах этот порог часто обозначается греческой буквой α (альфа) и называется уровнем значимости. Поскольку, отсутствие эффекта по результатам эксперимента может рассматриваться как неуспех (эксперимента либо обновленного веб-сайта, как в нашем случае), то может возникнуть желание корректировать уровень значимости до тех пор, пока эффект не будет найден. По этой причине классический подход к проверке статистической значимости требует, чтобы мы устанавливали уровень значимости до того, как обратимся к нашим данным. Часто выбирается уровень в 5%, и поэтому мы на нем и остановимся.

Проверка обновленного дизайна веб-сайта

Веб-команда в AcmeContent была поглощена работой, конструируя обновленный веб-сайт, который будет стимулировать посетителей оставаться на нем в течение более длительного времени. Она употребила все новейшие методы и, в результате мы вполне уверены, что веб-сайт покажет заметное улучшение показателя времени пребывания.

Вместо того, чтобы запустить его для всех пользователей сразу, в AcmeContent хотели бы сначала проверить веб-сайт на небольшой выборке посетителей. Мы познакомили веб-команду с понятием искаженности выборки, и в результате там решили в течение одного дня перенаправлять случайные 5% трафика на обновленный веб-сайт. Результат с дневным трафиком был нам предоставлен одним текстовым файлом. Каждая строка показывает время пребывания посетителей. При этом, если посетитель пользовался исходным дизайном, ему присваивалось значение «0», и если он пользовался обновленным (и надеемся, улучшенным) дизайном, то ему присваивалось значение «1».

Выполнение z-теста

Ранее при тестировании с интервалами уверенности мы располагали лишь одним популяционным средним, с которым и выполнялось сравнение.

При тестировании нулевой гипотезы с помощью z-теста мы имеем возможность сравнивать две выборки. Посетители, которые видели обновленный веб-сайт, отбирались случайно, и данные для обеих групп были собраны в тот же день, чтобы исключить другие факторы с временной зависимостью.

Поскольку в нашем распоряжении имеется две выборки, то и стандартных ошибок у нас тоже две. Z-тест выполняется относительно объединенной стандартной ошибки, т.е. квадратного корня суммы дисперсий (вариансов), деленных на размеры выборок. Она будет такой же, что и результат, который мы получим, если взять стандартную ошибку обеих выборок вместе:

Здесь σ 2 a — это дисперсия выборки a, σ 2 b — дисперсия выборки b и соответственно na и nb — размеры выборок a и b. На Python объединенная стандартная ошибка вычисляется следующим образом:

С целью выявления того, является ли видимое нами расхождение неожиданно большим, можно взять наблюдавшиеся расхождения между средними значениями на объединенной стандартной ошибке. Эту статистическую величину принято обозначать переменной z:

Используя функции pooled_standard_error , которая вычисляет объединенную стандартную ошибку, z-статистику можно получить следующим образом:

Соотношение z объясняет, насколько средние значения отличаются относительно величины, которую мы ожидаем при заданной стандартной ошибке. Следовательно, z-статистика сообщает нам о том, на какое количество стандартных ошибок расходятся средние значения. Поскольку стандартная ошибка имеет нормальное распределение вероятностей, мы можем связать это расхождение с вероятностью, отыскав z-статистику в нормальной ИФР:

В следующем ниже примере z-тест используется для сравнения результативность двух веб-сайтов. Это делается путем группировки строк по номеру веб-сайта, в результате чего возвращается коллекция, в которой конкретному веб-сайту соответствует набор строк. Мы вызываем groupby(‘site’)[‘dwell-time’] для конвертирования набора строк в набор значений времени пребывания. Затем вызываем функцию get_group с номером группы, соответствующей номеру веб-сайта:

Установление уровня значимости в размере 5% во многом аналогично установлению интервала уверенности шириной 95%. В сущности, мы надеемся убедиться, что наблюдавшееся расхождение попадает за пределы 95%-го интервала уверенности. Если это так, то мы можем утверждать, что нашли результат с 5%-ым уровнем значимости.

P -значение — это вероятность совершения ошибки 1-го рода в результате неправильного отклонения нулевой гипотезы, которая в действительности является истинной. Чем меньше p -значение, тем больше определенность в том, что нулевая гипотеза является ложной, и что мы нашли подлинный эффект.

Этот пример возвращает значение 0.0498, или 4.98%. Поскольку оно немногим меньше нашего 5% порога значимости, мы можем утверждать, что нашли нечто значимое.

Приведем еще раз нулевую и альтернативную гипотезы:

H0: Время пребывания на обновленном веб-сайте не отличается от времени пребывания на существующем веб-сайте

H1: Время пребывания на обновленном веб-сайте превышает время пребывания на существующем веб-сайте.

Наша альтернативная гипотеза состоит в том, что время пребывания на обновленном веб-сайте больше.

Мы готовы заявить о статистической значимости, и что время пребывания на обновленном веб-сайте больше по сравнению с существующим веб-сайтом, но тут есть одна трудность — чем меньше размер выборки, тем больше неопределенность в том, что выборочное стандартное отклонение совпадет с популяционным. Как показано в результатах предыдущего примера, наша выборка из обновленного веб-сайта содержит всего 16 посетителей. Столь малые выборки делают невалидным допущение о том, что стандартная ошибка нормально распределена.

К счастью, существует тест и связанное с ним распределение, которое моделирует увеличенную неопределенность стандартных ошибок для выборок меньших размеров.

t-распределение Студента

Популяризатором t-распределения был химик, работавший на пивоварню Гиннес в Ирландии, Уилльям Госсетт, который включил его в свой анализ темного пива Стаут.

В 1908 Уильям Госсет опубликовал статью об этой проверке в журнале Биометрика, но при этом по распоряжению своего работодателя, который рассматривал использованную Госсеттом статистику как коммерческую тайну, был вынужден использовать псевдоним. Госсет выбрал псевдоним « Студент ».

В то время как нормальное распределение полностью описывается двумя параметрами — средним значением и стандартным отклонением, t-распределение описывается лишь одним параметром, так называемыми степенями свободы. Чем больше степеней свободы, тем больше t-распределение похоже на нормальное распределение с нулевым средним и стандартным отклонением, равным 1. По мере уменьшения степеней свободы, это распределение становится более широким с более толстыми чем у нормального распределения, хвостами.

Нормальное распределение, t-распределение со степенью свободы df = 20 и степенью свободы df = 5

Нормальное распределение, t-распределение со степенью свободы df = 20 и степенью свободы df = 5

Приведенный выше рисунок показывает, как t-распределение изменяется относительно нормального распределения при наличии разных степеней свободы. Более толстые хвосты для выборок меньших размеров соответствуют увеличенной возможности наблюдать более крупные отклонения от среднего значения.

Степени свободы

Степени свободы, часто обозначаемые сокращенно df от англ. degrees of freedom, тесно связаны с размером выборки. Это полезная статистика и интуитивно понятное свойство числового ряда, которое можно легко продемонстрировать на примере.

Если бы вам сказали, что среднее, состоящее из двух значений, равно 10 и что одно из значений равно 8, то Вам бы не потребовалась никакая дополнительная информация для того, чтобы суметь заключить, что другое значение равно 12. Другими словами, для размера выборки, равного двум, и заданного среднего значения одно из значений ограничивается, если другое известно.

Если напротив вам говорят, что среднее, состоящее из трех значений, равно 10, и первое значение тоже равно 10, то Вы были бы не в состоянии вывести оставшиеся два значения. Поскольку число множеств из трех чисел, начинающихся с 10, и чье среднее равно 10, является бесконечным, то прежде чем вы сможете вывести значение третьего, второе тоже должно быть указано.

Для любого множества из трех чисел ограничение простое: вы можете свободно выбрать первые два числа, но заключительное число ограничено. Степени свободы могут таким образом быть обобщены следующим образом: количество степеней свободы любой отдельной выборки на единицу меньше размера выборки.

При сопоставлении двух выборок степени свободы на две единицы меньше суммы размеров этих выборок, что равно сумме их индивидуальных степеней свободы.

t-статистика

При использовании t-распределения мы обращаемся к t-статистике. Как и z-статистика, эта величина количественно выражает степень маловероятности отдельно взятого наблюдавшегося отклонения. Для двухвыборочного t-теста соответствующая t-статистика вычисляется следующим образом:

Здесь Sa̅b̅ — это объединенная стандартная ошибка. Объединенная стандартная ошибка вычисляется таким же образом, как и раньше:

Однако это уравнение допускает наличие информации о популяционных параметрах σa и σb, которые можно аппроксимировать только на основе крупных выборок. t-тест предназначен для малых выборок и не требует от нас принимать допущения о поплуляционной дисперсии (вариансе).

Как следствие, объединенная стандартная ошибка для t-теста записывается как квадратный корень суммы стандартных ошибок:

На практике оба приведенных выше уравнения для объединенной стандартной ошибки дают идентичные результаты при заданных одинаковых входных последовательностях. Разница в математической записи всего лишь служит для иллюстрации того, что в условиях t-теста мы на входе зависим только от выборочных статистик. Объединенная стандартная ошибка может быть вычислена следующим образом:

Хотя в математическом плане t-статистика и z-статистика представлены по-разному, на практике процедура вычисления обоих идентичная:

Различие между двумя выборочными показателями является не алгоритмическим, а концептуальным — z-статистика применима только тогда, когда выборки подчинены нормальному распределению.

t-тест

Разница в характере работы t-теста вытекает из распределения вероятностей, из которого вычисляется наше p-значение. Вычислив t-статистику, мы должны отыскать ее значение в t-распределении, параметризованном степенями свободы наших данных:

Значение степени свободы обеих выборок на две единицы меньше их размеров, и для наших выборок составляет 298.

t-распределение, степень свободы = 298

t-распределение, степень свободы = 298

Напомним, что мы выполняем проверку статистической гипотезы. Поэтому выдвинем нашу нулевую и альтернативную гипотезы:

H0: Эта выборка взята из популяции с предоставленным средним значением

H1: Эта выборка взята из популяции со средним значением большего размера

Выполним следующий ниже пример:

Этот пример вернет p-значение, составляющее более 0.05. Поскольку оно больше α, равного 5%, который мы установили для проверки нулевой гипотезы, то мы не можем ее отклонить. Наша проверка с использованием t-теста значимого расхождения между средними значениями не обнаружила. Следовательно, наш едва значимый результат z-теста отчасти объясняется наличием слишком малой выборки.

Двухсторонние тесты

В нашей альтернативной гипотезе было принято неявное допущение, что обновленный веб-сайт будет работать лучше существующего. В процедуре проверки нулевой статистической гипотезы предпринимаются особые усилия для обеспечения того, чтобы при поиске статистической значимости мы не делали никаких скрытых допущений.

Проверки, при выполнении которых мы ищем только значимое количественное увеличение или уменьшение, называются односторонними и обычно не приветствуются, кроме случая, когда изменение в противоположном направлении было бы невозможным. Название термина «односторонний» обусловлено тем, что односторонняя проверка размещает всю α в одном хвосте распределения. Не делая проверок в другом направлении, проверка имеет больше мощности отклонить нулевую гипотезу в отдельно взятом направлении и, в сущности, понижает порог, по которому мы судим о результате как значимом.

Статистическая мощность — это вероятность правильного принятия альтернативной гипотезы. Она может рассматриваться как способность проверки обнаруживать эффект там, где имеется искомый эффект.

Хотя более высокая статистическая мощность выглядит желательной, она получается за счет наличия большей вероятности совершить ошибку 1-го рода. Правильнее было бы допустить возможность того, что обновленный веб-сайт может в действительности оказаться хуже существующего. Этот подход распределяет нашу α одинаково по обоим хвостам распределения и обеспечивает значимый результат, не искаженный под воздействием априорного допущения об улучшении работы обновленного веб-сайта.

Надписи: t-распределение, степень свободы = 298

Надписи: t-распределение, степень свободы = 298

В действительности в модуле stats библиотеки scipy уже предусмотрены функции для выполнения двухвыборочных t-проверок. Это функция stats.ttest_ind . В качестве первого аргумента мы предоставляем выборку данных и в качестве второго — выборку для сопоставления. Если именованный аргумент equal_var равен True , то выполняется стандартная независимая проверка двух выборок, которая предполагает равные популяционные дисперсии, в противном случае выполняется проверка Уэлша (обратите внимание на служебную функцию t_test_verbose , (которую можно найти среди примеров исходного кода в репо):

По результатам t-теста служебная функция t_test_verbose возвращает много информации и в том числе p-значение. P-значение примерно в 2 раза больше того, которое мы вычислили для односторонней проверки. На деле, единственная причина, почему оно не совсем в два раза больше, состоит в том, что в модуле stats имплементирован легкий вариант t-теста, именуемый t-тестом Уэлша, который немного более робастен, когда две выборки имеют разные стандартные отклонения. Поскольку мы знаем, что для экспоненциальных распределений среднее значение и дисперсия тесно связаны, то этот тест немного более строг в применении и даже возвращает более низкую значимость.

Одновыборочный t-тест

Независимые выборки в рамках t-тестов являются наиболее распространенным видом статистического анализа, который обеспечивает очень гибкий и обобщенный способ установления, что две выборки представляют одинаковую либо разную популяцию. Однако в случаях, когда популяционное среднее уже известно, существует еще более простая проверка, представленная функцией библиотеки sciзy stats.ttest_1samp .

Мы передаем выборку и популяционное среднее относительно которого выполняется проверка. Так, если мы просто хотим узнать, не отличается ли обновленный веб-сайт значимо от существующего популяционного среднего времени пребывания, равного 90 сек., то подобную проверку можно выполнить следующим образом:

Служебная функция t_test_verbose не только возвращает p-значение для выполненной проверки, но и интервал уверенности для популяционного среднего. Интервал имеет широкий диапазон между 78.5 и 165.5 сек., и, разумеется, перекрывается 90 сек. нашего теста. Как раз он и объясняет, почему мы не смогли отклонить нулевую гипотезу.

Многократные выборки

В целях развития интуитивного понимания относительно того, каким образом t-тест способен подтвердить и вычислить эти статистики из столь малых данных, мы можем применить подход, который связан с многократными выборками, от англ. resampling. Извлечение многократных выборок основывается на допущении о том, что каждая выборка является лишь одной из бесконечного числа возможных выборок из популяции. Мы можем лучше понять природу того, какими могли бы быть эти другие выборки, и, следовательно, добиться лучшего понимания опорной популяции, путем извлечения большого числа новых выборок из нашей существующей выборки.

На самом деле существует несколько методов взятия многократных выборок, и мы обсудим один из самых простых — бутстрапирование. При бустрапировании мы генерируем новую выборку, неоднократно извлекая из исходной выборки случайное значение с возвратом до тех пор, пока не сгенерируем выборку, имеющую тот же размер, что и оригинал. Поскольку выбранные значения возвращаются назад после каждого случайного отбора, то в новой выборке то же самое исходное значение может появляться многократно. Это как если бы мы неоднократно вынимали случайную карту из колоды игральных карт и каждый раз возвращали вынутую карту назад в колоду. В результате время от времени мы будем иметь карту, которую мы уже вынимали.

Бутстраповская выборка, или бутстрап, — синтетический набор данных, полученный в результате генерирования повторных выборок (с возвратом) из исследуемой выборки, используемой в качестве «суррогатной популяции», в целях аппроксимации выборочного распределения статистики (такой как, среднее, медиана и др.).

В библиотеке pandas при помощи функции sample можно легко извлекать бутстраповские выборки и генерировать большое число многократных выборок. Эта функция принимает ряд опциональных аргументов, в т.ч. n (число элементов, которые нужно вернуть из числового ряда), axis (ось, из которой извлекать выборку) и replace (выборка с возвратом или без), по умолчанию равный False . После этой функции можно задать метод агрегирования, вычисляющий сводную статистику в отношении бутстраповских выборок:

Приведенный выше пример наглядно показывает результаты на гистограмме:

Гистограмма демонстрирует то, как средние значения изменялись вместе с многократными выборками, взятыми из времени пребывания на обновленном веб-сайте. Хотя на входе имелась лишь одна выборка, состоящая из 16 посетителей, бутстрапированные выборки очень четко просимулировали стандартную ошибку изначальной выборки и позволили визуализировать интервал уверенности (между 78 и 165 сек.), вычисленный ранее в результате одновыборочного t-теста.

Благодаря бутстрапированию мы просимулировали взятие многократных выборок, при том, что у нас на входе имелась всего одна выборка. Этот метод обычно применяется для оценивания параметров, которые мы не способны или не знаем, как вычислить аналитически.

Проверка многочисленных вариантов дизайна

Было разочарованием обнаружить отсутствие статистической значимости на фоне увеличенного времени пребывания пользователей на обновленном веб-сайте. Хотя хорошо, что мы обнаружили это на малой выборке пользователей, прежде чем выкладывать его на всеобщее обозрение.

Не позволяя себя обескуражить, веб-команда AcmeContent берется за сверхурочную работу и создает комплект альтернативных вариантов дизайна веб-сайта. Беря лучшие элементы из других проектов, они разрабатывают 19 вариантов для проверки. Вместе с нашим изначальным веб-сайтом, который будет действовать в качестве контрольного, всего имеется 20 разных вариантов дизайна веб-сайта, куда посетители будут перенаправляться.

Вычисление выборочных средних

Веб-команда разворачивает 19 вариантов дизайна обновленного веб-сайта наряду с изначальным. Как отмечалось ранее, каждый вариант дизайна получает случайные 5% посетителей, и при этом наше испытание проводится в течение 24 часов.

На следующий день мы получаем файл, показывающий значения времени пребывания посетителей на каждом варианте веб-сайта. Все они были промаркированы числами, при этом число 0 соответствовало веб-сайту с исходным дизайном, а числа от 1 до 19 представляли другие варианты дизайна:

Читать:
Где у макбука кнопка питания

Related Posts