Статистика в Python 5. U-тест Манна-Уитни // Александр Вихорев, НГУ

38 подписчиков

12+
12+

3 просмотра

17 дней назад

ПожаловатьсяНарушение авторских прав

38 подписчиков

12+
12+

3 просмотра

17 дней назад

ПожаловатьсяНарушение авторских прав
12+
12+

3 просмотра

17 дней назад

В этом видео мы обратимся к непараметрической альтернативе t-теста Стьюдента — тесту Манна-Уитни. Этот тест также служит для сравнения двух независимых выборок, но проверяет не различие средних значений, а различие в положении и форме распределений в целом. Он становится незаменимым инструментом, когда базовые предположения параметрических тестов не выполняются. Суть видео в том, чтобы понять логику и область применения теста Манна-Уитни, а затем научиться применять его на практике в Python. Мы разберем, в каких ситуациях необходимо отказаться от t-теста в пользу этого метода, как интерпретировать его результаты и в чем заключается его принципиальное отличие от параметрических аналогов. В этом видео мы детально разберем ключевые принципы и область применения теста. Тест Манна-Уитни, также известный как U-тест, используется для проверки нулевой гипотезы о том, что две независимые выборки взяты из одной и той же генеральной совокупности или из совокупностей с одинаковым распределением. Альтернативная гипотеза утверждает, что распределения различаются, и одна выборка в среднем «сдвинута» относительно другой. Ключевое преимущество теста — его устойчивость (робастность). Он не предъявляет строгих требований к данным. Его следует применять в трех основных ситуациях: когда данные не подчиняются нормальному распределению, что можно проверить тестом Шапиро-Уилка; когда сравниваемые выборки имеют сильно различающиеся дисперсии (гетероскедастичность); и когда ваши данные измерены в порядковой шкале (например, баллы, ранги, рейтинги), а не в интервальной. Принцип работы теста основан не на исходных значениях, а на их рангах. Весь алгоритм можно разбить на три шага. На первом шаге все наблюдения из обеих выборок объединяются в один общий ряд и упорядочиваются по возрастанию. Каждому значению присваивается ранг — порядковый номер в этом объединенном ряду. Если встречаются одинаковые значения (совпадения), им присваивается средний ранг. На втором шаге вычисляется ключевая статистика — U-статистика. Для каждой выборки отдельно рассчитывается сумма рангов. Затем по специальной формуле находится значение U для одной из групп. По сути, U показывает, насколько рано элементы одной выборки появляются в общем ранжированном ряду по сравнению с элементами другой. Чем больше значение U, тем больше перекрытие между выборками. На третьем шаге, на основе рассчитанной U-статистики и объемов выборок, определяется p-value. Если p-value меньше выбранного уровня значимости (0.05), мы отвергаем нулевую гипотезу и делаем вывод о статистически значимом различии распределений двух выборок. Для больших выборок используется нормальная аппроксимация для расчета p-value. В практической части видео мы перейдем к коду на Python. Мы смоделируем две выборки из ненормальных распределений или с разной дисперсией, для которых t-тест был бы не совсем корректен. Вы научитесь применять тест Манна-Уитни с помощью функции mannwhitneyu из модуля scipy.stats.

Название:

Статистика в Python 5. U-тест Манна-Уитни // Александр Вихорев, НГУ

Категория:

Разное