Содержание:
2. ОТЧЕТ О ПРОХОЖДЕНИИ ПРАКТИКИ
Приложение 1
Описательная (дескриптивная) статистика
Задание 1
Среднее значение (Mean) – «центральное» значение в наборе данных. Оно показывает, каким было бы значение каждого элемента, если бы вся сумма была распределена поровну между всеми элементами.
Расчет: сумма всех значений в наборе данных, деленная на количество этих значений.
x? (икс с чертой) – среднее значение
? (сигма) – знак суммирования
xi – каждое отдельное значение в наборе данных
n – общее количество значений
Среднее значение является одним из самых распространенных способов описать центр вашего набора данных. Позволяет сравнивать средние значения разных групп. Например, средний балл студентов в двух разных группах. Среднее значение очень чувствительно к экстремальным значениям (выбросам). Одно очень большое или очень маленькое значение может сильно исказить среднее.
Мода – значение, которое встречается в наборе данных чаще всего. Набор данных может иметь одну моду (унимодальный), две моды (бимодальный) или более двух мод (мультимодальный). Если все значения встречаются одинаково часто, то моды нет.
Расчет: значение, которое повторяется наибольшее количество раз в наборе данных.
Мода отлично подходит для описания категориальных данных (например, самый популярный цвет, самая частая профессия) или дискретных числовых данных. В отличие от среднего, мода не подвержена влиянию экстремальных значений. Может быть несколько мод, что иногда затрудняет интерпретацию.
Медиана (Median) – значение, которое находится ровно посередине упорядоченного набора данных. Половина значений меньше медианы, а половина – больше.
Расчет: упорядочить все значения в наборе данных от наименьшего к наибольшему. Если количество значений (n) нечетное, медиана – это среднее значение. Если количество значений (n) четное, медиана – это среднее арифметическое двух центральных значений.
Пример (нечетное n): 1, 3, 5, 7, 9. Медиана = 5.
Пример (четное n): 1, 3, 5, 7, 9, 11. Медиана = (5 + 7) / 2 = 6.
Медиана является более устойчивым показателем центральной тенденции, чем среднее, поскольку она не так сильно подвержена влиянию выбросов. Это делает ее предпочтительной для описания данных с сильными перекосами (например, распределение доходов, где несколько очень высоких доходов могут сильно поднять среднее значение). Медиана делит набор данных на две равные части, что полезно для понимания распределения данных.
Дисперсия (Variance) измеряет, насколько разбросаны значения в наборе данных относительно их среднего значения. Большая дисперсия означает, что значения сильно отличаются друг от друга, а малая дисперсия указывает на то, что значения сосредоточены близко к среднему.
Расчет: Найти среднее значение (x?) набора данных. Для каждого значения (xi) вычислить разницу между ним и средним (xi - x?). Возвести каждую из этих разностей в квадрат: (xi - x?)?. Сложить все полученные квадраты разностей. Разделить полученную сумму на количество значений (n) для генеральной совокупности, или на (n-1) для выборки (это называется выборочной дисперсией и является несмещенной оценкой дисперсии генеральной совокупности).
s? = ?(x_i – x?)? / (n – 1)
s? – выборочная дисперсия
xi – каждое отдельное значение
x? – среднее значение выборки
n – количество значений в выборке
Дисперсия дает количественную оценку изменчивости данных. Высокая дисперсия говорит о большой неоднородности, низкая – о высокой однородности. Дисперсия является ключевым компонентом для расчета среднеквадратического отклонения и многих других статистических тестов. Позволяет сравнивать, насколько вариативны два разных набора данных. Например, можно сравнить дисперсию роста в двух разных популяциях.
…………………………………………….
Приложение 2
Проверка достоверности отличий
Задание 1
Алгоритм проверки достоверности различий между двумя независимыми выборками с использованием параметрических критериев
1. Постановка задачи:
Предположим, имеются две независимые выборки, полученные путем случайного отбора объектов из соответствующих совокупностей. Мы хотим сравнить средние значения выборок и определить, являются ли различия между ними статистически значимыми.
2. Предпосылки для применения t-критерия Стьюдента:
– Распределение признаков в обеих совокупностях подчинено закону нормального распределения.
– Дисперсии признака в обоих совокупностях одинаковы или близки друг другу.
– Наблюдения получены независимо друг от друга.
3. Формулирование гипотез:
Нулевая гипотеза (H0): Среднее значение первой совокупности равно среднему второй совокупности, то есть нет существенного различия между выборочными средними.
Альтернативная гипотеза (Ha): Среднее значение первой совокупности отличается от среднего второй совокупности.
4. Подсчет средних значений и стандартных отклонений:
Обозначим:
X1 и X2 — выборочные наборы данных (первая и вторая выборки),
X?1 и X?2 — выборочные средние значения соответственно,
s12s и s22s — дисперсия каждой выборки,
n1 и n2 — размеры выборок.
Вычислим:
Средние значения выборок:
Стандартные отклонения выборок:
5. Вычисление объединенной дисперсии (предполагая равенство дисперсий):
Рассчитаем общую оценку дисперсии, объединяя обе выборки:
6. Подсчет статистики t:
Рассчитывается значение t, используемое для проверки гипотезы:
7. Определение степени свободы:
Степень свободы равна сумме степеней свободы обеих выборок минус 2:
8. Установление уровня значимости:
Обычно выбирается уровень значимости ?=0.05. Это означает, что мы допускаем ошибку первого рода (ошибочно отвергаем истинную гипотезу) с вероятностью 5%.
Вероятность ошибки первого рода также называют уровнем доверительной вероятности.
9. Определение критического значения:
При заданном уровне значимости и числе степеней свободы находим критическое значение t из таблицы распределения Стьюдента.
Например, при ?=0.05 и двустороннем тестировании (мы проверяем именно неравенство средней величины) критическое значение обозначается как tcrit.
10. Принятие решения:
Если ?t?>?tcrit?, отвергнуть нулевую гипотезу. Различия между выборками признаны статистически значимыми.
Если ?t???tcrit?, принять нулевую гипотезу. Отличия между выборками незначительны.
Если абсолютное значение расчётного t превосходит критическое значение tcri, делаем вывод о достоверности отличия средних значений выборок. Иначе считаем различия недостоверными и принимаем нулевую гипотезу.
…………………………………………….