Что называется модой дсв и как ее найти
Содержание:
Числовые характеристики случайных величин:
Как мы уже выяснили, закон распределения полностью характеризует случайную величину, так как позволяет вычислить вероятности любых событий, связанных с этой случайной величиной. Однако, во-первых, закон распределения не всегда известен, а, во-вторых, для решения многих практических задач совсем необязательно знать закон распределения. Достаточно знать отдельные числовые характеристики, которые в сжатой, компактной форме выражают наиболее существенные черты распределения.
Например, можно составить законы распределения двух случайных величин – числа очков, выбиваемых двумя стрелками, – и выяснить, какой из двух стрелков стреляет лучше. Однако, даже не зная законов распределения, можно сказать, что лучше стреляет тот, кто в с р е д н е м выбивает большее количество очков. Таким средним значением случайной величины является математическое ожидание.
Математическое ожидание случайной величины
Определение: Математическим ожиданием, или средним значением, M(X) д и с к р е т н о й случайной величины X называется сумма произведений всех ее значений на соответствующие им вероятности:
Заменим в формуле для дискретной случайной величины знак суммирования по всем ее значениям знаком интеграла с бесконечными пределами, дискретный аргумент xi – непрерывно меняющимся
Рассмотрим свойства математического ожидания.
Пример:
Найти математическое ожидание случайной величины Z = 8X – – 5Y + 7, если известно, что M(X) = 3, M(Y) = 2.
Решение:
Используя свойства 1, 2, 3 математического ожидания, находим
Итак, мы установили, что математическое ожидание является важной числовой характеристикой случайной величины. Однако одно лишь математическое ожидание не может в достаточной степени характеризовать случайную величину. Вернемся к задаче о стрелках. При равенстве средних значений числа выбиваемых очков, вопрос о том, какой из стрелков стреляет лучше, остается открытым. Однако в этом случае можно сделать предположение, что лучше стреляет тот стрелок, у которого отклонения числа выбитых очков от среднего значения меньше.
Мерой рассеяния значений случайной величины вокруг ее математического ожидания служит дисперсия (слово дисперсия означает «рассеяние).
Дисперсия случайной величины
Определение: Дисперсией D(X) случайной величины Х называется математическое ожидание квадрата ее отклонения от математического ожидания:
Для дискретной случайной величины X эта формула принимает вид:
Для непрерывной случайной величины: На практике для вычисления дисперсии часто удобно пользоваться следующей теоремой.
Теорема. Дисперсия равна разности между математическим ожиданием квадрата случайной величины Х и квадратом ее математического ожидания: Для дискретной случайной величины X эта формула принимает вид: Для непрерывной случайной величины:
Рассмотрим свойства дисперсии.
Пример №1
Найти дисперсию случайной величины Z = 8X – 5Y + 7, если известно, что D(X) = 1, D(Y) = 2.
Решение:
Используя свойства дисперсии, находим
Среднее квадратическое отклонение случайной величины
Дисперсия D(X) имеет размерность квадрата случайной величины, что не всегда удобно. Поэтому в качестве показателя рассеяния используют также величину
Определение: Средним квадратическим отклонением (или стандартным отклонением) σ(Х) случайной величины Х называют значение квадратного корня из ее дисперсии:
Свойства среднего квадратического отклонения вытекают из свойств дисперсии.
Мода и медиана. Квантили
Кроме математического ожидания, дисперсии и среднего квадратического отклонения, в теории вероятностей применяется еще ряд числовых характеристик, отражающих те или иные особенности распределения.
Определение: Модой Мо(Х) случайной величины Х называется ее наиболее вероятное значение (для которого вероятность pi или плотность вероятности f(x) достигает максимума).
Если вероятность или плотность вероятности достигает максимума не в одной, а в нескольких точках, распределение называется полимодальным.
Определение: Медианой Ме(Х) непрерывной случайной величины Х называется такое ее значение, для которого т. е. вероятность того, что случайная величина Х примет значение, меньшее медианы или большее ее, одна и та же и равна 1/2. Геометрически вертикальная прямая х = Ме(Х), проходящая через точку с абсциссой, равной Ме(Х), делит площадь фигуры под кривой распределения на две равные части. Очевидно, что в точке х = Ме(Х) функция распределения равна 1/2.
Пример №2
Найти моду, медиану случайной величины Х с плотностью вероятности
Решение:
Кривая распределения представлена на рис. 5.1 Очевидно, что плотность вероятности максимальна при х= Мо(Х) = 1. Медиану Ме(Х) = найдем из условия или откуда
Наряду с модой и медианой для описания случайной величины используется понятие квантиля.
Определение: Квантилем уровня q (или q-квантилем) называется такое значение хq случайной величины, при котором функция ее распределения принимает значение, равное q, т. е.
Пример №3
По данным примера 5.3 найти квантиль
Решение:
Находим функцию распределения
Моменты случайных величин. Асимметрия и эксцесс
Среди числовых характеристик случайной величины особое место занимают моменты – начальные и центральные.
Определение: Начальным моментом k-го порядка случайной величины Х называется математическое ожидание k-ой степени этой величины: Для дискретной случайной величины формула начального момента имеет вид: Для непрерывной случайной величины:
Определение: Центральным моментом k-го порядка случайной величины Х называется математическое ожидание k-ой степени отклонения случайной величины Х от ее математического ожидания:
Для дискретной случайной величины формула центрального момента имеет вид:
Для непрерывной случайной величины: Нетрудно заметить, что при k = 1 первый начальный момент случайной величины Х есть ее математическое ожиданиепри k = 2 второй центральный момент – дисперсия
Т.е. первый начальный момент характеризует среднее значение распределения случайной величины Х; второй центральный момент – степень рассеяния распределения Х относительно математического ожидания. Для более подробного описания распределения служат моменты высших порядков.
Третий центральный момент μ3 служит для характеристики ассиметрии (т.е. скошенности ) распределения. Он имеет размерность куба случайной величины. Чтобы получить безразмерную величину, ее делят на , где σ – среднее квадратическое отклонение случайной величины Х.
Полученная величина А называется коэффициентом асимметрии случайной величины: Если распределение симметрично относительно математического ожидания, то коэффициент асимметрии равен нулю А = 0.
На рис. 5.2 показаны две кривые распределения 1 и 2. Кривая 1 имеет положительную (правостороннюю) асимметрию (А > 0), а кривая 2 – отрицательную (левостороннюю) асимметрию (А
При копировании любых материалов с сайта evkova.org обязательна активная ссылка на сайт www.evkova.org
Сайт создан коллективом преподавателей на некоммерческой основе для дополнительного образования молодежи
Сайт пишется, поддерживается и управляется коллективом преподавателей
Whatsapp и логотип whatsapp являются товарными знаками корпорации WhatsApp LLC.
Cайт носит информационный характер и ни при каких условиях не является публичной офертой, которая определяется положениями статьи 437 Гражданского кодекса РФ. Анна Евкова не оказывает никаких услуг.
4. Мода. Медиана. Генеральная и выборочная средняя
Мода на экране, медиана в треугольнике, а средние – это температура по больнице и в палате. Продолжаем наш практический курс занимательной статистики (Занятие 1) изучением центральных характеристик статистической совокупности, названия которых вы видите в заголовке. И начнём мы с его конца, поскольку о средних величинах речь зашла практически с первых же абзацев темы. Для подготовленных читателей оглавление:
ну а «чайникам» лучше ознакомиться с материалом по порядку:
Итак, пусть исследуется некоторая генеральная совокупность объёма , а именно её числовая характеристика , не важно, дискретная или непрерывная (Занятия 2, 3).
Генеральной средней называется среднее арифметическое всех значений этой совокупности:
Если среди чисел есть одинаковые (что характерно для дискретного ряда), то формулу можно записать в более компактном виде:
, где
варианта повторяется раз;
варианта – раз;
варианта – раз;
…
варианта – раз.
Живой пример вычисления генеральной средней встретился в Примере 2, но чтобы не занудничать, я даже не буду напоминать его содержание.
Далее. Как мы помним, обработка всей генеральной совокупности часто затруднена либо невозможна, и поэтому из неё организуют представительную выборку объема , и на основании исследования этой выборки делают вывод обо всей совокупности.
Выборочной средней называется среднее арифметическое всех значений выборки:
и при наличии одинаковых вариант формула запишется компактнее:
– как сумма произведений вариант на соответствующие частоты , делённая на объём совокупности.
Выборочная средняя позволяет достаточно точно оценить истинное значение , чего вполне достаточно для многих исследований. При этом, чем больше выборка, тем точнее будет эта оценка.
Практику начнём, а точнее продолжим, с дискретного вариационного ряда и знакомого условия:
По результатам выборочного исследования рабочих цеха были установлены их квалификационные разряды: 4, 5, 6, 4, 4, 2, 3, 5, 4, 4, 5, 2, 3, 3, 4, 5, 5, 2, 3, 6, 5, 4, 6, 4, 3.
Это числа из Примера 4 (см. по ссылке выше), но теперь нам требуется: вычислить выборочную среднюю, и, не отходя от станка, найти моду и медиану.
Как решать задачу? Если нам даны первичные данные (исходные необработанные значения), то их можно тупо просуммировать и разделить результат на объём выборки:
– среднестатистический квалификационный разряд рабочих цеха.
Но во многих задачах требуется составить вариационный ряд (см. Пример 4):
– или же этот ряд предложен изначально (что бывает чаще). И тогда, мы, конечно, используем «цивилизованную» формулу:
Далее. Мода и медиана. Эти понятия тоже вводятся как для генеральной, так и для выборочной совокупности, и определения я сформулирую в общем виде.
Мода. Мода дискретного вариационного ряда – это варианта с максимальной частотой. В данном случае . Моду легко отыскать по таблице, и ещё легче на полигоне частот – это абсцисса самой высокой точки:
Иногда таковых значений несколько (с одинаковой максимальной частотой), и тогда модой считают каждое из них.
Если все или почти все варианты различны (что характерно для интервального ряда), то модальное значение определяется несколько другим способом, о котором во 2-й части урока.
Медиана. Медиана вариационного ряда* – это значение, которая делит его на две равные части (по количеству вариант).
* не важно, дискретного или интервального, генеральной совокупности или выборочной.
Медиану можно отыскать несколькими способами.
Если даны первичные данные, то сортируем их по возрастанию либо убыванию (см. Задание 1) и находим середину ранжированного ряда: . Почему именно 13-е число? Потому что перед ним находится 12 чисел и после него тоже 12 чисел, таким образом, значение разделило ряд на две равные части, а значит, является медианой. Этот номер можно найти аналитически:
– если совокупность содержит нечётное количество чисел (наш случай), то делим её объём пополам: и округляем полученное значение в бОльшую сторону: 13 – получая тем самым срединный номер.
– если совокупность содержит чётное количество чисел, например, 20, то делаем то же самое: , и медианное значение здесь рассчитывается как среднее арифметическое 10-го и следующего числа: .
Напоминаю, что изложенная инструкция работает для упорядоченного (по возрастанию либо убыванию) ряда. Но есть и более быстрый путь, где ничего не нужно сортировать. Это использование стандартной функции Экселя:
– забиваем в любую свободную ячейку =МЕДИАНА(, выделяем мышью все числа, закрываем скобку ) и жмём Enter. Попробуйте самостоятельно. Этот способ удобен, когда вам дано много значений.
Следует отметить, что в Экселе существуют и отдельные функции для вычисления средней (=СРЗНАЧ), моды (=МОДА) и ещё много чего, но я против использования этих функций в учебном курсе, за исключением случаев, где это действительно целесообразно. …Почему против? Потому что они не помогают понять суть показателей и, более того, отупляют. Так, среднюю гораздо вразумительнее рассчитывать следующим образом:
=СУММ(выделяем мышью диапазон) / объем совокупности. Вычисления рекомендую опробовать лично (ссылка выше).
Ситуация вторая. Когда составлен либо изначально дан готовый дискретный ряд. Тут можно поступить «по любительски» – начать отсчитывать примерно равное количество чисел по краям ряда:
после чего мысленно либо на черновике их отбрасывать, в данном случае отбросим по 8 штук сверху и снизу:
откуда становится ясно, что медианное значение:
Второй способ более академичен, находим относительные накопленные частоты:
и то значение «икса», у которого «переваливает» за отметку 0,5 (50% упорядоченной совокупности). Для 3-го разряда успело накопиться (32% совокупности), а вот для 4-го – уже (64%). Таким образом, отметка в 50% пройдена именно здесь, и, стало быть, .
Запишем красивый ответ:
Полученные значения близки друг к другу, и это говорит о симметрии вариационного ряда относительно центра, что хорошо видно по полигону частот (см. чертёж выше). И с высокой вероятностью можно утверждать, что примерно так же распределена и вся генеральная совокупность (все рабочие цеха).
И тут возникает следующий закономерный вопрос: а зачем вообще нужна мода с медианой? – ведь есть средняя.
А дело в том, что в ряде случаев среднее значение неудовлетворительно характеризует центральную тенденцию статистической совокупности:
Известны результаты продаж пиджаков в универмаге города:
где, – количество пуговиц на пиджаке, – число продаж, буква «эф» – это тоже достаточно популярная буква для обозначения частот, и она не должна вас смущать при встрече.
…ну, а если вам не нравятся пиджаки, то представьте какие-нибудь шляпки с цветочками 🙂
Также обратим внимание, что в условии задачи ничего не сказано о том, генеральная ли это совокупность или выборочная, и в подобной ситуации я не рекомендую ничего додумывать – среднюю просто обозначаем через , без подстрочного индекса.
Вычислить среднюю – в экселевском файле уже забиты исходные данные и приведена краткая инструкция. Если под пальцами нет Экселя, то считаем на калькуляторе. Не ленимся! – заданий я предлагаю немного (у вас своих хватает :)), но прорешать их очень важно! Краткое решение для сверки в конце урока.
…какие мысли на счёт полученного значения ? С такой статистикой магазин разорится.
И, конечно, важнейший показатель здесь мода: . Потому что такая мода 🙂 Более того, в прикладных исследованиях рассматривают несколько модальных значений (вроде даже в Экселе функция есть), в частности, ещё одной модой можно считать варианту . Но это уже попсовая статистика, которую я не буду развивать в этом курсе.
Ещё хуже (в содержательном плане) ситуация с медианой – продолжаем решать задачу в Экселе (ссылка выше) либо в тетради! Особо зоркие читатели медиану углядят и устно, и в конце урока я привёл способ, который просто бросился мне в глаза.
Теперь надеваем пиджаки / шляпы и возвращаемся на фабрику, где бухгалтер Петрова вычислила генеральную среднюю заработную плату рабочих: денежных единиц. Здесь мы плавно перешли к интервальному ряду, который целесообразно составлять для «денежных» показателей.
Что будет, если к совокупности добавить руководящий персонал и директора Петрова? Средняя зарплата немного увеличится: , и это уже будет несколько искажённая картина.
А вот если сюда добавить олигарха Петровского, то полученная средняя вообще вызовет широкое возмущение общественности.
Поэтому, если в статистической совокупности есть «аномальные» отклонения в ту или иную сторону, то в качестве оценки центрального значения как нельзя лучше подходит медиана, которая в нашем условном примере будет равна, скажем, . Ниже этой планки зарабатывает ровно половина совокупности и выше – другая половина, включая Петрова и Петровского. …Главное только, чтобы они наняли правильного статистика 🙂
Как вычислить моду, медиану и среднюю интервального ряда?
Начнём опять с ситуации, когда нам даны первичные статические данные:
По результатам выборочного исследования цен на ботинки в магазинах города получены следующие данные (ден. ед.):
– это в точности числа из Примера 6 статьи об интервальном вариационном ряде.
Но теперь нам нужно найти среднюю, моду и медиану.
Решение: чтобы найти среднюю по первичным данным, нужно просуммировать все варианты и разделить полученный результат на объём совокупности:
ден. ед.
Эти подсчёты, кстати, займут не так много времени и при использовании оффлайн калькулятора. Но если есть Эксель, то, конечно, забиваем в любую свободную ячейку =СУММ(, выделяем мышкой все числа, закрываем скобку ), ставим знак деления /, вводим число 30 и жмём Enter. Готово.
Что касается моды, то её оценка по исходным данным, становится непригодна. Хоть мы и видим среди чисел одинаковые, но среди них запросто может найтись пять так шесть-семь вариант с одинаковой максимальной частотой, например, частотой 2. Кроме того, цены могут быть округлёнными. Поэтому модальное значение рассчитывается по сформированному интервальному ряду (о чём чуть позже).
Чего не скажешь о медиане: забиваем в Эксель =МЕДИАНА(, выделяем мышью все числа, закрываем скобку ) и жмём Enter: . Причём, здесь даже ничего не нужно сортировать.
Но в Примере 6 была проведена сортировка по возрастанию (вспоминаем и сортируем – ссылка выше), и это хорошая возможность повторить формальный алгоритм отыскания медианы. Делим объём выборки пополам:
, и поскольку она состоит из чётного количества вариант, то медиана равна среднему арифметическому 15-й и 16-й варианты упорядоченного (!) вариационного ряда:
ден. ед.
Ситуация вторая. Когда дан готовый интервальный ряд (типичная учебная задача).
Продолжаем анализировать тот же пример с ботинками, где по исходным данным был составлен ИВР. Для вычисления средней потребуются середины интервалов:
– чтобы воспользоваться знакомой формулой дискретного случая:
– отличный результат! Расхождение с более точным значением (), вычисленным по первичным данным, составляет всего 0,04.
По сути дела, здесь мы приблизили интервальный ряд дискретным, и это приближение оказалось весьма эффективным. Впрочем, особой выгоды тут нет, т.к. при современном программном обеспечении не составляет труда вычислить точное значение даже по очень большому массиву первичных данных. Но это при условии, что они нам известны 🙂
С другими центральными показателями всё занятнее.
Чтобы найти моду, нужно найти модальный интервал (с максимальной частотой) – в данной задаче это интервал с частотой 11, и воспользоваться следующей страшненькой формулой:
, где:
– нижняя граница модального интервала;
– длина модального интервала;
– частота модального интервала;
– частота предыдущего интервала;
– частота следующего интервала.
Таким образом:
ден. ед. – как видите, «модная» цена на ботинки заметно отличается от средней арифметической .
Не вдаваясь в геометрию формулы, просто приведу гистограмму относительных частот и отмечу :
откуда хорошо видно, что мода смещена относительно центра модального интервала в сторону левого интервала с бОльшей частотой. Логично.
Справочно разберу редкие случаи:
– если модальный интервал крайний, то либо ;
– если обнаружатся 2 модальных интервала, которые находятся рядом, например, и , то рассматриваем модальный интервал , при этом близлежащие интервалы (слева и справа) по возможности тоже укрупняем в 2 раза.
– если между модальными интервалами есть расстояние, то применяем формулу к каждому интервалу, получая тем самым 2 или бОльшее количество мод.
Вот такой вот депеш мод 🙂
И медиана. Если дан готовый интервальный ряд, то медиана рассчитывается чуть по менее страшной формуле, но сначала нудно (описка по Фрейду:)) найти медианный интервал – это интервал, содержащий варианту (либо 2 варианты), которая делит вариационный ряд на две равные части.
Выше я рассказал, как определить медиану, ориентируясь на относительные накопленные частоты , здесь же сподручнее рассчитать «обычные» накопленные частоты . Вычислительный алгоритм точно такой же – первое значение сносим слева (красная стрелка), и каждое следующее получается как сумма предыдущего с текущей частотой из левого столбца (зелёные обозначения в качестве примера):
Всем понятен смысл чисел в правом столбце? – это количество вариант, которые успели «накопиться» на всех «пройденных» интервалах, включая текущий.
Поскольку у нас чётное количество вариант (30 штук), то медианным будет тот интервал, который содержит 30/2 = 15-ю и 16-ю варианту. И ориентируясь по накопленным частотам, легко прийти к выводу, что эти варианты содержатся в интервале .
Формула медианы:
, где:
– объём статистической совокупности;
– нижняя граница медианного интервала;
– длина медианного интервала;
– частота медианного интервала;
– накопленная частота предыдущего интервала.
Таким образом:
ден. ед. – заметим, что медианное значение, наоборот, оказалось смещено правее, т.к. по правую руку находится значительное количество вариант:
И справочно особые случаи:
– Если медианным является крайний левый интервал, то ;
– Если вариационный ряд содержит чётное количество вариант и две средние варианты попали в разные интервалы, то объединяем эти интервалы, и по возможности удваиваем предыдущий интервал
Ответ: ден. ед.
Здесь центральные показатели оказались заметно отличны друг от друга, и это говорит об асимметрии распределения, которая хорошо видна по гистограмме.
И задача для тренировки:
Для изучения затрат времени на изготовление одной детали рабочими завода проведена выборка, в результате которой получено следующее статистическое распределение:
…да, тематичная у меня получилась статья 🙂
Найти среднюю, моду и медиану.
Это, кстати, уже каноничная «интервальная» задача, в которой исследуется непрерывная величина – время.
Решаем эту задачу в Экселе – все числа и инструкции уже там. Если нет Экселя, считаем на калькуляторе, что в данном случае может оказаться даже удобнее. Образец решения, как обычно, в конце урока.
Несмотря на разнообразия рассмотренных показателей, их всё равно бывает не достаточно. Существуют крайне неоднородные совокупности, у которых варианты «кучкуются» во многих местах, и по этой причине средняя, мода и медиана неудовлетворительно характеризуют центральную тенденцию.
В таких случаях вариационный ряд дробят с помощью квартилей, децилей, а в упоротых специализированных исследованиях – и с помощью перцентилей.
Квартили упорядоченного вариационного ряда – это варианты , которые делят его на 4 равные (по количеству вариант) части. Откуда автоматически следует, что 2-я квартиль – есть в точности медиана: .
В тяжёлых случаях проводится разбиение на 10 частей – децилями – это варианты, который делят упорядоченный вариационный ряд на 10 равных (по количеству вариант) частей.
И в очень тяжелых случаях в ход пускается 99 перцентилей .
И после разбиения вариационного ряда каждый участок исследуется по отдельности – рассчитываются локальные средние показатели, локальные показатели вариации и т.д.
В учебном курсе квартили, децили, перцентили встречаются редко, и посему я оставляю этот материал (их нахождение) для самостоятельного изучения.
Ну а сейчас мы перейдём к рассмотрению другой группы статистических показателей – как раз к показателям вариации.
Пример 9. Решение: заполним расчётную таблицу:
Вычислим среднюю:
– две с половиной пуговицы, Карл!
По правому столбцу определяем «иксовое» значение, которое делит совокупность на 2 равные части: (именно здесь накопленная частота «перевалила» за 0,5).
Кроме того, медиану легко усмотреть и устно – поскольку половина совокупности равна , а сумма первых двух частот , то совершенно понятно, что 250-й и 251-й пиджак – двухпуговичные.
Пример 11. Решение: поскольку длина внутренних интервалов равна , то длины крайних интервалов полагаем такими же (см. конец статьи Интервальный вариационный ряд). Заполним расчётную таблицу:
Вычислим выборочную среднюю:
мин.
Моду вычислим по формуле , в данном случае:
– нижняя граница модального интервала;
– длина модального интервала;
– частота модального интервала;
– частота предшествующего интервала;
– частота следующего интервала.
Таким образом:
мин.
Анализируя накопленные частоты, приходим к выводу, что медианным является интервал (именно он содержит 50-ю и 51-ю варианты, которые делят ряд пополам).
Медиану вычислим по формуле , в данном случае:
– нижняя граница медианного интервала;
– длина этого интервала;
– объём статистической совокупности;
– частота медианного интервала;
– накопленная частота предыдущего интервала.
Таким образом:
мин.
Ответ: среднее время изготовления детали характеризуется следующими центральными характеристиками:
Автор: Емелин Александр
(Переход на главную страницу)
Zaochnik.com – профессиональная помощь студентам
cкидкa 15% на первый зaкaз, прoмoкoд: 5530-hihi5
Tutoronline.ru – онлайн репетиторы по математике и другим предметам