logo
Назад

Эффективные курсы (профильный уровень)

Тема 2

01. Производная функции. Профильный уровень

36 мин

02. Применение производной. Исследование функций. Профильный уровень

48 мин

03. Применение производной при построении графиков и решении задач. Профильный уровень

43 мин

04. Первообразная. Определённый интеграл. Профильный уровень

41 мин

05. Производная и интеграл. Практика. Профильный уровень

29 мин

06. Предел функции. Непрерывность. Профильный уровень

30 мин

07. Сравнение бесконечных. Ряды. Профильный уровень

30 мин

08. Средние. Неравенства между средними. Профильный уровень

23 мин

09. Основы теории вероятностей. Профильный уровень

29 мин

10. Теория вероятностей. Условная вероятность. Профильный уровень

19 мин

11. Дискретные случайные величины. Профильный уровень

33 мин

12. Непрерывные случайные величины. Профильный уровень

24 мин

13. Зависимость случайных величин. Профильный уровень

26 мин

14. Обработка статистических данных. Профильный уровень

24 мин

15. Математические методы работы с данными. Профильный уровень

17 мин

13. Зависимость случайных величин. Профильный уровень

Видео доступно по абонементу

"

Зависимые и независимые случайные величины

Если мы ставим чайник на огонь, то температура в чайнике зависит от вполне понятных нам условий — начальной температуры, количества воды, интенсивности огня, прошедшего времени (см. рис. 1).

Температуру в таком случае мы можем вычислить заранее, и она не является для нас случайной.

Конечно, у любой модели есть ограничения, все факторы учесть невозможно, но мы можем вычислить температуру чайника с достаточной точностью.

Температура воздуха на улице тоже определяется конкретными причинами, но для обычного человека они настолько сложно устроены  и неочевидны, что эта величина для нас с вами уже очень похожа на случайную (см. рис. 2).

Часто нас интересуют не просто случайные явления или величины, а связь двух или более явлений одновременно.

Для наших давних предков неудача во время ловли рыбы и появление на другом берегу человека из другого племени были очень даже связаны, что могло привести к войне (см. рис. 3).

Для средневекового человека связь между появлением кометы и последующим мором (эпидемией) могла представляться очень важной, так как на основе наблюдения за одним явлением — кометой, можно делать выводы относительно другого — например, что пора уезжать из города (см. рис. 4).

Связь между датой рождения, расположением планет и удачной покупкой до сих для многих людей остаётся фактом, о чём свидетельствуют многочисленные гороскопы, хотя никаких намёков на научное доказательство такой связи не существует (см. рис. 5).

Некоторые величины, очевидно, являются независимыми.

Результат броска кубика первый раз никак не влияет на результат второго броска. Но даже тут люди умудряются ошибаться и из независимых величин делать зависимые.

Если пять раз подряд выпал орел, то, зачастую, люди склонны думать, что шестой раз решка выпадет с большей вероятностью, ведь очень низка вероятность шести орлов подряд.

Нужно не путать две ситуации. Одно дело, если вы хотите оценить вероятность того, что сейчас из 6 бросков все 6 раз выпадет орёл. Такая вероятность действительно крайне мала (мы знаем, что она равна). Это так называемая безусловная вероятность — нет никаких дополнительных условий.

Другое дело, если вы оцениваете вероятность выпадения орла после 5 бросков, в результате которых выпал орёл. Если монета нормальная (без смещённого центра тяжести и т. д.), то вероятность выпадения орла во время любого броска будет всегда , независимо от результатов предыдущих бросков — у монеты нет памяти.

На самом деле, мы часто совершаем ошибки при определении зависимых и независимых событий. Подробнее об этом можно узнать из видео.

С другой стороны, есть очевидно зависимые величины. Вес и рост человека — стандартный пример. Сложно ожидать низкого веса при очень высоком росте (единичные примеры есть, но в общем количестве они не оказывают особого влияния на статистику).

При этом есть величины, про связь которых люди до сих пор спорят, несмотря на наличие убедительных научных доказательств.

Например, связано ли курение и продолжительность жизни. Хотя ученые и дают однозначный ответ на это (см. рис. 6), не редкость рассказы про родственников-долгожителей, которые всё время курили и прожили 100 лет (такие же примеры приводят и про алкоголь, и про другие вредные привычки).

Здесь, даже если примеры таких долгожителей не выдумка, идёт подмена средней величины уникальным явлением. Эта частая ошибка, которая используется для манипулирования информацией — это когда приводят один или несколько частных примеров, на основании которых делают обобщение о ситуации в целом.

Это частный случай так называемой ошибки выжившего. Так, многие успешные люди пишут книги со своими рецептами успеха.

Но нет никакой гарантии, что, в точности следуя их советам, вы тоже окажетесь успешными. Неуспешные люди, жившие по тем же принципам, книги о своих неудачах вряд ли напишут, и уж тем более вы вряд ли их прочитаете. Что такое «ошибка выжившего» более подробно вы можете узнать в ответвлении.


Ошибка выжившего

Термин «Ошибка выжившего» используется при обработке данных и означает такую ситуацию, когда исследуемые объекты разделены на две группы — о первой группе данных много, она называется «выжившие». 

О второй — очень мало, или вообще нет, она называется «погибшие». Ошибка заключается в том, что исследователь обладает данными только по первой группе, а делает выводы обо всём множестве объектов, игнорируя потерянную информацию о второй группе. Одно из первых высказываний, близкое по смыслу к описанию ошибки выжившего сделал древнегреческий софист Диагор Мелосский (см. рис. 1).

По словам Цицерона, когда один из друзей Диагора убеждал его поверить в существование богов, указывая на множество изображений спасения людей, которые попадали в шторм и давали клятву богам совершить какой-либо обет, Диагор парировал: однако отсутствуют любые изображения тех, кто погиб в море в результате кораблекрушения. Аналогичное высказывание приписывают древнегреческому философу-кинику Диогену Синопскому (см. рис. 2).

Когда какой-то человек удивлялся обилию даров, принесённых в благодарность за исполнение обетов, Диоген заметил: их было бы куда больше, если бы их приносили и те, кому не удалось спастись. Сам термин связан со Второй мировой войной. После выполнения боевых задач, американские бомбардировщики возвращались с повреждениями от зениток и истребителей врага. В основном страдали крылья и корпус, почти не страдали топливные системы и двигатель. Военные предлагали укрепить дополнительной бронёй те места, на которых были повреждения.

Математики, работавшие с этой задачей, объяснили, что всё как раз наоборот — если повреждения в крыле или хвосте, то самолёт, скорее всего, может вернуться. Зато попадание в двигатель или топливную систему фатально. Конечно, враг попадал и в эти места тоже, и именно эти самолёты не вернулись на базу — погибли. Анализ же проводился только на выживших самолетах. Таким образом, укреплять надо как раз те места, в которых попадания не нашли — именно такие попадания приводят к гибели самолёта. Как другой яркий пример «ошибки выжившего» приводят рассказ о дружелюбии дельфинов. То, что дельфины толкают тонущего человека к берегу и поддерживают его на плаву, мы знаем со слов тех, кто добрался до берега — выжил, если кого-то толкали в обратном направлении, то мы об этом не узнаем.

Утверждение, что старые фильмы были талантливее современных, основываются на том, что до нас доходят только заслуживающие внимания произведения, а слабые оказываются просто забытыми. Впечатление, что иностранное кино чаще более интересное, чем отечественное, тоже может быть результатом «ошибки выжившего». Для перевода иностранных фильмов на родной язык обычно выбирают те, что ожидаемо будут иметь успех, то есть там доступны только более удачные картины. А кино, сделанное изначально на родном языке, доступно всё — и интересное, и скучное.

Ну и часто «ошибка выжившего» делается намеренно, когда описывают исключительно одну группу объектов, а другую игнорируют — как заведомо невыгодную. Яркий пример, который уже упоминали — рецепт успеха. Пример успеха ярко описывается, неудачи просто игнорируется. Вывод из сказанного следующий: сбор данных — крайне важная часть исследования. Если не удаётся собрать данные о части объектов, то нужно это иметь в виду при дальнейшей обработке и построении выводов, то есть не допускать «ошибку выжившего».


Такая индукция ошибочна, поскольку любые частные примеры не могут достоверно свидетельствовать об общей статистике. Легко придумать такие примеры и в математике: можно привести сколько угодно простых чисел, но это не значит, что все натуральные числа — простые. Методы теории вероятностей и математической статистики позволяют, имея закон совместного распределения случайных величин, выяснить, существует ли связь между этими явлениями и насколько она сильна, то есть посчитать её количественное выражение.

Очень важным здесь является тот факт, что в этом случае не нужно изучать саму физическую связь явлений, которая обычно во много раз сложнее вероятностной.

То есть математика позволяет сделать вывод о наличии или отсутствии связи между явлениями, но не о причинах этого наличия или отсутствия.

Так, установлено, что люди с высшим образованием живут (в среднем) значительно дольше (см. рис. 7).

Версий для объяснения причин такой взаимосвязи очень много, но ни одну из них доказать (убедительно) на данный момент не удалось.

Совместное распределение

Если у нас есть законы распределения двух случайных величин по отдельности, то мы не можем понять — зависимы они или нет. Для начала исследования нам необходим закон их совместного распределения, который невозможно получить из отдельных законов каждой величины.

Например, глядя на два вот таких закона распределения, мы ничего не можем сказать о взаимной зависимости величин и .

 

 

p

Без дополнительной информации мы не можем построить закон совместного распределения.

Если окажется, что величина — это результат подбрасывания монеты, а — игрального кубика, то величины независимы и закон выглядит следующим образом:

Все вероятности одинаковы и равны .

Если же — это выпадение чёта (0) или нечета (1) на том же самом кубике при том же самом броске, то величины зависимы, и совместное распределение выглядит иначе:

Половина клеток соответствует невозможным событиям — там вероятность равна нулю, в остальных вероятность равна .

Таким образом, начинать мы можем, если у нас уже есть совместное распределение. На практике это обычно легко выполнимо. Мы наблюдаем сразу за двумя или большим количеством явлений и записываем частоты совместного появления их значений.

Например, мы измерили рост у 1000 взрослых людей с точностью до 1 см и выяснили у каждого, курит ли он. Допустим, нам встретились 5 человек ростом 176 см и при этом курящих. Частота такого события равна , что мы и берём в качестве вероятности в соответствующей клетке на пересечении значений 176 и 1 (курит).

(не курит)

(курит)

Когда заполним всю таблицу, сможем приступить к исследованию — существует ли связь между ростом взрослого человека и курением.

Рассмотрим совместное распределение двух случайных величин:

Сумма всех вероятностей должна быть равна единице. Это условие выполняется. Нам уже достаточно знаний, чтобы увидеть, зависимы эти величины или нет.

Найдём закон распределения каждой величины по отдельности, а также при условии, что одна величина приняла конкретное значение.

Величина принимает значение 2 в двух несовместных случаях, когда и . Складывая вероятности 0,1 и 0,2 получаем вероятность того, что (). То же самое касается остальных значений .

Таким образом, если мы сложим построчно вероятности в каждом столбце, то получим обычный закон распределения .

Найдём теперь закон распределения при условии, что . Для этого нам нужна формула условной вероятности:

Смотрим на первую строку.

Вероятность того, что равна сумме вероятностей в первой строке, то есть

Вероятность совместного события и равна 0,2:

Делим вероятность совместного события на вероятность того, что , и получаем искомую условную вероятность – 0,4:

:

:

Таким образом, чтобы построить закон распределения при условии, что , мы делим значение в каждой клетке первой строки на сумму всех значений в этой же строке. Аналогично вычисляем остальные значения. Проверяем себя и складываем вероятности — получили единицу.

Мы видим, что знание значения величины повлияло на закон распределения . Но это означает, что величины зависимы.

В качестве упражнения, найдите законы распределения при условии, что и три условных закона распределения при ,, и .

Чтобы описать степень зависимости одной случайной величины от другой, вводят такие величины, как ковариация и коэффициент корреляции.

Ученики профильного уровня могут ознакомиться с математическим определением этих величин и с примерами их расчёта. Остальным же достаточно понимать, что эти характеристики можно вычислить. При этом важно понимать, какие выводы можно сделать на основе этих вычислений.

Часто заманчивая простота корреляционного исследования подталкивает исследователя делать ложные интуитивные выводы о наличии причинно-следственной связи между парами признаков, в то время как коэффициенты корреляции устанавливают лишь статистические взаимосвязи. Например, рассматривая пожары в конкретном городе, можно выявить весьма высокую корреляцию между ущербом, который нанёс пожар, и количеством пожарных, участвовавших в ликвидации пожара, причём эта корреляция будет положительной. Из этого, однако, не следует вывод «увеличение количества пожарных приводит к увеличению причинённого ущерба», и тем более не будет успешной попытка минимизировать ущерб от пожаров путём ликвидации пожарных бригад.

Корреляция двух величин может свидетельствовать о существовании общей причины, хотя сами явления напрямую не взаимодействуют.

Например, обледенение становится причиной как роста травматизма из-за падений, так и увеличения аварийности среди автотранспорта. В этом случае две величины (травматизм из-за падений пешеходов и аварийность автотранспорта) будут коррелировать, хотя они не связаны причинно-следственно друг с другом, а лишь имеют стороннюю общую причину — гололедицу.

В то же время, отсутствие корреляции между двумя величинами ещё не значит, что между ними нет никакой связи. Например, зависимость может иметь сложный нелинейный характер, который корреляция не выявляет.

Ковариация и коэффициент корреляции

Вариация означает изменение. Приставка КО означает совместное действие. Например, вы скорее всего слышали слово КОВОРКИНГ — место, где работает одновременно много людей. Для измерения совместной вариации используют слово КОВАРИАЦИЯ, то есть совместное изменение.

Для одной случайной величины мы уже знакомы с мерой вариации, мерой отклонения от математического ожидания, или от среднего значения. Это дисперсия. Она представляет собой матожидание квадрата разности величины и её матожидания:

Чаще её вычисляют по другой формуле — как разность матожидания квадрата величины и квадрата матожидания исходной величины:

Итак, дисперсия — это матожидание квадрата отклонения величины от ее матожидания. Квадрат мы можем расписать как произведение:

Теперь, если второй множитель заменить на аналогичное выражение для величины , то мы получим уже не меру вариации величины , а меру совместной вариации двух величин, которую и называют ковариацией:

Вторая формула для вычисления дисперсии превращается во вторую формулу для вычисления ковариации:

Понятно, что если в любую формулу ковариации подставить две одинаковые величины, то мы получим дисперсию.

Формулы для дисперсии и ковариации очень похожи, а следовательно, и методы вычисления тоже.

Вычислим ковариацию наших случайных величин первым способом, то есть как матожидание произведения отклонений величин от своих матожиданий.

Мы рассматривали закон совместного распределения двух случайных величин:

По закону совместного распределения найдём законы распределения величин по отдельности.  Для этого складываем значения в столбцах или строках:

Найдем матожидания величин. Для матожидания :

Аналогично находим матожидание :

Добавим в законы распределения строки для  и , и найдём матожидания этих величин:

Чтобы не терять нить рассуждения, нужно на каждом шаге останавливать видео и проделывать все вычисления. Они совсем не сложные, но одно похоже на другое, в связи с чем легко запутаться.

Зная матожидания величин и их квадратов, найдём дисперсии:

Извлекая корни квадратные из дисперсий, получим среднеквадратичные отклонения случайных величин:

Составим таблицу распределения линейных отклонений величин от своих матожиданий. Для этого вычтем из значений величины их матожидания, вероятности остаются прежними.

Теперь нам нужна таблица попарных произведений всех значений величин.

Впишем вместо вероятностей произведения значений величин. В первую клетку вписываем произведение , получаем 0,5.

Заполняем всю таблицу.

Таким образом, у нас в одной таблице написаны значения произведений, а в другой — их вероятности.

Осталось перемножить числа в одинаковых клетках двух таблиц и сложить всё вместе. Получим матожидание последней величины, то есть ковариацию:

Получили значение ковариации равное 0,2.
Давайте коротко повторим, что мы сделали.

В формуле ковариации нужны матожидания каждой величины — мы их нашли. Далее мы составили законы распределения двух новых величин и , то есть написали, как устроены отклонения исходных величин от своих матожиданий. Далее мы нашли новую величину — произведение отклонений. И последнее, что нужно было сделать — найти матожидание этого произведения.

Найти ковариацию по второй формуле получится быстрее. Давайте посмотрим, как это делать.

Нам нужно найти матожидание произведения величин и вычесть из него произведение отдельных матожиданий.

Отдельные матожидания у нас уже вычислены.

Итак, нужно составить закон распределения произведения исходных величин и найти его матожидание. Сделаем новую таблицу для произведения:

И ещё одну таблицу, где значения уже умножены на вероятность:

Складываем значения последней таблицы и находим матожидание произведения:

Теперь мы всё знаем для вычисления ковариации. Осталось подставить нужные значения в формулу. Получим ту же самую ковариацию 0,2:

Итак, ковариация двух величин и оказалась равна 0,2.

Какой вывод можно сделать? Величины являются зависимыми.

Но это мы знали и раньше, когда увидели, что знание одной величины влияет на закон распределения другой.

Ковариацию мы вводили как меру этой зависимости, а вернее, меру линейной зависимости одной величины от другой.

На самом деле, просто значение ковариации мало о чём говорит. Представьте себе, что обе величины Х и Y были измерены в метрах, и тут мы решили записать их в сантиметрах. Все значения величин увеличатся в 100 раз, а значение ковариации рассчитывается через их произведения, то есть ковариация увеличится в 10 тысяч раз.

Таким образом, ковариация зависит от выбранных единиц, от масштаба.

Чтобы избежать этого неудобства, пользуются другой величиной, которая называется коэффициентом корреляции.

Корреляция (реляция, в английском relations, от латинского — отношение, соотношение) означает взаимосвязь, то есть этот коэффициент можно перевести как коэффициент взаимосвязи.

В чём же удобство этой величины?

Если увеличить в несколько раз, во столько же раз вырастет ковариация в числителе и среднеквадратичное отклонение в знаменателе. То же самое касается величины .

Таким образом, коэффициент корреляции не зависит от масштаба и является безразмерной величиной.

Если и независимы, то ковариация равна нулю, а, следовательно и коэффициент корреляции тоже равен нулю.

Если и связаны абсолютной точной линейной связью, то есть , то коэффициент корреляции будет равен единице, если   и , если .

То есть, коэффициент корреляции принимает значения из промежутка [–1; 1]. Чем модуль коэффициента корреляции ближе к единице, тем сильнее выражена линейная зависимость случайных величин, а чем ближе к нулю, тем эта зависимость меньше.

Найдём коэффициент корреляции для нашей задачи.

Среднеквадратичные отклонения у нас уже были найдены.

Получили коэффициент корреляции 0,52, что указывает, как говорят, на среднюю тесноту связи величин.

Положительный коэффициент говорит о положительной связи. То есть большее значение одной величины повышает вероятность больших значений второй величины.

Посмотрим на наше исходное распределение. Могли ли мы предположить положительный коэффициент корреляции?

Если , то может принимать значения только 2 и 3.

Если увеличивается, то есть становится равным одному , то сильно увеличивается вероятность того, что примет большее значение, например, 4.

То есть при беглом взгляде можно сказать следующее: если значимая линейная связь будет установлена, то она будет положительной.

Линейная регрессия

Если коэффициент корреляции указывает на достаточно тесную линейную связь двух случайных величин, стараются построить саму линейную функцию, которая связывает эти величины.

Функция , которая наилучшим образом приближает величину , называется линейной регрессией.

Коэффициенты и линейной регрессии ищут по следующим формулам:

,

.

Построим линейную регрессию для наших величин:

Таким образом, линейная регрессия имеет вид:

Посмотрим, насколько хорошо эта функция по значению предсказывает значение :

Если , то

Мы попали между двумя возможными значениями , причем не ровно между ними, а смещение произошло в сторону более вероятного значения , то есть в сторону 3. То есть это очень хорошее предсказание.

Посмотрим, что при :

Мы сдвинулись в сторону более вероятного значения, то есть 4.

Таким образом, можно сказать, что несмотря на среднюю тесноту линейной связи, о чём говорит не очень большой коэффициент корреляции, мы получили приличную линейную регрессию.

Далее нужно оговориться, что вычислений, подобных нашим, вручную никто не делает.

Электронные таблицы, специализированные статистические программы прекрасно обрабатывают огромное количество данных, вычисляют все рассмотренные величины, строят линейные регрессии (см. рис 8).

Задача исследователя при этом сводится к правильному сбору данных, правильной постановке задачи для программного обеспечения, и дальнейшей интерпретации полученных результатов.

Например, вы собрали большое количество данных, и построили закон совместного распределения двух случайных величин. В электронных таблицах обработали данные и получили, что коэффициент корреляции близок к нулю. Должны ли мы из этого сделать вывод, что величины независимы или близки к независимым? Вообще говоря, нет. Коэффициент корреляции отражает линейную зависимость. То есть равенство его нулю может в самом деле означать независимость величин или же наличие зависимости, но не линейной.

Исследованием связей случайных величин вы будете заниматься на многих специальностях университетов, связанных со статистикой. Интерпретация таких показателей, как матожидание, дисперсия, коэффициент корреляции будет для многих обязательным умением.

Ну а мы на этом заканчиваем урок, до свидания.

 

Список литературы

  1. Мерзляк А. Г. Математика. Алгебра и начала математического анализа. 11 класс. Углублённый уровень. Москва. Издательский центр «Вентана-Граф». 2019 г. §31, §35, §36.

  2. Гмурман В. Е. Теория вероятностей и математическая статистика. − М.: Высшая школа, 1997. − 479 с. Глава XIV, § 1–2, §17 – 18, §20 – 21.

  3. Кремер Н. Ш. Теория вероятностей и математическая статистика. – 3-е изд., перераб. и доп. – М.: ЮНИТИ-ДАНА, 2010. – 551 с. п. 5.1, п. 5.5. – 5.6.

 

Домашнее задание

Дано совместное распределение двух случайных величин:

  1. Найдите значение . 

  2. Найдите законы распределения каждой величины по отдельности.

  3. Найдите закон распределения  при условии, что .

  4. Найдите ковариацию данных случайных величин.

  5. Найдите коэффициент корреляции данных случайных величин.

  6. Запишите уравнение линейной регрессии для данных случайных величин.

"

Обсуждение