Молодые геи и бисексуалы временно-оккупированной территории (Донецк) демонстрируют бОльший уровень депрессии по сравнению с теми, кто живёт на подконтрольной Украине территории. Это показывают предварительные результаты опроса, проводимого Межрегиональным центром ЛГБТ-исследований «Донбас-СоцПроект», охватившего 720 респондентов — псевдослучайная выборка (RDS) гомо- и бисексуальных мужчин в возрасте от 16 до 28 лет, проживающих в Донецке, Мариуполе, Львове, Чернигове и Кривом Роге.
Читать далее
Показ дописів із міткою ANOVA. Показати всі дописи
Показ дописів із міткою ANOVA. Показати всі дописи
8 черв. 2015 р.
16 серп. 2014 р.
Коррупция и большая политика
Ниже я воспроизвожу пост, опубликованные в Фейсбуке Дмитрием ДУБИЛЕТОМ, возглавляющим IT-службу ПриватБанка. Этот текст, с одной стороны, великолепно иллюстрирует т. н. «журналистику данных» (поиск и занимательное описание неких неочевидных статистических закономерностей на ярком, актуальном материале). С другой, благодаря наличию исходных данных, даёт нам возможность проверить выкладки.
***
Читаю российские новости и блоги, в который раз поражаюсь тому, насколько в «том» мире все зеркально: сострадание «воинам ДНР», «зомбированные украинцы» и прочее.
Те же эмоции, та же риторика. Зеркальность настолько разительна, что в какой-то момент начинаешь сомневаться: а точно ли правда на нашей стороне? Вдруг Украина и Россия — это не борьба добра со злом, а противостояние Монтекки и Капулетти? Захотелось доказать свою правоту самому себе как-то математически.
Давайте, во-первых, определим, что такое «добро» и «зло». Я предлагаю здесь в качестве мерила использовать индекс коррупции (рейтинг за 2013 год: http://cpi.transparency.org/cpi2013/). Как-никак, каждое государство, каким бы оно ни было, признает (по крайней мере, официально), что коррупция — это зло (именно потому я избрал не индекс развития демократии, так как демократию не все признают). Чем выше индекс, тем меньше коррупции в стране.
Во-вторых, давайте определимся, кто в лагере Украины, кто — в лагере России. Для этого я использовал результаты голосования стран в Генассамблее ООН по территориальной целостности Украины (то есть по Крымскому вопросу).
В итоге получился такой график. Мои исходные данные, если кому интересно: https://docs.google.com/spreadsheets/d/1t_u-gUKJf6BYizIgbi5bzrt7iMzDCY0cLf4A1TdUQ1M/edit?usp=sharing
Фух, всё-таки это не история Монтекки и Капулетти. Это история Джордано Бруно против средневековой церкви, Авеля против Каина, Бэтмена против Джоркера. Здесь совершенно точно видно, на чьей стороне правда. Мы победим.
***
От себя. Приведённый текст, краткая заметка для памяти, неполон — в нём описан исследовательский вопрос, постановка проблемы, указан источник данных и результаты рисунком. До полноценного академизма не хватает обсуждения результатов, выводов и указаний на то, в чём может быть их недостаток. Попробуем отчасти восполнить это.
Вначале опишем исходные данные. Приведённая в тексте ссылка даёт таблицу из двух колонок: индекс коррупции (непрерывная переменная, т. е. просто числа) и результаты голосования (номинальная переменная — ЗА, ПРОТИВ, ВОЗДЕРЖАЛСЯ, НЕ ГОЛОСОВАЛ).
Распределение индекса коррупции похоже на нормальное, но скошено в сторону бОльших индексов (рис. 1), т. е. стран с меньшим уровнем коррупции больше, чем тех, где проблемы принято решать дачей взятки.
Распределение голосов в поддержку территориальной целостности Украины выглядит так:
52% «ЗА», 6% «ПРОТИВ», 31% «ВОЗДЕРЖАЛСЯ» и 11% «НЕ ГОЛОСОВАЛ». Следует сказать, что в дипломатии вариант «НЕ ГОЛОСОВАЛ» — тоже значимая форма выражения мнения.
Очевидно, что проверяемая гипотеза в более строгом виде звучит так: средние индексы коррупции в группах стран, по-разному голосовавших, отличаются. Т. е. это задача для дисперсионного анализа (ANOVA).
Из рис. 2 видно, что страны, поддержавшие территориальную целостность Украины, в среднем характеризуются бОльшими индексами, т. е. в них меньше распространена коррупция, тогда как голосовавшие против, воздержавшиеся или попытавшиеся не голосовать, страдают от большей коррупции.
Значимы ли эти отличия? — Да, дисперсионный анализ это подтверждает:
При этом попарные сравнения указывают, что по сути все страны разделились на две группы — те, кто проголосовал «ЗА», и все остальные — те, кто против территориальной целостности Украины однозначно или с оговорками. В первую группу (большинство, 52%) попали страны с меньшей коррупцией. Во вторую (48%) — с бОльшей.
Попытаемся теперь подумать, случайна ли эта связь. Итак, что такое коррупция? — Отсутствие разделяемых всеми и выполняемых всеми правил поведения, возможность при наличии ресурсов обойти правила.Чем больше коррупция, тем менее предсказуема жизнь. А что такое территориальная целостность? — Это одно из правил сосуществования разных стран. Получается, что поддержали территориальную целостность Украины те страны, где принято уважать правила игры, а не поддержали те, где принято на правила не обращать внимание. Таким образом, связь найдена не только статистическая, но и логическая.
Конечно, не только в коррупции дело. Безусловно, существуют и другие факторы, повлиявшие на результат голосования (например, экономическая зависимость ряда стран от России), в этом и состоит ограничение приведённых данных. Очевидно также, что к категориям моральным, к битве добра и зла, и уж тем более к победе первого над вторым эти закономерности не имеют отношения. Хотя ЛОБАНОВСКИЙ, сказавший «порядок бьёт класс», с этим бы не согласился.
Читать далее
***
Пост о том, как математика помогает в моральных ориентирах
Читаю российские новости и блоги, в который раз поражаюсь тому, насколько в «том» мире все зеркально: сострадание «воинам ДНР», «зомбированные украинцы» и прочее.
Те же эмоции, та же риторика. Зеркальность настолько разительна, что в какой-то момент начинаешь сомневаться: а точно ли правда на нашей стороне? Вдруг Украина и Россия — это не борьба добра со злом, а противостояние Монтекки и Капулетти? Захотелось доказать свою правоту самому себе как-то математически.
Давайте, во-первых, определим, что такое «добро» и «зло». Я предлагаю здесь в качестве мерила использовать индекс коррупции (рейтинг за 2013 год: http://cpi.transparency.org/cpi2013/). Как-никак, каждое государство, каким бы оно ни было, признает (по крайней мере, официально), что коррупция — это зло (именно потому я избрал не индекс развития демократии, так как демократию не все признают). Чем выше индекс, тем меньше коррупции в стране.
Во-вторых, давайте определимся, кто в лагере Украины, кто — в лагере России. Для этого я использовал результаты голосования стран в Генассамблее ООН по территориальной целостности Украины (то есть по Крымскому вопросу).
В итоге получился такой график. Мои исходные данные, если кому интересно: https://docs.google.com/spreadsheets/d/1t_u-gUKJf6BYizIgbi5bzrt7iMzDCY0cLf4A1TdUQ1M/edit?usp=sharing
Фух, всё-таки это не история Монтекки и Капулетти. Это история Джордано Бруно против средневековой церкви, Авеля против Каина, Бэтмена против Джоркера. Здесь совершенно точно видно, на чьей стороне правда. Мы победим.
***
От себя. Приведённый текст, краткая заметка для памяти, неполон — в нём описан исследовательский вопрос, постановка проблемы, указан источник данных и результаты рисунком. До полноценного академизма не хватает обсуждения результатов, выводов и указаний на то, в чём может быть их недостаток. Попробуем отчасти восполнить это.
Вначале опишем исходные данные. Приведённая в тексте ссылка даёт таблицу из двух колонок: индекс коррупции (непрерывная переменная, т. е. просто числа) и результаты голосования (номинальная переменная — ЗА, ПРОТИВ, ВОЗДЕРЖАЛСЯ, НЕ ГОЛОСОВАЛ).
Распределение индекса коррупции похоже на нормальное, но скошено в сторону бОльших индексов (рис. 1), т. е. стран с меньшим уровнем коррупции больше, чем тех, где проблемы принято решать дачей взятки.
Распределение голосов в поддержку территориальной целостности Украины выглядит так:
52% «ЗА», 6% «ПРОТИВ», 31% «ВОЗДЕРЖАЛСЯ» и 11% «НЕ ГОЛОСОВАЛ». Следует сказать, что в дипломатии вариант «НЕ ГОЛОСОВАЛ» — тоже значимая форма выражения мнения.
Очевидно, что проверяемая гипотеза в более строгом виде звучит так: средние индексы коррупции в группах стран, по-разному голосовавших, отличаются. Т. е. это задача для дисперсионного анализа (ANOVA).
Из рис. 2 видно, что страны, поддержавшие территориальную целостность Украины, в среднем характеризуются бОльшими индексами, т. е. в них меньше распространена коррупция, тогда как голосовавшие против, воздержавшиеся или попытавшиеся не голосовать, страдают от большей коррупции.
Значимы ли эти отличия? — Да, дисперсионный анализ это подтверждает:
> anova(lm(Index~Vote))
Analysis of Variance Table
Response: Index
Df Sum Sq Mean Sq F value Pr(>F)
Vote 3 13918 4639.3 14.415 2.117e-08 ***
Residuals 168 54069 321.8
---
Signif. Codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1При этом попарные сравнения указывают, что по сути все страны разделились на две группы — те, кто проголосовал «ЗА», и все остальные — те, кто против территориальной целостности Украины однозначно или с оговорками. В первую группу (большинство, 52%) попали страны с меньшей коррупцией. Во вторую (48%) — с бОльшей.
Попытаемся теперь подумать, случайна ли эта связь. Итак, что такое коррупция? — Отсутствие разделяемых всеми и выполняемых всеми правил поведения, возможность при наличии ресурсов обойти правила.Чем больше коррупция, тем менее предсказуема жизнь. А что такое территориальная целостность? — Это одно из правил сосуществования разных стран. Получается, что поддержали территориальную целостность Украины те страны, где принято уважать правила игры, а не поддержали те, где принято на правила не обращать внимание. Таким образом, связь найдена не только статистическая, но и логическая.
Конечно, не только в коррупции дело. Безусловно, существуют и другие факторы, повлиявшие на результат голосования (например, экономическая зависимость ряда стран от России), в этом и состоит ограничение приведённых данных. Очевидно также, что к категориям моральным, к битве добра и зла, и уж тем более к победе первого над вторым эти закономерности не имеют отношения. Хотя ЛОБАНОВСКИЙ, сказавший «порядок бьёт класс», с этим бы не согласился.
Читать далее
17 лют. 2012 р.
03. Просто R — Использование R для ознакомительной статистики
Продолжение серии моих переводов из учебного пособия «Просто R — Использование R для ознакомительной статистики» американского автора John’a VERZANI.
http://www.math.csi.cuny.edu/Statistics/R/simpleR
Раздел 15: Анализ различий (дисперсионный анализ, ANOVA)
t-Тест используется, чтобы узнать, существуют ли различия в средних двух выборок. Напр., есть ли разница между испытуемой и контрольной группами. Метод, именуемый «анализ различий» («дисперсионный анализ», ANOVA), позволяет сравнивать средние более чем в двух группах.
Разберём вначале пример однофакторного анализа.
Классификация стипендий
Предположим, что школа должна рассмотреть 300 заявок на стипендии. Эта работа слишком велика для одного человека, поэтому школа нанимает шестерых классификаторов. Комитет по рассмотрению стипендий хотел бы убедиться, что все классификаторы пользуются одной и той же шкалой при оценивании заявок, поскольку в ином случае заявители не будут находиться в равных условиях. Одним из способов сделать это является распределить в случайном порядке между классификаторами задания (каждому из шестерых достанется по 50) и затем сравнить оценки, выставленные каждым из шести, зная, что различия между классификаторами будут минимальны (т. е. будут в пределах случайной ошибки) в том случае, если все пользуются одинаковой шкалой оценок.
Для того, чтобы проиллюстрировать работу метода, положим, что в нашем распоряжении есть 27 тестов и три классификатора (а не 300 и 6 — для простоты). Кроме того, пусть классификаторы пользуются пятибальной шкалой. Выставленные ими оценки выглядят так:
grader 1: 4, 3, 4, 5, 2, 3, 4, 5
grader 2: 4, 4, 5, 5, 4, 5, 4, 4
grader 3: 3, 4, 2, 4, 5, 5, 4, 4
Введём эти данные в R и объединим затем в одну таблицу:
Вначале мы построили диаграммы размахов, позволяющие зрительно сравнить три распределения. Из рисунка следует, что второй классификатор отличается от двух других.
Дисперсионный анализ позволяет нам установить, действительно ли средние оценки всех классификаторов одинаковы в пределах ошибки. Функция в R, позволяющая проводить однофакторный дисперсионный анализ (
Посмотрев на имена векторов (names), мы узнали, что значения собраны в переменной «values», а категории — в переменной «ind». Чтобы вызвать
Мы видим, что p = 0.34, а это значит, что мы принимаем нулевую гипотезу о равенстве средних. Более детальную информацию об анализе можно получить, воспользовавшись функциями
Дополнение из книги Paul TEETOR. R Cookbook.
Итак, вы узнали, что есть значимые отличия в средних, относящихся к разным группам. Однако сам по себе тест не показывает, какие именно группы отличаются.
Функция
Выполнение дисперсионного анализа функцией
Здесь x — это ваши данные, а f — группирующий их фактор. Вы можете визуализировать результаты для наглядности:
Тест Краскела–Уоллиса
Тест Краскела–Уоллиса является непараметрическим тестом, используемым вместо однофакторного дисперсионного анализа в том случае, если данные не распределены нормально. Его применяют подобно тому, как тест Вилкоксона вместо t-теста.
Тест Краскела–Уоллиса используется в R подобно команде
Читать далее
http://www.math.csi.cuny.edu/Statistics/R/simpleR
Раздел 15: Анализ различий (дисперсионный анализ, ANOVA)
t-Тест используется, чтобы узнать, существуют ли различия в средних двух выборок. Напр., есть ли разница между испытуемой и контрольной группами. Метод, именуемый «анализ различий» («дисперсионный анализ», ANOVA), позволяет сравнивать средние более чем в двух группах.
Разберём вначале пример однофакторного анализа.
Классификация стипендий
Предположим, что школа должна рассмотреть 300 заявок на стипендии. Эта работа слишком велика для одного человека, поэтому школа нанимает шестерых классификаторов. Комитет по рассмотрению стипендий хотел бы убедиться, что все классификаторы пользуются одной и той же шкалой при оценивании заявок, поскольку в ином случае заявители не будут находиться в равных условиях. Одним из способов сделать это является распределить в случайном порядке между классификаторами задания (каждому из шестерых достанется по 50) и затем сравнить оценки, выставленные каждым из шести, зная, что различия между классификаторами будут минимальны (т. е. будут в пределах случайной ошибки) в том случае, если все пользуются одинаковой шкалой оценок.
Для того, чтобы проиллюстрировать работу метода, положим, что в нашем распоряжении есть 27 тестов и три классификатора (а не 300 и 6 — для простоты). Кроме того, пусть классификаторы пользуются пятибальной шкалой. Выставленные ими оценки выглядят так:
grader 1: 4, 3, 4, 5, 2, 3, 4, 5
grader 2: 4, 4, 5, 5, 4, 5, 4, 4
grader 3: 3, 4, 2, 4, 5, 5, 4, 4
Введём эти данные в R и объединим затем в одну таблицу:
> x = c(4,3,4,5,2,3,4,5)
> y = c(4,4,5,5,4,5,4,4)
> z = c(3,4,2,4,5,5,4,4)
> scores = data.frame(x,y,z)
> boxplot(scores)Вначале мы построили диаграммы размахов, позволяющие зрительно сравнить три распределения. Из рисунка следует, что второй классификатор отличается от двух других.
Дисперсионный анализ позволяет нам установить, действительно ли средние оценки всех классификаторов одинаковы в пределах ошибки. Функция в R, позволяющая проводить однофакторный дисперсионный анализ (
oneway.test) требует данных в ином формате, а именно — данные должны составлять один вектор, а во второй должен быть фактором, описывающим классификаторов или категорию (иными словами в одном столбце должны быть все оценки классификаторов, а во втором — указание, какая оценка какому классификатору принадлежит). Команда stack() сделает это преобразование:> scores = stack(scores)
> names(scores)
[1] "values" "ind"Посмотрев на имена векторов (names), мы узнали, что значения собраны в переменной «values», а категории — в переменной «ind». Чтобы вызвать
oneway.test(), мы должны воспользоваться такой же записью, какая применяется в формулах:> oneway.test(values ~ ind, data=scores, var.equal=T)
One-way analysis of means
data: values and ind
F = 1.1308, num df = 2, denom df = 21, p-value = 0.3417Мы видим, что p = 0.34, а это значит, что мы принимаем нулевую гипотезу о равенстве средних. Более детальную информацию об анализе можно получить, воспользовавшись функциями
anova() и aov(). Дополнение из книги Paul TEETOR. R Cookbook.
Итак, вы узнали, что есть значимые отличия в средних, относящихся к разным группам. Однако сам по себе тест не показывает, какие именно группы отличаются.
Функция
TukeyHSD() позволяет посчитать эти отличия и указывает вам на самые большие из них. В ней реализован т. н. метод «по-честному значимых отличий» («honest significant differences»), предложенный Джоном ТЬЮКИ.Выполнение дисперсионного анализа функцией
aov() даёт результаты, к которым применяют функцию TukeyHSD(): > TukeyHSD(aov(x ~ f))Здесь x — это ваши данные, а f — группирующий их фактор. Вы можете визуализировать результаты для наглядности:
> plot(TukeyHSD(m))Тест Краскела–Уоллиса
Тест Краскела–Уоллиса является непараметрическим тестом, используемым вместо однофакторного дисперсионного анализа в том случае, если данные не распределены нормально. Его применяют подобно тому, как тест Вилкоксона вместо t-теста.
Тест Краскела–Уоллиса используется в R подобно команде
oneway.test: > kruskal.test(values ~ ind, data=scores)
Kruskal-Wallis rank sum test
data: values by ind
Kruskal-Wallis chi-squared = 1.9387, df = 2, p-value = 0.3793 Читать далее
Мітки:
дисперсионный анализ,
учебник по R,
ANOVA,
R manual,
RU
Підписатися на:
Дописи (Atom)


