Показ дописів із міткою social networks. Показати всі дописи
Показ дописів із міткою social networks. Показати всі дописи

4 лист. 2012 р.

Бизнес-сети на рынке

Эта заметка — о данных, собранных ушедшим другом. В то время, в 2010 г., был сложный для нас период: не выдержав нагрузки у меня в организаци­и, он покинул её (что, в общем-то, поставило под удар два тогдашних проекта... ну да ладно — справились­) и создал свою. Её деятельнос­ть началась с исследован­ия горловских­ предприним­ателей. Часть дизайна этого исследован­ия один в один воспроизво­дила нашу предыдущую­ работу. В целом, это было развитие нашей идеи сравнить структуры двух сообществ:­ стигматизи­рованного и нестигмати­зированног­о.

Гипотеза была такова: первое сообщество, мужчины, имеющие секс с мужчинами (МСМ), загнанное в тень, вынуждено поддержива­ть свою целостност­ь единственн­о доступным способом — коллекцион­ируя контакты друг друга, т. е. быть в известной степени подобным сицилийско­й мафии. Второе, частные предприним­атели, торгующие на рынке, имея только одного естественн­ого врага — фискальные­ органы государств­а — и не испытывая необходимо­сти стыдиться себя («торгаш» — тоже стигма, но сила её воздействи­я значительн­о меньше, чем клеймо гомосексуа­льности), будет более разобщённы­м на бытовом уровне.

Целостност­ь / сплочённос­ть может проявлятьс­я по-разному. С одной стороны, сплочённос­ть выступает как наличие субъективн­о важных контактов с другими членами своего коллектива­ / общины / сообщества­. С другой — это способност­ь выступить единым фронтом против общего врага.

С такой точки зрения МСМ и предприниматели ведут себя по-разному. МСМ разобщены территориально, но их взаимные связи образуют целостную систему. К сожалению, обусловливающая это стигма одновременно разрушает «боевой» потенциал группы — ведь для совместных действий нужно выйти из уютной тени, заявить о себе и подвергнуться, как минимум, осуждению окружающих.

В отличие от МСМ, торгующие на рынке предприниматели близки территориально (они каждый день находятся на чётко выделенной части города), пребывают на виду. У них нет особой нужды знать телефоны всех своих соседей по рынку — в случае совсем уж острой необходимости они могут увидеться лично в соседнем ряду. В то же время, они легко сплачиваются в протестах — напр., из-за ликвидации рынка городскими властями или против нового Налогового кодекса.

Когда мы просим респондентов указать своих партнёров, пользуясь «телефонной книгой» своих мобильных, мы фиксируем только один из двух указанных аспектов — наличие субъективно важных контактов, но совершенно упускаем из виду те повседневные связи, которые проистекают из территориальной общности. Соответственно, полученная сетевая структура ничего не говорит о «боевом» потенциале группы. В этом состоит ограничение методики.

Сопоставление двух сетей — МСМ Донецка и ФЛП на рынках Горловки станет предметом одной из следующих публикаций. Цель нынешней, как указано выше, — проанализировать данные только о социальных связях бизнес-партнёров на рынке.

Очень печально, но в отчёте самого РЦСИ «Праксис» упущено очень много деталей, а та база, которую в своё время мне прислал её автор Евгений ЛЕЩИНСКИЙ, не содержит расшифровки категорий вопросов об организационно-правовом статусе опрошенных (ФЛП на едином налоге, на общей системе налогообложения, с наёмными сотрудниками или без таковых...) и о виде деятельности (продукты питания, одежда, канцелярия и т. п.). Поэтому в нашем распоряжении сейчас только такие данные:

– описание методики рекрутинга;
– список связей 50 ФЛП двух горловских рынков;
– пол и возраст узлов сети.

Попытаемся, всё же, пользуясь этой более чем скупой информацией, разобраться в вопросе о связанных в 2010 г. с структурой социальной сети ФЛП рынков г. Горловки факторах.

Методика рекрутинга (воспроизводится по отчёту) — «снежный ком», что подразумевает опрос одного информанта и просьбу порекомендовать 3–5 своих знакомых для проведения аналогичного опроса. Так процедура повторяется до тех пор пока не будет опрошено заданное количество респондентов.

После того, как интервьюер объяснил суть задачи и получил от респондента информированное согласие, опрашиваемому предлагалось самостоятельно составить список всех друзей и знакомых, с которыми он взаимодействует в рамках своего бизнеса.

Социо-демографические характеристики совокупности (воспроизводятся по отчёту): опрошено 50 человек, преобладают мужчины (64%) и люди в возрасте от 30 до 49 лет. Средний заработок составляет 2100 грн. в месяц (минимум 500 грн., максимум — 6000 грн.). Подавляющее большинство ФЛП заняты в сфере торговли промышленными товарами. Наёмный труд используется каждым восьмым предпринимателем, при этом максимальное количество наёмных работников составляет 3 человека.

Высшее образование имеет лишь каждый восьмой. При этом все торгующие продовольствием имеют высшее образование, а в самой большой группе — торговля промышленными товарами — высшее образование имеют лишь 12%, большинство же является выпускниками техникумов.

В 92% случаев частные предприниматели не имеют отдельного административного помещения и всю финансово-административную деятельность ведут на территории своей торговой точки. Наиболее распространённым видом коммуникации в среде ФЛП остается мобильный телефон.

Согласно полученным результатам, треть респондентов оценила свой уровень владения ПК как «самый низкий». Еще 30% респондентов оценили свой уровень знаний в этом вопросе как средний. Отмечается дисбаланс по полу в самооценках уровня знаний: у мужчин преобладает средний уровень, у женщин — низкий уровень.

Что же касается характеристик всех узлов (50 респондентов указали на 330 своих бизнес-партнёров), то оно в целом не отличается от описанных: 64% мужчин; люди в возрасте от 20 до 29 лет составляют 22%, 30–39 лет — 37%, 40–49 лет — 29%, а 12% относится к группе 50 лет и старше.

Структура сети изображена на рисунке (розовые — респонденты, синие — их коллеги, которые в опросе не участвовали).


Она включает в себя 380 узлов, соединённых 367 связями. Плотность (отношение существующего числа связей к теоретически возможному) составляет 0.005 — сеть весьма разрежена.

Следует отметить, что несмотря на использование «снежного кома» при рекрутинге, сеть оказалась несвязной, разбитой на 23 отдельных компонента, наименьший из которых есть один изолированный узел, а наибольшие объединяют 31, 40 и 145 человек. На наш взгляд, это вполне согласуется со сформулированным выше ограничением — наличие знакомства с другими предпринимателями на рынке вовсе не означает, что контакты этих людей будут записаны в телефон респондента.

Поскольку в массиве преобладают мужчины, постольку бОльшая часть связей (52%) соединяет двух мужчин:

Пол партнёровмужчинаженщина
мужчина192 связи
женщина99 связей76 связей
С т. з. возраста преобладают связи между 30- и 40-летними (18%), на втором месте связи двух тридцатилетних и между 20- и 30-летними (по 15%). Реже всего встречаются партнёры с большой разницей в возрасте или связи между двумя людьми в возрасте 50 лет и старше:

Возраст партнёров, лет20–2930–3940–3450+
20–2921 связь
30–3951 связь51 связь
40–4932 связи64 связи49 связей
50+13 связей27 связей32 связи9 связей
Распределение степеней центральности (т. е. количества связей у каждого узла) весьма далеко от нормального — преобладают узлы с центральностью 1, что обусловлено методикой формирования массива сетевых данных (мы ничего не знаем о связях нереспондентов).

Факторы, ассоциированные со структурой, определялись моделированием. Т. к. предикторов немного, то все они (образование полностью гетерогенной по возрасту и полу связи, центральность узла равная единице, гомофилия по статусу респондент–нереспондент, полу и возрасту) были включены в тестируемую модель. Результаты приведены в таблице.

ФакторlnORSEp-Значение
Образование гетерогенной по всем параметрам связи-3.40.2<0.001
Центральность узла равна 14.30.3<0.001
Гомофилия по статусу респондент–нереспондент-3.30.2<0.001
Гомофилия по возрасту
20–29 лет0.60.20.01
30–39 лет0.20.10.12
40–49 лет0.60.2<0.001
50+ лет0.50.30.18
Гомофилия по полу
мужчина0.80.1<0.001
женщина1.00.2<0.001


Полученная модель, в целом, неплохо воспроизводит наблюдаемую структуру сети, хотя даёт несколько больше связей мужчина–мужчина и больший размер самого крупного компонента, чем нужно.


Из коэффициентов полученной модели можно заключить, что несмотря на количественное преобладание в массиве 30-летних и мужчин, бОльшую склонность к образованию однородных соответственно по возрасту и полу связей демонстрируют 40-летние ФЛП и ФЛП-женщины. Вероятность образования связи между людьми, отличающимися по обоим этим параметрам, невелика — exp(-3.4)/(1+exp(-3.4)) = 0.03. Низкое значение общей гомофилии по статусу респондент–нереспондент согласуется с разбитостью сети на два десятка отдельных компонентов.

Как было указано выше, скупой набор измеренных и доступных сейчас параметров не позволяет найти объяснение полученным закономерностям, исходя из результатов самого исследования. Однако мы можем воспользоваться опытом своей повседневности.

К 40 годам жизнь (и деловые связи, в частности) стабилизируется, для людей становится важной предсказуемость будущего, соответственно 40-летние ФЛП «обрастают» кругом таких же постоянных и проверенных годами бизнес-партнёров.

Что касается несколько бОльшей склонности ФЛП-женщин образовывать связи с другими женщинами, то этот результат, как будто бы, противоречит известной из литературы бОльшей гомосоциальности мужчин. Вместе с тем, поскольку речь идёт о бизнес-контактах в 2010 г., т. е. до реформы Налогового кодекса, то можно предположить, что меньшая гомофильность по полу ФЛП-мужчин связана с существовавшим способом ведения дела: мужчина-хозяин точки ради минимизации налоговых отчислений делал своих реализаторов (преимущественно женщин) тоже частными предпринимателями. Вполне естественно, что у хозяина точки в телефоне есть номера его сотрудников-реализаторов, т. е. ФЛП низшего порядка. У реализаторов (как правило, женщин), соответственно, могут быть телефоны друг друга для того, чтобы в случае нехватки на точке какого-то товара из обычного ассортимента (напр., подходящего размера одежды) быстро уточнить его наличие у коллеги и, т. о., всё-таки не потерять клиента.

В целом, проведённая работа даёт представление о структуре социальной сети территориально-компактного профессионального сообщества. Её результаты, на самом общем уровне будут использованы для сравнения со структурами, которые образуют местные совокупности МСМ.

Читать далее

2 лист. 2012 р.

Сексуальная сеть МСМ г. Мариуполя

В 2010 г. мы опросили 100 МСМ г. Мариуполя. Среди прочего, в опросе фигурировал сетевой блок (такой же, как описан в http://donbas-socproject.blogspot.com/2012/10/blog-post_30.html), одним из вопросов которого был «У Вас был секс с ... в течение последнего перед опросом года?». На картинке — визуализация ответов: сексуальная сеть МСМ (розовеньким обозначены респонденты, синим — их знакомые, которых мы не опрашивали). Картинка забавная. Есть и большой связный компонент с героем-любовником, и треугольники, и общие партнёры... Пока анализ в деталях не даю. Просто полюбуйтесь.


Читать далее

25 жовт. 2012 р.

Упражнения­ по экспоненци­альному моделирова­нию случайных графов на примере флирта в сериале Grey’s Anatomy

Перевод поста http://badhessian.org/lessons-on-exponential-random-graph-modeling-from-greys-anatomy-hook-ups/

Я недавно нашёл прекрасный­ пост Gary Weissman’а Grey’s Anatomy Network of Sexual Relations (перевод на русский тут) и вдохновилс­я им. Для тех, кто ничего не слышал об этом телесериал­е, сообщаю, что он чрезвычайн­о популярен,­ отмечен наградами как лучшая медицинска­я драма, транслируе­мая ABC. Идя навстречу ожиданиям зрителей, шоу регулярно показывает­, как его герои флиртуют друг с другом.

Пытаясь дать студентам-медикам ряд простейших­ концепций анализа социальных­ сетей, Weissman создал набор сетевых данных о сексуальны­х контактах героев этого сериала. Хотя я особо не интересуюс­ь ни этим шоу, а сексуальны­е или воображаем­ые сети лежат вдали от моих исследовательских интересов,­ пост Weissman’а мне кажется отличной демонстрац­ией анализа социальных­ сетей в педагогиче­ских целях.

Я бы хотел, ради развлечения, вернуться к этим данным и рассмотреть их с помощью экспоненциального моделирования случайных графов (ERGM) в аспекте образования связей. Прежде чем я продолжу, я бы хотел сказать, что самые лучшие пособия по ERGM созданы их авторами и доступны на сайте. Моим любимым пособием из-за его прикладной направленности является серия презентаций на февральской конференции Sunbelt Workshop 2011 г. Если вы всерьёз настроены изучить ERGM, то указанные публикации должны стать вашими настольными книгами. Тем не менее, я думаю, что существует та аудитория, которая с бОльшим восторгом наблюдает за приключениями сексуальных врачей на телевидении, чем читает о брачных сетях во Флоренции 16 века.

Экспоненциальные модели случайных графов являются способом понять процесс возникновения сетевой структуры, процесс образования в ней сетей. В нашем примере «образование сетей» и «снять потрахаться» являются синонимами. Эти модели работают, измеряя некий набор известных сетевых характеристик и используя распределение их значений для генерации случайных сетей. Такие случайные сети затем сравниваются с сетью наблюдаемой, чтобы оценить правдоподобие модели. Хорошие ERG-модели продуцируют сети, изоморфно похожие на наблюдаемую сеть, и пользуются небольшим набором характеристик. Плохие ERG-модели продуцируют сети, которые слабо похожи на наблюдаемую сеть, но при этом используется много ненужных характеристик.

Какими характеристикам следует пользоваться? Число рёбер (т. е. «связей», «отношений») является одной из самых важных. Если мы занимаемся образованием связи, то очень важно знать число этих связей. Кроме того, в посте Weissman’а некоторые комментаторы упоминали важность пола персонажей или, к примеру, их должность в больнице. Узлы (т. е., «акторы», «вершины») могут иногда характеризоваться атрибутами, такими как пол, возраст, должность или астрологический знак. При моделировании сети можно использовать атрибуты узлов, чтобы оценить такие ассортативные эффекты как общая гомофилия («Спят ли члены больничных коллективов с сотрудниками, занимающими такие же должности?»), дифференциальная гомофилия («Спят ли штатные врачи с другими такими же? Делают ли они это чаще, чем интерны с другими интернами?») и ассортативное смешивание («Do resident-attending couples occur more frequently than we’d expect vis-à-vis nurse-attending couples?»). Можно анализировать и другие свойства сетей, но это зависит от доступности данных, типа анализируемой сети (направленная, ненаправленная, бимодальная), а также от сходимости модели.

Использованные здесь данные восходят к тем, которые Weissman сделал доступными. Я добавил узлы и рёбра по информации, найденной при просмотре Wikipedia. Я включал лишь те персонажи, которые переспали с одним или несколькими другими персонажами в сериале. Я также добавил такие атрибуты, как пол персонажа, расу, должность в больнице, приблизительный возраст, номер сезона, в котором он появился, и астрологический знак, под которым родился актёр. Я собрал эти атрибуты из Wikipedia и IMDB. Для простоты я кодировал расу каждого персонажа как чёрный (black), белый (white) или другой (other). Хотя я не люблю рассматривать расу именно в этих терминах, однако число персонажей и их разнообразие невелико, чтобы вдаваться в нюансы этого вопроса. Что касается приблизительного возраста персонажей, то я пользовался возрастом актёров, их играющих, а в двух случаях мне пришлось самому сделать предположения. Как у Weissman’а, нынешние данные, вероятно, не содержат какой-то информации об отношениях, узлах, упрощают описание персонажей и их взаимоотношений.

Для начала откройте R-терминал. Установите и загрузите пакеты ergm и RCurl, если вы не сделали этого раньше.

install.packages("RCurl"); install.packages("ergm")

library(RCurl); library(ergm)


Пакет RCurl будет использован для того, чтобы загрузить данные из моего файла на Google Docs. Пакет ergm включает несколько других пакетов, таких как network, поскольку ERGM использует объекты, созданные последним.

Далее, прочтите данные и создайте объект класса network.

#First, read in the sociomatrix

ga.mat<-getURL("https://docs.google.com/spreadsheet/pub?key=0Ai--oOZQWBHSdDE3Ynp2cThMamg1b0VhbEs0al9zV0E&single=true&gid=0&output=txt",ssl.verifypeer = FALSE)


ga.mat<-as.matrix(read.table(textConnection(ga.mat), sep="\t",header=T, row.names=1, quote="\""))

#Second, read in the network attributes

ga.atts<-getURL("https://docs.google.com/spreadsheet/pub?key=0Ai--oOZQWBHSdDE3Ynp2cThMamg1b0VhbEs0al9zV0E&single=true&gid=1&output=txt",ssl.verifypeer=FALSE)


ga.atts<-read.table(textConnection(ga.atts), sep="\t", header=T, quote="\"",stringsAsFactors=F, strip.white=T, as.is=T)

#Third, create a network object using the sociomatrix and its corresponding attributes

ga.net<-network(ga.mat,vertex.attr=ga.atts,vertex.attrnames=colnames(ga.atts),directed=F,hyper=F,loops=F,multiple=F,bipartite=F)


Теперь, когда вы получили данные, мы можем поиграть с ними. Прежде чем перейти к моделированию, давайте посмотрим на схему сети, отметив розовым цветом узлы, означающие женщин, и голубым — мужчин.

plot(ga.net,vertex.col=c("blue","pink")[1+(get.vertex.attribute(ga.net,"sex")=="F")],label=get.vertex.attribute(ga.net,"name"), label.cex=.75)

Расположение узлов на вашем рисунке может несколько отличаться. Здесь то, что получилось у меня:



Следует отметить несколько интересных особенностей этой сети.

Во-1, с точки зрения связности у нас есть большой связный компонент,но в целом граф поделён на четыре отдельных компонента. Если бы шоу продолжалось без появления новых персонажей, я бы думал, что один из самых маленьких компонентов должен бы «соединиться» с самым большим компонентом.

Во-2, большая часть сексуальных отношений в сериале суть гетеросексуальны. Только два ребра (torres-arizona и torres-hahn) были однополыми. По всей видимости, здесь нет нечётно-численных циклов: в сексуальных сетях циклы из трёх, пяти, семи и др. элементов содержат как минимум одну однополую связь внутри цикла.

В-3, в отражение способа построения выборки сеть не содержит сексуально-одиноких изолятов. Минимальная степень (число связей, падающих на узел) равна единице. В-четвёртых, сеть оказывается уязвимой перед табу «бывший бывшей бывшего». В одном из исследований сексуальных сетей учёные обнаружили запрет на создание пары с бывшим партнёром бывшего партнёра бывшего партнёра из-за возможных осложнений. Кажется, что здесь есть как минимум три цикла, отвечающих критериям этого табу. Вместе с тем, также хорошо известно, что нежелательные последствия, возникающие от сексуальных отношений с другими, делают шоу правдоподобным.

Давайте начнём наш формальный анализ с базовой модели, которая включает только число рёбер и, как второй предиктор, nodematch("sex"), который схватывает гетеросексуальную тенденцию сети.

ga.base<-ergm(ga.net~edges+nodematch("sex")) #Estimate the model summary(ga.base) #Summarize the model

Вот выдача команды summary(ga.base):

==========­==========­======
Summary of model fit
==========­==========­======

Formula: ga.net ~ edges + nodematch(“sex”)

Iterations: 20

Monte Carlo MLE Results:

Estimate Std. Error MCMC % p-value

edges -2.3003 0.1581 NA <1e -04="-04" -3.1399="-3.1399" 0.001="0.001" 0.01="0.01" 0.05="0.05" 0.1="0.1" 0.7260="0.7260" 0="0" 1311.43="1311.43" 1="1" 2="2" 320.47="320.47" 324.47="324.47" 334.17="334.17" 944="944" 946="946" 990.97="990.97" aic:="aic:" bic:="bic:" code="code" codes:="codes:" degrees="degrees" deviance:="deviance:" e-04="e-04" freedom="freedom" na="na" nodematch.sex="nodematch.sex" null="null" of="of" on="on" residual="residual" signif.="signif."


В согласии с ожиданиями число рёбер и гетеросексуальность суть значимые предикторы образования связей, поскольку p-значение существенно меньше, чем условный уровень значимости 0.05. Колонка «MCMC%» слева указана как пропущенная (NA), поскольку эта модель не требует оценки марковских цепей по методу Монте-Карло. Коэффициенты, −2.30 и −3.14, показывают условные логарифмы шансов (log-odds), таким образом логарифмы шансов того, что два персонажа вступили в сексуальные отношения, равны (-2.30)*увеличение числа связей на единицу + (-3.14)*увеличение числа однополых отношений. Логарифм шансов того, что одна гетеросексуальная связь образуется внутри сети, равен −2.30, что даёт её вероятность exp(-2.30)/(1+exp(-2.30)) = 0.09. Аналогично, логарифм шанса образования гомосексуальной связиравен −2.30-3.14 = 5.44, что соответствует вероятности 0.004 = exp(-5.44)/(1+exp(-5.44)).

Давайте посмотрим, какую случайную, расчётную сеть эта модель могла бы создать.

plot(simulate(ga.base),vertex.col=c("blue","pink")[1+(get.vertex.attribute(ga.net,"sex")=="F")])

Ваша картинка может несколько отличаться от того, что получилось у меня:


Эта сеть точно отражает как число рёбер, так и склонность к образованию гетеросексуальных связей, однако здесь не всё в порядке: некоторые из наших узлов суть изоляты. Иными словами, расчёт предсказывает существование в сети сексуально-воздерживающихся индивидов. Поскольку никаких таких людей в нашей реальной сети нет из-за особенностей формирования выборки, построенная модель неудовлетворительна.

Хотя у нас есть значения критерия согласия (goodness of fit), данного функцией правдоподобия, один обычный, систематический способ определения критерия согласия — это сравнение параметров немоделированной, наблюдаемой сети с такими же параметрами рассчитанных ERGM сетей.

ga.base.gof<-gof(ga.base)

summary(ga.base.gof) #Summarize the goodness of fit

par(mfrow=c(3,1)); plot(ga.base.gof) #Plot three windows. It's OK to ignore the warning.


Рисунок воспризводит ту же информацию, которую выдаёт команда summary(). p-Значения в правых колонках суть вероятности того, что рассчитанные сети точно совпадают с сетью наблюдаемой в ряду данных параметров. Мы видим, что в терминах of the edgewise shared partner and minimum geodesic distance measurements represent the data quite well. Однако, если мы посмотрим на такой параметр как центральность, то увидим то, что согласуется с нашими выводами из рисунков — число воздерживающихся изолятов (узлов с центральностью 0) больше, чем нужно, число узлов с центральностью 1 (моногамистов) — меньше, и что нет оценок для узлов с центральностью 3 и 9.

Мы сейчас добавим в модель параметр, контролирующий эффект моногамии (центральность 1).

ga.base.d1<-ergm(ga.net~edges+nodematch("sex")+degree(1)) summary(ga.base.d1) plot(simulate(ga.base.d1),vertex.col=c("blue","pink")[1+(get.vertex.attribute(ga.net,"sex")=="F")]) ga.base.d1.gof<-gof(ga.base.d1); summary(ga.base.d1.gof) par(mfrow=c(3,1)); plot(ga.base.d1.gof)

Если принять значение BIC предыдущей модели 334.17 как исходное, то мы увидим, что модель ga.base.d1 лучше — её BIC равен 316.56. Эффект моногамии также является статистически значимым. Рисунок демонстрирует меньше изолятов, что подтверждает команда gof(). Судя по значениям критерия согласия, модель кажется разумным приближением к реальности, если не принимать во внимание персонаж шоу с девятью сексуальными партнёрами.

В отличие от предыдущей модели, эта использует методику оценки марковских цепей (MCMC). Мы можем оценить результаты MCMC.

mcmc.diagnostics(ga.base.d1)

В выводе следует сначала глянуть на второй пункт, в котором сравниваются параметры расчётной и наблюдаемой моделей.

Are sample statistics significantly different from observed?

edges nodematch.sex degree1 Overall (Chi^2)

diff. -0.0968000 0.0232000 0.0534000 NA
test stat. -0.2942081 0.8328180 0.3379779 1.086016
P-val. 0.7685989 0.4049474 0.7353798 0.780451


Вроде бы всё в порядке: рассчитанные при помощи MCMC графы значимо не отличаются от наблюдаемого. Давайте посмотрим по-другому:

Sample statistics auto-correlation:
Chain 1

edges nodematch.sex degree1

Lag 0 1.0000000 1.00000000 1.0000000
Lag 100 0.8476292 0.47956824 0.7334256
Lag 200 0.7332856 0.26641687 0.6116231
Lag 300 0.6371281 0.17109432 0.5198955
Lag 400 0.5587029 0.12489565 0.4480439
Lag 500 0.4883954 0.08496445 0.3860807

Sample statistics burn-in diagnostic (Geweke):
Chain 1

Fraction in 1st window = 0.1
Fraction in 2nd window = 0.5

edges nodematch.sex degree1

-1.590 -1.068 1.372

P-values (lower = worse):

edges nodematch.sex degree1

0.1117691 0.2856841 0.1701817


В целом, нет ничего подозрительного в результатах диагностики MCMC. Параметр автокорелляции между лагами несколько больше, чем предпочитаемый мною (лаги должны быть ближе к нулю и дальше от единицы, за исключением нулевого лага). Кроме того, статистика Geweke, приблизительно соответствующая z-статистике, когда её p-значения незначимы, должна быть значительно ближе к нулю. К счастью, мы можем так изменить некоторые параметры по умолчанию в MCMC для того, чтобы получить более приемлемый результат.

ga.base.d1<-ergm(ga.net~edges+nodematch("sex")+degree(1),control=control.ergm(MCMC.burnin=50000, MCMC.interval=5000))

При увеличении MCMC.burnin с 10,000 (по умолчанию) до 50,000 должен уменьшаться параметр Geweke. При увеличении MCMC.interval со 100 (по умолчанию) до 5000 должна уменьшаться автокорреляция между лагами. Если бы параметры нашего расчётного образца действительно значимо отличались от наблюдаемых, мы бы увеличили размер выборки в MCMC с 10,000 (по умолчанию) до 20,000 или даже 50,000.

ga.base.d1<-ergm(ga.net~edges+nodematch("sex")+degree(1),control=control.ergm(MCMC.burnin=50000,MCMC.interval=5000, MCMC.samplesize=50000))

Нам следовало бы поупражняться в увеличении этих параметров MCMC, но это может резко увеличить время расчётов.

summary(ga.base.d1) #The figures are mostly the same

mcmc.diagnostics(ga.base.d1)

Ура! MCMC диагностика заметно улучшилась, что указывает на большую жёсткость нашей последней модели.

Теперь, когда мы понимаем чуть больше, как оценивать качество модели, мы можем вернуться к интригующему вопросу секса! Только что мы моделировали сеть по числу рёбер, склонности к гетеросексуальности и по моногамии, но могут ли другие аспекты привнести смысл в анализ? Я бы предложил начать с возраста, поскольку большинство любовных связей возникают между сверстниками.

ga.base.d1.age<-ergm(ga.net~edges+nodematch("sex")+degree(1)+absdiff("birthyear"),control=control.ergm(MCMC.burnin=50000, MCMC.interval=5000))

summary(ga.base.d1.age)

mcmc.diagnostics(ga.base.d1.age)

summary(gof(ga.base.d1.age))

Кажется, модель ощутимо улучшилась! Значение BIC снизилось с 316.56 до 297.51, MCMC-диагностика выглядит хорошо, значение критерия согласия выглядит, в целом, разумным, а разница в возрасте значима и отрицательна, что указывает на то, что чем больше разница в возрасе акторов, тем меньше шансы у них флиртовать друг с другом.

Наконец, давайте рассмотрим ассортативность с точки зрения группировки по расам. Предыдущие исследования юношеских сексуальных и любовных сетей открыли такую ассортативность. Создательница сериала, Shonda Rhimes, сознательно построила отбор актёров так, чтобы представить расовое разнообразие. Поскольку шоу включает ряд афроамериканских (наряду с обилием других не-белых) персонажей, можно попытаться установить, привело ли такое разнообразие при отборе персонажей к расовому разнообразию в сексуальных отношениях. Для начала, давайте попробуем построить модель общей гомофилии по расе.

ga.base.d1.age.race<-ergm(ga.net~edges+nodematch("sex")+degree(1)+absdiff("birthyear")+nodematch("race"),control=control.ergm(MCMC.burnin=50000,MCMC.interval=5000))

summary(ga.base.d1.age.race)

mcmc.diagnostics(ga.base.d1.age.race)

summary(gof(ga.base.d1.age.race))

Мы в самом деле нашли эффект расового отбора, предполагающий, что образование связи более вероятно между персонажами одной и той же расы. В этом шоу сексуальные отношения являются скорее внутри-, нежели межрасовыми по сравнению с тем, что было бы, если бы персонажи разных рас комбинировались совершенно случайно. MCMC-диагностика выглядит хорошо, а измерения критерия согласия в пределах разумного. Хотя полученная модель выглядит хорошо по многим индикаторам, но заметно небольшое увеличение BIC (298.21) по сравнению с предыдущей моделью (297.51). Если бы нам были интересны только параметры сети, то предыдущая модель даёт лучшие значения.

Но возможно, что белые персонажи проявляют большую гомофилию, а чёрные — меньшую? Или наоборот? Мы можем посмотреть на это как на дифференциальную гомофилию. В модель добавляем параметр diff=T к слагаемому nodematch("races").

ga.base.d1.age.racediff<-ergm(ga.net ~ edges + nodematch("sex") + degree(1) +absdiff("birthyear") + nodematch("race", diff=T), control=control.ergm(MCMC.burnin=50000,MCMC.interval=5000))

summary(ga.base.d1.age.racediff)

Хотя мы можем моделировать дифференциальную гомофилию, ergm() не смог интерпретировать категорию «other», поскольку в наблюдаемой сети нет сексуальных отношений между латиноамериканцами и азиатоамериканцами. ergm() указывает на эту сложность следующей фразой:

Observed statistic(s) nodematch.race.Other are at their smallest attainable values. Their coefficients will be fixed at -Inf.

Аналогично, the AIC, BIC, отклонение и эффекты nodematch.race.Other помечены как NA в summary. Давайте попробуем создать новую модель, исключив гомофилию между латиноамериканцами и азиатоамериканцами. Чтобы это сделать, мы включаем параметр keep=c(1,3) в слагаемое nodematch("race"), поскольку «Black» и «White» были первой и третьей категориями, перечисленными в summary(ga.base.d1.age.racediff).

ga.base.d1.age.racediff<-ergm(ga.net~edges+nodematch("sex")+degree(1)+absdiff("birthyear")+nodematch("race", diff=T, keep=c(1,3)),control=control.ergm(MCMC.burnin=50000, MCMC.interval=5000))

summary(ga.base.d1.age.racediff)

mcmc.diagnostics(ga.base.d1.age.racediff)

summary(gof(ga.base.d1.age.racediff))

Как и в предыдущей модели, мы видим значимую ассортативность по расовым группам в сериале. Как чёрные, так и белые персонажи проявляют склонность к расовой гомофилии бОльшую, чем можно было бы ждать, если бы выбор партнёра был случайным. Эта модель также указывает, что эффекты гомофилии сильнее среди афроамериканских персонажей (на это указывает более высокий коэффициент и меньшее p-значение при nodematch.race.Black по сравнению с nodematch.race.White term). Проверка MCMC-диагностики и статистик критерия согласия говорит, что полученная модель является хорошим отражением оригинальной сети. Вместе с тем, BIC ещё больше сдвигается к 300.73, указывая что модель менее экономна по сравнению с моделью общей гомофилии и модели с возрастом.

Давайте посмотрим на картинку.

plot(simulate(ga.base.d1.age.racediff),vertex.col=c("blue","pink")[1+(get.vertex.attribute(ga.net,"sex")=="F")])


Ваша может выглядеть несколько иначе, но в целом, кажется, эта модель воспроизводит оригинальные данные достаточно хорошо. Результат расчётов отличается наличием большого компонента, небольшим количеством изолятов (их даже может не быть), несколькими небольшими компонентами и, хотя отношения на ней преимущественно гетеросексуальны, мы видим четыре однополых связи (в оригинальных данных их было две).

Хотя число съёмов в сериале Grey’s Anatomy может казаться удивительным, в аспекте образования диад видно скорее традиционное восприятие сексуальных отношений: доминируют нормы моногамии, а бОльшая часть связей суть гетеросексуальны и соединяют пары близкого возраста и одной расы. Следует, однако отметить, что описанный анализ обошёл ряд альтернативных версий, которые могли бы лучше отразить свойства сети. Я приглашаю читателей самостоятельно поиграть с данными и с другими моделями. Несколько дополнительных примеров:

#Perhaps men and women have different tendencies to form sexual partnerships?

ga.base.d1.age.sex<-ergm(ga.net~edges+nodematch("sex")+degree(1) +absdiff("birthyear")+nodefactor("sex"), control=control.ergm(MCMC.burnin=100000, MCMC.interval=5000)) #Maybe less "traditional" than previously concluded?


#Perhaps you're interested in the assortative mixture among roles in the hospital?
#Resident-resident sexual contacts (28) are the reference group,
#and unobserved pairings between positions (3-5, 9, 12-15, 17-21, 24, 27) are omitted.

ga.base.d1.age.rolemix<-ergm(ga.net~edges+nodematch("sex")+degree(1)+absdiff("birthyear") +nodemix("position", base=c(3:5, 9, 12:15, 17:21, 24, 27, 28)), control=control.ergm(MCMC.burnin=50000, MCMC.interval=5000))


list.vertex.attributes(ga.net) #List the different vertex attributes in the network object

get.vertex.attribute(ga.net, "sign") #Provides each actor's astrological sign.

?ergm.terms #This command will provide a list of other terms that ergm() can model

?control.ergm #This command will present different options on the estimation methods.



Читать далее

31 жовт. 2011 р.

Введение в концепции сетевого анализа

На русском языке появился неплохой обзор работ в разнообразных сферах научного и прикладного знания, в которых применение концепции графов/сетей оказалась чрезвычайно плодотворным:

Евин И. А. Введение в теорию сложных сетей [Текст] // Компьютерные исследования и моделирование. — 2010. — Т. 2, No 2. — С. 121–141. — Режим доступа: http://crm.ics.org.ru/uploads/crmissues/crm2010-2-2/crm10201.pdf
Читать далее

28 жовт. 2011 р.

Учёные разработали метод организации «Twitter-революций»

Выпускники Массачусетского технологического института (MIT) с помощью методов сетевого маркетинга создали универсальный алгоритм мобилизации и координации действий больших групп людей через Twitter, другие блоги и социальные сети.

Такую технологию можно использовать как для спасательных операций, так и для организации действий политических активистов во время революции, говорится в статье, опубликованной в журнале Science.

В 2009 году американское агентство оборонных разработок DARPA объявило конкурс «Сетевой вызов», участники которого должны были разработать лучший метод для мобилизации и координации общественных действий по всей территории США.

Организаторы конкурса спрятали на континентальной территории США десять красных шаров-метеорологических зондов, запуск которых должны были зафиксировать участники «вызова».

Группа учёных под руководством Алекса ПЕНТЛАНДА из MIT решила эту проблему за девять часов после взлёта шаров.


Команда из четырёх человек обогнала другие группы участников из нескольких сотен человек, которые использовали менее эффективные методы сбора информации — альтруистические стратегии, связи и славу самых популярных пользователей социальной сети Twitter, а также сообщество пользователей в этой сети, увлекающихся геолокацией.

Секрет их успеха заключается в том, что за 36 часов до начала эксперимента исследователи собрали в микроблогах Twitter многотысячную армию добровольцев со всех уголков Соединенных Штатов при помощи механизма «обратного» стимулирования, который основывается на принципах сетевого маркетинга и финансовых пирамид.

ПЕНТЛАНД и его коллеги заранее объявили, что они потратят весь призовой фонд, 40 тысяч долларов, на вознаграждение не только тем, кто сообщил им о местонахождении красного шара, но и тем, кто был задействован в приглашении этих людей.

Авторы статьи оценили находку каждого зонда в 4 тысячи долларов, половину из которых получает сам «первооткрыватель», четвёртую часть — тот человек, который пригласил его в сетевую команду, 500 долларов — участник группы, пригласивший второго «пирамидчика» и так далее.

Таким образом, чем больше человек пригласил людей, тем больше у него было шансов получить некоторую долю призового «пирога» по цепочке его «последователей». Подобная структура пирамиды стимулирует её расширение на всех уровнях.

С одной стороны, участник старается приглашать новых участников сети самостоятельно, а не через своих последователей, из-за прямой финансовой выгоды. С другой стороны, он не препятствует росту дерева последователей, так как это в любом случае увеличивает его шансы на выигрыш.

Подобная стратегия позволила учёным собрать 845 «пирамид» из добровольных последователей, общая численность которых составила 4.5 тысячи пользователей. Самая широкая сеть содержала 602 пользователя, а самая «высокая» состояла из 14 уровней «пирамидчиков».

В половине случаев новые пользователи не покидали пирамиду и привлекали в неё других людей, хотя обычно этот показатель составляет 10-35%.

Затем исследователи проверили, влияет ли географическое положение пользователей на то, кого они приглашают в социальную пирамиду, и на успешность этих приглашений.

Авторы статьи измерили расстояния между пользователями при помощи LiveJournal и обнаружили, что люди прикладывали наибольшие усилия и достигали большего успеха в том случае, если они пытались привлечь своих друзей из удаленных от них городов США.

Таким образом, стратегия «обратного» стимулирования позволяет мобилизовать большое количество ранее незаинтересованных пользователей социальных сетей для решения сложных задач, требующих мобилизации и слаженных действий нескольких тысяч людей в практически неограниченных географических масштабах.

Источник: http://korrespondent.net/tech/science/1277042-uchenye-razrabotali-metod-organizacii-twitter-revolyucij

Читать далее

22 жовт. 2011 р.

Исследование: мировой экономикой управляет одна «суперкорпорация»

Специалисты университета в Цюрихе провели математический анализ связей 43 тысяч транснациональных корпораций и сделали вывод: миром правит одна гигантская «суперкорпорация». Именно она «дёргает за ниточки» всемирной экономики.

Учёные обнаружили ядро из 1318 компаний, связи которых с другими сложно назвать иначе как кровосмесительными. У каждой из этих 1318 обнаружились теснейшие взаимосвязи с двумя или более другими компаниями.

Большинство финансовых цепочек идут в направлении «суперанклава» из 147 компаний. Их активы пересекаются друг с другом, фактически являясь общей собственностью.

Чтобы смоделировать образ глобальной корпоративной системы, эксперты обработали гигантский массив данных, отражающих отношения собственности между крупнейшими транснациональными корпорациями, пишет New Scientist.

«Реальность настолько сложна, что мы должны были отойти от догм, будь то теории заговора или теории свободного рынка, — пояснил автор исследования, теоретик комплексных систем Джеймс ГЛАТТФЕЛЬДЕР. — Наш анализ основан на реальных данных».

Предыдущие исследования показали, что сравнительно небольшая группа компаний и банков владеет львиной долей мирового «экономического пирога», от которого всем остальным остаются лишь крохи. Однако эти исследования упустили из виду косвенные взаимосвязи — отношения корпораций с дочерними и аффилированными компаниями.

Отсортировав 37 млн компаний и инвесторов по всему миру, представленных в базе данных Orbis С от 2007 года, команда учёных из Цюриха отобрала 43060 компаний, принадлежащих транснациональным корпорациям, и выявила их общие активы.

Была выстроена модель распределения экономического влияния ТНК путём контроля одних компаний над другими: владение фондами, участие в прибыли и т. п.

Существует ядро из 1318 компаний, у каждой из них обнаружились теснейшие взаимосвязи с двумя или более другими компаниями (среднее количество аффилированных партнёров оказалось равно 20).

И хотя официальные доходы этих корпораций едва превышают 20% от общемировой операционной выручки, через свои фирмы-сателлиты они фактически владеют большинством мировых компаний, работающих в секторе «реальной» экономики. Таким образом, в щупальцах корпоративных монстров сосредоточены порядка 60% общемировых доходов.

Большинство из этих «суперкорпораций» являются финансовыми институтами. Так, в топ-10 вошли:

1. Barclays plc

2. Capital Group Companies Inc

3. FMR Corporation

4. AXA

5. State Street Corporation

6. JP Morgan Chase & Co

7. Legal & General Group plc

8. Vanguard Group Inc

9. UBS AG

10. Merrill Lynch & Co Inc

Исследователи отмечают, что протесты против глобального капитализма, развернувшиеся по всему миру под лозунгом «Захвати Уолл-стрит» — очевидная реакция на власть корпораций.

http://newsru.com/finance/20oct2011/global_capitalism.html

Читать далее

4 черв. 2011 р.

Социальные онлайн-сети не меняют способности человека общаться


В мае 2011 г. опубликована статья, посвящённая анализу онлайн-коммуникаций более чем 1 млн 700 тыс человек в Твиттере:

Gonalves B., Perra N., and Vespignani A. Validation of Dunbar’s number in Twitter conversations [Электронный ресурс] // arXiv. — 28.05.2011. — 8 p. — Режим доступа: http://arxiv.org/pdf/1105.5170

Материал наблюдений, собранный в течение полугода, позволяет сделать выводы об устойчивости теоретического когнитивного ограничения числа стабильных социальных отношений, известного как число Данбара.

Поддержание таких связей предполагает знание отличительных черт индивида, его характера, социального положения, что требует значительных интеллектуальных способностей. Лежит в диапазоне от 100 до 230, чаще всего считается равным 150.

Величина названа в честь английского антрополога Робина ДАНБАРА, который предложил его на основе данных, изначально полученных из наблюдений за приматами.

Стадные приматы отличаются сложным общественным поведением — активно строят отношения с другими членами стаи. ДАНБАР заметил зависимость между уровнем развития новой коры больших полушарий головного мозга и размером стаи у приматов.

На основании данных по 38 родам приматов он вывел математическую зависимость между развитием неокортекса и размером стаи, и, основываясь на оценке развития человеческого мозга, предложил оценку оптимального размера человеческого стада.

Для проверки своей теории ДАНБАР обратился к данным антропологии. Средние размеры деревень, традиционных поселений колеблются в предположенных им пределах. Кроме того, размеры неолитических поселений составляют до 200 человек.

Современные коммуникации в среде Интернет, несмотря на неограниченные географией возможности знакомства и общения, также не выходят за когнитивные и биологические границы «экономики внимания». Так, пользователи Твиттера могут поддерживать максимум 100–200 стабильных контактов с другими людьми, что вполне согласуется с числом Данбара.

Примечание:


Кроме описываемой статьи в этом посте использованы материалы Википедии.

Автор:

Читать далее

24 квіт. 2011 р.

Межличностные и социально-сетевые факторы, влияющие на общение мужчин-геев о незащищённом сексе

Interpersonal and social network influences on gay men’s communication about unprotected sex /
Anthony M A Smith, Jeffrey Grierson, David Wain, Marian Pitts and Phillipa Pattison // Int. J. STD AIDS. — 2006. — Vol. 17. — P. 267–270. — http://ijsa.rsmjournals.com/cgi/content/abstract/17/4/267

Новое исследование документирует модели, используемые мужчинами-геями при разговоре о незащищённом сексе.

Исследование выполнено на материале структурированных интервью (N = 206), в которых респондентов спрашивали об их социальных сетях. 167 мужчин, вступавших в незащищённый секс, указали на 1390 связей с другими людьми; 33% из них были связаны с обсуждением незащищённого полового акта. Дискуссии о незащищённом сексе были связаны с характером взаимоотношений (как с другим геем или лесбиянкой), с тем, как часто люди проводили время вместе (сексуальные или социальные контакты), и с тем, какова плотность социальной сети.

Авторы работы приходят к выводу, что социальные сети обеспечивает важный контекст для обеспечения безопасной культуры секса.

Читать далее

30 бер. 2011 р.

Сеть сексуальных контактов героев телесериала

Всё началось с вводной презентации об анализе социальных сетей для группы студентов-медиков. Что могло бы быть для них более захватывающим, если не разговор о привлекательных персонажах телевизионного сериала о жизни врачей? Эти персонажи по законам жанра не только говорят о медицине, но и влюбляются друг в друга, а потом, конечно, занимаются друг с другом сексом.

Просмотр сериала Grey’s Anatomy и изучение страниц поклонников сериала дали обширный, но, безусловно, отнюдь не исчерпывающий список связывающих персонажи этого шоу сексуальных контактов, который можно скачать http://www.babelgraph.org/data/ga_edgelist.csv.

library(igraph)
ga.data <- read.csv('ga_edgelist.csv', header=TRUE)

подключается библиотека igraph, записывается перечень связей между героями сериала;

g <- graph.data.frame(ga.data, directed=FALSE)
список связей преобразуется в нужный библиотеке igraph формат;

summary(g)
g$layout <- layout.fruchterman.reingold(g)

в атрибуты графа записывается информация о координатах узлов на будущих рисунках этого графа; эти координаты рассчитываются по алгоритму Fruchterman'а и Reingold'a. При всех последующих операциях взаимное расположение узлов на рисунке не будет меняться, что удобно для презентаций (библиотеки network и sna при каждой визуализации меняют рисунок).

plot(g)


Что мы можем сказать, глядя на рисунок, но не зная, кто именно изображён каждым узлом графа? С точки зрения общественного здоровья, если бы можно было протестировать только одного человека на наличие ИППП, кто им бы был? Если можно было бы предоставить консультацию и дать бесплатные презервативы только одному человеку, кто им бы был? Если бы было известно, что эпидемия распространяется в этой сети, то кто на кого именно нужно подействовать, чтобы остановить заразу?

Попробуем сделать визуализацию более интересной. Сначала уберём метки узлов, а затем изменим их размер так, чтобы он отражал степень центральности (degree centrality), т. е. число партнёров, связанных с каждым узлом. В контексте инфекций, передаваемых половым путём степень центральности будет обозначать количество людей, которые могли заразить данного конкретного человека или заразиться сами от него.

V(g)$label <- NA
удаляются метки узлов;

V(g)$size <- degree(g) * 2 plot(g)
переменным «размер узла» присваиваются значения соответствующей степени центральности, умноженные на 2.


Полученная схема показывает абсолютное число партнёров, но ничего не говорит об относительных позициях каждого узла в сети. Рассмотрим два типа центральности: близость (closeness) и посредничество (betweenness).

Близость — это усреднённый самый короткий путь от данного узла к любому другому узлу на графе. Большое значение близости свидетельствует, что данный узел легко достижим, если идти от большинства других узлов на графе, тогда как малое значение указывает на удалённость узла от большинства других узлов. Мы можем рассчитать центральность и затем преобразовать значения в цветовую схему для визуализации найденных различий:

clo <- closeness(g)
в вектор clo записываются значения «близости» каждого из узлов;

clo.score <- round( (clo-min(clo))*length(clo)/max(clo))+1

clo.colors <- rev(heat.colors(max(clo.score)))
создаётся вектор с перечнем цветов, в которые будут потом раскрашиваться узлы;

V(g)$color <- clo.colors[clo.score]
создаётся вектор атрибутов узла с именем color и этим атрибутам присваиваются значения цветов в зависимости от рассчитанных выше значений «близости»;

plot(g)


Как видно, на схеме есть как несколько узлов, окрашенных в красные, «горячие» тона, так и несколько в «холодных» тонах.

Далее мы сделаем то же самое, чтобы рассчитать показатель посредничества для каждого узла.

Посредничество — это число кратчайших путей в сети, проходящих через данный узел. Узлы с высоким показателем посредничества могут считаться привратниками — они контролируют самые короткие пути между другими узлами.

btw <- betweenness(g) btw.score <- round(btw) + 1 btw.colors <- rev(heat.colors(max(btw.score))) V(g)$color <- btw.colors[ btw.score ] plot(g)


Этот рисунок с указанием посредничества демонстрирует две ключевых фигуры в сети, по сравнению с анализом показателей близости.

Полезной техникой в анализе социальных сетей является использование алгоритмов нахождения сообществ. Тут мы воспользуемся алгоритмом Гирвана-Ньюмена (Girvan-Newman algorithm, http://en.wikipedia.org/wiki/Girvan%E2%80%93Newman_algorithm и http://www.pnas.org/content/99/12/7821), который нам поможет установить, из каких сообществ состоит граф.

gnc <- edge.betweenness.community(g, directed=FALSE) m <- vector() for (s in 0:nrow(gnc$merges) ) { memb <- community.to.membership(g,gnc$merge,steps=s)$membership m <- c(m,modularity (g, memb, weights=NULL)) } ideal_steps <- which(m==max(m)) - 1 plot(0:(length(m)-1),m, col="blue",xlab="Steps",ylab="Modularity") gn.groups <- community.to.membership(g,gnc$merge, steps=ideal_steps)$membership V(g)$color <- gn.groups V(g)$size <- 15 # reset to default size plot(g)



Сокращённый перевод материала: gary. Grey’s Anatomy Network of Sexual Relations [Электронный ресурс]. — Режим доступа: http://www.babelgraph.org/wp/?p=1

Читать далее

27 січ. 2011 р.

Две конференции

Украинское сообщество ЛГБТ-лидеров выработало хорошую традицию собираться на ежегодные конференции. Так, в 2011 году состоится уже IV Национальная конференция ЛГБТ-сообщества и МСМ-сервисных проектов.

Не менее замечательным становится то, что финансово и организационно поддерживают эти мероприятия не только международные доноры (такие как МБФ «Международный Альянс по ВИЧ/СПИДу в Украине» и USAID), но и местные ЛГБТ-организации (в 2010 г. коспонсором выступила ВОО «Гей-Альянс Украины», в нынешнем году — ВБО «Точка опоры» и ЛГБТ-центр «Донбас-СоцПроект», функции оргкомитета традиционно выполняет Постоянная референтая группа по вопросам ЛГБТ-движения и МСМ-сервиса в Украине).

Всё это способствует росту внутренней целостности сообщества, увеличению его организационного потенциала и выработке консолидированной позиции по целому ряду принципиальных общественно-политических вопросов.

Одним из видимых показателей описанного роста являются карты взаимных связей между ЛГБТ-лидерами.

В заявках на участие в конференциях был пункт «Предоставьте контакты тех людей (не больше трёх), которые могли бы Вас порекомендовать для участия в этой Конференции». Понятное дело, если я хочу принять участие в каком-то мероприятии, то я не стану выставлять в качестве рекомендателей тех людей, которые меня не знают или которые могут сказать обо мне какую-либо неблагожелательную информацию... Поэтому указанные аппликантами рекомендатели отражают связи по симпатии между лидерами сообщества и могут быть визуализированы как сеть.

Сравним сети аппликантов на II и III Национальные конференции (2009 и 2010 гг. соответственно).























Рис. 1 (2009 г.) демонстрирует, с одной стороны, достаточно рыхлую структуру — много изолированных узлов (тех, которые не связаны с большинством других людей), при этом, с другой стороны, видно несколько центральных узлов, контролирующих связи с прочими.

Через год ситуация существенно иная (рис. 2, 2010 г.) — количество изолированных узлов уменьшилось, а между узлами основного фрагмента появилось много взаимных связей. Структура стала плотной и децентрализованной.

Эти соображения подтверждаются и числами: централизация сети 2009 г. выше (0.166), чем сети 2010 г. (0.124).

Таким образом, даже самый поверхностный взгляд на структуру взаимных связей между украинскими ЛГБТ-лидерами указывает на происходящие внутри сообщества консолидационные процессы, что внушает оптимизм в отношении перспектив.
Автор:

Читать далее

19 груд. 2009 р.

Анализ социальных сетей: основные понятия



Нашёл замечательную статью (на англ.), в которой один из авторов пакетов для работы с сетевыми данными в R — Carter T. Butts — доступно излагает основные понятия и концепции сетевого анализа.

Butts C. T. Social network analysis: A methodological introduction // Asian J. Soc. Psychol. — 2008. — Vol.11. — P.13-41.



На русском языке такого рода пролегомены можно найти в диссертации и учебнике Галины Витальевны Градосельской.

Градосельская Г. В. Сетевые измерения в социологии: Уч. пос. — М.: Издат. дом «Новый учебник», 2004. — 244 с.

Читать далее

12 груд. 2009 р.

R для сетей: краткое руководство

Свободный перевод с сокращениями материала Hunter D. R for networks: A short tutorial [Электронный ресурс]. — Режим доступа: http://www.stat.psu.edu/~dhunter/Rnetworks/

Одной из наиболее важных особенностей языка R является его расширяемость. Много разных учёных создали пакеты для R и выложили их в открытом доступе (архив CRAN). Среди прочих там есть и пакет network, который можно установить, набрав в командной строке R (при подключённом интернете!)

>install.packages ('network')

После того, как пакет установлен, его следует запустить командой

>library(network)

Сеть данных

Рассмотрим небольшую часть огромной сети, состоящей из 10000 узлов, в котором рёбра означают (гетеро)сексуальные отношения между соответствующими узлами. Поскольку контакты женщина-женщина и мужчина-мужчина из этой сети убраны с целью её упрощения, рассматриваемую сеть можно считать бимодальной (т. е. такой, узлы в которой условно делятся на два подмножества, внутри которых нет рёбер). Все контакты (рёбра нашего графа) являются неориентированными. В начале этого моделирования 5 случайно выбранных «семян» (четверо белых мужчин и один чёрный мужчина) инфицированы какой-то гипотетической ЗППП, которая может со 100%-й вероятностью передаваться при контакте. В нашей модели есть только две расы, при этом пропорции полов и рас среди 10000 узлов сети были выбраны так, чтобы репрезентировать определённый набор данных. В конце моделирования, соответствовавшего 3600 дням, были инфицированы 256 узлов.

У каждого узла есть несколько связанных с ним атрибутов. Введём их в R помощью команды read.table:

>help(read.table) # Взгляните на варианты. Обратите внимание на значения по умолчанию.

>nodeinfo=read.table("http://www.stat.psu.edu/~dhunter/Rnetworks/nodal.attr.txt",head=T)


Мы можем использовать объект nodeinfo, который мы только-что создали, чтобы узнать характеристики этих акторов — но об этом позже. Для начала давайте взглянем на список рёбер в нашей сети:

>myedges=read.table("http://www.stat.psu.edu/~dhunter/Rnetworks/edgelist.txt")

Объект myedges представляет собой матрицу из двух столбцов. В каждой строке женщинам и мужчинам (узлам сети) присвоены идентификаторы узла. Мы можем узнать размеры этой матрицы:

>dim(myedges)

Теперь давайте узнаем немного больше об объекте nodeinfo. Названия столбцов:

>names(nodeinfo)

Мы можем, например, ещё определить число людей каждой расы в этой сети:

>table(nodeinfo$race) # Эти все 3 команды эквивалентны
>table(nodeinfo[,2])
>table(nodeinfo[,"race"])


Или же мы можем посмотреть двумерную таблицу раса-пол:

>table(sex$nodeinfo,race$nodeinfo) # Такую таблицу трудно читать, поэтому нужно добавить заголовки:
>table(sex=nodeinfo$sex, race=nodeinfo$race)


В R есть потрясающие графические возможности (нужно, правда, потратить много времени на изучение всех тонкостей так, чтобы виртуозно манипулировать ими и получать на выходе именно то, что Вам нужно). Мы, напр., можем сделать гистограмму времени заражения или сравнить время заражения по признаку расы с помощью команды boxplots:

>boxplot(nodeinfo$time~nodeinfo$race)

Создание сети объектов

Помните команду library(network)? Теперь у нас есть ряд инструментов, с помощью которых мы можем работать на сетевых объектах. Давайте начнём с создания такого объекта:

>diseasenw=network(myedges)

Мы можем построить эту сеть:

>plot(diseasenw)



Заметьте, что наличие стрелок на рисунке указывает на то, что наша сеть является направленной (построение направленных сетей задано в функции network() по умолчанию, но это легко изменить). Кроме того, давайте включим в рисунок чуть больше информации об аттрибутах узлов и укажем, что наша сеть бимодальна. В дальнейшем, мы проведём разделительную линию между узлами одного типа и узлами другого типа, в этом случае такая граница пролегает по самому большому номеру узла женского пола (т. е. для того, чтобы указать программе, что сеть бимодальна, нужно указать тот номер, до которого узлы будут считаться женскими, а после которого — мужскими):

>diseasenw=network(myedges,directed=F,bipartite=132,vertex.attr=nodeinfo)

Построим рисунок снова:

>plot(diseasenw)



Можно ещё очень многое поменять на полученном рисунке. Для того, чтобы узнать об этих возможностях, следует познакомиться с документацией для команды plot (наберите help(plot) в командной строке R).

Например, если нам нужно цветом узлов обозначить расы, а их формой — пол, то следует записать:

>plot(diseasenw, vertex.col=3-nodeinfo$race,vertex.sides=2+nodeinfo$sex,main="Кружки суть женщины, треугольники — мужчины")




Читать далее

3 жовт. 2009 р.

Левое и правое

«Быть левшой — это быть как-бы членом тайного клуба. У нас есть свои собственные странные ритуалы, такие как научиться писать <неправильно>. Мы платим ежедневные членские взносы, т. е. прилагаем дополнительные усилия, чтобы жить в праворуком мире. Когда мы встречаем другого левшу, мы сразу чувствуем, что у нас с ним есть нечто общее. Существование этого клуба держится в секрете, ибо мы редко упоминаем нашу леворукость в общении с нашими праворукими друзьями».
Lucas Pereira // http://graphics.stanford.edu/~lucasp/lefty.html

Леворукость издавна привлекала внимание людей. Ещё в древних языках двоичное противопоставление «левого» и «правого» трактовалось как противопоставление «хаоса» «упорядоченности», «зла» «добру», «нечестивого» «священному», «нечистого» «чистому» [1]. Эти ассоциации дожили до нынешнего времени.

Медицина, занявшись этим любопытным феноменом, не могла поначалу быть свободной от тысячелетней традиции видеть в «левом» и «правом» отблески адского пламени и райского сияния. Эмпирика, казалось, была в счастливом согласии с преданием: «обследования в тюрьмах и психиатрических больницах в конце XIX в. „подтвердили“, что левши чаще других людей бывают лунатиками, невротиками, имеют преступные наклонности, что среди них больше умственно отсталых, заик, эпилептиков и т. д.» [2]. Позже было установлено, что у левшей и правшей по-разному соотносятся в активности правое и левое полушария мозга и что, строго говоря, это по-разному влияет не только на то, какая рука более активна, но и на другие парные органы — ноги, глаза, уши. Более того, психофизиологические различия между левшами и правшами, не особо заметные на первый взгляд, имеют большое значение в криминалистике [3]. Однако в обыденной жизни люди обращают внимание только на леворукость.

Известная пословица «рыбак рыбака видит издалека» описывает феномен гомосоциальности, т. е. склонности человека общаться преимущественно с себе подобными. В качестве признака, по которым такое подобие организуется, может, вообще говоря, быть что угодно — пол, возраст, общие увлечения, уровень образования, профессия и даже какая-то болезнь. Несомненно, этот признак должен быть социально и субъективно важен. И если важность пола или возраста очевидна, то значение леворукости как фактора установления и поддержания социальных связей в настоящее время может быть невелико.

В самом деле, левши не воспринимаются сейчас как дьяволово отродье. Их не ловят и не сжигают на кострах. У родителей и учителей больше не возникает, как кажется, неодолимой потребности любыми способами переучить ребёнка-левшу. На левшей не показывают пальцем. В средствах массовой информации изредка появляются сообщения о том, что тот или иной производитель стал выпускать в дополнение к основной линейке своих товаров «для правшей» ещё и вариант «для левшей». В 1984 г. был учреждён «День левши» (13 августа). Леворукость выглядит просто как небольшое жизненное неудобство. Иначе говоря, нет вроде бы особых причин для того, чтобы держаться друг за друга. И тем не менее мы предполагаем, что этот признак всё ещё значим. Причём он более важен для самих левшей, чем для тех, кто пишет правой рукой.

Для проверки этого предположения мы провели небольшое исследование, в котором задавали — устно или письменно — разным людям три вопроса: 1) Вы — пишете левой рукой, правой рукой или же Вы переученный левша?, 2) Обращаете ли Вы внимание, кто какой рукой пишет? («Да, как правило обращаю», «Нет, обычно не обращаю»), 3) Как много людей, пишущих левой рукой, Вы лично знаете из числа тех, с кем Вы регулярно и часто общаетесь (т. е. среди Ваших знакомых и друзей)?

Поставленные вопросы были призваны подтвердить или опровергнуть две гипотезы, возникающие в связи с упоминавшейся склонностью людей объединяться по подобию. Во-первых, человек должен сначала найти своё подобие, а для этого систематически обращать внимание на те особенности окружающих его людей, которые кажутся ему важными. Во-вторых, если социальные связи образуются (напр., если носитель искомого признака кажется более симпатичным по сравнению с окружающими), то в числе знакомых носителя заданного признака окажется несколько бóльшая концентрация аналогичных людей, чем среди знакомых того человека, которому данный признак не свойственен.

Выборку мы формировали методом «снежного кома», т. е. сначала опросили наших знакомых, потом знакомых знакомых и т. д. (анкета также размещена в интернете http://virtualexs.ru/cgi-bin/exsurveys/survey.cgi?ac=1171). Удельный вес как пишущих левой, так и переученных левшей оказался
невысок — 8 и 7%, что в сумме близко к среднестатистическому значению (10 — 13%) [4] (пол опрошенных не влияет на соотношение праворуких и леворуких). Всего опрошено 475 человек от 15 до 66 лет.

Опрошенные пришли из самых разных социальных слоёв (мы старались добиться разнородности выборки) — студенты и преподаватели вузов, работники коммерческого и некоммерческого секторов, врачи, техническая и гуманитарная интеллигенция. Представлялось однако разумным отдельно анализировать студентов (слушатели Макеевского экономико-гуманитарного института, Восточноукраинского института культуры и искусства, Донецкой национальной академии строительства и архитектуры, а также Донецкого национального технического университета), поскольку учащаяся молодёжь чаще видит своих сверстников пишущими и, следовательно, может иметь больше поводов обратить внимание на то, кто какой рукой пользуется.

Как видно из рис. 1, значение, придаваемое леворукости окружающих, отличается в группах правшей, с одной стороны, и левшей, с другой. Различия между мужчинами и женщинами в ответах на этот вопрос оказались несущественными.


Рис.1. % тех, кто обращает внимание на леворукость окружающих

Однако то, какое субъективное значение придаёт каждый из опрошенных право- или леворукости окружающих его людей, может как влиять, так и не влиять на число его знакомых, о которых он знает, что они пишут левой рукой. Данные табл. 1 демонстрируют, что различия в количестве знакомых-левшей между правшами и левшами статистически значимы. Самые заметные отличия наблюдаются между теми, кто не знает никого, и теми, кто смог вспомнить от трёх до пяти левшей в числе своих знакомых и друзей.

Таблица 1. «Как много людей, пишущих левой рукой, Вы лично знаете из числа тех, с кем Вы регулярно и часто общаетесь (т. е. среди Ваших знакомых и друзей)?»
Левши и переученные левши, N = 70Правши, N = 388
%
никого912
одного — двух человек1938
от трёх до пяти человек4939
6 человек и больше2410
Поскольку мужчины и женщины, в среднем, отличаются по ряду как моторных, так и когнитивных функций, то логично предположить наличие связи признака «количество левшей среди знакомых» с полом респондентов. Наши данные свидетельствуют, что среди женщин существенно больше тех, у кого три и больше знакомых-левши (56% против 43% у мужчин). Женщины, вероятно, лучше мужчин помнят особенности, связанные с телом.

Подвыборка студентов (N = 309) по сравнению с респондентами-нестудентами (N = 154) также продемонстрировала в среднем меньшее количество людей, которые не знали никого леворукого, (7 и 24% соответственно) и большее тех, у кого от трёх до пяти знакомых-левшей, (48 и 32% соответственно).

Чтобы пояснить это, вспомним, что студенты (по крайней мере постсоветские) отличаются от нестудентов в нашей выборке, во-первых, возрастом (подавляющее большинство из них родилось в то время, когда из учебных учреждений ушла практика переучивания леворуких, к тому же молодёжь более склонна принимать чужие отличия как данность), а во-вторых, тем, что они гораздо чаще могут наблюдать леворукость товарищей.

Интересно, что полученные результаты — в окружении леворуких чаще чем у праворуких есть другие левши — совпадают с результатами небольшой работы американского статистика Эндрю Гилмена, который попросил каждого студента в своём классе (20 человек) написать список их близких друзей, после чего попросил этих студентов установить -рукость этих друзей. Оказалось, что даже в этой маленькой виборке есть значимая корреляция между право- и леворукостью студентов и долей соответственно правшей и левшей в круге их друзей [5]. Эта работа, к сожалению, осталась без продолжения и развития.

Итак, гипотеза о более сильной фиксации внимания левшей на левшах подтвердилась. Вместе с тем, подтвердилась и гипотеза о том, что у левшей и переученных левшей чаще, чем у правшей, встречаются знакомые-левши. Следовательно, это может служить аргументом в пользу предполагаемого нами наличия слабых социальных связей по признаку леворукости, а проведённая работа cвидетельствует, в целом, о наличии ряда факторов, которые, будучи весьма слабыми, тем не менее структурируют человеческое общество.

Авторы приносят свою искреннюю благодарность людям, которые совершенно бескорысно помогли нам в проведении этого исследования, а именно: главе Украинского ин-та социальных исследований им. А. Яременко, к. социол. н. Балакиревой О. Н., ст. преподавателю кафедры социальных и гуманитарных дисциплин Восточноукраинского института культуры и искусства Коденко Ю. В., системному администратору ООО «Сантехкомплект» Остапенко А. И., членам общественной организации «Донбасс-СоцПроект» Шеремету-Шереметьеву С. П. и Сидорченко Р. В., врачу Донецкого городского кожно-венерологического диспансера Кокиной И. В., а также всем нашим респондентам.

Использованная литература

1. Маковский М. М. Сравнительный словарь мифологической символики в индоевропейских языках: Образ мира и миры образов. — М.: Гуманит. изд. центр ВЛАДОС, 1996. — 416 с.
2. Кон И. С. Лунный свет на заре. Лики и маски однополой любви. — М.: Олимп; ООО «Издательство АСТ», 1998. — 496 с.
3. Ткаченко А. А., Введенский Г. Е., Дворянчиков Н. В. Судебная сексологическая экспертиза. — Т.1. — М.: ГНЦ СиСП им. В. П. Сербского, 1998. — 360 с.
4.Raymond M., Pontier D., Dufour A., Pape M. Frequency-dependent maintenance of left-handedness in humans // Proceedings of the Royal Society of London B. — 1996. — Vol.263. — P.1627-1633; Chiu R. The fighting Hypotesis: Stability of Polymorphism in Human Handedness // Science Creative Quarterly. — 2007-2008. — Iss.3. — http://www.scq.ubc.ca/the-fighting-hypothesis-stability-of-polymorphism-in-human-handedness/
5. Gelman A. Left-handed statistics. — Режим доступа: http://www.stat.columbia.edu/~cook/movabletype/archives/2006/08/left.html

Читать далее

9 лип. 2009 р.

R, OpenOffice, языки описания графов и социальные сети

В последнее время у нас накопилось много данных о структуре социальных сетей. Во всех случаях эти массивы достаточно велики и требуют машинной обработки. В этом посте я хочу поделиться сугубо технологическими приёмами работы с массивами сетевых данных.



1. Предварительные сведения
1.1. Для статистического анализа социальных сетей есть много разных программ. Мы пользуемся, в основном, R и — на подготовительном этапе — Open Office’ом. В R эти вычисления реализованы в пакете sna (Social Network Analysis), подробнее о котором можно почитать здесь. После того, как он загружен и установлен, подключение его в командной строке R выполняется рутинной командой

> library('sna')

1.2. Одной из красивостей, из предоставляемых пакетом sna, является возможность нарисовать свою сеть. Предположим, что наши данные содержатся в матрице network (о том, как её создать, см. ниже).

> gplot(network)

Если нужно сохранить эту картинку, то процедура такова

> png('network.png')
> gplot(network)
> dev.off()


Подробнее о команде png() см. во встроенной помощи R

> help('png')

1.3. Ввод готовой матрицы смежности (adjacency matrix) или социоматрицы из табличного редактора (напр. Calc’a или Excel’я) в R не отличается от рутинных процедур

а) сначала нужно выделить и скопировать в буфер саму матрицу;
б) ввести в командной строке R

> network=read.table('clipboard')

(важно, чтобы в заголовках строк и столбцов не было кириллицы).

2. Формирование массива сетевых данных.
2.1. Существует, по крайней мере, два способа описания сетевых данных: матрица смежности и текстовое описание (его разновидностями являются языки gdl и dgl).

Матрица смежности позволяет напрямую вычислить ряд основных параметров социальной сети, но её создание в случае больших сетей очень трудоёмко. Описание сети на формализированном языке программирования, близком к человеческому, существенно легче, но не даёт возможности сразу получать статистики — описание сети нужно как-то перевести в матрицу смежности.

В связи с этим я попросил нашего программиста Сашу Остапенко написать макрос, который бы переводил описание сети с gdl в матрицу смежности.

*************************
REM ***** BASIC *****

Sub Main

Dim i As Integer, j As Integer, k As Integer, l As Integer, n As Integer, m As Integer
Dim nodes(1) As String, edges(1,1) As Integer
Dim r As Integer, t As Integer
Dim Doc As Object, Sheet As Object, Cell As Object
Dim str As String, strn(1) As String

Doc=StarDesktop.CurrentComponent
Sheet=Doc.Sheets(0)
Cell=Sheet.getCellByPosition(0,0)
str=Cell.getString

i=0 : r=0

Do While Left(str,1)<>"}"
If Left(str,5)="node:" Then
r=r+1
End If
i=i+1
Cell=Sheet.getCellByPosition(0,i)
str=Cell.getString
Loop

t=i

ReDim nodes(r-1)
ReDim edges(r-1,r-1)

For i=0 to r-1
For j=0 to r-1
edges(i,j)=0
Next j
Next i

j=0

For i=0 To t
Cell=Sheet.getCellByPosition(0,i)
str=Cell.getString
If Left(str,5)="node:" Then
k=InStr(str,chr(34))
l=InStr(k+1,str,chr(34))
nodes(j)=Mid(str,k+1,l-k-1)
j=j+1
End If
Next i

j=0

For i=0 To t
Cell=Sheet.getCellByPosition(0,i)
str=Cell.getString
If Left(str,5)="edge:" Then
k=InStr(str,"source: ")
l=InStr(str,"target: ")
strn(0)=Mid(str,k+9,InStr(k+9,str,chr(34))-k-9)
strn(1)=Mid(str,l+9,InStr(l+9,str,chr(34))-l-9)
For j=0 to r-1
Select Case nodes(j)
Case strn(0): m=j
Case strn(1): n=j
End Select
Next j

edges(m,n)=1
' edges(n,m)=1
End If

Next i

k=0 : l=0
Sheet = Doc.createInstance("com.sun.star.sheet.Spreadsheet")
Doc.Sheets.insertByName("Матрица смежности", Sheet)
Sheet = Doc.Sheets.getByName("Матрица смежности")

For i=0 to r-1
Cell=Sheet.getCellByPosition(i+1,0)
Cell.String = nodes(i)
Cell=Sheet.getCellByPosition(0,i+1)
Cell.String = nodes(i)
Next i

For i=0 to r-1
For j=0 to r-1
Cell=Sheet.getCellByPosition(i+1,j+1)
Cell.Value=edges(i,j)
Next j
Next i

MsgBox "Готово! Автор макроса Александр Остапенко, 2009"
End Sub
*************************


Примечание: этот макрос даёт на выходе матрицу смежности ориентированного графа. Если же требуется граф неориентированный, то нужно раскомментировать строчку

edges(n,m)=1

2.2. В отличие от коммерческого языка gdl, описание графа на языке dgl (т. е. файл с расширением .dot) можно напрямую экспортировать в R, для чего в составе пакета sna предусмотрена команда read.dot

>network=read.dot('~/network.dot')


Читать далее