11 вер. 2009 р.

Элтон Джон как носитель необразцовых семейных ценностей

Элтон Джон приезжает в Донецк. Местная власть в лице депутата Адамова обеспокоилась количеством местных п----ов :)



Читать далее

9 лип. 2009 р.

R, OpenOffice, языки описания графов и социальные сети

В последнее время у нас накопилось много данных о структуре социальных сетей. Во всех случаях эти массивы достаточно велики и требуют машинной обработки. В этом посте я хочу поделиться сугубо технологическими приёмами работы с массивами сетевых данных.



1. Предварительные сведения
1.1. Для статистического анализа социальных сетей есть много разных программ. Мы пользуемся, в основном, R и — на подготовительном этапе — Open Office’ом. В R эти вычисления реализованы в пакете sna (Social Network Analysis), подробнее о котором можно почитать здесь. После того, как он загружен и установлен, подключение его в командной строке R выполняется рутинной командой

> library('sna')

1.2. Одной из красивостей, из предоставляемых пакетом sna, является возможность нарисовать свою сеть. Предположим, что наши данные содержатся в матрице network (о том, как её создать, см. ниже).

> gplot(network)

Если нужно сохранить эту картинку, то процедура такова

> png('network.png')
> gplot(network)
> dev.off()


Подробнее о команде png() см. во встроенной помощи R

> help('png')

1.3. Ввод готовой матрицы смежности (adjacency matrix) или социоматрицы из табличного редактора (напр. Calc’a или Excel’я) в R не отличается от рутинных процедур

а) сначала нужно выделить и скопировать в буфер саму матрицу;
б) ввести в командной строке R

> network=read.table('clipboard')

(важно, чтобы в заголовках строк и столбцов не было кириллицы).

2. Формирование массива сетевых данных.
2.1. Существует, по крайней мере, два способа описания сетевых данных: матрица смежности и текстовое описание (его разновидностями являются языки gdl и dgl).

Матрица смежности позволяет напрямую вычислить ряд основных параметров социальной сети, но её создание в случае больших сетей очень трудоёмко. Описание сети на формализированном языке программирования, близком к человеческому, существенно легче, но не даёт возможности сразу получать статистики — описание сети нужно как-то перевести в матрицу смежности.

В связи с этим я попросил нашего программиста Сашу Остапенко написать макрос, который бы переводил описание сети с gdl в матрицу смежности.

*************************
REM ***** BASIC *****

Sub Main

Dim i As Integer, j As Integer, k As Integer, l As Integer, n As Integer, m As Integer
Dim nodes(1) As String, edges(1,1) As Integer
Dim r As Integer, t As Integer
Dim Doc As Object, Sheet As Object, Cell As Object
Dim str As String, strn(1) As String

Doc=StarDesktop.CurrentComponent
Sheet=Doc.Sheets(0)
Cell=Sheet.getCellByPosition(0,0)
str=Cell.getString

i=0 : r=0

Do While Left(str,1)<>"}"
If Left(str,5)="node:" Then
r=r+1
End If
i=i+1
Cell=Sheet.getCellByPosition(0,i)
str=Cell.getString
Loop

t=i

ReDim nodes(r-1)
ReDim edges(r-1,r-1)

For i=0 to r-1
For j=0 to r-1
edges(i,j)=0
Next j
Next i

j=0

For i=0 To t
Cell=Sheet.getCellByPosition(0,i)
str=Cell.getString
If Left(str,5)="node:" Then
k=InStr(str,chr(34))
l=InStr(k+1,str,chr(34))
nodes(j)=Mid(str,k+1,l-k-1)
j=j+1
End If
Next i

j=0

For i=0 To t
Cell=Sheet.getCellByPosition(0,i)
str=Cell.getString
If Left(str,5)="edge:" Then
k=InStr(str,"source: ")
l=InStr(str,"target: ")
strn(0)=Mid(str,k+9,InStr(k+9,str,chr(34))-k-9)
strn(1)=Mid(str,l+9,InStr(l+9,str,chr(34))-l-9)
For j=0 to r-1
Select Case nodes(j)
Case strn(0): m=j
Case strn(1): n=j
End Select
Next j

edges(m,n)=1
' edges(n,m)=1
End If

Next i

k=0 : l=0
Sheet = Doc.createInstance("com.sun.star.sheet.Spreadsheet")
Doc.Sheets.insertByName("Матрица смежности", Sheet)
Sheet = Doc.Sheets.getByName("Матрица смежности")

For i=0 to r-1
Cell=Sheet.getCellByPosition(i+1,0)
Cell.String = nodes(i)
Cell=Sheet.getCellByPosition(0,i+1)
Cell.String = nodes(i)
Next i

For i=0 to r-1
For j=0 to r-1
Cell=Sheet.getCellByPosition(i+1,j+1)
Cell.Value=edges(i,j)
Next j
Next i

MsgBox "Готово! Автор макроса Александр Остапенко, 2009"
End Sub
*************************


Примечание: этот макрос даёт на выходе матрицу смежности ориентированного графа. Если же требуется граф неориентированный, то нужно раскомментировать строчку

edges(n,m)=1

2.2. В отличие от коммерческого языка gdl, описание графа на языке dgl (т. е. файл с расширением .dot) можно напрямую экспортировать в R, для чего в составе пакета sna предусмотрена команда read.dot

>network=read.dot('~/network.dot')


Читать далее

5 лип. 2009 р.

Результаты операционного исследования "Экспериментальное изучение эффективности привлечения клиентов в МСМ-проекты через социальные онлайн-сети"

Доклад на рабочей встрече МСМ-проектов, финансируемых МБФ "Международный Альянс по ВИЧ/СПИДу в Украине", 2-4 июля 2009 г.



Прежде чем я начну рассказывать об основных результатах, я хочу выразить благодарность тем людям, которые активно участвовали в этом исследовании: Марине Варбан, Анне Довбах, Мирославе Дебелюк, Святославу Шеремету, а также членам региональных команд из Киева, Одессы, Донецка и Харькова.

В социологии крайне редко появляются работы собственно экспериментальные, т.е. такие, когда исследователь изменяет один параметр системы, оставляя неизменными прочие, и смотрит, что получается. Эта работа — из этих редкостей, поэтому имеет она не только прикладное значение быть основой принятия управленческого решения, но и ценна в академическом ключе.

Для чего всё это делалось?

Как вы знаете, чтобы победить эпидемию, нужно охватить профилактикой определённую и достаточно большую долю людей — в этом случае инфекция не сможет распространяться. В случае ВИЧ минимальный, по расчётам ВОЗ, охват должен быть не ниже 60% особенно уязвимых популяций. Украине пока далеко до таких объёмов, поэтому остро стоит задача сделать так, чтобы в ВИЧ-профилактические проекты общественных организаций приходило как можно большее число людей. Увы, в нашем случае, группа МСМ есть группа скрытая и наученная годами и даже столетиями гонений не высовываться. Кроме того, что завоевать её доверие непросто, весьма нетривиальной представляется и проблема даже простой передачи информации о том, что там-то и сям-то можно получить специфические услуги.

Мы не будем здесь подробно останавливаться на описании того, как это делалось до сих пор. Важно, что используемые пока способы хоть и работают, но не дают по ряду причин желаемого охвата целевой группы услугами. Поэтому встаёт задача разработать и апробировать иные способы.

Самое первое, что приходит на ум современному человеку — воспользоваться помощью интернета, а точнее сайтов знакомств. Собственно, наше исследование и было посвящено проверке того, насколько эта идея пригодна практически.


Любое исследование должно подтверждать или опровергать какие-то предположения, гипотезы. Без них оно — не более, чем удовлетворение праздного любопытства.

Таких предположений мы сделали три.


Первая гипотеза вытекает из теории «сетевого общества» М. Кастельса, в рамках которой сформулированы законы его существования: а) сетевая структура состоит из узлов (технических, информационных, социальных и т.п.), б) обмен информацией между двумя точками, когда они выступают узлами одной социальной структуры, будет интенсивнее, чем тогда, когда они не принадлежат одной сети.

Забегая вперёд, скажу, что это полностью подтвердилось — если у организации, предоставляющей какие-то услуги для МСМ, есть активные представители в числе пользователей сайта знакомств, то другие пользователи этого сайта будут охотнее обращаться в эту организацию.

Вторая связана с тем, что в крупных городах охват населения интернет-услугами выше, соответственно у МСМ из крупных городов есть больше возможностей пользоваться услугами сайтов знакомств (напр., по результатам недавнего опроса 816 МСМ Киева, Винницы и Черновцов, проведённого организацией «Гей-альянс», в сельских регионах 39% опрошенных не пользуются Интернетом, тогда как в Киеве МСМ, не пользующиеся Интернетом, составили 30%).

Эта гипотеза скорее не подтвердилась, но т.к. общее количество привлечённых во время реализации этого проекта МСМ невелико (об этом — ниже), то мы предпочитаем не быть категоричными в ответе на этот вопрос.

Как же исследование было реализовано?

Вначале координатор исследования со стороны Заказчика (МБФ «Международный Альянс по ВИЧ/СПИДу в Украине») Марина Варбан договорилась с владельцем одного из русскоязычных сайтов знакомств для геев и бисексуалов о том, чтобы разослать пользователям из четырёх избранных областей (Киевской, Харьковской, Одесской и Донецкой) с промежутком в две недели сообщения с информацией о действующих в этих областях МСМ-сервисных проектах.


Первое сообщение было нейтральным:

Мы можем разминуться в толпе прохожих, и не заметить друг друга.
Мы можем жить на одной лестничной площадке и не знать друг друга.
Мы можем работать в одном офисе и ни разу не заговорить друг с другом.
Мир одиночек.
Это скучно…
Это грустно…
Это неправильно!

Мы хотим изменений.
Приходи!


(контактные данные организаций для пользователей из разных областей, естественно, отличались). Оно рассылалось от имени администрации сайта и рядовой пользователь (потенциальный клиент) не мог отреагировать привычным ему образом (т.е. написать что-то в ответ).

Текст второго сообщения содержал перечень услуг, оказываемых МСМ-сервисным проектом:

У нас собираются отличные парни. У нас ты можешь БЕСПЛАТНО пройти обследование на ВИЧ, болезни, передающиеся половым путем, получить консультацию юриста, психолога или врача. Еще мы БЕСПЛАТНО раздаем презервативы и лубриканты.

А деньги ты сможешь потратить на что-то другое.


Второе сообщение рассылалось со специально созданного каждой местной организацией профайла, на котором была указана по крайней мере минимально-необходимая контактная информация. Рядовой пользователь сайта знакомств уже мог писать в ответ: задавать вопросы, выражать эмоции и получать отклик от сотрудников организации.

Чтобы увеличить аудиторию потенциальных клиентов МСМ-проектов, текст второго сообщения был несколько раз размещён на досках объявлений date.bluesystem.ru в соответствующих регионах.

Результаты рассылок фиксировались двумя способами. Для обращений по телефону и через профайл организации каждая организация завела специальный журнал. Визиты потенциального клиента в офис организации фиксировались социальным работником, который проводил опрос пришедшего по анкете, а также знакомил человека с работой своей организации.


Параллельно с полевым этапом (рассылка сообщений и фиксацией откликов на них) проводился этап кабинетного исследования, во время которого была сформирована репрезентативная рандомизированная выборка 760 профайлов пользователей Qguys.ru из четырёх изучаемых регионов.

Оказалось, что лишь треть зарегистрированных пользователей Qguys.ru могли оперативно знакомиться с рассылаемой информацией о действующих МСМ-сервисных проектах.


Из этой трети какая-то часть людей может воспринять сообщение как спам или не захотеть общаться с неизвестной организацией или группой. Таким образом, результативность разосланной информации не может быть слишком высокой из-за действия описанных факторов. В то же время, можно надеяться, что отклики потенциальных клиентов растянутся на продолжительное время — сразу откликнутся или не откликнутся те, кто часто бывает на своём профайле, позже — те, кто бывает редко.

Рассмотрим соотношение числа посланных сообщений и откликов пользователей на них.

Таблица 1.
РегионСообщенияОтклики
посланные (число профайлов)полученные (число «живых» профайлов)на первое (по телефону)на второе (через профайл организации)личные визиты в организацию
Все регионы1886450936321935
Киев и область917524773111214
Донецк и область14944036392
Одесса и область17294675335
Харьков и область1468396213514

В первой строке приведены суммарные по всем регионам данные. Видно, что разрыв между количеством посланных сообщений и откликов на них огромен. Отчасти это поясняется тем, что реализация исследования пришлась на майские праздники и начало периода летних отпусков, поэтому мы полагаем, что отклики на рассылку будут длиться, по крайней мере, ещё полгода.

Кабинетное исследование дало нам "нулевую точку" — социодемографический и идентичностный портрет пользователя Qguys.ru. Подробно он будет описан в Отчёте, а на слайде представлены самые основные данные.


Возраст пользователей простирается от 18 до 78 лет, средний возраст — 28 лет, модальный — 26 лет. Треть пользователей состояла на момент регистрации профайла в официальном гетеросексуальном браке или пребывала в неофициальном гетеросексуальном сожительстве, у одной десятой есть дети. У 38% есть однополый партнёр. Важно также, что половина тех, у кого есть однополый партнёр, есть ещё и жена или сожительница. Почти две трети пользователей Qguys.ru идентифицировали себя как «геи», остальные — преимущественно как «бисексуалы». В среднем одна десятая пользователей занимается или готова заняться сексом за деньги.

Отклики на рассылку через профайл организации, звонки потенциальных клиентов по телефону и анкетирование пришедших людей в организации дал нам три списка потребностей.


В звонках по телефону доминирует информационный запрос: узнать о деятельности организации захотели 58% позвонивших. На втором месте стоит желание потенциальных клиентов познакомиться и поучаствовать в группах встреч, т.е. тем или иным способом расширить круг общения с себе подобными.

В откликах через профайл организации главное место принадлежит отсутствию интереса к разосланной информации: это и негативное (блокировка профайла организации, требования "больше не спамить" — 11% откликов) и дежурная благодарность за сообщение без дальнейшего развития диалога.



Людей, которые пришли лично, было немного — 35 человек. Поэтому их потребности мы просто проранжировали в порядке убывания частоты упоминания.


Видно, что на первом месте стоят консультации специалистов, второе место занимает "халява" - получить что-то бесплатное, тогда как желание знакомиться (стабильно занимавшее второе место в предыдущих списках потребностей) — почти в самом конце.

Таким образом, основные результаты операционного исследования:

Разработан и апробирован способ привлечения клиентов в МСМ-сервисные проекты с использованием сайтов знакомств. Показано, что использование социальных онлайн-сетей для привлечения клиентов в МСМ-сервисные проекты малоэффективно — рассылка приглашений с информацией об услугах проектов через профайлы сайтов знакомств существенно не увеличивает посещаемость тех организаций, чьи контактные данные указаны в информационных сообщениях.

Качественно выявлен эффект мультипликации информационных потоков: посланные информационные сообщения спровоцировали обращения потенциальных клиентов на личные профайлы сотрудников МСМ-сервисных проектов, размещённые на других сайтах знакомств (в частности, входящих в систему Mamba (love.gay.ru, love.mail.ru, facelink.ru и т. п.). Таким образом, можно утверждать, что проявился эффект социальной сети: люди, не имеющие профайла на одном сайте знакомств, узнают от своих знакомых, которые имеют там профайл, рассылаемую информацию и обращаются к тем, кто причастен к организации-источнику сообщения, с уточняющими вопросами.

Изучены потребности МСМ, откликнувшихся на информационное сообщение. Показано, что наиболее востребованы (в порядке уменьшения приоритета) услуги психолога, консультации специалистов-медиков, бесплатные презервативы и лубриканты, бесплатное тестирование и обследование на сифилис и другие ИППП, бесплатное лечение сифилиса и других ИППП, вечеринки/дискотеки и другие развлекательные мероприятия, возможность знакомиться и проводить время вместе с такими же людьми, бытовые услуги (прачечная, душ, ночлег и др.), бесплатное тестирование на ВИЧ. Опрошенные клиенты не испытывают потребности в консультациях по преодолению наркотической зависимости, бесплатном обследовании на гепатит-Б, телефоне доверия и в услугах спортивных тренажёров.

На материале рандомизированной выборки 760 профайлов пользователей сайта знакомств Qguys.ru изучены характеристики МСМ, являющихся членами этой онлайн-сети.


Читать далее

17 черв. 2009 р.

Сетевые аспекты социальной идентичности (обзор выполненных работ)

Доклад на 2й Национальной конференции ЛГБТ- и МСМ-сервисных организаций, Киев, 2009

Касянчук М. Г., Лещинский Е. Б., Шеремет-Шереметьев С. П.

Когда звучит термин «сеть», то мы с вами вспоминаем сразу не сети рыбака, а интернет; соответственно, «социальная сеть» ассоциируется прежде всего с такими сайтами как «Одноклассники», «Вконтакте», «Мой круг» и др. Однако термин «социальная сеть» впервые появился в 1954 г. в работе, посвящённой отношениям в маленькой ирландской общине.


Социальная сеть — это аналогия, описывающая социальную структуру как составленную из гнёзд (отдельные индивиды или организации), определённым образом связанные между собой. Сила связей может быть разной — от случайных знакомств вплоть до тесных родственных отношений.

Концепция социальных сетей была сразу взята на вооружение гуманитарными науками — такими как социология, экономика и эпидемиология. Её огромным преимуществом оказалась неразрывная связь как с традиционно применяемыми в социальных науках статистическими методами, так и с теорией графов.

Концепция социальных сетей послужила основой разработанного в 1990-х годах проф. Дугласом Геккаторном метода формирования выборки RDS, применяемой для исследований скрытых сообществ. В Украине RDS c 2004 г. используется в контексте ВИЧ/СПИДа в поведенческих исследованиях.
Информация об индивидуальных социальных сетях респондентов используется и в ряде способов оценки численности труднодостижимых социальных групп — метод загаданного знакомого, метод наращивания сетей. Напр. в Украине именно так в 2008 г. были проведены оценки численности ПИН, ЖСБ, МСМ, а также ВИЧ-инфицированных людей.

Вместе с тем, ряд допущений, положенных в основу этих разработок, оказались несостоятельными. Так, оценки численности ВИЧ-инфицированных вышли ниже, чем даже численность ВИЧ-инфицированных, зарегистрированных государственной медицинской статистикой. Численность всех украинских МСМ по этим данным оказалась неправдоподобно низкой — ниже чем число пользователей из одного только Киева, зарегистрированных в специализированной геевской онлайн-сети http://qguys.ru. Поскольку численность нестигматизированных социальных групп эти методы воспроизводили очень хорошо, разумным представляется предположение, что разброс в составе индивидуальных социальных сетей настолько велик, а изолированность ряда социальных групп так значительна, что невозможно распространить данные, полученные при доскональном изучении особенностей индивидуальных сетей представителей одних групп, на сети представителей других групп.



Следует учитывать три обстоятельства.

Во-первых, любая стигматизированная группа является группой закрытой (если нет визуального способа отнести человека к данной группе, то члены группы будут, как правило, скрывать свою принадлежность к ней).

Во-вторых, даже тех членов стигматизированной группы, которые не скрываются, окружающие их люди могут не замечать именно как членов этой группы (т. е. не придавать этому значения) либо — в наихудшем случае — стыдиться таких знакомств.

И наконец, в-третьих, следует обязательно вводить поправки на вполне вероятные внутригрупповые связи через общих знакомых.

Для краткости назовём эти факторы «видимость», «замечаемость», «пересекаемость». К сожалению, ни один из этих факторов не был полноценно учтён.

В этом докладе мы попытаемся обобщить известную на сегодня информацию о разных аспектах социальных сетей украинских МСМ.

На подступах к социальным сетям МСМ

Качественные данные

Ряд источников характеризует качественный состав индивидуальных социальных сетей МСМ. Прежде всего, это привычный для любого представителя стигматизированной группы вопрос: «Кто знает о том, что ты такой?». Этот вопрос обязательно всплывает при знакомстве и первом общении как двух гомосексуалов, так и в контактах с людьми извне. Идеология «гей-движения» также призывает гомосексуалов быть открытым перед окружающими в отношении своей сексуальной ориентации/идентичности, ибо только привычность явления, обеспечиваемая его частой и повсеместной встречаемостью, его повседневностью и банальностью — путь к уничтожению стигмы, к нормализации отношений между разными группами людей, к ослаблению противопоставления «мы и они». Именно поэтому вопрос «Вы скрываете свою ориентацию?» (в разных вариантах) — частый спутник опросов людей на темы гомосексуальности.

Этот вопрос подразумевает, по большей части, описательный ответ, напр. «знают только друзья». Соответственно, из этих ответов мы не можем извлечь информацию о том, скольким людям респондент счёл нужным представить себя как МСМ/ЖСЖ. Для респондента более важно описать тот круг посвящённых, который чем-то отличается от всех остальных. В терминах социальной сети мы предполагаем, что эти круги «посвящённых» и «непосвящённых» отличаются, прежде всего, силой связи — родственники и близкие друзья соединены с респондентом сильными связями, тогда как «коллеги», «знакомые» и «все» — слабыми. Сила связи с такими-же людьми, как и респондент (то, что в голубой субкультуре называется «друзья по теме») отнюдь не однозначна. С одной стороны, это — связь слабая (два человека сплошь и рядом не имеют ничего общего, кроме желания любить человека того-же пола), с другой — сильная (поскольку эта общность ощущается как родственная, ибо она, как и родня, дана Природой или Провидением, т. е. силами сугубо внешними).



Самой последней из таких работ является опрос «Однополое партнёрство в Украине». В начале 2009 г. РИПЦ «Наш мир» опросил 527 чел. Предметом исследования были разнообразные аспекты однополого партнёрства. Но, в частности, респондентам ставился вопрос о степени их открытости. Треть опрошенных не скрывает своей сексуальной ориентации.

Количественные данные

Опрос Украинского института социальных исследований. Мониторинг МСМ 2007 года, проведённый УИСИ по заказу «Альянса» охватил 1764 человека из 12 городов Украины. Опросник, в частности, содержал вопрос «Как много мужчин, имеющих сексуальные отношения с мужчинами, Вы лично знаете из числа тех, кто живёт в этом городе, Вам известно, что они знают Вас, и Вы их видели в последние три месяца? ___ человек». У этого вопроса была сугубо служебная роль — он помогал отбирать среди респондентов тех, кто мог бы привести для опроса других МСМ (в соответствии с требованиями метода RDS).

Минимальное количество знакомых МСМ у респондентов-МСМ было 0, максимальное — 400, среднее — 22 человека, однако чаще всего — 10 человек.



Все рассмотренные работы давали фрагментарные данные. К примеру, мы знаем, сколько МСМ есть в индивидуальной социальной сети респондента-МСМ, но не знаем, каков, собственно, общий размер его социальной сети. Не было и сравнения с другими группами, т. е. мы не знаем, сколько МСМ в индивидуальной сети респондента-неМСМ и — опять таки — как это соотносится с общим размером индивидуальной сети такого респондента.



Такие данные были получены в наших следующих работах.

Опрос «Мобильный телефон как отражение социальной сети и видимости стигматизированных групп». Опрошено 213 человек в возрасте от 17 до 52 лет (средний возраст 28 лет, модальный возраст 26 лет). Опрошенные живут преимущественно в мегаполисах.



Количество людей (размер социальной сети) в «Телефонной книге» респондентов колеблется от 11 до 1194 человек, среднее значение «165 чел.», мода «100 чел.», модальный интервал «100—120 чел.» (12% опрошенных). В целом, полученный размер близок к т. н. числу Данбара и к среднему размеру социальной сети украинцев в опросе КМИСа.

Размер сети, по-видимому, не связан с возрастом, полом и с социосексуальной идентичностью, однако связан на уровне тенденции с размером населённого пункта — респонденты с сетями свыше 100 человек живут преимущественно в крупных городах (500 тыс. чел. и больше).
Количество знакомых респондентам МСМ и ЖСЖ из людей, фигурирующих в «Телефонной книге», простирается от 0 до 700. Оно сильно связано с социосексуальной идентичностью.

Особенно красноречивыми являются выделенные строки — гомо- и бисексуалы знают и общаются с существенно большим количеством МСМ и ЖСЖ, чем гетеросексуалы.

Таким образом, 1) качественный состав личной социальной сети является надёжным индикатором включённости индивида в то или иное сообщество, что является одним из атрибутов социальной идентичности (эта банальность выражается пословицей «скажи мне, кто твой друг, и я скажу, кто ты»); 2) при прочих равных условиях основное допущение методов, основанных на изучении личных социальных сетей («чем больше размер определённой категории населения, тем чаще её представители будут встречаться среди знакомых респондентов»), не будет давать адекватных результатов в отношении социальных групп, которым свойственна ущемлённая социальная идентичность.

Наши работы позволяют утверждать, что социальная идентичность связана не только с сознательной вовлечённостью человека в сообщество себе подобных, но и с большей интенсивностью поиска представителей своей группы в массе окружающих человека людей («рыбак рыбака видит издалека», при этом «не-рыбак» часто «рыбака» не замечает, даже если тот у него под носом).

Итак, у нас есть такие данные: ориентировочное численность социально доступных ЛГБТ. Известно, сколько у каждого из них знакомых из среды ЛГБТ/МСМ/ЖСЖ. Можно ли сказать из этого, сколько всего ЛГБТ в Украине? Проще говоря, можем ли мы помножить одно на другое? — Рискну утвержать, что нет. Рассмотрим простой пример: если мы опросили двух человек и каждый сказал, что он знает ещё двух, то общее количество людей, о которых идёт речь может меняться от трёх до шести человек.





Следовательно, чтобы сосчитать численность группы на основе данных о количестве знакомых каждого её члена, нам следует знать как можно точнее её структуру.

Вернёмся теперь к первому рисунку.



На нём — в обобщённом, разумеется, виде — показаны мы с вами — участники этой конференции. Вспомните, когда каждый из нас заполнял заявку на участие в конференции, там был пункт «Предоставьте контакты тех людей, которые могли бы Вас порекомендовать для участия в этой Конференции». Понятное дело, если я хочу принять участие в каком-то мероприятии, то я не стану выставлять в качестве рекомендателей тех людей, которые меня не знают или которые могут сказать обо мне какую-либо неблагожелательную информацию... Поэтому изображённая сеть отражает связи по симпатии между участниками.

Видно, что структура получилась очень сложная. Тем не менее, теория графов и компьютеры позволяют нам просчитать её... Итак, у нас уже есть практически все данные, чтобы на основе данных о социальных сетях ЛГБТ-сообщества оценить численность ЛГБТ/МСМ/ЖСЖ в Украине. Нужно сделать совсем ещё немного: посмотреть, насколько плотны сети респондентов, не входящих в плотное ЛГБТ-сообщество.

Читать далее

4 черв. 2009 р.

Fugue for Friday

Вчера совершенно случайно наткнулся на прелестную фугу — мою ровестницу. Стиль её очень мне напомнил Пахельбеля и Фробергера, хотя этим уважаемым мастерам не свойственны такие модуляции.

Очень рекомендую — сделана крепко!

Читать далее

23 бер. 2009 р.

Інтернет-профайли яко засіб знайомства

Протягом вересня 2006 року я поставив два паралельних експерименти, які дали можливість на реальних цифрах з’ясувати, наскільки ефективним є спосіб відшукати собі нового сексуального партнера чи просто друзів через сайти знайомств. Звичайно, цілі, які я переслідував, були аж ніяк не експериментальні – це був правдивий пошук партнера, але результати виявилися настільки красномовними у статистичному аспекті, що мені здалося цікавим опублікувати їх.

Пошук «друзів» через інтернетівські служби знайомств можна умовно розділити на активний і пасивний.
Стратеґія «активного пошуку» полягає у тому, що, задавши відповідні параметри фільтрації інших профайлів – «познакомлюсь с парнем 26-50 лет, скрывать предложения интим-услуг, из Донецка / Мариуполя» – та відкинувши ті, де нема взагалі ніяких відомостей про автора («пусті профайли»), та ті, що їхнім авторам мої параметри ніяк не підходять (напр. мені 31, а такий пише, що шукає хлопів до 26), всім решта (47 в Донецьку та 27 в Маріуполі) було направлене повідомлення «привет, давай знакомиться» або «привет, мне понравилось то, что ты о себе написал, давай знакомиться».
Активний пошук на маріупольському сеґменті відбувався з «донецького профайлу» [1] – з фотоґрафією.
Частина профайлів (6 в Донецьку та 7 в Маріуполі) була вже давно не відвідувана, тому їхні автори, річ ясна, не відгукнулись, хоча база знайомств «mamba», до якої належать http://facelink.ru, http://love.gay.ru, http://love.rambler.ru та інші, автоматично ґенерує таким своїм членам лист на електронну адресу, вказану при реєстрації, про те, що їм залишено від такого-то, вік такий-то, повідомлення, яке можна прочитати за вказаною адресою.

З тих, що прочитали мою пропозицію про знайомство, відповіли дуже нечисленні (10 в Донецьку та 11 в Маріуполі) [2]. Відповіді ці були, здебільшого, позитивно формальні – «давай», «:)» і т.п., неґативних лише 3 (два в Донецьку та одна Маріуполі). Решта позитивних були розгорнутими – «давай, а сможешь сделать как я мечтаю?», «давай. анкету читал?» і т.п.
Навіть у випадку формальних відповідей я намагався продовжити контакт в той чи інший спосіб. Тексти, звичайно, вже розрізнялися залежно від деталей профайлу мого кореспондента або залежно від його першої реакції, але основний вектор був один – перевести спілкування з віртуального в реальне, для чого я або відразу давав свій стаціонарний телефон (мобільного в мене нема) і просив у відповідь телефон кореспондента, або спочатку давав електронну адресу, а вже потім – через емейл – свій телефон. Питання фотоґрафії головним не було, я не ставив її наявність за обов’язкову умову дальших контактів, хоча і просив своїх кореспондентів дати, якщо мають.
На цьому етапі – обміну телефонами і першої розмови – відсіялася ще частина (7 в Донецьку та 5 в Маріуполі), з рештою я зустрівся вже обличчям до обличчя. Наочно динаміку інтернет-знайомств можна побачити в таблиці:

Таблиця 1. Динаміка встановлення контактів при застосуванні стратеґії активного пошуку інтернет-знайомств
Місто, де мешкають кореспондентиНадіслано повідомлень всьогоКореспондент повідомлення не прочитав* Повідомлень проіґнорованоНеґативні відповідіПозитивні відповідіОпосередковане спілкування**Зустріч у реалі*
у дужках – відсоток від різниці («всього повідомлень»-«не прочитав»)
Донецьк47630 (73)2 (5)9 (22)8 (19.5)1 (2.4)
Маріуполь2779 (45)1 (5)10 (50)9 (45)3 (15)

* – на момент написання статті; ** – у віртуалі та через телефон.

Отже, якщо звернути увагу на відносні цифри (%), то виявляється, що маріупольська публіка (міста вдвічі меншого за Донецьк та без будь-якої «ґейовської» інфраструктури – плєшки я до уваги не беру) є, фактично, вдвічі менш «балувана» – менше тих, хто іґнорує пропозицію знайомства, більше позитивних відповідей та більше тих, хто підтримує дальше спілкування (тобто проявляє дієву зацікавленість у знайомстві).
Розподіл моїх кореспондентів за ідентифікаціями, шлюбним станом та іншими ознаками нема сенсу аналізувати, адже при так невеликих цифрах критерій достовірності надто незначний.

Стратеґія пасивного пошуку (коли не я звертаюся з пропозиціями про знайомство, а на мої профайли надходять такі пропозиції з власної ініціативи користувачів сайту знайомств) є в абсолютних цифрах за близький період часу значно менш результативна: 12 контактів при пасивному проти 22 при активному пошуку.

Таблиця 2. Динаміка встановлення контактів при застосуванні стратеґії пасивного пошуку інтернет-знайомств
Місто, де мешкають кореспондентиНадіслано повідомлень всьогоПовідомлень проіґнорованоНеґативні відповідіПозитивні відповідіОпосередковане спілкування**Зустріч у реалі***
Донецьк800860
Маріуполь200220
Одеса*200210

* – з «порожніх профайлів»; обидва кореспонденти приїзжали у справах (один до Донецька, інший до Маріуполя); ** – у віртуалі та через телефон; *** – на момент написання статті.

При такій незначній кількості [3] «запитів на знайомство» якихось ґлобальніших висновків відносно цієї стратеґії робити не можна, хоча мені здається, що в такий спосіб є значно менша ймовірність знайти для себе «підходящий» варіант.

Отже, висновків з цієї роботи може, як на мене, бути два (я абсолютно свідомий того, що описані результати потребують доповнення та уточнення, приміром, на матеріалі інших міст, на матеріалі, що я його зовсім не зачепив, інтерактивних знайомств – аська, чат).

Перший – конкретний: познайомитись з кимсь через сайти інтернет-знайомств можна, але для цього треба застосовувати передовсім стратеґію активного пошуку (пасивний може тільки доповнити її), причому розсилка поодиноких повідомлень радше неефективна – треба слати їх відразу десятками (причому чим більше місто, тим більше зусиль і часу треба на те діло дати), а з відповідями вже розбиратися персонально (інформація про авторів профайлів є надто стандартна і практично не дає ніякого уявлення про живу людину). Звичайно, якщо користувачі послуг сайтів інтернет-знайомств будуть активніші, то і стратеґія пасивного пошуку буде результативнішою.
Другий – абстрактний: руйнування міжперсональних зв’язків і брак чітких правил поведінки в «ґейовському» середовищі виразно даються взнаки у крупних містах із розвиненою «ґейовською інфраструктурою». Іншими словами, при тому, що в Донецьку можливостей для знайомства ніби більше ніж у Маріуполі (дискотека «Каліфорнія», купа плєшек, більший рівень прибутків населення і, отже, більший рівень «інтернетизованості»), щастя звичайного спілкування – яке виражається в простоті встановлення нових людських зв’язків і їх тривалому існуванні – менше.
М. Касянчук, 22/09/2006

Примітки:
1. Я мав у системі «mamba» два реґулярно відвідуваних мною профайли, які далі умовно називатиму «донецьким» і «маріупольським». Перший з них містив фотоґрафію, другий – ні. Їхні тексти (розділ «Обо мне») відрізнялися, хоч у кожному є фрази «по выходным бываю в Мариуполе», «для меня не составляет проблемы наличие у партнёра семьи». Разом з тим обидва профайли повідомляли правдиві дані про вік, зріст, масу тіла, інші антропометричні деталі, звички, соціальний статус та погляди автора).
2. «Надіслане повідомлення проіґнороване» означає, що людина принаймні два рази після дати розсилки була на відповідному сайті, але ніяк не відповіла (для того, щоби мати профайл, треба реєструватися, а «mamba» висвітлює дату останнього відвідування автора профайлу).
3. ця кількість та їхня «якість» сильно залежать від наповнення профайлу – текст і, особливо, фотокартка. На підтвердження наводжу частину інтерв’ю, даного мені одним з моїх інформаторів:
«однажды я решился вывесить в интернете фотографию своего причинного места (без лица), написал, что я «актив» и что я ищу задницу. Я даже не ожидал такой быстрой реакции – в первые 15 минут пришло 3 сообщения, за следующие сутки ещё 16. Удивительно, но писали в основном би и натуралы (у них в анкете было написано «ориентация - гетеро», «познакомлюсь с девушкой»!!!). Через день мою фотографию удалил администратор сайта, но за это время мы успели обменяться телефонами, мэйлами и фотками с несколькими» (Юрій, 33 роки, Донецьк).

Читать далее

16 бер. 2009 р.

Краткие результаты опроса «Мобильный телефон как отражение личной социальной сети и видимости стигматизированных групп»

Все приведённые результаты даны по состоянию на 14 марта 2009 г.

Аргументы в пользу выбора «Телефонной книги» мобильного телефона как отражения личной социальной сети респондента содержатся в литературе [1, 2]. Недавняя наша работа «Леворукость как фактор установления социальных связей» (статья отправлена в публикацию) позволяет утверждать, что социальная идентичность связана не только с сознательной вовлечённостью человека в сообщество себе подобных, но и с большей интенсивностью поиска представителей своей группы в массе окружающих человека людей («рыбак рыбака видит издалека», при этом «не-рыбак» часто «рыбака» не замечает, даже если тот у него под носом). Поразительно низкие результаты видимости стигматизированных групп (ВИЧ+, ПИН, МСМ) в украинском обществе, полученные в исследовании КМИСа на репрезентативной по основным социодемографическим показателям выборке, подтвержают это.

Опрошено 152 человека. Возраст от 17 до 52 лет, средний возраст 28 лет, модальный возраст 26 лет.
Способ опроса: через интернет (http://virtualexs.ru/cgi-bin/exsurveys/survey.cgi?ac=1153).
Географический охват: Ляйпциг — Владивосток (+ 1 человек из США), из Украины — 115 чел., т. е. 76%.
Половой состав опрошенных: мужчины 70%, женщины 30%.
Социосексуальная идентичность опрошенных: гомосексуалы 65%, бисексуалы 25%, гетеросексуалы 10%.

Количество людей (размер социальной сети) в «Телефонной книге» респондентов колеблется от 11 до 1200 человек, среднее значение «184 чел.» (если же отбросить четыре самых больших значения — от 1000 и выше, то «161 чел.»), мода «100 чел.», модальный интервал «100 — 120 чел.» (13% опрошенных). В целом, полученный размер близок к т. н. числу Данбара [3] и к среднему размеру социальной сети украинцев в опросе КМИСа.

Размер сети, по-видимому, не связан с полом (табл.1) и с социосексуальной идентичностью (табл.2).

Табл.1
«Сколько всего людей фигурирует в Вашей “Телефонной книге”? (если у Вас несколько телефонов, то посчитайте людей во всех)» М, N = 105 Ж, N = 47
%
0 ÷ 99 43 30
100 ÷ 199 29 45
200 ÷ 299 12 15
300 ÷ 1200 17 10


Табл.2
«Сколько всего людей фигурирует в Вашей “Телефонной книге”? (если у Вас несколько телефонов, то посчитайте людей во всех)» гомосексуал, N = 99 бисексуал, N = 38 гетеросексуал, N = 15
%
0 ÷ 99 39 29 60
100 ÷ 199 36 29 27
200 ÷ 299 11 21 7
300 ÷ 1200 13 21 7


Количество знакомых респондентам МСМ и ЖСЖ из людей, фигурирующих в «Телефонной книге», простирается от 0 до 700. Оно сильно связано с социосексуальной идентичностью (табл.3).

Табл.3
«Вы наверняка знаете с разных (иногда неожиданных) сторон людей, упоминаемых в Вашей “Телефонной книге”. Пожалуйста, посмотрите ещё раз на их имена в Вашем мобильном телефоне и посчитайте, сколько среди них людей (как мужчин, так и женщин), которые вступают в сексуальные контакты с людьми своего пола?» гомосексуал, N = 99 бисексуал, N = 38 гетеросексуал, N = 15
%
0 ÷ 4 10 29 93
5 ÷ 19 32 24 7
20 ÷ 49 28 32 0
50 ÷ 199 18 14 0
200 ÷ 700 11 3 0


Особенно красноречивыми являются выделенные строки — гомо- и бисексуалы знают и общаются с существенно большим количеством МСМ и ЖСЖ, чем гетеросексуалы. В табл.4 приведены обобщающие статистики для представителей разных социосексуальных идентичностей.

Табл.4
Статистика гомосексуал бисексуал гетеросексуал
«Вы наверняка знаете с разных (иногда неожиданных) сторон людей, упоминаемых в Вашей “Телефонной книге”. Пожалуйста, посмотрите ещё раз на их имена в Вашем мобильном телефоне и посчитайте, сколько среди них людей (как мужчин, так и женщин), которые вступают в сексуальные контакты с людьми своего пола?»
Диапазон 0 ÷ 700 1 ÷ 374 0 ÷ 12
Среднее 74 34 2
Мода 15 10 0


Если перейти от абсолютного числа знакомых МСМ и ЖСЖ к относительному (% МСМ и ЖСЖ среди тех, кто фигурирует в «Телефонной книге» респондента), то различия станут ещё более выпуклыми (табл.5).

Табл.5
% МСМ и ЖСЖ среди тех, кто фигурирует в «Телефонной книге» респондента гомосексуал, N = 99 бисексуал, N = 38 гетеросексуал, N = 15
%
0 ÷ 19 43 71 100
20 ÷ 49 34 21 0
50 ÷ 100 22 8 0


Таким образом, 1) качественный состав личной социальной сети является надёжным индикатором включённости индивида в то или иное сообщество, что является одним из атрибутов социальной идентичности (эта банальность выражается пословицей «скажи мне, кто твой друг, и я скажу, кто ты»); 2) при прочих равных условиях основное допущение методов, основанных на изучении личных социальных сетей («чем больше размер определённой категории населения, тем чаще её представители будут встречаться среди знакомых респондентов»), не будет давать адекватных результатов в отношении социальных групп, которым свойственна ущемлённая [4] социальная идентичность (или, если сказать мягче, эффекты трансмиссии и барьера требуют дополнительных инструментов для того, чтобы быть нейтрализованными).
Практическая значимость для оценки численности: коэффициент видимости МСМ можно грубо прикинуть из данных табл.4 или табл.5.

Примечания

1. Lai, Chih-Hui. Understanding the Design of Mobile Social Networking: The Example of EzMoBo in Taiwan [Электронный ресурс] // M/C Journal. — 2007. — Vol.10, №1. — Режим доступа: http://journal.media-culture.org.au/0703/08-lai.php

2. Lugano, G. Mobile Social Networking in Theory and Practice [Электронный ресурс] // First Monday. — 2008. — Vol.13, №11. — Режим доступа: http://firstmonday.org/htbin/cgiwrap/bin/ojs/index.php/fm/article/view/2232/2050

3. Максимальный размер социальных сетей приближается к 150 чел., а средний их размер — 124 чел.: Hill, R. and Dunbar, R. Social Network Size in Humans // Human Nature. — 2002. — Vol.14, №1. — P.53-72.

4. Национальная идентичность является одним из самых сильных компонентов личности, однако в норме она задаётся по умолчанию и не требует дополнительных усилий по поддержанию, поэтому не актуализирована (напр. мне очень сложно вспомнить, кто из моих здешних знакомых русский, тогда как при попадании в совершенно иную языковую среду — Лондон, Таллинн etc. — я начинал обращать внимание, кто в окружении говорит по-русски).

Максим Касянчук

Читать далее

2 бер. 2009 р.

Из заметок лектора

Есть у меня в группе некий М-им. Всё как обычно — немного ленив, немного наивен, немного распиздяй и немного враль. А так вообще неплохой, наверное, человек. И вот дошло дело до того, что надо поставить ему хоть какую-то оценку, но сколько раз не давал я задания, вечная отмазка: «Вы специально выбираете мне самые тяжёлые» (то, что это отмазка, следует из того, что на лекциях он всегда бездельничает). И вот сегодня мне это надоело :) Была разработана метода :) гарантирующая, как мне кажется, случайный отбор вопросов силами самой аудитории.

В моём списке слушателей — 34 человека. Берётся любой первый слушатель, его я прошу назвать любое число в интервале 1-29 (номера первого списка вопросов). Таким образом получился вопрос первый для М-ма. Потом от 34 отнимается названный номер и получаем номер второго слушателя, которого я также прошу наугад назвать любое чило в интервале 1-16 (номера второго списка вопросов). Получаем второй вопрос для М-ма... и так далее по числу прозёванных тем :)

В результате М-м заткнулся и заработал законный трояк — по уровню знаний :)

Описывать это муторно, делать было веселее, параллельно поясняя, что это мы на практике применяем цепи Маркова :)

Читать далее

8 лют. 2009 р.

02. Просто R – Использование R для ознакомительной статистики

Продолжение серии моих переводов из учебного пособия «Просто R — Использование R для ознакомительной статистики» американского автора John’a Verzani.
http://www.math.csi.cuny.edu/Statistics/R/simpleR

Раздел 2: Данные

Статистика — это изучение данных. После того, как мы разберёмся, как запустить R, первое, что нам понадобится, — научиться, как вводить данные в R и как работать с данными, когда они уже введены.

Запуск R

R легче всего изучать интерактивным способом. Вы задаёте вопрос, а R даёт вам ответ. Вопросы задают и получают на них ответы в командной строке. Чтобы запустить командную строку R, вы можете: в Windows отыскать иконку R и дважды кликнуть по ней, в Unix набрать в командной строке терминала прописную букву R. Другие операционные системы, потребуют от вас других действий. Как только R будет запущен, вы увидите приветствие, подобное следующему:

R : Copyright 2001, The R Development Core Team
Version 1.4.0 (2001-12-19)
R is free software and comes with ABSOLUTELY NO WARRANTY.
You are welcome to redistribute it under certain conditions.
Type ‘license()’ or ‘licence()’ for distribution details.
R is a collaborative project with many contributors.
Type ‘contributors()’ for more information.
Type ‘demo()’ for some demos, ‘help()’ for on-line help, or
‘help.start()’ for a HTML browser interface to help.
Type ‘q()’ to quit R.
[Previously saved workspace restored]
>


Значок > называется «приглашением» (prompt). В дальнейшем мы будем им пользоваться, чтобы показать, что нужно вводить в командной строке R, если вы хотите повторить приведённые примеры. Если команда слишком длинна и не помещается в одну строку, применяется значок + для переноса её на следующую строку.


Ввод данных с помощью функции c


Самой употребимой командой в R для быстрого ввода небольших наборов данных является функция c. Она объединяет или «сцепляет» (combines or concatenates) следующие за ней значения. Например, предположим, что у нас есть следующий набор чисел, выражающий количество опечаток на странице. Его мы назовём typos: 2 3 0 3 1 0 0 1
Чтобы ввести это в текущую сессию R, мы наберём
> typos = c(2,3,0,3,1,0,0,1)
> typos
[1] 2 3 0 3 1 0 0 1


Заметьте себе
• мы присвоили ряд значений переменной typos.
• знак равенства = является оператором присвоения в версии R 1.4.0 или выше. В более ранних версиях таким опрератором был (и по прежнему может быть) знак <-. Оба эти знака могут использоваться, хотя вы должны запомнить какой-либо один и пользоваться им. • значения переменной typos не выводятся автоматически на печать или на монитор. Это происходит только тогда, когда мы набираем имя переменной, как показано в последней строке предыдущего примера. • значения переменной typos предваряются чем-то подобным тому, что произошло в нашем примере: [1]. Это показывает, что наша переменная — вектор. Подробнее об этом мы поговорим ниже. Чтобы сэкономить силы

Во многих случаях вы можете сэкономить свои силы, если вы запомните, что клавиши стрелок могут использоваться для повторного ввода ранее введённых команд. Каждая команда сохраняется в истории сессии и с помощью клавиши «стрелка вверх» вы можете просматривать эту историю от последних команд к первым, а с помощью клавиши «стрелка вниз» — от первых к последним. Клавиши «стрелка влево» и «стрелка вправо» работают как обычно. Это в сочетании с мышкой существенно облегчает простое редактирование ваших предыдущих команд.

Применение функций

В R очень много встроенных функций, которыми можно обрабатывать такие данные, как typos. Одна из них — расчёт среднего (mean function). Воспользоваться ею просто:
> mean(typos)
[1] 1.25


Точно также мы можем вызвать расчёт медианы (median) или функцию дисперсии (var). Синтаксис этих команд такой же — имя функции с последующими круглыми скобками, в которых содержится один или несколько аргументов:
> median(typos)
[1] 1
> var(typos)
[1] 1.642857


Данные — это вектор

Данные содержатся в R как вектор. Это значит попросту то, что они находятся в том порядке, который был задан при их вводе. Т. е. тут есть некий первый элемент, второй элемент и т. д. вплоть до последнего элемента. Такая организация данных удобна по ряду причин:
• наш простенький вектор данных typos расположен в естественном порядке — число опечаток на первой странице, на второй и т. д. Мы бы не хотели всё тут попутать.
• мы бы могли изменить наши данные одно за другим вместо того, чтобы вводить весь массив снова.
• векторы суть математические объекты. Они — естественное продолжение таких математических концепций как сложение и умножение, что облегчает работу с данными в векторной форме.

Давайте посмотрим, как всё изложенное применяется к нашему примеру typos. Для начала предположим, что переменная typos из Раздела 1 есть первый черновик нашего текста. Мы хотим слегка исправить опечатки, т. е. изменить данные. Это можно было бы сделать так:
> typos.draft1 = c(2,3,0,3,1,0,0,1)
> typos.draft2 = c(0,3,0,3,1,0,0,1)


Таким образом, два набора typos различаются только первым числом. Обратите внимание на имена переменных. В отличие от других языков, точка (period) используется только в качестве разделителя. Нельзя пользоваться подчёркиванием _ , чтобы отделять имена друг от друга так, как это можно делать в других языках программирования.
Сейчас вы могли бы сказать, что слишком много времени занимает повторное переписывание данных. Могу ли я указать R просто внести изменения в первое значение? Ответ, естественно, будет «да». И вот как:
> typos.draft1 = c(2,3,0,3,1,0,0,1)
> typos.draft2 = typos.draft1 # делаем копию
> typos.draft2[1] = 0 # приписываем 0 первому значению


Обратите внимание на детали. Во-первых, знак комментария #. Вообще, всё что следует после этого знака в строке, игнорируется (естественно R, но, надеюсь, не читателем). Важнее однако то, что операция присвоения первому значению в векторе typos.draft2 сделана через ссылку на номер самого значения в векторе. Это сделано с помощью квадратных скобок []. Важно запомнить: круглые скобки () используются в функциях, тогда как квадратные [] — в векторах (и в дальнейших вызовах (arrays) и списках). В частности, мы получили следующие значения в typos.draft2
> typos.draft2 # вывести значения на экран
[1] 0 3 0 3 1 0 0 1
> typos.draft2[2] # вывести значение под номером два (опечатки на второй странице)
[1] 3
> typos.draft2[4] # значение под номером четыре (опечатки на четвёртой странице)
[1] 3
> typos.draft2[-4] # все, кроме четвёртого
[1] 0 3 0 1 0 0 1
> typos.draft2[c(1,2,3)] # и допустим ещё — первое, второе и третье.
[1] 0 3 0


Заметьте, что знак минус перед номером значения указывает R вывести всё, кроме этого номера. Последний пример особенно важен. Вы можете получить несколько значений сразу с использованием иного вектора с индексными номерами. Это так называемая «вырезка» (slicing).
Окей, нам нужно привести эти заметки в порядок, давайте найдём по настоящему плохие страницы. Мы, конечно, можем просто просмотреть наш список и заметить, что на второй и четвёртой странице больше всего опечаток. Можно ли это сделать в R более систематическим образом?
> max(typos.draft2) # каково самое большое число опечаток на странице?
[1] 3 # 3 опечатки
> typos.draft2 == 3 # Где страницы с тремя опечатками?
[1] FALSE TRUE FALSE TRUE FALSE FALSE FALSE FALSE


Заметьте, мы воспользовались двойным знаком равенства (==). Это указывает программе проверить все значения в typos.draft2 на равенство их 3. Второй и четвёртые ответы «да» (TRUE), все остальные — «нет» (FALSE).
Представьте, что вы спрашиваете R: «равно ли значение 3?» R ответит для всех значений каждого, даже самого длинного вектора, правда это (TRUE) или ложь (FALSE).
Но как же нам получить номера страниц, соответствующих условию? Давайте перефразируем наш запрос:
> which(typos.draft2 == 3)
[1] 2 4


Но что, если вам не подходит команда which? Вы не остались без помощи, но вы просто дожны немного больше поработать. Основная идея в этом случае состоит в том, чтобы создать вектор 1 2 3 ... , состоящий из номеров страниц, после чего вырезать из него (slicing) только те, для которых typos.draft2==3:
> n = length(typos.draft2) # сколько у нас страниц
> pages = 1:n # сгенерировать вектор, состоящий из последовательных номеров страниц
> pages # показать этот вектор
[1] 1 2 3 4 5 6 7 8
> pages[typos.draft2 == 3] # логическое исключение — чрезвычайно полезная команда
[1] 2 4


Чтобы создать вектор 1 2 3 ... мы воспользовались очень простым оператором двоеточия (colon) : . Конечно, мы могли бы просто напечатать эти номера вручную, но полезно знать, как это сделать автоматически. Команда a:b генерирует последовательной чисел a, a+1, a+2, ..., b (при этом a, b могут быть целыми или дробными):
> x=1.5:7
> x
[1] 1.5 2.5 3.5 4.5 5.5 6.5


Более общей функцией в R является seq(). Попробуйте ?seq для того, чтобы узнать о её опциях. Для того, чтобы воспроизвести предыдущий пример наберите:
>seq(1.5,7,1)

Пользование экстрагирующими элементами вектора с использованием другого вектора такого же размера, состоящего из єлементов «истинно» (TRUE) и «ложно» (FALSE) относится к операции извлечения логическим вектором. Заметьте, что это отличается от извлечения по номерам страниц через нарезку (slicing), описанного ранее. Знание, как пользоваться нарезкой (slicing) и логическими векторами, даёт вам возможность получить лёгкий доступ к вашим данным так, как это вам нужно.
Естественно, мы бы могли сделать всё описанное с использованием только одной команды (но зачем?):
> (1:length(typos.draft2))[typos.draft2 == max(typos.draft2)]
[1] 2 4


Это выглядит устрашающе и, к тому же, при наборе такой фразы можно наделать кучу ошибок, но приведённый пример на самом деле иллюстрирует, как команды могут быть объединены в короткую мощную фразу. Это очень важный момент. Чтобы оценить все прелести использования R, вы должны понять, как соединяется выход одной функции или операции со входщом другой. В математике это называется композицией (composition).
В конце-концов мы могли бы захотеть знать, сколько всего у нас опечаток, или, например, на каких страницах по-прежнему есть опечатки, или чем отличаются черновики? На эти вопросы можно получить ответ с помощью математических функций:
> sum(typos.draft2) # Сколько всего опечаток?
[1] 8
> sum(typos.draft2>0) # Сколько страниц с опечатками?
[1] 4
> typos.draft1 - typos.draft2 # Чем отличаются два черновика?
[1] 2 0 0 0 0 0 0 0


Пример: изучение ставок на бирже — добавление данных

Предположим, что дневные ставки вашей биржи за две недели таковы:
45,43,46,48,51,46,50,47,46,45
Введём эти данные в R как вектор:
> x = c(45,43,46,48,51,46,50,47,46,45)
> mean(x) # среднее
[1] 46.7
> median(x) # медиана
[1] 46
> max(x) # максимум или самое большое значение
[1] 51
> min(x) # минимум или наименьшее значение
[1] 43


Из приведённого примера следует, что много интересных функций можно легко найти по названию. Давайте посмотрим, как можно сделать что-нибудь другое. Во-первых, давайте добавим ставки двух следующих недель к данным вектора x, а именно: 48,49,51,50,49,41,40,38,35,40
Мы можем сделать это по-разному:
> x = c(x,48,49,51,50,49) # присоединить значения к x
> length(x) # какой длины сейчас x (было 10)
[1] 15
> x[16] = 41 # добавить ещё одно значение
> x[17:20] = c(40,38,35,40) # добавить оставшиеся


Заметьте, мы добавляли значения тремя разными способами. Все они полезны, поэтому объясним их. Сначала мы воспользовались оператором c (combine) и объединили прежние значения x с новыми. После этого мы напрямую приписали одно из них к 16 номеру (при этом до этого у x было только 15 значений, следовательно 16-е создалось автоматически). И, наконец, мы приписали оставшие к отрезку. Последнее сильно упрощает ряд задач.

Основы R: Графические интерфейсы для ввода данных

Есть и другие пути редактирования данных — с использованием интерфейса таблицы. Это может быть более предпочтительно для некоторых студентов. Рассмотрим их:
> data.entry(x) # Вызов таблицы для редактирования данных
> x = de(x) # То же самое, но без возможности записи изменений (в режиме «только для чтения»)
> x = edit(x) # Использование редактора для редактирования вектора x.


Всем этим легко пользоваться. Главной неожиданностью будет то, что переменная x должна быть определена заранее. Например:
> data.entry(x) # не работает. x не определена.
Error in de(..., Modes = Modes, Names = Names) :
Object "x" not found
> data.entry(x=c(NA)) # работает. x определена.

Другие методы ввода данных будут рассмотрены в Приложении.
Прежде чем мы закончим с этим примером, давайте посмотрим, как мы можем ещё манипулировать с данными. Всего несколько примеров.

Динамичное среднее (moving average) означает по-просту нахождение среднего за некоторое предыдущее число дней. Предположим, мы хотим пятидневное динамичное среднее (обычно применяется 50-дневное или 100-дневное). Мы можем сделать это, начиная с пятого дня торгов на бирже, поскольку другие дни содержат недостаточные данные:
> day = 5;
> mean(x[day:(day+4)])
[1] 48


Суть трюка состоит в том, чтобы извлечь из массива дни 5й, 6й, 7й, 8й и 9й:
> day:(day+4)
[1] 5 6 7 8 9

после чего взять среднее только от этих значений вектора x.

Какова наивысшая ставка торгов? Это легко найти с помощью функции max(x). Однако, Вы, возможно, интересуетесь наивысшей ставкой, когда-либо достигнутой к заданной дате (прим. переводчика: я не смог подобрать эквивалента термину running maximum, смысл которого поясняется аналогией с прибором «максимальный термометр»). Это также просто — если Вы знаете, что у R есть для этого встроенная функция. Она называется cummax, показывающий кумулятивный максимум. Покажем результаты обработки наших четырёжнедельных данных:
> cummax(x) # running maximum
[1] 45 45 46 48 51 51 51 51 51 51 51 51 51 51 51 51 51 51 51 51
> cummin(x) # running minimum
[1] 45 43 43 43 43 43 43 43 43 43 43 43 43 43 43 41 40 38 35 35


Пример: Работа с математикой

R позволяет легко оперировать математическими выражениями привычным нам образом (если, конечно, данные уже введены). Например, предположим, что ежегодное число китов, приплывающих к техасским пляжам за период с 1990 по 1999 таково: 74 122 235 111 292 111 211 133 156 79
Как отыскать среднее, дисперсию и стандартное отклонение? Итак:
> whale = c(74,122,235,111,292,111,211,133,156,79)
> mean(whale)
[1] 152.4
> var(whale)
[1] 5113.378
> std(whale)
Error: couldn’t find function "std"
> sqrt(var(whale))
[1] 71.50789
> sqrt(sum((whale - mean(whale))^2 /(length(whale)-1)))
[1] 71.50789


Ну, наконец-то! Во-первых, нужно помнить имена функций. Запомнить функцию mean() легко2, дисперсию — var() чуть сложнее, стандартное отклонение —std(), казалось бы, тоже очевидно, но почему R выдаёт ошибку? функции std() в нём нет! Но можно попробовать кое-что другое. Во-первых мы помним, что стандартное отклонение — это квадратный корень из дисперсии. Во-вторых, последняя строка иллюстрирует, что средствами R можно достаточно точно воспроизвести математическую формулу стандартного отклонения.

Конечно, было бы неплохо иметь всегда под рукой встроенную функцию. Сделать её очень легко:
> std = function(x) sqrt(var(x))
> std(whale)
[1] 71.50789


Лёгкость создания ваших собственных функций — это очень привлекательная особенность R; мы ещё вернёмся к ней.
Ну и наконец: если бы мы чуть больше напряглись, то мы могли бы отыскать уже встроенную команду для вычисления стандартного отклонения — sd(), которая даёт:
> sd(whale)
[1] 71.50789


Основы R: Доступ к данным

Существует несколько способов извлечь данные из вектора. Ниже приведён перечень использования как вырезок (slicing), так и извлечения данных с помощью логического вектора. Пусть x — это вектор данных, например x=1:10.

сколько элементов в векторе? length(x)
i-тый элемент x[2] (i = 2)
все элементы, кроме i-того x[-2] (i = 2)
первые k элементов x[1:5] (k = 5)
последние k элементов x[(length(x)-5):length(x)] (k = 5)
определённые элементы x[c(1,3,5)] (первый, третий и пятый)
все элементы, большие некоторого значения x[x>3] (3 — это граничное значение)
все элементы большие чем или меньшие чем некоторое значение x[ x< -2 | x > 2]
какие номера у самых больших элементов? which(x == max(x))

Упражнения

2.1 Предположим, Вы записываете каждый раз после поезки расстояние, которое Вы преодолели. В последних Ваших шести путешествиях расстояние было (в милях): 65311 65624 65908 66219 66499 66821 67145 67447.
Введите эти числа в R. Примените функцию diff() к этим данным. Что у Вас получилось?
> miles = c(65311, 65624, 65908, 66219, 66499, 66821, 67145, 67447)
> x = diff(miles)

Вы, должно быть, увидели разницу в числе миль между соседними поезками. Используйте max(), чтобы найти максимальную разницу между пройденными Вами расстояниями, mean(), чтобы вычислить среднее пройденное расстояние, и min(), чтобы узнать самое короткое из пройденных дистанций.

2.2 Предположим, Вы записывали время пути из дому на работу в течение двух недель (10 дней) и получили следующий ряд чисел (в минутах): 17 16 20 24 22 15 21 15 17 22.
Введите эти числа в R. Воспользуйтесь функцией max() для того, чтобы найти продолжительность самого долгого пути, mean() — среднего и min() — самого короткого. Сколько раз Вы шли 20 минут или дольше? (для ответа на этот вопрос попробуйте, если Вы назвали Ваш вектор commutes,
> sum(commutes>=20)
Что у Вас получилось? Каков процент Ваших походов продолжался менее 17 минут? Как бы Вы ответили на это с помощью R?

2.3 Счета за переговоры по Вашему мобильному телефону изменяются от месяца к месяцу. Предположим, за год суммы по месяцам были таковы: 46 33 39 37 46 30 48 32 49 35 30 48
Введите эти данные в R как переменную bill. Воспользуйтесь коммандой sum(), чтобы вычислить сумму, потраченную Вами на переговоры. Какова наименьшая сумма, потраченная Вами за один месяц? Наибольшая?Как часто Вы тратили больше 40 долларов? В скольки процентов случаев это было?

2.4 Вы хотите купить подержанный автомобиль и после трёх месяцев поисков по объявлениям нашли следующие цены (предположим, что автомобили одинаковые): 9000 9500 9400 9400 10000 9500 10300 10200
С помощью R вычислите среднюю цену и сравните её с оценочной ценой Эдмунта (http://www.edmunds.com) $9500. Отыщите минимальное и максимальное значения. Какая цена Вас бы устроила?

2.5 Попробуйте предположить результаты нижеприведённых команд в R. Учтите, что способом получения доступа к элементам вектора являются квадратные скобки [].
> x = c(1,3,5,7,9)
> y = c(2,3,5,7,11,13)

1. x+1
2. y*2
3. length(x) and length(y)
4. x + y
5. sum(x>5) and sum(x[x>5])
6. sum(x>5 | x< 3) # read | as ’or’, & and ’and’ 7. y[3] 8. y[-3] 9. y[x] (What is NA?) 10. y[y>=7]

2.6 Пусть данные вектора x определены так:
> x = c(1, 8, 2, 6, 3, 8, 5, 5, 5, 5)
С помощью R рассчитайте следующие функции. Заметьте, мы обозначаем как X1 первый элемент вектора x и т. д.
1. (X1 + X2 + · · · + X10 )/10 (используйте команду sum)
2. Отыщите log10 (Xi ) для каждого i. (Воспользуйтесь функцией log, основание которой по умолчанию равно e)
3. Отыщите (Xi − 4.4)/2.875 для каждого i. (Сделайте это за один раз)
4. Отыщите разность между самым большим и самым малым значением x.

Читать далее

5 лют. 2009 р.

РЕЦЕНЗИЯ на статью М. Касянчука, Е. Лещинского «Аналіз соціальних ідентичностей чоловіків, які мають секс із чоловіками, в українському суспільстві»

Коллега из дружественной организации прислал рецензию на нашу статью.


В. о. президента Гей-Форума Украины Святослав Шеремет

В целом, статья является существенным вкладом в академическое освещение МСМ-проблематики.

Замечания по существу
1.Мне представляется, что предметом статьи является не столько социальная идентичность, сколько социосексуальная идентичность.
2.Логически возникает вопрос, каким образом проведена в Дневнике Миготина градация посетителей плешки по возрасту. Путём опроса или визуальной оценки?
3.Градация по возрасту, на наш взгляд, проведена нерационально. Выглядело бы логичнее прописать группы «16–20 лет», «21-30 лет» и т. д., чтобы в каждой возрастной группе (кроме последней) закрывать группу ПОСЛЕДНИМ годом десятилетия жизни, а не предпоследним, как предложено в статье.
4.В разделе «Плешка как центр идентичностей» идёт речь о том, что «плешка возникает только в городской жизни новейшей эпохи». Наше знакомство с литературой позволяет настаивать на том, что истоки плешки в её современном виде восходят ко второй половине XIX в. В частности, прообразы плешки уже существовали в то время в Петербурге. Иначе говоря, следует вести речь о формировании плешки не в новейшем времени (после 1917 г.), а в конце нового времени.
5.В конце раздела «Плешка как центр идентичностей» идёт речь о том, что плешка сохраняет значение реперной точки, относительно которой выстраивается гомосексуальная идентичность. Мы добавили бы, что отчасти и бисексуальная тоже.
6.Определение коллективных социальных действий по Веберу, предложенное в начале раздела «Позитивные идентичности, или “Девки”», неудачно, по нашему мнению. Мы бы дали альтернативное, авторское определение.
7.Какую разницу соавторы усматривают между «негосударственными» и «некоммерческими» организациями, упомянутыми на с. 23? По сути, речь идёт об одних и тех же организациях, поэтому стоило бы поменять формулировку, забрав союз «и».
8.Из статьи можно заключить, что авторы подразумевают некоторую тождественность между «приличными людьми» и «геями», что, на наш взгляд, требовало бы дополнительных разъяснений.

Замечания по форме
1.Неправильно подан инициал имени второго соавтора — «E» вместо необходимого «Ye».
2.При упоминании ряда авторов, например, М. Витковского и М. Вебера, употреблены инициалы имён вместо самих имён. Между тем, употребление инициала оправдано лишь в тех случаях, когда имя уже введено выше по тексту. Инициалы сами по себе бессодержательны.
3.Некачественная корректура, в т. ч. по части орфографии. Пример — слово «примірм» (3‑я строка на с. 20 снизу).
4.В цитате из [10] на с. 23 отсутствует выделение, отмеченное соавторами.
5.Не все источники цитат отображены в конечных ссылках, как, например, цитата с бэггерского сайта на с. 25.
6.Встречаются русизмы типа «достоїн влади» вместо нормативного «гідний влади» (с. 26).
7.В словах, предполагающих возможность различного ударения, следует ставить знак ударения (акут). Пример: «світові» на с. 27 в выводе № 3: неправильное прочтение этого слова сбивает с толку.
8.Несколько позиций литературы необоснованно объединены в одно целое: см. позицию 3 списка литературы.
9.Список литературы составлен недостаточно скрупулёзно: например, не указан год издания газеты, названной в позиции 7 списка литературы.

Читать далее

1 лют. 2009 р.

01. Просто R – Использование R для ознакомительной статистики

Этим постом я открываю серию моих переводов из учебного пособия "Просто R – Использование R для ознакомительной статистики" американского автора John'a Verzani.
http://www.math.csi.cuny.edu/Statistics/R/simpleR

Предисловие автора

Эти заметки являются введением в использование статистического програмного пакета R в ознакомительном курсе статистики. Они должны сопровождать учебник, например такой как Kitchens «Exploring Statistics». Их целью было не столько показать все особенности R или заменить стандартное руководство к нему, но скорее быть полезным вместе с руководством, для того чтобы проиллюстрировать те особенности R, которые можно изучить за один семестр вводного курса статистики.

Эти заметки были написаны с учётом преимуществ версии R 1.5.0 или более поздней. Из учебных соображений знак равенства, =, используется как оператор присвоения (an assignment operator) вместо традиционной стрелки <-. Это было добавлено в R в версии 1.4.0. Если же читателю доступна лишь более старая версия, то он должен будет вводить небольшие поправки. В этом тексте я буду несколько раз ссылаться на данные и функции, которые надо установить, прежде чем ими пользоваться. Сделать это несложно, но инструкции будут отличаться в зависимости от вашей операционной системы. Пользователям Windows нужно загрузить «zip»-файл, после чего установить его из меню «Программы». В UNIX следует использовать комманду R cmd install имя-пакета.tar.gz Некоторые из наборов данных я позаимствовал у других авторов, особенно у Kitchens. Более подробно это описано в help-файлах каждого набора данных. Все эти материалы доступны как R-пакеты по адресам: http://www.math.csi.cuny.edu/Statistics/R/simpleR/Simple 0.4.zip для пользователей Windows
http://www.math.csi.cuny.edu/Statistics/R/simpleR/Simple 0.4.tar.gz для пользователей UNIX

Кроме этого, отдельные наборы данных можно скачать по адресу:
http://www.math.csi.cuny.edu/Statistics/R/simpleR/Simple

Это версия 0.4 заметок, от 22 августа 2002 года.
Copyright c John Verzani (verzani@math.csi.cuny.edu), 2001-2. All rights reserved.


Раздел 1: Введение
Что такое R

Эти заметки описывают, как пользоваться R при изучении вводного курса статистики. Моей целью было упростить освоение этой превосходной программой на «низкоуровневых» курсах, где часто пользуются такими пакетами как MINITAB, SPSS, Excel и др. Я предполагаю, что читатель к этому моменту уже усвоил курс «начальных вычислений» (pre-calculus course). Надеюсь, что студенты, увидев на этом начальном этапе, как пользоваться R, будут лучше разбираться в статистических вопросах и извлекут значительно большую пользу из более сложных программ.

Преимуществами R для начинающих являются:
• R — свободен и бесплатен. R относится к категории «open-source» и его можно запускать под UNIX, Windows и Macintosh.
• у R есть отличная встроенная система помощи.
• у R превосходные визуализационные возможности.
• студенты могут легко перейти от R к коммерческой программе S-Plus, если возникнет потребность.
• язык R обладает мощным, лёгким в изучении синтаксисом с огромным количеством встроенных статистических функций.
• этот язык легко расширить функциями, написанными самим пользователем.
• R — это язык компьютерного программирования. Для программистов он покажется более знакомым, чем для других, особенно для начинающих пользователей; однако после него перейти к программированию будет намного легче.

В чём же R проигрывает по сравнению с другими программными продуктами?
• у него очень ограниченный графический интерфейс (даже у S‑Plus он значительно лучше). Это значит, что R сложнее учить на первых порах.
• у него нет коммерческой поддержки (хотя некоторые говорят, что международная рассылка, в которой обсуждаются проблемы R, даже лучше).
• командный язык R — это язык программирования, поэтому студенты должны чётко владеть, к примеру, вопросами его синтаксиса.

R является «open-source» (по лицензии GPL) статистическим окружением, сделанным по образцу языков S и S‑Plus (http://www.insightful.com). Язык S был разработан в конце 1980х в лабораториях компании AT&T. Проект R был начат Робертом Джентельменом (Rober Gentleman) и Россом Игакой (Ross Ihaka) с факультета статистики Оклендского университета (Statistics Department of the University of Auckland) в 1995м. Проект сразу получил широкое признание. Он по сию пору поддерживается Командой развития R (R core-development team), состоящей из интенсивно работающего, международного коллектива добровольных разработчиков. Интернет-страница проекта R (http://www.r-project.org) является основным информационным ресурсом по R. На этом сайте можно получить как саму программу R, так и дополнительные пакеты, а также познакомиться с соответствующей документацией.

Читать далее