Пятница, 14 августаИнститут «Высшая школа журналистики и массовых коммуникаций» СПбГУ
Тень

Методологические основы анализа ценностных ориентаций в российском сегменте социальных сетей. Описание методики и ее апробация на эмпирическом материале

Постановка проблемы

Между клас­си­че­ски­ми под­хо­да­ми и мето­да­ми ана­ли­за цен­но­стей по циф­ро­вым дан­ным суще­ству­ет важ­ное мето­до­ло­ги­че­ское про­ти­во­ре­чие. Если тра­ди­ци­он­ные опрос­ные мето­ди­ки огра­ни­че­ны соци­аль­ной жела­тель­но­стью отве­тов респон­ден­тов и жест­ко задан­ным набо­ром кате­го­рий, то ана­лиз циф­ро­вых сле­дов стал­ки­ва­ет­ся с дру­ги­ми труд­но­стя­ми: зашум­лен­но­стью дан­ных, невоз­мож­но­стью одно­знач­ной интер­пре­та­ции и про­бле­мой репре­зен­та­тив­но­сти выбор­ки. Данное про­ти­во­ре­чие тре­бу­ет созда­ния ком­плекс­ной мето­до­ло­гии, спо­соб­ной объ­еди­нить есте­ствен­ность и спон­тан­ность циф­ро­вых дан­ных с точ­но­стью и интер­пре­ти­ру­е­мо­стью клас­си­че­ских методов.

История вопроса

Ценности рас­смат­ри­ва­ют­ся соци­аль­ной нау­кой как базо­вые ори­ен­ти­ры, вли­я­ю­щие на миро­воз­зре­ние и пове­де­ние людей. Классические под­хо­ды к изу­че­нию цен­но­стей опи­ра­ют­ся на социо­ло­ги­че­ские опро­сы и пси­хо­ло­ги­че­ские мето­ди­ки (напри­мер, шка­лы М. Рокича [Rokeach 1973], а так­же тео­рию базо­вых цен­но­стей Ш. Шварца [Schwartz 1992]). Ш. Шварц опре­де­ля­ет цен­но­сти как устой­чи­вые убеж­де­ния, выра­жа­ю­щие пред­по­чти­тель­ные цели, кото­рые слу­жат руко­во­дя­щи­ми прин­ци­па­ми в жиз­ни чело­ве­ка. Традиционные мето­ды (опрос­ни­ки, рей­тин­ги цен­но­стей) поз­во­ля­ют изме­рить декла­ри­ру­е­мые цен­ност­ные ори­ен­та­ции, одна­ко обла­да­ют извест­ны­ми огра­ни­че­ни­я­ми — вли­я­ни­ем соци­аль­ной жела­тель­но­сти и огра­ни­чен­но­стью чис­ла задан­ных кате­го­рий [Phillips, Clancy 1972].

Развитие же соци­аль­ных сетей откры­ло новые воз­мож­но­сти для изу­че­ния цен­но­стей на осно­ве циф­ро­вых сле­дов — спон­тан­ных тек­стов, пуб­ли­ку­е­мых поль­зо­ва­те­ля­ми в интер­не­те. В этих пото­ках есте­ствен­но воз­ник­ше­го кон­тен­та могут про­яв­лять­ся цен­ност­ные ори­ен­та­ции, напри­мер в упо­ми­на­ни­ях того, что поль­зо­ва­те­ли счи­та­ют «важ­ным», «доро­гим серд­цу», за что испы­ты­ва­ют гор­дость или, напро­тив, что их воз­му­ща­ет и т. п. Анализ тако­го мате­ри­а­ла пред­став­ля­ет боль­шой инте­рес для иссле­до­ва­ния цен­но­стей, посколь­ку поз­во­ля­ет выявить цен­но­сти, реаль­но про­яв­ля­ю­щи­е­ся в мас­со­вом дис­кур­се, вне рамок фор­ма­ли­зо­ван­ных анкет [Kalimeri et al. 2019].

Более того, циф­ро­вые дан­ные поз­во­ля­ют отсле­жи­вать дина­ми­ку цен­ност­ных акцен­тов в обще­стве прак­ти­че­ски в реаль­ном вре­ме­ни и с высо­кой сте­пе­нью дета­ли­за­ции (напри­мер, по реги­о­нам, груп­пам или событиям).

В то же вре­мя ана­лиз цен­но­стей по дан­ным соци­аль­ных сетей сопря­жен с мето­до­ло­ги­че­ски­ми труд­но­стя­ми. Во-первых, сами тек­сты соци­аль­ных медиа не струк­ту­ри­ро­ва­ны под иссле­до­ва­ние цен­но­стей (они могут быть крат­ки, насы­ще­ны жар­го­ном, эмо­ци­я­ми, могут содер­жать нере­ле­вант­ную инфор­ма­цию или спам). Во-вторых, не все пуб­лич­ные сооб­ще­ния дей­стви­тель­но отра­жа­ют глу­бин­ные цен­но­сти авто­ров — неко­то­рые посты могут быть ситу­а­тив­ны­ми или ими­ти­ро­вать попу­ляр­ные нар­ра­ти­вы. Существует так­же про­бле­ма атри­бу­ти­ро­ва­ния и репре­зен­та­тив­но­сти (ауди­то­рия соци­аль­ных сетей не в пол­ной мере пред­став­ля­ет все слои обще­ства, а часть поль­зо­ва­те­лей пуб­ли­ку­ет кон­тент анонимно).

Целью насто­я­ще­го иссле­до­ва­ния явля­ет­ся раз­ра­бот­ка и обос­но­ва­ние под­хо­да к выяв­ле­нию и ана­ли­зу цен­ност­ных ори­ен­та­ций в рос­сий­ском сег­мен­те соци­аль­ных сетей, обес­пе­чи­ва­ю­ще­го досто­вер­ность, интер­пре­ти­ру­е­мость и даль­ней­шую опе­ра­ци­о­на­ли­зи­ру­е­мость резуль­та­тов. Для дости­же­ния этой цели была реа­ли­зо­ва­на мно­го­сту­пен­ча­тая мето­до­ло­гия, включающая:

— отбор лек­си­че­ских мар­ке­ров и фор­му­ли­ро­вок, реле­вант­ных теме ценностей;

— сбор круп­но­мас­штаб­ной выбор­ки сооб­ще­ний из соци­аль­ных медиа с помо­щью систе­мы мониторинга;

— пре­до­б­ра­бот­ку тек­стов (очист­ку, нор­ма­ли­за­цию, отбор лексики);

— авто­ма­ти­че­ское тема­ти­че­ское моде­ли­ро­ва­ние тек­стов с целью выяв­ле­ния латент­ных цен­ност­ных тем;

— кла­сте­ри­за­цию тема­ти­че­ских при­зна­ков и семан­ти­че­ски близ­ких групп ценностей;

— экс­перт­ную интер­пре­та­цию и вали­да­цию полу­чен­ных кластеров.

Методология вклю­ча­ет после­до­ва­тель­ность эта­пов, каж­дый из кото­рых направ­лен на реше­ние отдель­ной зада­чи от под­го­тов­ки дан­ных до интер­пре­та­ции результатов.

Описание методики исследования

До нача­ла сбо­ра дан­ных систе­мой мони­то­рин­га Brand Analytics (более 100 тыс. источ­ни­ков — соц­се­ти, СМИ, мес­сен­дже­ры, мар­кет­плей­сы и др.) был про­ве­ден этап пред­ва­ри­тель­ной лексико-семантической под­го­тов­ки, направ­лен­ный на уточ­не­ние язы­ко­вых при­зна­ков, по кото­рым мож­но иден­ти­фи­ци­ро­вать сооб­ще­ния, содер­жа­щие рас­суж­де­ния о ценностях.

В рам­ках это­го эта­па были про­ана­ли­зи­ро­ва­ны сте­но­грам­мы фокус-групп, мате­ри­а­лы глу­бин­ных интер­вью, а так­же пуб­лич­ные выступ­ле­ния (интер­вью, лек­ции, речи), в кото­рых люди обсуж­да­ли темы, свя­зан­ные с жиз­нен­ны­ми при­о­ри­те­та­ми и самоопределением.

Анализ поз­во­лил выде­лить харак­тер­ные язы­ко­вые кон­струк­ции, с кото­рых обыч­но начи­на­ет­ся раз­го­вор о цен­но­стях. Речь шла не столь­ко об отдель­ных сло­вах, сколь­ко об устой­чи­вых язы­ко­вых фор­му­лах, мар­ки­ру­ю­щих лич­ност­ные уста­нов­ки и убеж­де­ния, напри­мер Моя жиз­нен­ная цель…; Для меня важ­но…; Я гор­жусь тем, что…; Я счи­таю глав­ным…; В моей жиз­ни главное…

В резуль­та­те было сфор­ми­ро­ва­но ядро из 38 устой­чи­вых фраз, кото­рые ста­ли филь­тром при после­ду­ю­щем сбо­ре сооб­ще­ний. Эти фра­зы поз­во­ли­ли сузить выбор­ку до сооб­ще­ний, в кото­рых поль­зо­ва­те­ли наме­рен­но арти­ку­ли­ру­ют цен­ност­ные пози­ции, в отли­чие от быто­вых выска­зы­ва­ний на отвле­чен­ные темы. Подход обес­пе­чил кон­тек­сту­аль­ную реле­вант­ность выбор­ки, сохра­нив при этом есте­ствен­ную язы­ко­вую сре­ду и поз­во­лив сосре­до­то­чить­ся на сооб­ще­ни­ях, где цен­но­сти осмыс­ля­ют­ся или декла­ри­ру­ют­ся явно.

Сбор данных

В каче­стве источ­ни­ка дан­ных исполь­зо­ва­ны откры­тые пуб­ли­ка­ции поль­зо­ва­те­лей рос­сий­ско­го сег­мен­та соци­аль­ных сетей, агре­ги­ро­ван­ные с помо­щью систе­мы мони­то­рин­га соц­ме­диа Brand Analytics. Система поз­во­ля­ет соби­рать пуб­лич­ные сооб­ще­ния из раз­лич­ных источ­ни­ков («ВКонтакте», «Одноклассники» и др.), а так­же из блог-платформ и ком­мен­та­ри­ев в СМИ, филь­труя их по язы­ку, реги­о­ну и дру­гим пара­мет­рам. Использование Brand Analytics обес­пе­чи­ло мас­штаб­ный охват: были выгру­же­ны сооб­ще­ния на рус­ском язы­ке общим объ­е­мом свы­ше двух мил­ли­о­нов за задан­ный пери­од наблю­де­ния (с сен­тяб­ря 2023 г. по сен­тябрь 2024 г.) по опре­де­лен­ным на более ран­нем эта­пе 38 устой­чи­вым лек­си­че­ским мар­ке­рам. Каждый собран­ный доку­мент содер­жал текст сооб­ще­ния, мета­дан­ные об авто­ре (ано­ни­ми­зи­ро­ван­ный ID, пол, воз­раст­ная кате­го­рия при нали­чии), дату пуб­ли­ка­ции и ука­за­ние на источ­ник (плат­фор­му).

Для того что­бы сфо­ку­си­ро­вать­ся имен­но на содер­жа­тель­ных выска­зы­ва­ни­ях, каса­ю­щих­ся цен­но­стей, из обще­го мас­си­ва исклю­че­ны тех­ни­че­ские и реклам­ные посты. В част­но­сти, на эта­пе сбо­ра был при­ме­не­ны базо­вые сиг­на­ту­ры спа­ма (сооб­ще­ния, содер­жа­щие лишь ссыл­ки, рекла­му това­ров, явные при­зы­вы ком­мер­че­ско­го харак­те­ра и т. п.). Отдельного вни­ма­ния заслу­жи­ва­ет про­бле­ма репре­зен­та­тив­но­сти: ауди­то­рия соци­аль­ных сетей не явля­ет­ся ста­ти­сти­че­ски репре­зен­та­тив­ной выбор­кой насе­ле­ния. Мы осо­зна­ем это огра­ни­че­ние и рас­смат­ри­ва­ем полу­чен­ные резуль­та­ты как харак­тер­ные имен­но для актив­ных поль­зо­ва­те­лей соци­аль­ных медиа, а не для все­го насе­ле­ния России. Тем не менее, учи­ты­вая мас­со­вость соц­се­тей, собран­ные два мил­ли­о­на сооб­ще­ний отра­жа­ют мне­ния широ­кой и раз­но­об­раз­ной аудитории.

Предобработка текстов

На сле­ду­ю­щем эта­пе была про­ве­де­на лек­си­че­ская нор­ма­ли­за­ция и под­го­тов­ка тек­сто­во­го кор­пу­са с целью при­ве­де­ния его к фор­ме, удоб­ной для ком­пью­тер­но­го тема­ти­че­ско­го ана­ли­за. Эта обра­бот­ка вклю­ча­ла несколь­ко процедур.

Из сооб­ще­ний уда­ле­ны неже­ла­тель­ные сим­во­лы (HTML-теги, эмод­зи, мусор­ные повто­ря­ю­щи­е­ся зна­ки) и токе­ны, не несу­щие смыс­ло­вой нагруз­ки в кон­тек­сте ана­ли­за цен­но­стей, напри­мер упо­ми­на­ния поль­зо­ва­те­лей (@username), хеш­те­ги, URL-ссылки. Также на этом шаге из рас­смот­ре­ния исклю­ча­лись сооб­ще­ния, иден­тич­ные по содер­жа­нию (дуб­ли­ка­ты, часто воз­ни­ка­ю­щие при репо­стах), что­бы не сме­щать ста­ти­сти­ку в сто­ро­ну широ­ко разо­шед­ших­ся шаблонов.

Каждый текст раз­би­вал­ся на отдель­ные токе­ны (сло­ва и зна­чи­мые сим­во­лы). Затем из спис­ка токе­нов уда­ля­лись стоп-слова — наи­бо­лее частые сло­ва язы­ка, не несу­щие спе­ци­фи­ка­ции темы (место­име­ния, слу­жеб­ные части речи, меж­до­ме­тия и т. д.). Исключение стоп-слов — стан­дарт­ная прак­ти­ка при обра­бот­ке тек­ста, поз­во­ля­ю­щая сни­зить шум и раз­мер­ность дан­ных, а уда­ле­ние часто встре­ча­ю­щих­ся неин­фор­ма­тив­ных слов улуч­ша­ет каче­ство тема­ти­че­ско­го моде­ли­ро­ва­ния и сни­жа­ет вычис­ли­тель­ную нагруз­ку [Schofield, Magnusson, Mimno 2017; Zimmermann et al. 2024]. Для рус­ско­го язы­ка был исполь­зо­ван объ­еди­нен­ный спи­сок стоп-слов из откры­тых биб­лио­тек (NLTK, SpaCy) с допол­ни­тель­ны­ми домен­ны­ми попол­не­ни­я­ми (напри­мер, сло­ва «это», «свой», «кото­рый» и т. п.). После пер­во­на­чаль­но­го моде­ли­ро­ва­ния спи­сок стоп-слов уточ­нял­ся ите­ра­тив­но: из ана­ли­за исклю­ча­лись сло­ва, кото­рые ока­за­лись широ­ко рас­про­стра­не­ны, но не отно­сят­ся к темам цен­но­стей (напри­мер, «год», «делать», «быть» в опре­де­лен­ных кон­текстах). Такой под­ход соот­вет­ству­ет реко­мен­да­ци­ям по адап­та­ции переч­ня стоп-слов под кон­крет­ный кор­пус [Schofield, Magnusson, Mimno 2017].

На эта­пе лек­си­че­ской нор­ма­ли­за­ции была про­ве­де­на лем­ма­ти­за­ция — все сло­ва при­ве­де­ны к базо­вой сло­во­фор­ме (име­ни­тель­но­му паде­жу, един­ствен­но­му чис­лу для суще­стви­тель­ных, инфи­ни­ти­ву для гла­го­лов и т. д.). Для это­го при­ме­нен мор­фо­ло­ги­че­ский ана­ли­за­тор биб­лио­тек PyMystem3 и PyMorphy2, поз­во­ля­ю­щий с высо­кой точ­но­стью опре­де­лять лем­му сло­ва. Благодаря исполь­зо­ва­нию тако­го инстру­мен­та сло­ва «герой», «героя», «геро­ям» будут рас­смат­ри­вать­ся как одна лек­се­ма «герой», а, напри­мер, гла­голь­ные фор­мы «люб­лю», «любил», «любить» — как «любить». Лемматизация умень­ша­ет искус­ствен­ное раз­дроб­ле­ние тема­ти­че­ских при­зна­ков и улуч­ша­ет каче­ство моде­ли­ро­ва­ния [May, Cotterell, Van Durme 2016]. В слу­ча­ях омо­ни­мии выби­ра­лось наи­бо­лее веро­ят­ное зна­че­ние на осно­ве кон­тек­ста (что обес­пе­чи­ва­ет мор­фо­ло­ги­че­ский ана­лиз с раз­ре­ше­ни­ем неод­но­знач­но­сти). После лем­ма­ти­за­ции объ­ем уни­каль­но­го сло­ва­ря кор­пу­са суще­ствен­но сни­зил­ся (до 800 тыс. уни­каль­ных лемм), что облег­чи­ло после­ду­ю­щие вычис­ли­тель­ные процедуры.

После нор­ма­ли­за­ции про­ве­де­на оцен­ка частот­но­сти тер­ми­нов. Были исклю­че­ны из ана­ли­за крайне ред­кие сло­ва, встре­тив­ши­е­ся лишь 1–2 раза, посколь­ку они не дают устой­чи­вых тем и уве­ли­чи­ва­ют раз­ре­жен­ность дан­ных. Такой адап­тив­ный отбор при­зна­ков соот­вет­ству­ет под­хо­дам, реко­мен­ду­е­мым в зада­чах тема­ти­че­ско­го моде­ли­ро­ва­ния боль­ших кор­пу­сов [Manning, Raghavan, Schütze 2008]. В резуль­та­те дан­но­го эта­па каж­дый текст сооб­ще­ния пре­об­ра­зо­ван в нор­ма­ли­зо­ван­ный набор лемм, очи­щен­ный от шумо­вых и нере­ле­вант­ных эле­мен­тов. Этот очи­щен­ный кор­пус послу­жил осно­вой для выяв­ле­ния тема­ти­че­ских структур.

Анализ материала

Тематическое моделирование (LDA)

Для авто­ма­ти­че­ско­го выяв­ле­ния скры­тых тема­ти­че­ских струк­тур, отра­жа­ю­щих цен­ност­ные ори­ен­ти­ры, при­ме­не­но тема­ти­че­ское моде­ли­ро­ва­ние на осно­ве веро­ят­ност­ной моде­ли латент­но­го раз­ме­ще­ния Дирихле (Latent Dirichlet Allocation, LDA). Этот метод, пред­ло­жен­ный Д. Блеем и кол­ле­га­ми, широ­ко исполь­зу­ет­ся для обна­ру­же­ния latent topics в боль­ших тек­сто­вых кол­лек­ци­ях [Blei, Ng, Jordan 2003]. В кон­тек­сте наше­го иссле­до­ва­ния роль тем выпол­ня­ют потен­ци­аль­ные цен­ност­ные ори­ен­та­ции, про­яв­ля­ю­щи­е­ся в поль­зо­ва­тель­ских обсуждениях.

Суть LDA заклю­ча­ет­ся в том, что она рас­смат­ри­ва­ет каж­дый доку­мент (сооб­ще­ние) как смесь несколь­ких латент­ных тем, а каж­дую тему — как рас­пре­де­ле­ние на сло­вар­ном мно­же­стве [Blei, Ng, Jordan 2003]. На выхо­де LDA-моделирования полу­ча­ют­ся набо­ры топ-слов, харак­те­ри­зу­ю­щих каж­дую тему. В нашем слу­чае эти темы долж­ны соот­вет­ство­вать раз­лич­ным цен­но­стям или их соче­та­ни­ям, при­сут­ству­ю­щим в данных.

Мы зада­ли отно­си­тель­но круп­ное чис­ло тем (5 тыс.) на эта­пе моде­ли­ро­ва­ния LDA, что­бы полу­чить раз­дель­но даже близ­кие по смыс­лу цен­ност­ные кате­го­рии. Такое «раз­ре­ше­ние» оправ­да­но стрем­ле­ни­ем не про­пу­стить мел­кие, но зна­чи­мые темы. В лите­ра­ту­ре отме­ча­ет­ся, что для корот­ких тек­стов (напри­мер, тви­тов) опти­маль­ное чис­ло тем может быть доста­точ­но боль­шим, что­бы учесть раз­но­об­ра­зие дис­кур­са [Murshed et al. 2022].

Полученные LDA-темы были про­ана­ли­зи­ро­ва­ны по спис­кам самых веро­ят­ных слов. Выявлено, что мно­гие темы явно отра­жа­ют цен­ност­ные кате­го­рии. Например, одна из тем содер­жа­ла топ-слова: стра­на, роди­на, гор­дость, народ, Россия, подвиг, герой… — что ука­зы­ва­ло на пат­ри­о­ти­че­скую цен­ность. Другая тема вклю­ча­ла сло­ва любовь, семья, друг, под­держ­ка, помо­гать, забо­та… — оче­вид­но, тема меж­лич­ност­ных отно­ше­ний. Однако часть тем ока­за­лась труд­ной для интер­пре­та­ции или дуб­ли­ро­ва­ла дру­гую тему. Подобное явле­ние извест­но при тема­ти­че­ском моде­ли­ро­ва­нии: неко­то­рые латент­ные темы могут быть «шумо­вы­ми» либо раз­ла­гать одну смыс­ло­вую тему на избы­точ­ное чис­ло ком­по­нен­тов [Churchill, Singh 2023].

Для улуч­ше­ния интер­пре­ти­ру­е­мо­сти резуль­та­тов мы объ­еди­ни­ли сход­ные темы и отфиль­тро­ва­ли бес­со­дер­жа­тель­ные. Сходство тем оце­ни­ва­лось по пере­кры­ва­ю­щим­ся клю­че­вым сло­вам и по сход­ству рас­пре­де­ле­ний тем по доку­мен­там. Если две темы име­ли явно схо­жее смыс­ло­вое ядро (напри­мер, обе про семей­ные цен­но­сти, но с раз­ным акцен­том), они объ­еди­ня­лись на сле­ду­ю­щем эта­пе ана­ли­за посред­ством кла­сте­ри­за­ции. По резуль­та­там LDA-моделирования зна­чи­мая часть веро­ят­ност­но­го набо­ра веро­ят­ных тем рас­пре­де­ли­лась по цен­ност­ным кате­го­ри­ям, задан­ным на эта­пе интер­пре­та­ции иссле­до­ва­те­ля­ми. Это сви­де­тель­ству­ет в поль­зу при­ме­ни­мо­сти подхода.

Кластеризация ценностных кластеров (Word2Vec + k‑means)

После выде­ле­ния началь­но­го набо­ра цен­ност­ных тем с помо­щью LDA воз­ник­ла зада­ча сгруп­пи­ро­вать эти темы в укруп­нен­ные кла­сте­ры цен­но­стей и опре­де­лить их семан­ти­че­ские мет­ки. Для это­го был при­ме­нен двух­ша­го­вый под­ход: сна­ча­ла постро­е­ны кон­тек­сту­аль­ные век­тор­ные пред­став­ле­ния слов (word embeddings), затем выпол­не­на кла­сте­ри­за­ция век­тор­ных при­зна­ков мето­дом k-сред­них.

Мы вос­поль­зо­ва­лись алго­рит­мом Word2Vec для обу­че­ния век­тор­ных пред­став­ле­ний слов на нашем кор­пу­се сооб­ще­ний. Word2Vec поз­во­ля­ет отра­зить скры­тые семан­ти­че­ские свя­зи: сло­ва, часто упо­треб­ля­ю­щи­е­ся в похо­жих кон­текстах, полу­ча­ют близ­кие век­то­ры в про­стран­стве [Mikolov et al. 2013]. Поэтому в одном кла­сте­ре могут сбли­жать­ся как лек­се­мы, выра­жа­ю­щие цен­ность, так и лек­си­ка ее нару­ше­ния (вклю­чая анто­ни­мы), если они регу­ляр­но встре­ча­ют­ся в сход­ных кон­текстах обсуж­де­ния соот­вет­ству­ю­щей проблематики.

Мы обу­чи­ли модель на всем кор­пу­се (2 млн сооб­ще­ний, око­ло 300 млн сло­во­упо­треб­ле­ний), что гаран­ти­ро­ва­ло ста­ти­сти­че­скую устой­чи­вость эмбед­дин­гов даже для ред­ких цен­ност­ных тер­ми­нов. В каче­стве про­вер­ки каче­ства эмбед­дин­гов оце­ни­ва­ли устой­чи­вость бли­жай­ших семан­ти­че­ских сосе­дей при пере­обу­че­нии моде­ли. В серии из шести запус­ков сред­няя доля сов­па­де­ния 20 бли­жай­ших сосе­дей для частот­ных лемм соста­ви­ла 0,60 (12 из 20). Дополнительно на отдель­ных при­ме­рах про­ве­ря­лось, что модель сбли­жа­ет семан­ти­че­ски свя­зан­ные поня­тия (напри­мер, «семья» и «роди­те­ли», «пат­ри­о­тизм» и «нация») и не сбли­жа­ет заве­до­мо несвя­зан­ные (напри­мер, «пат­ри­о­тизм» и «ком­форт»).

На осно­ве полу­чен­ных эмбед­дин­гов слов была про­ве­де­на кла­сте­ри­за­ция, что­бы объ­еди­нить сло­ва и темы в более общие кла­сте­ры цен­но­стей. Для кла­сте­ри­за­ции эмбед­дин­гов выбран алго­ритм k-means (k-сред­них) как вос­про­из­во­ди­мый метод, мас­шта­би­ру­е­мый на боль­ших мас­си­вах век­тор­ных дан­ных, он раз­би­ва­ет мно­же­ство век­то­ров на k кла­сте­ров, мини­ми­зи­руя сум­мар­ную внут­ри­кла­стер­ную вари­а­цию (сум­му квад­ра­тов рас­сто­я­ний объ­ек­тов до цен­т­ро­и­дов) [Boehmke, Greenwell 2020]. В дан­ном слу­чае мы кла­сте­ри­зо­ва­ли век­то­ры клю­че­вых слов и выра­же­ний, харак­тер­ных для LDA-тем, а так­же сред­ние век­то­ры самих тем. Это объ­еди­не­ние поз­во­ли­ло свя­зать близ­кие по смыс­лу темы. Например, одна из тем LDA каса­лась «пат­ри­о­тиз­ма», дру­гая — «гор­до­сти и ува­же­ния», тре­тья — «исто­ри­че­ской памя­ти»; их клю­че­вые сло­ва (роди­на, гор­дость, долг, герой, исто­рия и т. д.) обра­зо­ва­ли плот­ную груп­пу в век­тор­ном про­стран­стве и были объ­еди­не­ны k-means в один кла­стер цен­но­сти «патриотизм/гордость».

Число кла­сте­ров k под­би­ра­лось эмпи­ри­че­ски в ходе серии проб­ных запус­ков и соот­но­си­лось с зада­чей после­ду­ю­щей содер­жа­тель­ной интер­пре­та­ции кла­сте­ров как цен­ност­ных ори­ен­та­ций в трак­тов­ке клас­си­че­ских под­хо­дов [Rokeach 1973; Schwartz 1992]. В каче­стве рабо­че­го ком­про­мис­са было выбра­но k = 25: при мень­ших зна­че­ни­ях ряд тема­ти­че­ски раз­лич­ных групп сли­вал­ся, а при бóль­ших воз­ни­ка­ла избы­точ­ная фраг­мен­та­ция, ухуд­ша­ю­щая интер­пре­ти­ру­е­мость. В резуль­та­те алго­ритм k-means раз­де­лил семан­ти­че­ское про­стран­ство на 25 групп. Исследования пока­зы­ва­ют, что k-means спо­со­бен выяв­лять груп­пы, близ­кие к темам LDA, при соот­вет­ству­ю­щей настрой­ке k [Lossio-Ventura et al. 2019], что и под­твер­ди­лось (боль­шин­ство полу­чен­ных кла­сте­ров при­мер­но соот­вет­ство­ва­ли одной или двум исход­ным темам LDA). Отметим, что k-means как метод доволь­но чув­стви­те­лен к ини­ци­а­ли­за­ции кла­стер­ных цен­тров, поэто­му, что­бы полу­чить устой­чи­вое раз­би­е­ние, мы запу­сти­ли алго­ритм несколь­ко раз и выбра­ли реше­ние с наи­мень­шей внут­ри­кла­стер­ной дисперсией.

Каждому кла­сте­ру была при­сво­е­на содер­жа­тель­ная мет­ка — назва­ние цен­но­сти или цен­ност­ной груп­пы — на осно­ве его клю­че­вых слов. Этот про­цесс выпол­нял­ся экс­перт­но: авто­ры про­ана­ли­зи­ро­ва­ли спи­сок самых харак­тер­ных слов каж­до­го кла­сте­ра (по бли­зо­сти к цен­т­ро­и­ду и частот­но­сти в кор­пу­се) и сопо­ста­ви­ли их с извест­ны­ми цен­ност­ны­ми поня­ти­я­ми. Например, кла­стер с харак­тер­ны­ми сло­ва­ми {семья, любовь, друж­ба, дове­рие, под­держ­ка, вер­ность, забо­та…} был одно­знач­но интер­пре­ти­ро­ван как цен­ность «семей­ные и дру­же­ские отно­ше­ния, любовь и вза­и­мо­по­мощь» (услов­но назван «Семья и вза­и­мо­от­но­ше­ния»). Кластер со сло­ва­ми {успех, дости­же­ние, цель, карье­ра, доста­ток, успех (в раз­ных фор­мах), амби­ции…} полу­чил назва­ние «Успех и дости­же­ние». В про­цесс интер­пре­та­ции были вовле­че­ны четы­ре неза­ви­си­мых эксперта-социолога; рас­хож­де­ния по отдель­ным кла­сте­рам (напри­мер, раз­гра­ни­че­ние цен­но­стей «спра­вед­ли­вость» и «равен­ство») обсуж­да­лись до кон­сен­су­са. В ито­ге сфор­ми­ро­ван ито­го­вый пере­чень из 25 цен­ност­ных кла­сте­ров, каж­до­му из кото­рых при­сво­е­но назва­ние и крат­кое определение.

Экспертная проверка и валидация

Завершающим эта­пом мето­до­ло­гии ста­ла вали­да­ция — про­вер­ка надеж­но­сти и осмыс­лен­но­сти выде­лен­ных цен­ност­ных кла­сте­ров. Она осу­ществ­ля­лась в двух фор­мах: коли­че­ствен­ной и качественной.

Для каж­до­го кла­сте­ра было вычис­ле­но коли­че­ство сооб­ще­ний, в кото­рых он про­яв­ля­ет­ся. Сообщение счи­та­лось отно­ся­щим­ся к кла­сте­ру, если содер­жа­ло хотя бы одно харак­тер­ное сло­во из дан­но­го цен­ност­но­го кла­сте­ра (после лем­ма­ти­за­ции) или если LDA-тема, соот­вет­ству­ю­щая кла­сте­ру, име­ла в сооб­ще­нии высо­кую веро­ят­ность. Это поз­во­ли­ло постро­ить рас­пре­де­ле­ние частот кла­сте­ров (см. рису­нок). Оказалось, что даже на под­вы­бор­ках дан­ных (напри­мер, раз­бив­ке по вре­ме­ни или по плат­фор­мам) отно­си­тель­ный поря­док наи­бо­лее частых кла­сте­ров сохраняется.

Рис. Распределение цен­ност­ных кла­сте­ров в рос­сий­ском сег­мен­те соц­ме­диа (чис­ло сооб­ще­ний, в кото­рых при­сут­ству­ет соот­вет­ству­ю­щая цен­ност­ная тематика)

 

Так, кла­сте­ры «Гордость и пат­ри­о­тизм», «Семья и вза­и­мо­от­но­ше­ния» и «Поддержка и сотруд­ни­че­ство» ста­биль­но вхо­ди­ли в топ‑3 по часто­те в раз­ные меся­цы и на раз­ных плат­фор­мах. Мы трак­ту­ем это как при­знак вос­про­из­во­ди­мо­сти резуль­та­та на раз­ных под­вы­бор­ках внут­ри иссле­ду­е­мо­го пери­о­да. Доминирование этих кла­сте­ров сохра­ня­ет­ся при смене плат­фор­мы и меся­ца наблю­де­ния, хотя их доли могут коле­бать­ся под вли­я­ни­ем внеш­ней собы­тий­ной повестки.

Для каж­до­го цен­ност­но­го кла­сте­ра так­же были ото­бра­ны слу­чай­ные при­ме­ры сооб­ще­ний, силь­но свя­зан­ных с этим кла­сте­ром (напри­мер, содер­жа­щих несколь­ко харак­тер­ных слов кла­сте­ра). Эксперты про­ана­ли­зи­ро­ва­ли эти сооб­ще­ния на пред­мет соот­вет­ствия сути кла­сте­ра. В подав­ля­ю­щем боль­шин­стве слу­ча­ев под­твер­жда­лось, что сооб­ще­ния дей­стви­тель­но затра­ги­ва­ют соот­вет­ству­ю­щую цен­ност­ную тему. Например, типич­ное сооб­ще­ние для кла­сте­ра «Справедливость и равен­ство» В обще­стве не хва­та­ет спра­вед­ли­во­сти — зако­ны долж­ны быть рав­ны для всех без исклю­че­ния, для кла­сте­ра «Доброта и чело­веч­ность» — Надо отно­сить­ся друг к дру­гу с доб­ро­той, быть чело­веч­нее, тогда мир ста­нет луч­ше — явно отра­жа­ют заяв­лен­ные цен­но­сти. Подобная про­вер­ка слу­жит «кон­тро­лем реаль­но­сти» — убеж­да­ет, что за абстракт­ны­ми кла­сте­ра­ми сто­ят реаль­но интер­пре­ти­ру­е­мые фраг­мен­ты дискурса.

Кроме того, про­ве­де­на пере­крест­ная про­вер­ка: сооб­ще­ния с высо­ким содер­жа­ни­ем тер­ми­нов одно­го кла­сте­ра не долж­ны систе­ма­ти­че­ски попа­дать в дру­гой кла­стер. Некоторые сооб­ще­ния могут отра­жать сра­зу несколь­ко цен­но­стей (напри­мер, «гор­жусь сво­ей семьей и стра­ной» объ­еди­ня­ет пат­ри­о­тизм и семей­ные цен­но­сти) — такие слу­чаи отме­ча­лись, но они обыч­но свя­за­ны с осмыс­лен­ной ком­би­на­ци­ей цен­но­стей, а не с ошиб­кой разметки.

Наконец, резуль­та­ты наше­го авто­ма­ти­зи­ро­ван­но­го выяв­ле­ния цен­но­стей были сопо­став­ле­ны с извест­ны­ми тео­ре­ти­че­ски­ми типо­ло­ги­я­ми (Ш. Шварц, Р. Инглхарт [Инглхарт 2018] и др.) с целью внеш­ней вали­да­ции. Выяснилось, что боль­шин­ство кла­сте­ров нахо­дят соот­вет­ствия в базо­вых цен­но­стях Шварца: напри­мер, кла­стер «Доброта и чело­веч­ность» кор­ре­ли­ру­ет с цен­но­стя­ми уни­вер­са­лиз­ма (Universalism) и бла­го­же­ла­тель­но­сти (Benevolence), «Успех и дости­же­ния» — с цен­но­стя­ми само­утвер­жде­ния (Achievement, power), «Патриотизм и гор­дость» — с цен­но­стя­ми тра­ди­ции (Tradition) и без­опас­но­сти (Security), «Поддержка и сотруд­ни­че­ство» — с цен­но­стя­ми бла­го­же­ла­тель­но­сти (Benevolence). Это соот­вет­ствие сви­де­тель­ству­ет о том, что сти­хий­но выде­лен­ные из дан­ных кла­сте­ры не про­ти­во­ре­чат суще­ству­ю­щим пред­став­ле­ни­ям о струк­ту­ре цен­ност­ных ори­ен­та­ций, а, напро­тив, обо­га­ща­ют их эмпи­ри­че­ским содер­жа­ни­ем. Таким обра­зом, мно­го­сту­пен­ча­тая мето­до­ло­гия, соче­та­ю­щая авто­ма­ти­че­ский ана­лиз и экс­перт­ную оцен­ку, поз­во­ли­ла иден­ти­фи­ци­ро­вать клю­че­вые цен­ност­ные ори­ен­та­ции в рос­сий­ском сег­мен­те соц­се­тей. Далее пред­став­ле­ны основ­ные резуль­та­ты — струк­ту­ра и состав этих цен­ност­ных кла­сте­ров, их рас­пре­де­ле­ние и доми­ни­ру­ю­щие темы.

Результаты исследования

В резуль­та­те опи­сан­ных про­це­дур полу­чен пере­чень из 25 цен­ност­ных кла­сте­ров, выяв­лен­ных на осно­ве ана­ли­за более двух мил­ли­о­нов сооб­ще­ний рус­ско­языч­ных соци­аль­ных сетей. Эти кла­сте­ры пред­став­ля­ют собой укруп­нен­ные тема­ти­ки, каж­дая из кото­рых объ­еди­ня­ет близ­кие по смыс­лу цен­но­сти, обсуж­да­е­мые поль­зо­ва­те­ля­ми. Ниже при­ве­де­ны наи­бо­лее зна­чи­мые кла­сте­ры с крат­ким описанием:

  1. Семья и вза­и­мо­от­но­ше­ния. Объединяет цен­но­сти семьи, близ­ких отно­ше­ний, друж­бы, вза­и­мо­по­мо­щи и эмо­ци­о­наль­ной под­держ­ки. Ключевые сло­ва: семья, любовь, дру­зья, под­держ­ка, забо­та, дове­рие, вер­ность, пони­ма­ние. Это наи­бо­лее широ­кий кла­стер, ука­зы­ва­ю­щий на фун­да­мен­таль­ную зна­чи­мость меж­лич­ност­ных свя­зей и при­вя­зан­но­стей в жиз­ни людей [Schwartz 1994]. Семейные цен­но­сти высту­па­ют доми­нан­той: семья рас­смат­ри­ва­ет­ся как выс­шая цен­ность и источ­ник под­держ­ки во мно­гих сообщениях.
  2. Гордость и пат­ри­о­тизм. Включает цен­но­сти, свя­зан­ные с гор­до­стью за свою стра­ну, народ, исто­рию и куль­тур­ные тра­ди­ции. Ключевые поня­тия: роди­на, Россия, гор­дость, пат­ри­о­тизм, герои, наци­о­наль­ная иден­тич­ность, долг. Этот кла­стер от ража­ет важ­ность кол­лек­тив­ной иден­тич­но­сти и лояль­но­сти к стране. Он вклю­ча­ет как политико-гражданские аспек­ты (гор­дость за госу­дар­ство, ува­же­ние к зако­нам), так и куль­тур­ные (ува­же­ние к исто­рии, ветеранам).
  3. Достижения и успех. Включает цен­но­сти лич­но­го успе­ха, само­ре­а­ли­за­ции, карьер­но­го роста, мате­ри­аль­но­го достат­ка. Ключевые поня­тия: успех, цель, карье­ра, биз­нес, богат­ство, дости­же­ния, амби­ции, побе­да. Этот кла­стер отра­жа­ет ори­ен­та­цию на резуль­та­ты и ста­тус. Часто встре­ча­ют­ся обсуж­де­ния необ­хо­ди­мо­сти «добить­ся успе­ха», «стре­мить­ся к побе­де», цен­ность упор­но­го тру­да ради высо­ких дости­же­ний. Связь успе­ха с дру­ги­ми цен­но­стя­ми про­яв­ля­ет­ся, напри­мер, в том, что успех неред­ко вос­при­ни­ма­ет­ся как сред­ство обес­пе­чить семью или гор­дость страны.
  4. Развитие и само­со­вер­шен­ство­ва­ние. Кластер цен­но­стей лич­ност­но­го роста, обра­зо­ва­ния, твор­че­ства и духов­но­го раз­ви­тия. Ключевые сло­ва: раз­ви­тие, обра­зо­ва­ние, зна­ние, рост, твор­че­ство, само­ре­а­ли­за­ция, само­раз­ви­тие, духов­ность. Пользователи обсуж­да­ют важ­ность посто­ян­но­го обу­че­ния, рабо­ты над собой, рас­кры­тия сво­е­го потен­ци­а­ла. Эта цен­ност­ная ори­ен­та­ция, по сути, близ­ка к кон­цеп­ции само­ак­ту­а­ли­за­ции. Упор на само­раз­ви­тие ино­гда про­ти­во­по­став­ля­ет­ся мате­ри­а­ли­сти­че­ским цен­но­стям (встре­ча­ют­ся посты о при­о­ри­те­те духов­но­го роста над богатством).
  5. Справедливость и равен­ство. Кластер, охва­ты­ва­ю­щий цен­но­сти соци­аль­ной спра­вед­ли­во­сти, рав­но­пра­вия, чест­но­сти и ответ­ствен­но­сти. Ключевые поня­тия: спра­вед­ли­вость, равен­ство, чест­ность, ответ­ствен­ность, пра­ва, закон, поря­док, прав­да. В сооб­ще­ни­ях это­го кла­сте­ра часто выра­жа­ет­ся воз­му­ще­ние неспра­вед­ли­во­стью, при­зы­вы к рав­ным воз­мож­но­стям для всех, к чест­но­сти вла­стей и граж­дан. Тема соци­аль­ной спра­вед­ли­во­сти явля­ет­ся замет­ной, отра­жая запрос на соблю­де­ние мораль­ных и пра­во­вых норм в обществе.
  6. Доброта и чело­веч­ность. Включает цен­но­сти мило­сер­дия, состра­да­ния, гума­низ­ма, ува­же­ния к каж­до­му чело­ве­ку. Ключевые сло­ва: доб­ро­та, чело­веч­ность, эмпа­тия, ува­же­ние, тер­пи­мость, мило­сер­дие, помощь. Пользователи под­чер­ки­ва­ют важ­ность доб­ро­го отно­ше­ния к окру­жа­ю­щим, уме­ния про­щать, сочув­ство­вать чужой беде. Этот кла­стер фоку­си­ру­ет­ся на нрав­ствен­ных каче­ствах лич­но­сти, высту­пая про­ти­во­по­лож­но­стью агрес­сии и жесто­ко­сти. Он так­же тес­но свя­зан с семейно-дружескими цен­но­стя­ми (пере­кры­ва­ет­ся поня­ти­ем забо­ты, поддержки).
  7. Надежда и вера. Кластер духов­ных цен­но­стей, свя­зан­ных с верой (как рели­ги­оз­ной, так и в широ­ком смыс­ле) и надеж­дой. Ключевые сло­ва: вера, надеж­да, духов­ность, Бог, молит­ва, меч­та, смысл жиз­ни. Здесь отра­же­ны религиозно-нравственные моти­вы (упо­ва­ние на Бога, сле­до­ва­ние вере) и экзи­стен­ци­аль­ные поис­ки смыс­ла, надеж­ды на луч­шее. Доля это­го кла­сте­ра срав­ни­тель­но неве­ли­ка, но он важен как про­яв­ле­ние тра­ди­ци­он­ных духов­ных устремлений.
  8. Здоровье и без­опас­ность. (Отдельно явно не выде­лял­ся, но при­сут­ству­ет как мотив в дру­гих кла­сте­рах, осо­бен­но в кла­сте­рах «пат­ри­о­тизм» и «семья».) Включает цен­но­сти физи­че­ской и эко­но­ми­че­ской без­опас­но­сти, поряд­ка, ста­биль­но­сти жиз­ни. Ключевые поня­тия: без­опас­ность, ста­биль­ность, поря­док, защи­щен­ность, спо­кой­ствие. Эти цен­но­сти часто упо­ми­на­ют­ся в связ­ке с пат­ри­о­тиз­мом (без­опас­ность стра­ны) или с семьей (ста­биль­ность для семьи).
  9. Свобода и пра­во. Ценности лич­ной и граж­дан­ской сво­бо­ды, неза­ви­си­мо­сти мне­ний и дей­ствий. Ключевые поня­тия: сво­бо­да, неза­ви­си­мость, выбор, пра­ва, само­сто­я­тель­ность. Хотя откры­тое обсуж­де­ние поли­ти­че­ской сво­бо­ды может быть огра­ни­че­но, встре­ча­ют­ся заяв­ле­ния о цен­но­сти сво­бо­ды само­вы­ра­же­ния, сво­бод­но­го выбо­ра жиз­нен­но­го пути, неза­ви­си­мо­сти от чужо­го мнения.
  10. Гибкость и адап­тив­ность. Ценности откры­то­сти пере­ме­нам, уме­ния адап­ти­ро­вать­ся, инно­ва­ций. Ключевые сло­ва: адап­тив­ность, гиб­кость, про­гресс, инно­ва­ции, пере­ме­ны. Довольно узкий кла­стер, замет­ный в обсуж­де­ни­ях, где ценит­ся уме­ние менять­ся, обу­чать­ся ново­му, «не застре­вать в про­шлом». Его мож­но свя­зать с совре­мен­ны­ми трен­да­ми (напри­мер, цен­ность тех­но­ло­ги­че­ско­го про­грес­са или лич­ной гиб­ко­сти в карьере).

Некоторые из пере­чис­лен­ных кла­сте­ров частич­но пере­кры­ва­ют­ся или иерар­хи­че­ски свя­за­ны. Например, семей­ные цен­но­сти отно­сят­ся к более широ­ко­му кла­сте­ру семьи и вза­и­мо­от­но­ше­ний, вопро­сы без­опас­но­сти тес­но свя­за­ны с пат­рио тиз­мом и ста­биль­но­стью и т. д. Тем не менее выбран­ный уро­вень дета­ли­за­ции (25 кла­сте­ров) поз­во­лил зафик­си­ро­вать раз­но­об­ра­зие цен­ност­ных ори­ен­та­ций, экс­пли­ци­ро­ван­ных в текстах.

Частотный ана­лиз выяв­лен­ных кла­сте­ров пока­зал замет­ную диф­фе­рен­ци­а­цию их пред­став­ле­ния в мас­со­вом дис­кур­се. На рисун­ке пред­став­ле­но соот­но­ше­ние чис­ла сооб­ще­ний, в кото­рых упо­ми­на­ет­ся та или иная цен­ност­ная тема (один пост может вхо­дить в несколь­ко кла­сте­ров, если затра­ги­ва­ет несколь­ко цен­но­стей одновременно).

Три круп­ней­ших кла­сте­ра — «Гордость и пат­ри­о­тизм», «Семья (любовь) и вза­и­мо­от­но­ше­ния», «Открытость и доб­ро­со­сед­ство» — охва­ты­ва­ют суще­ствен­ную часть обсуж­де­ний (в сум­ме более поло­ви­ны всех сооб­ще­ний). Это поз­во­ля­ет выде­лить их как доми­ни­ру­ю­щие цен­ност­ные ори­ен­та­ции рос­сий­ско­го сег­мен­та соц­се­тей на дан­ный пери­од. Ценности, отно­ся­щи­е­ся к соци­аль­ным потреб­но­стям (обще­ние, при­вя­зан­но­сти, кол­лек­тив), в сово­куп­но­сти зна­чи­тель­но пре­вос­хо­дят по часто­те цен­но­сти инди­ви­ду­аль­но­го само­утвер­жде­ния. По оцен­кам, доля цен­ност­ных выска­зы­ва­ний, отра­жа­ю­щих соци­аль­ную при­над­леж­ность (любовь, друж­бу, под­держ­ку, сотруд­ни­че­ство и т. п.), состав­ля­ет свы­ше 50 %. Это, воз­мож­но, про­дик­то­ва­но спе­ци­фи­кой пуб­лич­ных дис­кус­сий в соци­аль­ных сетях как сре­де для ком­му­ни­ка­ции. Тем не менее суще­ствен­ная доля (око­ло чет­вер­ти упо­ми­на­ний) при­хо­дит­ся на цен­но­сти само­ре­а­ли­за­ции (успех, раз­ви­тие, независимость).

Анализ сов­мест­ных упо­ми­на­ний пока­зал ряд зако­но­мер­но­стей. Рассуждения о пат­ри­о­тиз­ме и успе­хе име­ют поло­жи­тель­ную кор­ре­ля­цию в упо­ми­на­ни­ях: неред­ко в пат­ри­о­ти­че­ски окра­шен­ных дис­кус­си­ях речь захо­дит об успе­хах стра­ны или о лич­ных дости­же­ни­ях во бла­го Родины. Напротив, кла­сте­ры «Гордость и пат­ри­о­тизм» и «Справедливость и равен­ство» зача­стую появ­ля­ют­ся в про­ти­во­по­став­ле­нии: темы спра­вед­ли­во­сти порой зву­чат в кри­ти­че­ском клю­че по отно­ше­нию к госу­дар­ству, тогда как пат­ри­о­ти­че­ские посты обыч­но носят позитивно-лояльный тон. «Семья и вза­и­мо­от­но­ше­ния» хоро­шо соче­та­ет­ся с «Доброта и чело­веч­ность» и «Надежда и вера» — в постах о семье часто упо­ми­на­ют­ся надеж­ды на луч­шее буду­щее, важ­ность доб­ро­ты. «Достижения и успех» и «Развитие и само­со­вер­шен­ство­ва­ние» свя­за­ны: мно­гие пуб­ли­ка­ции об успе­хе упо­ми­на­ют само­раз­ви­тие как путь к нему. Кроме того, рито­ри­ка о «Справедливости и равен­стве» часто сопро­вож­да­ет­ся рас­суж­де­ни­я­ми про чест­ное имя и ува­же­ние. Таким обра­зом, цен­ност­ные ори­ен­та­ции не изо­ли­ро­ва ны: они обра­зу­ют слож­ную сеть, где одни цен­но­сти могут под­креп­лять или отте­нять другие.

Полученная кар­та цен­ност­ных кла­сте­ров в зна­чи­тель­ной сте­пе­ни резо­ни­ру­ет с извест­ны­ми моде­ля­ми чело­ве­че­ских цен­но­стей, но име­ет и свои осо­бен­но­сти. Так, в тео­рии Ш. Шварца базо­вы­ми кате­го­ри­я­ми явля­ют­ся, в част­но­сти, Benevolence (доб­ро­же­ла­тель­ность, забо­та о близ­ких), Achievement (дости­же­ние), Security (без­опас­ность, вклю­чая наци­о­наль­ную), Tradition (ува­же­ние к тра­ди­ци­ям, рели­ги­оз­ность) и др. [Schwartz 1992]. Наши кла­сте­ры «Семья и вза­и­мо­от­но­ше­ния», «Развитие и само­со­вер­шен­ство­ва­ние», «Гордость и пат­ри­о­тизм», «Доброта и чело­веч­ность», «Надежда и вера» в целом соот­вет­ству­ют этим кате­го­ри­ям. При этом онлайн-дискурс выявил неко­то­рый сдвиг акцен­тов: цен­но­сти обще­ства и отно­ше­ний доми­ни­ру­ют над цен­но­стя­ми лич­ных интересов.

Исследование охва­ты­ва­ет пери­од, в кото­ром в рос­сий­ском обще­стве име­ли место зна­чи­мые собы­тия (напри­мер, гео­по­ли­ти­че­ские кон­флик­ты, эко­но­ми­че­ские пере­ме­ны). Это мог­ло уси­лить при­сут­ствие опре­де­лен­ных цен­но­стей, преж­де все­го пат­ри­о­тиз­ма. Вместе с тем цен­ность спра­вед­ли­во­сти мог­ла уси­лить­ся под вли­я­ни­ем внут­рен­них соци­аль­ных про­блем и запро­сов на чест­ность и равен­ство — она так­же полу­чи­ла замет­ное место. Можно пред­по­ло­жить, что дина­ми­ка цен­но­стей в онлайн-дискурсе чув­стви­тель­на к внеш­ним обсто­я­тель­ствам. Это откры­ва­ет воз­мож­ность исполь­зо­ва­ния подоб­но­го ана­ли­за для мони­то­рин­га изме­не­ний цен­ност­ных ори­ен­та­ций обще­ства в режи­ме реаль­но­го вре­ме­ни. Например, мож­но отсле­дить, как меня­ет­ся частот­ность рас­суж­де­ний о без­опас­но­сти и пат­ри­о­тиз­ме в пери­од кри­зи­сов или воз­рас­та­ет ли кла­стер «Справедливость и равен­ство» в кон­тек­сте обще­ствен­ных обсуж­де­ний резо­нанс­ных собы­тий (судеб­ных дел, реформ).

Ограничения и критические замечания

Как упо­ми­на­лось, поль­зо­ва­те­ли соц­се­тей — не стро­го репре­зен­та­тив­ная выбор­ка насе­ле­ния. В част­но­сти, моло­дежь и город­ские жите­ли обыч­но более актив­ны онлайн, тогда как цен­ност­ные ори­ен­ти­ры стар­ших поко­ле­ний и сель­ско­го насе­ле­ния могут быть ина­че рас­став­ле­ны. Это накла­ды­ва­ет огра­ни­че­ния на обоб­ще­ние резуль­та­тов на все обще­ство. Мы трак­ту­ем полу­чен­ные выво­ды как харак­те­ри­сти­ку цен­ност­но­го дис­кур­са имен­но циф­ро­во­го сооб­ще­ства в рас­смат­ри­ва­е­мый пери­од. Однако ауди­то­рия соц­се­тей в России вели­ка (десят­ки мил­ли­о­нов поль­зо­ва­те­лей), а пото­му клю­че­вые тен­ден­ции (напри­мер, высо­кая зна­чи­мость семей­ных цен­но­стей) с боль­шой веро­ят­но­стью отра­жа­ют общие куль­тур­ные чер­ты. Тем не менее для боль­шей уве­рен­но­сти в обоб­ще­ни­ях целе­со­об­раз­но в буду­щем сопо­ста­вить наши дан­ные с резуль­та­та­ми офлайн-опросов по цен­но­стям, таких как Всемирное иссле­до­ва­ние цен­но­стей (World Values Survey).

Мы ана­ли­зи­ро­ва­ли тек­сты сооб­ще­ний без при­вяз­ки к кон­крет­ным авто­рам (в обез­ли­чен­ном виде). Это озна­ча­ет, что выво­ды дела­ют­ся об общем содер­жа­нии дис­кур­са, но не о цен­но­стях отдель­ных людей. Один и тот же поль­зо­ва­тель мог писать на раз­ные темы, и наобо­рот, груп­па акти­ви­стов мог­ла мно­го­крат­но про­дви­гать опре­де­лен­ную тему. В нашем иссле­до­ва­нии еди­ни­ца ана­ли­за — сооб­ще­ние, а не чело­век. Это огра­ни­че­ние при ана­ли­зе кон­тен­та: мы иссле­ду­ем рас­про­стра­нен­ность цен­ност­ных тем в мас­со­вых ком­му­ни­ка­ци­ях, но не напря­мую цен­ност­ные при­о­ри­те­ты отдель­ных лич­но­стей или групп.

В соци­аль­ных сетях наблю­да­ет­ся фено­мен эхо-камер и нерав­но­мер­но­го вкла­да отдель­ных групп. Например, орга­ни­зо­ван­ные сооб­ще­ства или боты могут мно­го­крат­но транс­ли­ро­вать одни и те же цен­ност­ные мес­седжи, и алго­рит­мы плат­форм могут уси­ли­вать одни темы за счет дру­гих. В нашем кор­пу­се мог­ли при­сут­ство­вать кла­сте­ры, уве­ли­чен­ные актив­но­стью кон­крет­ных сооб­ществ. Мы частич­но ниве­ли­ро­ва­ли это, уда­ляя явный спам и дуб­ли, одна­ко пол­но­стью исклю­чить вли­я­ние коор­ди­ни­ро­ван­ных кам­па­ний невоз­мож­но. Тем не менее мето­ды кла­сте­ри­за­ции и каче­ствен­ной оцен­ки поз­во­ли­ли выявить устой­чи­вые темы, кото­рые про­сле­жи­ва­ют­ся и при раз­бив­ке дан­ных (т. е. не явля­ют­ся арте­фак­том одной группы).

Российские соцмедиа-данные соби­ра­лись из откры­тых источ­ни­ков, что под­ра­зу­ме­ва­ет соот­вет­ствие кон­тен­та пра­ви­лам плат­форм и зако­нам. Возможна само­цен­зу­ра поль­зо­ва­те­лей по неко­то­рым чув­стви­тель­ным темам. Поэтому отсут­ствие или низ­кая доля неко­то­рых цен­но­стей необя­за­тель­но озна­ча­ют их незна­чи­мость, а могут быть след­стви­ем внеш­них огра­ни­че­ний. В нашем ана­ли­зе это учте­но в интер­пре­та­ции: резуль­та­ты отра­жа­ют раз­ре­шен­ный и при­ня­тый в обще­стве дис­курс о ценностях.

Автоматическая тема­ти­че­ская модель учи­ты­ва­ла толь­ко факт упо­ми­на­ния тех или иных цен­ност­ных поня­тий, но не оце­ни­ва­ла тональ­ность выска­зы­ва­ния (пози­тив­ную, нега­тив­ную, иро­ни­че­скую, ней­траль­ную). Наш ана­лиз на эта­пе каче­ствен­ной вали­да­ции ста­рал­ся учи­ты­вать кон­текст вруч­ную, одна­ко систем­но­го ана­ли­за тональ­но­сти тек­стов (sentiment analysis) не про­во­ди­лось. В буду­щем обо­га­ще­ние моде­ли ана­ли­зом тональ­но­сти поз­во­ли­ло бы раз­де­лять, какие цен­но­сти одоб­ря­ют­ся, а какие упо­ми­на­ют­ся в нега­тив­ном клю­че. Пока же резуль­та­ты сле­ду­ет читать в ней­траль­ном плане. Мы выяви­ли темы раз­го­во­ров о цен­но­стях без оцен­ки того, хоро­шо или пло­хо о них отзываются.

Существует так­же веро­ят­ность оши­бок на каж­дом авто­ма­ти­че­ском эта­пе: непол­ная лем­ма­ти­за­ция (осо­бен­но для жар­го­на и слен­га), про­ма­хи LDA (сли­я­ние раз­ных тем), неточ­ное чис­ло кла­сте­ров k, субъ­ек­тив­ность руч­ной интер­пре­та­ции и т. д. Мы пред­при­ня­ли шаги для мини­ми­за­ции оши­бок: поль­зо­ва­лись про­ве­рен­ны­ми инстру­мен­та­ми, про­ве­ря­ли несколь­ко кон­фи­гу­ра­ций моде­ли, при­влек­ли несколь­ких экс­пер­тов к оцен­ке. Тем не менее мето­до­ло­гия откры­та для доработок.

Несмотря на огра­ни­че­ния, резуль­та­ты иссле­до­ва­ния обла­да­ют при­клад­ной зна­чи­мо­стью. Они могут исполь­зо­вать­ся для мони­то­рин­га обще­ствен­ных настро­е­ний. Ценностные кла­сте­ры отра­жа­ют реак­цию на соци­аль­ные и поли­ти­че­ские собы­тия, поз­во­ляя фик­си­ро­вать сдви­ги в дис­кур­се. Высокая частот­ность пат­ри­о­ти­че­ских, семей­ных при­о­ри­те­тов и уста­но­вок спра­вед­ли­во­сти может слу­жить инди­ка­то­ром акту­аль­ных обще­ствен­ных запро­сов. Понимание цен­но­стей, реаль­но обсуж­да­е­мых в циф­ро­вой сре­де, важ­но для кор­рек­ти­ров­ки вос­пи­та­тель­ных про­грамм и раз­ра­бот­ки учеб­ных мате­ри­а­лов, осо­бен­но в обла­сти граж­дан­ско­го обра­зо­ва­ния. Выявленные ори­ен­ти­ры так­же полез­ны для ком­му­ни­ка­ци­он­ных стра­те­гий (брен­ды и НКО могут опи­рать­ся на них при созда­нии содер­жа­тель­но реле­вант­но­го и эмо­ци­о­наль­но резо­нанс­но­го контента).

Предложенная мето­ди­ка поз­во­ля­ет коли­че­ствен­но изме­рять цен­но­сти и сопо­став­лять их с соци­аль­ны­ми пока­за­те­ля­ми, что дела­ет ее при­ме­ни­мой в ана­ли­ти­ке и прогнозировании.

В целом прак­ти­че­ская зна­чи­мость наше­го иссле­до­ва­ния, с одной сто­ро­ны, де мон­стри­ру­ет новый метод изме­ре­ния и мони­то­рин­га цен­но­стей в циф­ро­вую эпо­ху, с дру­гой — предо­став­ля­ет кон­крет­ные инсай­ты о теку­щих цен­ност­ных ори­ен­ти­рах рос­си­ян, кото­рые могут быть непо­сред­ствен­но исполь­зо­ва­ны в раз­лич­ных сферах.

Перспективы даль­ней­ших иссле­до­ва­ний вклю­ча­ют углуб­ле­ние ана­ли­за: при­ме­не­ние ней­ро­се­те­вых тема­ти­че­ских моде­лей сле­ду­ю­ще­го поко­ле­ния, ана­лиз дина­ми­ки цен­но­стей во вре­ме­ни (напри­мер, поме­сяч­но или в пери­од кри­зис­ных собы­тий), сопо­став­ле­ние с дан­ны­ми опро­сов и по раз­лич­ным соци­аль­ным группам.

Выводы

Методика зада­ет пол­ный цикл ана­ли­за циф­ро­вых тек­стов для рекон­струк­ции цен­ност­ных ори­ен­та­ций в рус­ско­языч­ных соци­аль­ных сетях на дан­ных Brand Analytics. Корпус соби­рал­ся по всей биб­лио­те­ке источ­ни­ков Brand Analytics, затем тек­сты про­хо­ди­ли нор­ма­ли­за­цию и очист­ку. Для выде­ле­ния тема­ти­че­ской струк­ту­ры при­ме­ня­лось тема­ти­че­ское моде­ли­ро­ва­ние LDA. Далее темы пере­во­ди­лись в цен­ност­ные груп­пы через век­тор­ные пред­став­ле­ния и кла­сте­ри­за­цию k-means.

Апробация про­ве­де­на на мас­си­ве более двух мил­ли­о­нов сооб­ще­ний за пери­од с сен­тяб­ря 2023 г. по сен­тябрь 2024 г. Итогом ста­ла «кар­та» из 25 кла­сте­ров цен­ност­ных ори­ен­та­ций в иссле­ду­е­мом кор­пу­се. Среди доми­ни­ру­ю­щих выде­ля­ют­ся рас­суж­де­ния о пат­ри­о­тиз­ме, люб­ви, семье, вза­и­мо­по­мо­щи и под­держ­ке. Одновременно при­сут­ству­ют выска­зы­ва­ния о само­ре­а­ли­за­ции, успе­хе и дости­же­ни­ях, что пока­зы­ва­ет замет­ную долю цен­но­стей, свя­зан­ных с лич­ны­ми резуль­та­та­ми. Часть кла­сте­ров напря­мую соот­но­сит­ся с доме­на­ми цен­но­стей в под­хо­дах Шварца и Рокича, посколь­ку опи­сы­ва­ет уни­вер­саль­ные ори­ен­та­ции, кото­рые в кор­пу­се про­яв­ля­ют­ся через устой­чи­вую лек­си­ку и типо­вые кон­тек­сты, в том чис­ле «семья», «любовь и под­держ­ка», «успех» и «дости­же­ния». Одновременно в кар­те при­сут­ству­ют эмпи­ри­че­ски выде­лен­ные тема­ти­че­ские доме­ны, кото­рые не сов­па­да­ют с переч­ня­ми Шварца и Рокича. К ним отно­сит­ся «пат­ри­о­тизм», оформ­ля­ю­щий­ся в кор­пу­се как само­сто­я­тель­ный кла­стер и соот­но­си­мый на уровне интер­пре­та­ции с более общи­ми ори­ен­та­ци­я­ми, свя­зан­ны­ми с груп­по­вой лояль­но­стью, тра­ди­ци­ей и соци­аль­ным порядком.

В резуль­та­те ана­лиз сво­дит боль­шой мас­сив сооб­ще­ний и набор веро­ят­ност­ных тем к огра­ни­чен­но­му чис­лу цен­ност­ных групп, при­год­ных для даль­ней­ше­го опи­са­ния струк­ту­ры цен­ност­но­го содер­жа­ния кор­пу­са. Карта высту­па­ет ито­го­вым уров­нем пред­став­ле­ния резуль­та­тов, на кото­рый пере­во­дят­ся темы после тема­ти­че­ско­го моде­ли­ро­ва­ния и кластеризации.

Статья посту­пи­ла в редак­цию 30 апре­ля 2025 г.;
реко­мен­до­ва­на к печа­ти 15 фев­ра­ля 2026 г.

© С. А. Зверев, Е. Н. Соколова, М. В. Григорьева, А. Г. Смирнов, 2026

Received: April 30, 2025
Accepted: February 15, 2026