Представлена авторская методология прикладного лингвистического анализа цифровых текстов для изучения ценностных ориентаций в российском сегменте социальных сетей, целью которой является операционализация и апробация данного подхода, а также построение «карты» кластеров ценностных ориентаций пользователей русскоязычных социальных сетей. Методология апробирована на основе более двух миллионов сообщений. Описаны все этапы исследования — от сбора данных с помощью системы мониторинга Brand Analytics (мониторинг проводился по всей библиотеке ресурсов Brand Analytics) и лексической подготовки текстов (нормализация и очистка) до тематического моделирования (Latent Dirichlet Allocation), кластеризации ценностных тем (векторные представления слов и алгоритм k-средних) и последующей ручной валидации выделенных кластеров. Структура статьи включает две части: изложение и разбор разработанной методологии и представление результатов ее апробации на эмпирическом материале. В рамках анализа исследуемого корпуса сообщений за период с сентября 2023 г. по сентябрь 2024 г. выявлена карта из 25 кластеров ценностей, доминирующими среди которых являются патриотизм, любовь, се мья, взаимопомощь и поддержка. Основные результаты демонстрируют преобладание социальных ценностей (патриотизм, семья, поддержка) при значимой доле ценностей самореализации (успех, достижения). Обсуждается значимость полученных результатов для социологии ценностей и практические направления применения: мониторинг динамики ценностных установок в обществе, информационная политика, реализации национальной цели воспитания патриотичной и социально ответственной личности, образовательные программы и коммуникационные стратегии.
Methodological foundations for analysing value orientations in the Russian segment of social networks
The article presents an original applied methodology in applied linguistic analysis of digital texts designed to study value orientations in the Russian segment of social media. The purpose of the study is to operationalize and test this approach in practice, as well as to construct a map of clusters that represent the value orientations of users in Russian-language social networks. The methodology was validated on a corpus of more than two million messages. The paper describes the full research pipeline, starting with data collection through the Brand Analytics monitoring system. Importantly, monitoring covered the entire library of Brand Analytics sources rather than a limited set of platforms or outlets. The next stage includes lexical preprocessing of the texts, specifically normalization and cleaning procedures. The processed corpus is then examined through topic modeling using Latent Dirichlet Allocation (LDA). To move from probabilistic topics to interpretable value-related groupings, the study applies clustering of value topics based on word vector representations and the k-means algorithm, followed by manual validation of the resulting clusters. The structure of the article consists of two main parts: first, a detailed presentation and discussion of the developed methodology, and second, the results of its empirical application. Using the analyzed corpus of messages posted between September 2023 and September 2024, the study identifies a map of 25 value clusters. Among the dominant clusters are patriotism as well as the values of love, family, mutual assistance, and support. Overall, the findings indicate the prevalence of social values (patriotism, family, support), alongside a substantial share of self-realization values (success, achievements). The article also discusses the relevance of these results for the sociology of values and outlines practical applications of the proposed methodology, including monitoring changes in public value orientations, supporting information policy, contributing to the national goal of fostering a patriotic and socially responsible individual, and informing educational programs and communication strategies.
Зверев Сергей Александрович — проф.;
https://orcid.org/0000-0001-5273-2607, szverev@hse.ru
Соколова Екатерина Никитична — канд. полит. наук;
https://orcid.org/0009-0007-3188-707X, e.sokolova@hse.ru
Григорьева Мария Владимировна — ст. преп.;
https://orcid.org/0009-0007-2413-7721, mariya.grigoreva@hse.ru
Смирнов Александр Георгиевич — доц.;
https://orcid.org/0009-0004-8079-9808, ag.smirnov@hse.ru
Национальный исследовательский университет «Высшая школа экономики», Российская Федерация, 101000, Москва, ул. Мясницкая, 20
Sergei A. Zverev — Professor;
https://orcid.org/0000-0001-5273-2607, szverev@hse.ru
Ekaterina N. Sokolova — PhD in Political Sciences; https://orcid.org/0009-0007-3188-707X, e.sokolova@hse.ru
Maria V. Grigorieva — Senior Lecturer;
https://orcid.org/0009-0007-2413-7721, mariya.grigoreva@hse.ru
Aleksandr G. Smirnov — Associate Professor;
https://orcid.org/0009-0004-8079-9808, ag.smirnov@hse.ru
HSE University,
20, ul. Myasnitskaya, Moscow, 101000, Russian Federation
Зверев С. А., Соколова Е. Н., Григорьева М. В., Смирнов А. Г. (2026). Методологические основы анализа ценностных ориентаций в российском сегменте социальных сетей. Описание методики и ее апробация на эмпирическом материале. Медиалингвистика, 13 (2), 275−291.
EDN: GSWUXZ
URL: https://medialing.ru/metodologicheskie-osnovy-analiza-cennostnyh-orientacij-v-rossijskom-segmente-socialnyh-setej-opisanie-metodiki-i-ee-aprobaciya-na-ehmpiricheskom-materiale/ (дата обращения: 14.08.2026)
Trofimova, О. V., Nabieva, E. A. (2018). The research of enlightening network genre by media-project Newtonew. Media Linguistics, 5 (3), 314–329. (In Russian)
EDN: GSWUXZ
URL: https://medialing.ru/metodologicheskie-osnovy-analiza-cennostnyh-orientacij-v-rossijskom-segmente-socialnyh-setej-opisanie-metodiki-i-ee-aprobaciya-na-ehmpiricheskom-materiale/ (accessed: 14.08.2026)
УДК 81-139+81’27
Постановка проблемы
Между классическими подходами и методами анализа ценностей по цифровым данным существует важное методологическое противоречие. Если традиционные опросные методики ограничены социальной желательностью ответов респондентов и жестко заданным набором категорий, то анализ цифровых следов сталкивается с другими трудностями: зашумленностью данных, невозможностью однозначной интерпретации и проблемой репрезентативности выборки. Данное противоречие требует создания комплексной методологии, способной объединить естественность и спонтанность цифровых данных с точностью и интерпретируемостью классических методов.
История вопроса
Ценности рассматриваются социальной наукой как базовые ориентиры, влияющие на мировоззрение и поведение людей. Классические подходы к изучению ценностей опираются на социологические опросы и психологические методики (например, шкалы М. Рокича [Rokeach 1973], а также теорию базовых ценностей Ш. Шварца [Schwartz 1992]). Ш. Шварц определяет ценности как устойчивые убеждения, выражающие предпочтительные цели, которые служат руководящими принципами в жизни человека. Традиционные методы (опросники, рейтинги ценностей) позволяют измерить декларируемые ценностные ориентации, однако обладают известными ограничениями — влиянием социальной желательности и ограниченностью числа заданных категорий [Phillips, Clancy 1972].
Развитие же социальных сетей открыло новые возможности для изучения ценностей на основе цифровых следов — спонтанных текстов, публикуемых пользователями в интернете. В этих потоках естественно возникшего контента могут проявляться ценностные ориентации, например в упоминаниях того, что пользователи считают «важным», «дорогим сердцу», за что испытывают гордость или, напротив, что их возмущает и т. п. Анализ такого материала представляет большой интерес для исследования ценностей, поскольку позволяет выявить ценности, реально проявляющиеся в массовом дискурсе, вне рамок формализованных анкет [Kalimeri et al. 2019].
Более того, цифровые данные позволяют отслеживать динамику ценностных акцентов в обществе практически в реальном времени и с высокой степенью детализации (например, по регионам, группам или событиям).
В то же время анализ ценностей по данным социальных сетей сопряжен с методологическими трудностями. Во-первых, сами тексты социальных медиа не структурированы под исследование ценностей (они могут быть кратки, насыщены жаргоном, эмоциями, могут содержать нерелевантную информацию или спам). Во-вторых, не все публичные сообщения действительно отражают глубинные ценности авторов — некоторые посты могут быть ситуативными или имитировать популярные нарративы. Существует также проблема атрибутирования и репрезентативности (аудитория социальных сетей не в полной мере представляет все слои общества, а часть пользователей публикует контент анонимно).
Целью настоящего исследования является разработка и обоснование подхода к выявлению и анализу ценностных ориентаций в российском сегменте социальных сетей, обеспечивающего достоверность, интерпретируемость и дальнейшую операционализируемость результатов. Для достижения этой цели была реализована многоступенчатая методология, включающая:
— отбор лексических маркеров и формулировок, релевантных теме ценностей;
— сбор крупномасштабной выборки сообщений из социальных медиа с помощью системы мониторинга;
— предобработку текстов (очистку, нормализацию, отбор лексики);
— автоматическое тематическое моделирование текстов с целью выявления латентных ценностных тем;
— кластеризацию тематических признаков и семантически близких групп ценностей;
— экспертную интерпретацию и валидацию полученных кластеров.
Методология включает последовательность этапов, каждый из которых направлен на решение отдельной задачи от подготовки данных до интерпретации результатов.
Описание методики исследования
До начала сбора данных системой мониторинга Brand Analytics (более 100 тыс. источников — соцсети, СМИ, мессенджеры, маркетплейсы и др.) был проведен этап предварительной лексико-семантической подготовки, направленный на уточнение языковых признаков, по которым можно идентифицировать сообщения, содержащие рассуждения о ценностях.
В рамках этого этапа были проанализированы стенограммы фокус-групп, материалы глубинных интервью, а также публичные выступления (интервью, лекции, речи), в которых люди обсуждали темы, связанные с жизненными приоритетами и самоопределением.
Анализ позволил выделить характерные языковые конструкции, с которых обычно начинается разговор о ценностях. Речь шла не столько об отдельных словах, сколько об устойчивых языковых формулах, маркирующих личностные установки и убеждения, например Моя жизненная цель…; Для меня важно…; Я горжусь тем, что…; Я считаю главным…; В моей жизни главное…
В результате было сформировано ядро из 38 устойчивых фраз, которые стали фильтром при последующем сборе сообщений. Эти фразы позволили сузить выборку до сообщений, в которых пользователи намеренно артикулируют ценностные позиции, в отличие от бытовых высказываний на отвлеченные темы. Подход обеспечил контекстуальную релевантность выборки, сохранив при этом естественную языковую среду и позволив сосредоточиться на сообщениях, где ценности осмысляются или декларируются явно.
Сбор данных
В качестве источника данных использованы открытые публикации пользователей российского сегмента социальных сетей, агрегированные с помощью системы мониторинга соцмедиа Brand Analytics. Система позволяет собирать публичные сообщения из различных источников («ВКонтакте», «Одноклассники» и др.), а также из блог-платформ и комментариев в СМИ, фильтруя их по языку, региону и другим параметрам. Использование Brand Analytics обеспечило масштабный охват: были выгружены сообщения на русском языке общим объемом свыше двух миллионов за заданный период наблюдения (с сентября 2023 г. по сентябрь 2024 г.) по определенным на более раннем этапе 38 устойчивым лексическим маркерам. Каждый собранный документ содержал текст сообщения, метаданные об авторе (анонимизированный ID, пол, возрастная категория при наличии), дату публикации и указание на источник (платформу).
Для того чтобы сфокусироваться именно на содержательных высказываниях, касающихся ценностей, из общего массива исключены технические и рекламные посты. В частности, на этапе сбора был применены базовые сигнатуры спама (сообщения, содержащие лишь ссылки, рекламу товаров, явные призывы коммерческого характера и т. п.). Отдельного внимания заслуживает проблема репрезентативности: аудитория социальных сетей не является статистически репрезентативной выборкой населения. Мы осознаем это ограничение и рассматриваем полученные результаты как характерные именно для активных пользователей социальных медиа, а не для всего населения России. Тем не менее, учитывая массовость соцсетей, собранные два миллиона сообщений отражают мнения широкой и разнообразной аудитории.
Предобработка текстов
На следующем этапе была проведена лексическая нормализация и подготовка текстового корпуса с целью приведения его к форме, удобной для компьютерного тематического анализа. Эта обработка включала несколько процедур.
Из сообщений удалены нежелательные символы (HTML-теги, эмодзи, мусорные повторяющиеся знаки) и токены, не несущие смысловой нагрузки в контексте анализа ценностей, например упоминания пользователей (@username), хештеги, URL-ссылки. Также на этом шаге из рассмотрения исключались сообщения, идентичные по содержанию (дубликаты, часто возникающие при репостах), чтобы не смещать статистику в сторону широко разошедшихся шаблонов.
Каждый текст разбивался на отдельные токены (слова и значимые символы). Затем из списка токенов удалялись стоп-слова — наиболее частые слова языка, не несущие спецификации темы (местоимения, служебные части речи, междометия и т. д.). Исключение стоп-слов — стандартная практика при обработке текста, позволяющая снизить шум и размерность данных, а удаление часто встречающихся неинформативных слов улучшает качество тематического моделирования и снижает вычислительную нагрузку [Schofield, Magnusson, Mimno 2017; Zimmermann et al. 2024]. Для русского языка был использован объединенный список стоп-слов из открытых библиотек (NLTK, SpaCy) с дополнительными доменными пополнениями (например, слова «это», «свой», «который» и т. п.). После первоначального моделирования список стоп-слов уточнялся итеративно: из анализа исключались слова, которые оказались широко распространены, но не относятся к темам ценностей (например, «год», «делать», «быть» в определенных контекстах). Такой подход соответствует рекомендациям по адаптации перечня стоп-слов под конкретный корпус [Schofield, Magnusson, Mimno 2017].
На этапе лексической нормализации была проведена лемматизация — все слова приведены к базовой словоформе (именительному падежу, единственному числу для существительных, инфинитиву для глаголов и т. д.). Для этого применен морфологический анализатор библиотек PyMystem3 и PyMorphy2, позволяющий с высокой точностью определять лемму слова. Благодаря использованию такого инструмента слова «герой», «героя», «героям» будут рассматриваться как одна лексема «герой», а, например, глагольные формы «люблю», «любил», «любить» — как «любить». Лемматизация уменьшает искусственное раздробление тематических признаков и улучшает качество моделирования [May, Cotterell, Van Durme 2016]. В случаях омонимии выбиралось наиболее вероятное значение на основе контекста (что обеспечивает морфологический анализ с разрешением неоднозначности). После лемматизации объем уникального словаря корпуса существенно снизился (до 800 тыс. уникальных лемм), что облегчило последующие вычислительные процедуры.
После нормализации проведена оценка частотности терминов. Были исключены из анализа крайне редкие слова, встретившиеся лишь 1–2 раза, поскольку они не дают устойчивых тем и увеличивают разреженность данных. Такой адаптивный отбор признаков соответствует подходам, рекомендуемым в задачах тематического моделирования больших корпусов [Manning, Raghavan, Schütze 2008]. В результате данного этапа каждый текст сообщения преобразован в нормализованный набор лемм, очищенный от шумовых и нерелевантных элементов. Этот очищенный корпус послужил основой для выявления тематических структур.
Анализ материала
Тематическое моделирование (LDA)
Для автоматического выявления скрытых тематических структур, отражающих ценностные ориентиры, применено тематическое моделирование на основе вероятностной модели латентного размещения Дирихле (Latent Dirichlet Allocation, LDA). Этот метод, предложенный Д. Блеем и коллегами, широко используется для обнаружения latent topics в больших текстовых коллекциях [Blei, Ng, Jordan 2003]. В контексте нашего исследования роль тем выполняют потенциальные ценностные ориентации, проявляющиеся в пользовательских обсуждениях.
Суть LDA заключается в том, что она рассматривает каждый документ (сообщение) как смесь нескольких латентных тем, а каждую тему — как распределение на словарном множестве [Blei, Ng, Jordan 2003]. На выходе LDA-моделирования получаются наборы топ-слов, характеризующих каждую тему. В нашем случае эти темы должны соответствовать различным ценностям или их сочетаниям, присутствующим в данных.
Мы задали относительно крупное число тем (5 тыс.) на этапе моделирования LDA, чтобы получить раздельно даже близкие по смыслу ценностные категории. Такое «разрешение» оправдано стремлением не пропустить мелкие, но значимые темы. В литературе отмечается, что для коротких текстов (например, твитов) оптимальное число тем может быть достаточно большим, чтобы учесть разнообразие дискурса [Murshed et al. 2022].
Полученные LDA-темы были проанализированы по спискам самых вероятных слов. Выявлено, что многие темы явно отражают ценностные категории. Например, одна из тем содержала топ-слова: страна, родина, гордость, народ, Россия, подвиг, герой… — что указывало на патриотическую ценность. Другая тема включала слова любовь, семья, друг, поддержка, помогать, забота… — очевидно, тема межличностных отношений. Однако часть тем оказалась трудной для интерпретации или дублировала другую тему. Подобное явление известно при тематическом моделировании: некоторые латентные темы могут быть «шумовыми» либо разлагать одну смысловую тему на избыточное число компонентов [Churchill, Singh 2023].
Для улучшения интерпретируемости результатов мы объединили сходные темы и отфильтровали бессодержательные. Сходство тем оценивалось по перекрывающимся ключевым словам и по сходству распределений тем по документам. Если две темы имели явно схожее смысловое ядро (например, обе про семейные ценности, но с разным акцентом), они объединялись на следующем этапе анализа посредством кластеризации. По результатам LDA-моделирования значимая часть вероятностного набора вероятных тем распределилась по ценностным категориям, заданным на этапе интерпретации исследователями. Это свидетельствует в пользу применимости подхода.
Кластеризация ценностных кластеров (Word2Vec + k‑means)
После выделения начального набора ценностных тем с помощью LDA возникла задача сгруппировать эти темы в укрупненные кластеры ценностей и определить их семантические метки. Для этого был применен двухшаговый подход: сначала построены контекстуальные векторные представления слов (word embeddings), затем выполнена кластеризация векторных признаков методом k-средних.
Мы воспользовались алгоритмом Word2Vec для обучения векторных представлений слов на нашем корпусе сообщений. Word2Vec позволяет отразить скрытые семантические связи: слова, часто употребляющиеся в похожих контекстах, получают близкие векторы в пространстве [Mikolov et al. 2013]. Поэтому в одном кластере могут сближаться как лексемы, выражающие ценность, так и лексика ее нарушения (включая антонимы), если они регулярно встречаются в сходных контекстах обсуждения соответствующей проблематики.
Мы обучили модель на всем корпусе (2 млн сообщений, около 300 млн словоупотреблений), что гарантировало статистическую устойчивость эмбеддингов даже для редких ценностных терминов. В качестве проверки качества эмбеддингов оценивали устойчивость ближайших семантических соседей при переобучении модели. В серии из шести запусков средняя доля совпадения 20 ближайших соседей для частотных лемм составила 0,60 (12 из 20). Дополнительно на отдельных примерах проверялось, что модель сближает семантически связанные понятия (например, «семья» и «родители», «патриотизм» и «нация») и не сближает заведомо несвязанные (например, «патриотизм» и «комфорт»).
На основе полученных эмбеддингов слов была проведена кластеризация, чтобы объединить слова и темы в более общие кластеры ценностей. Для кластеризации эмбеддингов выбран алгоритм k-means (k-средних) как воспроизводимый метод, масштабируемый на больших массивах векторных данных, он разбивает множество векторов на k кластеров, минимизируя суммарную внутрикластерную вариацию (сумму квадратов расстояний объектов до центроидов) [Boehmke, Greenwell 2020]. В данном случае мы кластеризовали векторы ключевых слов и выражений, характерных для LDA-тем, а также средние векторы самих тем. Это объединение позволило связать близкие по смыслу темы. Например, одна из тем LDA касалась «патриотизма», другая — «гордости и уважения», третья — «исторической памяти»; их ключевые слова (родина, гордость, долг, герой, история и т. д.) образовали плотную группу в векторном пространстве и были объединены k-means в один кластер ценности «патриотизм/гордость».
Число кластеров k подбиралось эмпирически в ходе серии пробных запусков и соотносилось с задачей последующей содержательной интерпретации кластеров как ценностных ориентаций в трактовке классических подходов [Rokeach 1973; Schwartz 1992]. В качестве рабочего компромисса было выбрано k = 25: при меньших значениях ряд тематически различных групп сливался, а при бóльших возникала избыточная фрагментация, ухудшающая интерпретируемость. В результате алгоритм k-means разделил семантическое пространство на 25 групп. Исследования показывают, что k-means способен выявлять группы, близкие к темам LDA, при соответствующей настройке k [Lossio-Ventura et al. 2019], что и подтвердилось (большинство полученных кластеров примерно соответствовали одной или двум исходным темам LDA). Отметим, что k-means как метод довольно чувствителен к инициализации кластерных центров, поэтому, чтобы получить устойчивое разбиение, мы запустили алгоритм несколько раз и выбрали решение с наименьшей внутрикластерной дисперсией.
Каждому кластеру была присвоена содержательная метка — название ценности или ценностной группы — на основе его ключевых слов. Этот процесс выполнялся экспертно: авторы проанализировали список самых характерных слов каждого кластера (по близости к центроиду и частотности в корпусе) и сопоставили их с известными ценностными понятиями. Например, кластер с характерными словами {семья, любовь, дружба, доверие, поддержка, верность, забота…} был однозначно интерпретирован как ценность «семейные и дружеские отношения, любовь и взаимопомощь» (условно назван «Семья и взаимоотношения»). Кластер со словами {успех, достижение, цель, карьера, достаток, успех (в разных формах), амбиции…} получил название «Успех и достижение». В процесс интерпретации были вовлечены четыре независимых эксперта-социолога; расхождения по отдельным кластерам (например, разграничение ценностей «справедливость» и «равенство») обсуждались до консенсуса. В итоге сформирован итоговый перечень из 25 ценностных кластеров, каждому из которых присвоено название и краткое определение.
Экспертная проверка и валидация
Завершающим этапом методологии стала валидация — проверка надежности и осмысленности выделенных ценностных кластеров. Она осуществлялась в двух формах: количественной и качественной.
Для каждого кластера было вычислено количество сообщений, в которых он проявляется. Сообщение считалось относящимся к кластеру, если содержало хотя бы одно характерное слово из данного ценностного кластера (после лемматизации) или если LDA-тема, соответствующая кластеру, имела в сообщении высокую вероятность. Это позволило построить распределение частот кластеров (см. рисунок). Оказалось, что даже на подвыборках данных (например, разбивке по времени или по платформам) относительный порядок наиболее частых кластеров сохраняется.

Рис. Распределение ценностных кластеров в российском сегменте соцмедиа (число сообщений, в которых присутствует соответствующая ценностная тематика)
Так, кластеры «Гордость и патриотизм», «Семья и взаимоотношения» и «Поддержка и сотрудничество» стабильно входили в топ‑3 по частоте в разные месяцы и на разных платформах. Мы трактуем это как признак воспроизводимости результата на разных подвыборках внутри исследуемого периода. Доминирование этих кластеров сохраняется при смене платформы и месяца наблюдения, хотя их доли могут колебаться под влиянием внешней событийной повестки.
Для каждого ценностного кластера также были отобраны случайные примеры сообщений, сильно связанных с этим кластером (например, содержащих несколько характерных слов кластера). Эксперты проанализировали эти сообщения на предмет соответствия сути кластера. В подавляющем большинстве случаев подтверждалось, что сообщения действительно затрагивают соответствующую ценностную тему. Например, типичное сообщение для кластера «Справедливость и равенство» В обществе не хватает справедливости — законы должны быть равны для всех без исключения, для кластера «Доброта и человечность» — Надо относиться друг к другу с добротой, быть человечнее, тогда мир станет лучше — явно отражают заявленные ценности. Подобная проверка служит «контролем реальности» — убеждает, что за абстрактными кластерами стоят реально интерпретируемые фрагменты дискурса.
Кроме того, проведена перекрестная проверка: сообщения с высоким содержанием терминов одного кластера не должны систематически попадать в другой кластер. Некоторые сообщения могут отражать сразу несколько ценностей (например, «горжусь своей семьей и страной» объединяет патриотизм и семейные ценности) — такие случаи отмечались, но они обычно связаны с осмысленной комбинацией ценностей, а не с ошибкой разметки.
Наконец, результаты нашего автоматизированного выявления ценностей были сопоставлены с известными теоретическими типологиями (Ш. Шварц, Р. Инглхарт [Инглхарт 2018] и др.) с целью внешней валидации. Выяснилось, что большинство кластеров находят соответствия в базовых ценностях Шварца: например, кластер «Доброта и человечность» коррелирует с ценностями универсализма (Universalism) и благожелательности (Benevolence), «Успех и достижения» — с ценностями самоутверждения (Achievement, power), «Патриотизм и гордость» — с ценностями традиции (Tradition) и безопасности (Security), «Поддержка и сотрудничество» — с ценностями благожелательности (Benevolence). Это соответствие свидетельствует о том, что стихийно выделенные из данных кластеры не противоречат существующим представлениям о структуре ценностных ориентаций, а, напротив, обогащают их эмпирическим содержанием. Таким образом, многоступенчатая методология, сочетающая автоматический анализ и экспертную оценку, позволила идентифицировать ключевые ценностные ориентации в российском сегменте соцсетей. Далее представлены основные результаты — структура и состав этих ценностных кластеров, их распределение и доминирующие темы.
Результаты исследования
В результате описанных процедур получен перечень из 25 ценностных кластеров, выявленных на основе анализа более двух миллионов сообщений русскоязычных социальных сетей. Эти кластеры представляют собой укрупненные тематики, каждая из которых объединяет близкие по смыслу ценности, обсуждаемые пользователями. Ниже приведены наиболее значимые кластеры с кратким описанием:
- Семья и взаимоотношения. Объединяет ценности семьи, близких отношений, дружбы, взаимопомощи и эмоциональной поддержки. Ключевые слова: семья, любовь, друзья, поддержка, забота, доверие, верность, понимание. Это наиболее широкий кластер, указывающий на фундаментальную значимость межличностных связей и привязанностей в жизни людей [Schwartz 1994]. Семейные ценности выступают доминантой: семья рассматривается как высшая ценность и источник поддержки во многих сообщениях.
- Гордость и патриотизм. Включает ценности, связанные с гордостью за свою страну, народ, историю и культурные традиции. Ключевые понятия: родина, Россия, гордость, патриотизм, герои, национальная идентичность, долг. Этот кластер от ражает важность коллективной идентичности и лояльности к стране. Он включает как политико-гражданские аспекты (гордость за государство, уважение к законам), так и культурные (уважение к истории, ветеранам).
- Достижения и успех. Включает ценности личного успеха, самореализации, карьерного роста, материального достатка. Ключевые понятия: успех, цель, карьера, бизнес, богатство, достижения, амбиции, победа. Этот кластер отражает ориентацию на результаты и статус. Часто встречаются обсуждения необходимости «добиться успеха», «стремиться к победе», ценность упорного труда ради высоких достижений. Связь успеха с другими ценностями проявляется, например, в том, что успех нередко воспринимается как средство обеспечить семью или гордость страны.
- Развитие и самосовершенствование. Кластер ценностей личностного роста, образования, творчества и духовного развития. Ключевые слова: развитие, образование, знание, рост, творчество, самореализация, саморазвитие, духовность. Пользователи обсуждают важность постоянного обучения, работы над собой, раскрытия своего потенциала. Эта ценностная ориентация, по сути, близка к концепции самоактуализации. Упор на саморазвитие иногда противопоставляется материалистическим ценностям (встречаются посты о приоритете духовного роста над богатством).
- Справедливость и равенство. Кластер, охватывающий ценности социальной справедливости, равноправия, честности и ответственности. Ключевые понятия: справедливость, равенство, честность, ответственность, права, закон, порядок, правда. В сообщениях этого кластера часто выражается возмущение несправедливостью, призывы к равным возможностям для всех, к честности властей и граждан. Тема социальной справедливости является заметной, отражая запрос на соблюдение моральных и правовых норм в обществе.
- Доброта и человечность. Включает ценности милосердия, сострадания, гуманизма, уважения к каждому человеку. Ключевые слова: доброта, человечность, эмпатия, уважение, терпимость, милосердие, помощь. Пользователи подчеркивают важность доброго отношения к окружающим, умения прощать, сочувствовать чужой беде. Этот кластер фокусируется на нравственных качествах личности, выступая противоположностью агрессии и жестокости. Он также тесно связан с семейно-дружескими ценностями (перекрывается понятием заботы, поддержки).
- Надежда и вера. Кластер духовных ценностей, связанных с верой (как религиозной, так и в широком смысле) и надеждой. Ключевые слова: вера, надежда, духовность, Бог, молитва, мечта, смысл жизни. Здесь отражены религиозно-нравственные мотивы (упование на Бога, следование вере) и экзистенциальные поиски смысла, надежды на лучшее. Доля этого кластера сравнительно невелика, но он важен как проявление традиционных духовных устремлений.
- Здоровье и безопасность. (Отдельно явно не выделялся, но присутствует как мотив в других кластерах, особенно в кластерах «патриотизм» и «семья».) Включает ценности физической и экономической безопасности, порядка, стабильности жизни. Ключевые понятия: безопасность, стабильность, порядок, защищенность, спокойствие. Эти ценности часто упоминаются в связке с патриотизмом (безопасность страны) или с семьей (стабильность для семьи).
- Свобода и право. Ценности личной и гражданской свободы, независимости мнений и действий. Ключевые понятия: свобода, независимость, выбор, права, самостоятельность. Хотя открытое обсуждение политической свободы может быть ограничено, встречаются заявления о ценности свободы самовыражения, свободного выбора жизненного пути, независимости от чужого мнения.
- Гибкость и адаптивность. Ценности открытости переменам, умения адаптироваться, инноваций. Ключевые слова: адаптивность, гибкость, прогресс, инновации, перемены. Довольно узкий кластер, заметный в обсуждениях, где ценится умение меняться, обучаться новому, «не застревать в прошлом». Его можно связать с современными трендами (например, ценность технологического прогресса или личной гибкости в карьере).
Некоторые из перечисленных кластеров частично перекрываются или иерархически связаны. Например, семейные ценности относятся к более широкому кластеру семьи и взаимоотношений, вопросы безопасности тесно связаны с патрио тизмом и стабильностью и т. д. Тем не менее выбранный уровень детализации (25 кластеров) позволил зафиксировать разнообразие ценностных ориентаций, эксплицированных в текстах.
Частотный анализ выявленных кластеров показал заметную дифференциацию их представления в массовом дискурсе. На рисунке представлено соотношение числа сообщений, в которых упоминается та или иная ценностная тема (один пост может входить в несколько кластеров, если затрагивает несколько ценностей одновременно).
Три крупнейших кластера — «Гордость и патриотизм», «Семья (любовь) и взаимоотношения», «Открытость и добрососедство» — охватывают существенную часть обсуждений (в сумме более половины всех сообщений). Это позволяет выделить их как доминирующие ценностные ориентации российского сегмента соцсетей на данный период. Ценности, относящиеся к социальным потребностям (общение, привязанности, коллектив), в совокупности значительно превосходят по частоте ценности индивидуального самоутверждения. По оценкам, доля ценностных высказываний, отражающих социальную принадлежность (любовь, дружбу, поддержку, сотрудничество и т. п.), составляет свыше 50 %. Это, возможно, продиктовано спецификой публичных дискуссий в социальных сетях как среде для коммуникации. Тем не менее существенная доля (около четверти упоминаний) приходится на ценности самореализации (успех, развитие, независимость).
Анализ совместных упоминаний показал ряд закономерностей. Рассуждения о патриотизме и успехе имеют положительную корреляцию в упоминаниях: нередко в патриотически окрашенных дискуссиях речь заходит об успехах страны или о личных достижениях во благо Родины. Напротив, кластеры «Гордость и патриотизм» и «Справедливость и равенство» зачастую появляются в противопоставлении: темы справедливости порой звучат в критическом ключе по отношению к государству, тогда как патриотические посты обычно носят позитивно-лояльный тон. «Семья и взаимоотношения» хорошо сочетается с «Доброта и человечность» и «Надежда и вера» — в постах о семье часто упоминаются надежды на лучшее будущее, важность доброты. «Достижения и успех» и «Развитие и самосовершенствование» связаны: многие публикации об успехе упоминают саморазвитие как путь к нему. Кроме того, риторика о «Справедливости и равенстве» часто сопровождается рассуждениями про честное имя и уважение. Таким образом, ценностные ориентации не изолирова ны: они образуют сложную сеть, где одни ценности могут подкреплять или оттенять другие.
Полученная карта ценностных кластеров в значительной степени резонирует с известными моделями человеческих ценностей, но имеет и свои особенности. Так, в теории Ш. Шварца базовыми категориями являются, в частности, Benevolence (доброжелательность, забота о близких), Achievement (достижение), Security (безопасность, включая национальную), Tradition (уважение к традициям, религиозность) и др. [Schwartz 1992]. Наши кластеры «Семья и взаимоотношения», «Развитие и самосовершенствование», «Гордость и патриотизм», «Доброта и человечность», «Надежда и вера» в целом соответствуют этим категориям. При этом онлайн-дискурс выявил некоторый сдвиг акцентов: ценности общества и отношений доминируют над ценностями личных интересов.
Исследование охватывает период, в котором в российском обществе имели место значимые события (например, геополитические конфликты, экономические перемены). Это могло усилить присутствие определенных ценностей, прежде всего патриотизма. Вместе с тем ценность справедливости могла усилиться под влиянием внутренних социальных проблем и запросов на честность и равенство — она также получила заметное место. Можно предположить, что динамика ценностей в онлайн-дискурсе чувствительна к внешним обстоятельствам. Это открывает возможность использования подобного анализа для мониторинга изменений ценностных ориентаций общества в режиме реального времени. Например, можно отследить, как меняется частотность рассуждений о безопасности и патриотизме в период кризисов или возрастает ли кластер «Справедливость и равенство» в контексте общественных обсуждений резонансных событий (судебных дел, реформ).
Ограничения и критические замечания
Как упоминалось, пользователи соцсетей — не строго репрезентативная выборка населения. В частности, молодежь и городские жители обычно более активны онлайн, тогда как ценностные ориентиры старших поколений и сельского населения могут быть иначе расставлены. Это накладывает ограничения на обобщение результатов на все общество. Мы трактуем полученные выводы как характеристику ценностного дискурса именно цифрового сообщества в рассматриваемый период. Однако аудитория соцсетей в России велика (десятки миллионов пользователей), а потому ключевые тенденции (например, высокая значимость семейных ценностей) с большой вероятностью отражают общие культурные черты. Тем не менее для большей уверенности в обобщениях целесообразно в будущем сопоставить наши данные с результатами офлайн-опросов по ценностям, таких как Всемирное исследование ценностей (World Values Survey).
Мы анализировали тексты сообщений без привязки к конкретным авторам (в обезличенном виде). Это означает, что выводы делаются об общем содержании дискурса, но не о ценностях отдельных людей. Один и тот же пользователь мог писать на разные темы, и наоборот, группа активистов могла многократно продвигать определенную тему. В нашем исследовании единица анализа — сообщение, а не человек. Это ограничение при анализе контента: мы исследуем распространенность ценностных тем в массовых коммуникациях, но не напрямую ценностные приоритеты отдельных личностей или групп.
В социальных сетях наблюдается феномен эхо-камер и неравномерного вклада отдельных групп. Например, организованные сообщества или боты могут многократно транслировать одни и те же ценностные месседжи, и алгоритмы платформ могут усиливать одни темы за счет других. В нашем корпусе могли присутствовать кластеры, увеличенные активностью конкретных сообществ. Мы частично нивелировали это, удаляя явный спам и дубли, однако полностью исключить влияние координированных кампаний невозможно. Тем не менее методы кластеризации и качественной оценки позволили выявить устойчивые темы, которые прослеживаются и при разбивке данных (т. е. не являются артефактом одной группы).
Российские соцмедиа-данные собирались из открытых источников, что подразумевает соответствие контента правилам платформ и законам. Возможна самоцензура пользователей по некоторым чувствительным темам. Поэтому отсутствие или низкая доля некоторых ценностей необязательно означают их незначимость, а могут быть следствием внешних ограничений. В нашем анализе это учтено в интерпретации: результаты отражают разрешенный и принятый в обществе дискурс о ценностях.
Автоматическая тематическая модель учитывала только факт упоминания тех или иных ценностных понятий, но не оценивала тональность высказывания (позитивную, негативную, ироническую, нейтральную). Наш анализ на этапе качественной валидации старался учитывать контекст вручную, однако системного анализа тональности текстов (sentiment analysis) не проводилось. В будущем обогащение модели анализом тональности позволило бы разделять, какие ценности одобряются, а какие упоминаются в негативном ключе. Пока же результаты следует читать в нейтральном плане. Мы выявили темы разговоров о ценностях без оценки того, хорошо или плохо о них отзываются.
Существует также вероятность ошибок на каждом автоматическом этапе: неполная лемматизация (особенно для жаргона и сленга), промахи LDA (слияние разных тем), неточное число кластеров k, субъективность ручной интерпретации и т. д. Мы предприняли шаги для минимизации ошибок: пользовались проверенными инструментами, проверяли несколько конфигураций модели, привлекли нескольких экспертов к оценке. Тем не менее методология открыта для доработок.
Несмотря на ограничения, результаты исследования обладают прикладной значимостью. Они могут использоваться для мониторинга общественных настроений. Ценностные кластеры отражают реакцию на социальные и политические события, позволяя фиксировать сдвиги в дискурсе. Высокая частотность патриотических, семейных приоритетов и установок справедливости может служить индикатором актуальных общественных запросов. Понимание ценностей, реально обсуждаемых в цифровой среде, важно для корректировки воспитательных программ и разработки учебных материалов, особенно в области гражданского образования. Выявленные ориентиры также полезны для коммуникационных стратегий (бренды и НКО могут опираться на них при создании содержательно релевантного и эмоционально резонансного контента).
Предложенная методика позволяет количественно измерять ценности и сопоставлять их с социальными показателями, что делает ее применимой в аналитике и прогнозировании.
В целом практическая значимость нашего исследования, с одной стороны, де монстрирует новый метод измерения и мониторинга ценностей в цифровую эпоху, с другой — предоставляет конкретные инсайты о текущих ценностных ориентирах россиян, которые могут быть непосредственно использованы в различных сферах.
Перспективы дальнейших исследований включают углубление анализа: применение нейросетевых тематических моделей следующего поколения, анализ динамики ценностей во времени (например, помесячно или в период кризисных событий), сопоставление с данными опросов и по различным социальным группам.
Выводы
Методика задает полный цикл анализа цифровых текстов для реконструкции ценностных ориентаций в русскоязычных социальных сетях на данных Brand Analytics. Корпус собирался по всей библиотеке источников Brand Analytics, затем тексты проходили нормализацию и очистку. Для выделения тематической структуры применялось тематическое моделирование LDA. Далее темы переводились в ценностные группы через векторные представления и кластеризацию k-means.
Апробация проведена на массиве более двух миллионов сообщений за период с сентября 2023 г. по сентябрь 2024 г. Итогом стала «карта» из 25 кластеров ценностных ориентаций в исследуемом корпусе. Среди доминирующих выделяются рассуждения о патриотизме, любви, семье, взаимопомощи и поддержке. Одновременно присутствуют высказывания о самореализации, успехе и достижениях, что показывает заметную долю ценностей, связанных с личными результатами. Часть кластеров напрямую соотносится с доменами ценностей в подходах Шварца и Рокича, поскольку описывает универсальные ориентации, которые в корпусе проявляются через устойчивую лексику и типовые контексты, в том числе «семья», «любовь и поддержка», «успех» и «достижения». Одновременно в карте присутствуют эмпирически выделенные тематические домены, которые не совпадают с перечнями Шварца и Рокича. К ним относится «патриотизм», оформляющийся в корпусе как самостоятельный кластер и соотносимый на уровне интерпретации с более общими ориентациями, связанными с групповой лояльностью, традицией и социальным порядком.
В результате анализ сводит большой массив сообщений и набор вероятностных тем к ограниченному числу ценностных групп, пригодных для дальнейшего описания структуры ценностного содержания корпуса. Карта выступает итоговым уровнем представления результатов, на который переводятся темы после тематического моделирования и кластеризации.
Инглхарт, Р. (2018). Культурная эволюция: как изменяются человеческие мотивации и как это меняет мир. Пер. с англ. С. Л. Лопатиной. М.: Мысль.
Blei, D. M., Ng, A. Y., Jordan, M. I. (2003). Latent Dirichlet Allocation. Journal of Machine Learning Research, 3, 993–1022.
Boehmke, B., Greenwell, B. (2020). Hands-On Machine Learning with R. Boca Raton: CRC Press.
Churchill, R., Singh, L. (2023). Using topic-noise models to generate domain-specific topics across data sources. Knowledge and Information Systems, 65 (5), 2159–2186.
Kalimeri, K., Beiró, M. G., Delfino, M., Raleigh, R., Cattuto, C. (2019). Predicting demographics, moral foundations, and human values from digital behaviours. Computers in Human Behavior, 92, 428–445.
Lossio-Ventura, J. A., Morzan, J., Alatrista-Salas, H., Hernandez-Boussard, T., Bian, J. (2019). Clustering and topic modeling over tweets: A comparison over a health dataset. In I. Yoo, J. Bi, X. T. Hu (Eds), Proceedings — 2019 IEEE International Conference on Bioinformatics and Biomedicine (BIBM 2019) (p. 1544–1547). San Diego, CA: IEEE.
Manning, C. D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge: Cambridge University Press.
May, C., Cotterell, R., Van Durme, B. (2016). An analysis of lemmatization on topic models of morphologically rich language. arXiv:1608.03995.
Mikolov, T., Chen, K., Corrado, G., Dean, J. (2013). Efficient estimation of word representations in vector space. arXiv:1301.3781.
Murshed, B. A. H., Mallappa, S., Abawajy, J., Saif, M. A. N., Al-ariki, H. D. E., Abdulwahab, H. M. (2022). Short text topic modelling approaches in the context of big data: taxonomy, survey, and analysis. Artificial Intelligence Review, 56 (6), 5133–5260.
Phillips, D. L., Clancy, K. J. (1972). Some effects of ‘‘social desirability’’ in survey studies. American Journal of Sociology, 77 (5), 921–940.
Rokeach, M. (1973). The Nature of Human Values. New York: Free Press.
Schofield, A., Magnusson, M., Mimno, D. (2017). Pulling out the stops: Rethinking stopword removal for topic models. In M. Lapata, P. Blunsom, A. Koller (Eds), Proceedings of the 15th Conference of the European Chapter of the Association for Computational Linguistics: Volume 2, Short Papers (p. 432–436). Valencia: Association for Computational Linguistics.
Schwartz, S. H. (1992). Universals in the content and structure of values: Theoretical advances and empirical tests in 20 countries. Advances in Experimental Social Psychology, 25, 1–65.
Schwartz, S. H. (1994). Are there universal aspects in the structure and contents of human values? Journal of Social Issues, 50 (4), 19–45.
Zimmermann, J., Champagne, L. E., Dickens, J. M., Hazen, B. T. (2024). Approaches to improve preprocessing for Latent Dirichlet Allocation topic modeling. Decision Support Systems, 185, 114310.
Blei, D. M., Ng, A. Y., Jordan, M. I. (2003). Latent Dirichlet Allocation. Journal of Machine Learning Research, 3, 993–1022.
Boehmke, B., Greenwell, B. (2020). Hands-On Machine Learning with R. Boca Raton: CRC Press.
Churchill, R., Singh, L. (2023). Using topic-noise models to generate domain-specific topics across data sources. Knowledge and Information Systems, 65, 2159–2186.
Inglehart, R. F. (2018). Cultural evolution: How people’s motivations are changing and how this is changing the world. Rus. ed. Moscow: Mysl’ Publ. (In Russian)
Kalimeri, K., Beiró, M. G., Delfino, M., Raleigh, R., Cattuto, C. (2019). Predicting demographics, moral foundations, and human values from digital behaviours. Computers in Human Behavior, 92, 428–445.
Lossio-Ventura, J. A., Morzan, J., Alatrista–Salas, H., Hernandez-Boussard, T., Bian, J. (2019). Clustering and topic modeling over tweets: A comparison over a health dataset. In I. Yoo, J. Bi, X. Hu (Eds), Proceedings of the 2019 IEEE International Conference on Bioinformatics and Biomedicine (BIBM) (pp. 1544–1547). San Diego, CA: IEEE.
Manning, C. D., Raghavan, P., Schütze, H. (2008). Introduction to Information Retrieval. Cambridge: Cambridge University Press.
May, C., Cotterell, R., Van Durme, B. (2016). An analysis of lemmatization on topic models of morphologically rich language. arXiv:1608.03995.
Mikolov, T., Chen, K., Corrado, G., Dean, J. (2013). Efficient estimation of word representations in vector space. arXiv:1301.3781.
Murshed, B. A. H., Mallappa, S., Abawajy, J., Saif, M. A. N., Al-ariki, H. D. E., Abdulwahab, H. M. (2022). Short text topic modelling approaches in the context of big data: taxonomy, survey, and analysis. Artificial Intelligence Review, 56 (6), 5133–5260.
Phillips, D. L., Clancy, K. J. (1972). Some effects of ‘‘social desirability’’ in survey studies. American Journal of Sociology, 77 (5), 921–940.
Rokeach, M. (1973). The Nature of Human Values. New York: Free Press.
Schofield, A., Magnusson, M., Mimno, D. (2017). Pulling out the stops: Rethinking stopword removal for topic models. In M. Lapata, P. Blunsom, A. Koller (Eds), Proceedings of the 15th Conference of the European Chapter of the Association for Computational Linguistics: Volume 2, Short Papers (pp. 432–436). Valencia: Association for Computational Linguistics.
Schwartz, S. H. (1992). Universals in the content and structure of values: theoretical advances and empirical tests in 20 countries. Advances in Experimental Social Psychology, 25, 1–65.
Schwartz, S. H. (1994). Are there universal aspects in the structure and contents of human values? Journal of Social Issues, 50 (4), 19–45.
Zimmermann, J., Champagne, L. E., Dickens, J. M., Hazen, B. T. (2024). Approaches to improve preprocessing for Latent Dirichlet Allocation topic modeling. Decision Support Systems, 185, 114310.
Статья поступила в редакцию 30 апреля 2025 г.;
рекомендована к печати 15 февраля 2026 г.
© С. А. Зверев, Е. Н. Соколова, М. В. Григорьева, А. Г. Смирнов, 2026
Received: April 30, 2025
Accepted: February 15, 2026
