Modeling Demographically Conditioned Language in Large Language Models: Towards a Synthetic Respondent for Linguistic Research

Cover Page

Cite item

Full Text

Abstract

Using large language models (LLMs) to construct synthetic respondents is increasingly common in marketing and the social sciences, yet their applicability to modeling demographically conditioned variation in natural language remains underexplored in linguistics. This article aims to assess the extent to which synthetic respondents, instantiated via sociodemographic persona prompting, can reproduce gender-marked features of Russian diary writing. The data comprise diary entries from the Russian National Corpus (RNC) after 1950, split into female and male subcorpora and used as reference data, as well as 108 synthetic diary texts generated by three large language models (GPT-5.2, DeepSeek, GigaChat) across 32 persona-prompt configurations. The methods include corpus-based analysis of gender variation in language using a set of lexico-grammatical and pragmatic features, automated morphological and lexico-pragmatic annotation of synthetic texts with the Stanza library, computation of a parametric and a lexical index of gender proximity, and their aggregation into an integral measure. The results show that specific combinations of models and persona-prompt formulas (above all GPT-5.2 and DeepSeek with direct role adoption and structured or name-based demographic priming) generate texts whose statistical profiles approximate the female diary subcorpus of the RNC, whereas other configurations systematically shift towards the male profile. The study concludes that synthetic respondents can serve as a research instrument for modeling gender-marked language use, but their validity is tightly dependent on the choice of model and persona prompt and requires prior calibration against reference corpora, thereby specifying the scope and conditions for the responsible use of synthetic respondents in linguistics.

Full Text

Введение

В последние годы в научном дискурсе активно формируется понятийный аппарат, связанный с использованием больших языковых моделей (Large language model, LLM) для имитации поведения реальных информантов в исследовательских целях. В англоязычных академических публикациях, а также в практико‑ориентированных материалах компаний, разрабатывающих подобные решения на коммерческой основе, для обозначения генерируемых искусственным интеллектом (ИИ) участников исследования используются  термины synthetic respondent («синтетический респондент») и synthetic participant («синтетический участник»), определяемые как искусственные цифровые личности, сгенерированные моделями машинного обучения с целью воспроизведения ответов реальных людей на основе демографических, психологических и поведенческих профилей [1]1. В одной из ключевых для данной научно-практической области работ «Out of One, Many: Using Language Models to Simulate Human Samples» также вводится понятие silicon samples («кремниевые выборки»), обозначающее выборки синтетических ответов, которые были сгенерированы языковой моделью и предварительно настроены на тысячах социодемографических профилей реальных участников нескольких крупных опросов, проведенных в США. За счет такой параметризации модель воспроизводила распределения ответов различных социальных групп с высокой степенью соответствия эмпирическим данным и отражала не только поверхностное сходство, но и многомерное переплетение идей и социокультурных контекстов, лежащее в основе человеческих установок [2]. В русскоязычных источниках параллельно закрепляются термины синтетический респондент2, цифровой респондент3 и виртуальный респондент [3], первый из которых далее будет использоваться в данной работе по причине большего соответствия международной практике. Важно отметить, что в русскоязычной научной литературе использование LLM в качестве синтетических респондентов пока освещено крайне ограниченно, тогда как на прикладные популярные материалы в прессе, блогах и на корпоративных страницах разработчиков приходится основной массив публикаций по этой теме.

Основные сферы применения синтетических респондентов на сегодняшний день сосредоточены преимущественно в маркетинговых исследованиях, социологии и поведенческих науках, что подтверждается появлением отраслевых решений вроде проекта Synth компании «Родная Речь», использующего синтетических респондентов (разработчики называют их «синтеты») для быстрой оценки реакции аудитории и предварительного тестирования гипотез в сфере маркетинга и медиапотребления4. В то же время исследование [4], представленное на конференции International Conference on Machine Learning (ICML) — одной из ведущих площадок в области машинного обучения, — показало, что LLM способны воспроизводить результаты не только опросов, но и классических экономических, психолингвистических и социо-психологических экспериментов.

Вместе с тем применимость синтетических респондентов в лингвистических исследованиях, в частности при изучении речевого поведения конкретных социальных групп, остается существенно менее разработанной. При этом именно в тех областях, где доступ к эмпирическому языковому материалу ограничен вследствие физической недоступности данных, жестких этических регуляций и строгих режимов конфиденциальности, потребность в подобных исследованиях оказывается особенно значимой. К числу таких типов дискурса относятся личная переписка, дневниковые записи и частные заметки, для которых наблюдается выраженный дефицит репрезентативных корпусов, что существенно затрудняет систематическое изучение вариативности идиолектов, социолектов и прагматических стратегий. Синтетические респонденты потенциально могут помочь преодолеть эти барьеры, позволяя  моделировать речевые паттерны на основе агрегированных демографических данных без риска нарушения приватности, что особенно актуально для труднодоступных социальных групп, таких как носители редких диалектов или маргинализированные сообщества.

В настоящей работе синтетические респонденты рассматриваются  в фокусе гендерной вариативности русскоязычного дневникового письма и сопоставляются с реальными текстами из Национального корпуса русского языка (НКРЯ), где дневниковые записи после 1950 г. снабжены метаданными об авторском поле и позволяют выделить референсные женский и мужской подкорпусы. На основе этих данных конструируется система лексико‑грамматических и прагматических показателей (части речи, грамматические категории, экспрессивность, диминутивы, средства вежливости, обсценная лексика, вопросы, восклицания, лексические повторы), задающих эмпирический профиль гендерной вариативности дневниковых текстов. Далее с помощью формул личностного социодемографического промптинга генерируется корпус синтетических дневниковых записей тремя крупными языковыми моделями (GPT‑5.2, DeepSeek, GigaChat); все тексты проходят автоматизированную морфологическую и прагматическую разметку с помощью Python, после чего для каждого из них вычисляются интегральные параметры сходства с женским и мужским эталонными профилями. Это позволяет оценить, в какой мере выбор модели и конфигурации личностного промпта влияет на способность синтетических респондентов воспроизводить гендерно маркированные особенности русскоязычного дневникового письма.

НКРЯ как источник референсных данных  для оценки синтетических респондентов

Для оценки эффективности LLM в задаче моделирования синтетических респондентов в лингвистических исследованиях исходным требованием является возможность адекватного сопоставления результатов больших языковых моделей с реальными языковыми данными. В качестве такой референсной эмпирической базы в настоящем исследовании используется Национальный корпус русского языка (НКРЯ), обеспечивающий достаточный объем материала для надежного статистического анализа.

Именно особенностями данной платформы — в частности, структурой и полнотой метаданных об авторах текстов, — обуславливался выбор демографических переменных для тестирования синтетических респондентов. Таким образом, в качестве ключевого параметра определения социальной группы была выбрана гендерная принадлежность, поскольку соответствующий признак наиболее последовательно и полно аннотирован в референсном источнике. Возрастные характеристики, напротив, не могут стать предметом  анализа из-за заметной несбалансированности корпуса по годам рождения авторов, а также вследствие отсутствия во многих случаях сведений о возрасте автора на момент написания текста в экстралингвистической разметке.  Другие демографические параметры, такие как национальность, уровень образования и др., в НКРЯ в явном виде не представлены.

Среди доступных в НКРЯ типов текстов, релевантных для поставленных задач, были рассмотрены подкорпусы личных писем («письмо личное»:  3112 текстов, 4 402 739 слов) и дневниковых записей («дневники, записные книжки»: 3677 текстов, 38 735 953 слова), причем последний превосходит первый по объему более чем в десять раз, что делает его предпочтительным источником данных. Выбор дневниковых записей дополнительно мотивирован их жанровой спецификой — монологической спонтанностью, отсутствием явного адресата и высокой степенью индивидуализации языкового выражения [5]. В письмах речевое поведение в значительной степени регулируется ожиданиями конкретного адресата и нормами вежливости, тогда как дневниковый текст фиксирует преимущественно автокоммуникативные практики, менее подверженные внешнему коммуникативному контролю.

Ограничение корпусного материала записями после 1950 г. обусловлено необходимостью обеспечить соответствие референсных данных материалу, на котором обучены современные большие языковые модели, и тем самым повысить корректность последующего сравнения. Тексты этого периода не содержат системных архаизмов и орфографических колебаний, характерных для первой половины XX века, что снижает риск расхождений в распределениях форм и улучшает качество автоматической морфосинтаксической  разметки. Такой хронологический срез также позволяет интерпретировать наблюдаемые различия между реальными и синтетическими текстами как отражение особенностей генерации, а не как эффект историко-языковых  сдвигов.

В совокупности эти решения задают референсную базу исследования: дневниковые записи НКРЯ, разделенные на женский и мужской подкорпуса и ограниченные периодом после 1950 г.

Сбор и анализ референсных данных

Поскольку в качестве основной переменной для дальнейшего моделирования синтетических респондентов рассматривается гендерная принадлежность автора, следующим шагом стало определение параметров, репрезентирующих типичную гендерную вариативность речи. Опираясь на представление о гендерлекте как социально и культурно обусловленном варианте речевого поведения мужчин и женщин [6], а также на наблюдения о дифференциации мужской и женской речи на различных уровнях языка, в качестве отправной точки был выбран широкий спектр описанных в литературе признаков [7–10] — от распределения частей речи и лексико‑грамматических предпочтений до частотности параметров экспрессивности, средств вежливости и модальности, а также прагматических маркеров. Однако прямое перенесение всего этого множества индикаторов в корпусную парадигму оказалось невозможным: во‑первых, значительная часть описанных различий относится к устной, диалогической, ситуативно привязанной коммуникации, тогда как настоящая работа базируется на письменных дневниковых текстах;  во‑вторых, многие параметры (типичные темы, особенности прагматикализации, семантические и оценочные сдвиги) либо не поддаются надежной автоматической разметке, либо требуют трудоемкой ручной аннотации, несовместимой с масштабом исследуемого материала.

С учетом этих ограничений перечень признаков гендерлекта был ограничен теми параметрами, которые, с одной стороны, имеют теоретическое обоснование в работах по гендерной вариативности речи, с другой стороны, могут быть обработаны существующими инструментами автоматического и автоматизированного анализа. Таким образом, последующие сбор и анализ  данных были реализованы по следующим единицам: частям речи (существительные, глаголы, прилагательные, наречия, числительные, предлоги, союзы, местоимения, частицы, междометия) и леммам; некоторым грамматическим категориям (временные формы, императив, условное наклонение, сравнительная и превосходная степени); параметрам прагматической организации высказывания (вводные конструкции, вопросительные и восклицательные предложения); а также лексическим и социопрагматическим маркерам, включающим диминутивы, нецензурную лексику, лексемы‑индикаторы вежливости, имена собственные и лексические повторы. В дальнейшем этот перечень трактуется как параметры гендерной вариативности речи.

Таким образом, анализ, осуществленный на предыдущем этапе, позволил не только сузить набор признаков гендерлекта до перечня соответствующих целям и ограничениям исследования параметров, но и применить их к установленному ранее подкорпусу НКРЯ, разделенному на женские и мужские подвыборки.

На этой основе были выделены два референсных подкорпуса на базе НКРЯ: дневниковые записи, написанные женщинами (418 текстов, 2 508 844 словоформы), и дневниковые записи, написанные мужчинами (1493 текста, 13 936 392 словоформы). В каждом из этих подкорпусов был проведен лексико‑грамматический поиск по всем параметрам гендерлекта, определенным ранее. В большинстве случаев процедура опиралась на грамматические признаки (части речи и грамматические категории), однако ряд параметров требовал привлечения дополнительных указателей, в частности при идентификации лексических повторов.

Специальные решения потребовались и для подсчета вопросительных и восклицательных предложений, поскольку интерфейс НКРЯ не предусматривает прямого поиска по знакам препинания. Вместо этого использовались пометы категории «слово перед» с подкатегориями «перед восклицательным знаком» и «перед вопросительным знаком», что позволило получить статистические данные по распределению восклицательных и вопросительных предложений в каждом из подкорпусов. Дополнительные трудности возникли при поиске лексических средств выражения вежливости и нецензурной лексики, так как соответствующие пометы в НКРЯ в явном виде отсутствуют и каждый из этих параметров требовал предварительного составления специального списка лексем. Вслед за наблюдениями о гендерно дифференцированной вариативности редуцированных форм в повседневной устной коммуникации [10], при поиске средств выражения вежливости дополнительно учитывались их графически редуцированные варианты, которые, как показал предварительный анализ Основного корпуса НКРЯ, представлены и в письменных текстах (например: «спасиб», «спс», «пожалста», «плз»). Поиск нецензурной лексики осуществлялся на основе соответствующей словарной статьи в Толковом словаре государственного языка Российской Федерации, входящем в перечень нормативных словарей ИРЯ РАН, причем дополнительной сложностью являлось то, что словарная статья фиксирует набор корней, а не лемм, вследствие чего список лексем для корпусного поиска по леммам и словоформам формировался вручную.

Результаты поиска по параметрам сохранялись в двух форматах.  Во‑первых, формировались две сводные таблицы (по женским и мужским дневниковым записям) по всем параметрам, в которых для каждого параметра указывались общее количество текстов в подкорпусе, общий объем подкорпуса в словоформах, число найденных вхождений, удовлетворяющих поисковому запросу, и нормализованная частотность на миллион словоформ (instances per million words, IPM). Во‑вторых, для каждого отдельного поискового запроса из НКРЯ выгружалась частотная таблица лемм, содержащая сведения о доле каждой лексемы в рамках данного запроса, ее нормализованной частотности и абсолютном количестве вхождений.

Далее был реализован макроуровневый анализ, рассматривающий каждый из параметров как целостный маркер, для которого сопоставлялись относительные частоты в мужском и женском подкорпусах. Для каждого параметра X из сводных таблиц извлекались: объем женского подкорпуса в словоформах Nf, объем мужского подкорпуса Nm, число вхождений параметра X  в женском подкорпусе hitsf и число вхождений параметра X в мужском  подкорпусе hitsm. На основе этих величин сравнивались частоты токенов параметра  и всех остальных токенов (\( \neg X \)) в обоих подкорпусах.

Каждый параметр, таким образом, моделировался как бинарная категория (наличие/отсутствие маркера в токенах подкорпуса), что позволяет использовать G‑тест (log‑likelihood ratio) для проверки нулевой гипотезы об одинаковых относительных частотах X в мужском и женском подкорпусах. При этом суммарный объем корпуса обозначался как N = Nf + Nm, а общая частота параметра hits = hitsf + hitsm. Ожидаемые частоты при верной нулевой гипотезе вычислялись из маргинальных сумм: ожидаемое число вхождений \( \neg X \) и  в каждом подкорпусе определялось как

\( E_{fX}=\frac{N_f \times hits}{N},\ E_{mX}=\frac{N_m \times hits}{N},\ E_{fX}=\frac{N_f \times (N-hits)}{N},\ E_{mX}=\frac{N_m \times (N-hits)}{N}. \)

Статистика G2 вычислялась по стандартной формуле отношения правдоподобий для таблицы сопряженности:

\( G^2=2\left(hits_f\ln\frac{hits_f}{E_{fX}}+(N_f-hits_f)\ln\frac{N_f-hits_f}{E_{f\neg X}} + hits_m\ln\frac{hits_m}{E_{mX}}+(N_m - hits_m)\ln\frac{N_m-hits_m}{E_{m\neg X}} \right). \)

Большие значения \( G^2 \) соответствуют сильным отклонениям наблюдаемых частот от ожидаемых при нулевой гипотезе. Для каждого параметра полученное значение  интерпретировалось в терминах распределения \( \chi^2 \)  с одной степенью свободы, что позволяло вычислить p‑значение как \( p = P(\chi^2(df = 1) \ge G^2_{набл}) \), то есть вероятность получить такое же или более  экстремальное значение G2 при условии, что относительные частоты параметра X в мужском и женском подкорпусах на самом деле совпадают. Чем меньше p‑значение, тем менее правдоподобно, что наблюдаемое расхождение частот возникло случайно при верной нулевой гипотезе, и тем более убедительными являются основания для ее отклонения.

Параллельно для каждого параметра сохранялись нормированные  частоты в IPM для женского и мужского подкорпусов (IPMf  и IPMm), их  разность ΔIPM = IPMf - IPMm и направление эффекта: тег «female»/«male»  присваивался в зависимости от знака ΔIPM, при этом положительное значение указывало на более высокую частоту параметра у женщин, отрицательное — у мужчин.

Полученная сводная таблица показала статистически значимые различия по целому ряду параметров: G² достигал значений в тысячах, а p‑значение оценивались как 0.0 вследствие предельно малых величин в условиях больших объемов корпусов, что стандартно для корпусных G‑тестов на больших выборках. При этом направление соответствует ожиданиям гендерной лингвистики: например, женщины демонстрируют относительно более высокие нормализованные частоты междометий, диминутивов, восклицательных предложений, лексических повторов и форм будущего времени; мужчины — более высокую относительную частоту существительных, прилагательных, числительных, предлогов и некоторых градационных форм (превосходная степень).

Таким образом, на макроуровне было показано, что отобранные параметры систематически распределены по полу, и эти различия не могут быть объяснены случайными флуктуациями.

На следующем этапе фокус исследования сместился с уровня обобщенной представленности параметров в подкорпусах на уровень распределения отдельных лексем внутри каждого из них: использовались частотные таблицы НКРЯ, полученные по результатам лексико‑грамматических запросов и содержащие сведения о лемме, IPM и абсолютном числе вхождений. Их обработка осуществлялась с помощью кода на языке программирования Python, который последовательно обращался к каждому такому файлу, соответствующему комбинации «параметр–пол», и приводил данные к единому формату, что позволило выделить наиболее типичные лексемы в женских и мужских дневниковых текстах.

В дальнейшем лексемы внутри каждого файла упорядочивались по убыванию IPM; затем фиксировалось пороговое значение IPM на позиции N  (в данном исследовании N = 10), то есть значение, приходящееся на условную десятую строку отсортированного списка. На основании этого порога формировалось множество высокочастотных единиц: в него включались все лексемы с IPM не ниже порогового значения. Если единицы на последующих позициях (после десятой) имели такое же значение IPM, они также относились к этому множеству, что исключало искусственное разделение статистически сопоставимых по частоте форм.

Для каждой лексемы, включенной в множество высокочастотных единиц, сохранялись сведения о параметре, поле, лемме, IPM и абсолютном числе вхождений; далее результаты по всем комбинациям «параметр–пол» конкатенировались в единый сводный файл. На основании этого массива для каждого параметра были выделены три типа множеств: общие лексемы,  входящие в верхнюю зону распределения по IPM и в женском, и в мужском подкорпусе; единицы, характерные только для женских дневников; и лексемы, присутствующие лишь в мужских текстах. Для общих элементов дополнительно сопоставлялись значения IPM и ранги в обоих подкорпусах, что позволило зафиксировать как пересечение наборов наиболее частотных лексем, так и различия в их положении в женском и мужском подкорпусах.

Личностный социодемографический промптинг  при моделировании синтетических респондентов

В настоящем исследовании при создании синтетических респондентов используются формулы личностного социодемографического промптинга (sociodemographic persona prompting), сформулированные в работе «The Prompt Makes the Person(a): A Systematic Evaluation of Sociodemographic Persona Prompting for Large Language Models» [11]. Согласно авторам, адекватный задачам исследования запрос делится на два основных элемента: во-первых, личностный сегмент, который включает в себя характер принятия роли (role adoption format) и стратегию демографического прайминга (demographic priming strategy), во-вторых, сегмент задачи, которую синтетический респондент должен выполнить.

Выделяются следующие типы характера принятия роли: непосредственный (Direct), где модель напрямую позиционируется как носитель заданной личности — «You are a Hispanic woman» / «Ты женщина латиноамериканского происхождения»; от третьего лица (Third Person), где личность вводится опосредованно как объект воображаемой перспективы — «Think of a Hispanic woman» / «Представь женщину латиноамериканского происхождения»; интервью (Interview), где демографические характеристики поочередно задаются в вопросно-ответном виде — «Interviewer: What gender do you identify as? Interviewee: I identify as female» / «Интервьюер: Какого вы пола? Интервьюируемый: Я идентифицирую себя как женщину»).

Стратегии социодемографического прайминга также подразделяются на несколько типов: эксплицитная (Explicit), использующая явные вербальные описания — «a Hispanic woman» / «Женщина латиноамериканского происхождения»; именная (Name), при которой демографические признаки задаются имплицитно через имя — «Ms. Hernandez» / «г-жа Эрнандес»; структурированная (Structured), в которой характеристики задаются в виде перечня категориальных атрибутов — «a person of race „Hispanic“ and gender „female“» / «лицо происхождения „латиноамериканский“ и пола „женский“».

Для проведения экспериментов авторы определяют формулы личностного социодемографического промптинга как декартово произведение трех типов характера принятия роли и трех стратегий демографического  прайминга, в результате чего выделяются девять типов личностных запросов для создания синтетических респондентов. Для каждой из этих девяти  комбинаций используются две альтернативные формулировки, сохраняющие общую структуру инструкций.

В настоящем исследовании описанные выше формулы личностного  социодемографического промптинга используются в адаптированном виде, с учетом ограничений референсного корпуса и задач сопоставления с дневниковыми текстами НКРЯ. В экстралингвистической разметке корпуса пол  является единственной стабильно доступной социодемографической характеристикой автора, поэтому в личностном сегменте он указывается явно; при этом в качестве целевой группы для моделирования синтетического респондента был произвольно выбран женский гендерлект. Другие параметры (национальность, гражданство и т.п.) в разметке отсутствуют, поэтому характеристики типа «русская», «россиянка» и аналогичные им не включались в личностный сегмент, и синтетический респондент специфицируется через русскоязычность.

В рамках именной стратегии социодемографического прайминга требовалось задать устойчивый антропонимический шаблон. По данным основного корпуса НКРЯ, были определены наиболее частотные женское имя, отчество и фамилия: «Анна», «Ивановна» и «Иванова». Поскольку возраст автора в корпусной разметке также не задан, временная характеристика синтетического респондента задается через условие «жизнь после 1950 г.», что обеспечивает сопоставимость генерируемых текстов с дневниковым подкорпусом этого периода.

Сегмент задачи включал указание жанрово‑стилистической характеристики целевого текста как «нехудожественной записи в личный дневник», что обеспечивает жанровое соответствие синтетических текстов референсным данным. Дополнительно задавалось требование подробности записи (для получения достаточного объема материала при отсутствии жесткого числового ограничения на длину текста) и уточнение «как в реальной записной книжке», призванное приблизить высказывание к повседневной письменной практике.

Вслед за опорной работой для каждой комбинации характера принятия роли и стратегии прайминга использовались две альтернативные версии.  Однако дополнительно варьировалась и форма обращения к модели (на «ты» и на «вы») с учетом противоречивых данных о влиянии вежливости запроса на качество ответа: в ряде исследований для английских моделей описывается наивысшая результативность в зоне нейтрально‑вежливых формулировок [12], тогда как более поздние работы демонстрируют преимущество грубо сформулированных инструкций по сравнению с вежливыми запросами [13]. В результате общее число тестируемых вариантов промптов было увеличено с 18 до 32 за счет введения переменной формы обращения.

Для каждого из описанных выше промптов был сформирован набор ответов от нескольких доступных больших языковых моделей. В рамках  настоящего исследования сознательно не использовались специализированные коммерческие решения, обученные на текстах конкретных социальных групп, поскольку в типичной исследовательской практике на начальном этапе эксперимента такие дорогостоящие инструменты, как правило, недоступны. Вместо этого были отобраны три широко используемые модели: GPT‑5.2, DeepSeek и GigaChat, что позволило сопоставить результаты систем, разработанных в разных национальных и технологических средах.

При запуске запросов соблюдался единый протокол использования моделей. Для каждого промпта открывался отдельный диалог, чтобы избежать переноса контекста между запросами, а последовательность подачи промптов в разные модели рандомизировалась, что минимизировало влияние порядка предъявления инструкций на характеристики генерируемых текстов.

Таким образом, использование всех формул личностного социодемографического промптинга — сочетаний трех типов характера принятия роли и трех стратегий социодемографического прайминга, заданных в двух альтернативных формулировках и в двух вариантах обращения к модели (на «ты»  и на «вы»), для генерации текстов тремя выбранными большими языковыми моделями дало 108 синтетических текстов для последующего сопоставления с полученными ранее референсными данными. Каждый из этих текстов  сохранялся в отдельном файле, который включал служебный заголовочный блок с техническими параметрами промпта и идентификаторами модели, а также основной блок с собственно дневниковым текстом.

Автоматизированная разметка и выделение  лексико‑прагматических показателей в сгенерированных текстах

Тексты, сгенерированные моделями в ответ на экспериментальные промпты, обрабатывались с применением модулей Python, предназначенных для работы с файловыми структурами, регулярными выражениями и табличными данными. В качестве основного инструмента морфологической обработки использовалась библиотека Stanza, соответствующая стандартам Universal Dependencies и, согласно опубликованным бенчмаркам, демонстрирующая более высокие показатели по сравнению с альтернативными  решениями.

На этапе подготовки данных из каждого файла извлекалась только содержательная часть дневникового текста, тогда как форматирование и технические метаданные сохранялись отдельно для последующего качественного анализа. Далее проводилась полная морфологическая разметка: материал  сегментировался на предложения и токены, для каждой словоформы определялись лемма, часть речи и совокупность морфологических признаков.  На основе полученных данных вычислялись базовые структурные показатели (количество предложений и токенов), а также частотные распределения  частей речи и грамматических категорий.

Помимо базовой морфологической разметки, для ряда лексико‑прагматических маркеров потребовались специализированные процедуры, не реализуемые в существующих инструментах автоматического анализа. К таким маркерам относились вводные слова, средства выражения вежливости,  диминутивы, обсценная лексика и лексические повторы. Вводные конструкции идентифицировались в два этапа: вначале на основе дневниковых текстов НКРЯ формировался совокупный перечень лемм вводных слов; далее в сгенерированных текстах выделялись токены, совпадающие по лемме с этим списком и одновременно обособленные запятыми, что обеспечивало приближение к их типичным синтаксическим позициям. Маркеры вежливости определялись по перечню целевых лемм и набору усеченных основ, отражающих редуцированные варианты. Поиск диминутивов осуществлялся с использованием специально сформированного словаря, поскольку стандартные морфологические средства не обеспечивают надежного распознавания подобных форм в русскоязычных текстах. На первом этапе во всем корпусе выделялись слова, оканчивающиеся на последовательности символов, соответствующие типичным уменьшительно‑ласкательным суффиксам; затем полученный список проходил ручную проверку, в ходе которой исключались единицы,  формально подпадающие под шаблон, но не являющиеся диминутивами (например, «понедельник»). На основе предобработанного набора лемм и соответствующих словоформ создавался итоговый словарь, по которому оценивалась представленность диминутивов в каждом тексте. Обсценная лексика выявлялась по отдельному списку целевых лемм, адаптированному к особенностям лемматизации русской модели Stanza. Лексические повторы трактовались как повторное употребление одной и той же леммы в пределах  интервала длиной не более двух токенов. Дополнительно рассчитывалась частота восклицательных и вопросительных предложений на основе соответствующих знаков препинания.

Все вычисленные параметры — от структурных и морфологических до прагматических и стилистических — были агрегированы в единую табличную структуру, где каждая строка соответствовала отдельному сгенерированному дневниковому тексту. Для каждого показателя гендерной маркированности в таблице фиксировались абсолютная частота, значение IPM,  рассчитываемое на объеме конкретного текста, и словарь частотности соответствующих лексем в формате «лемма: абсолютная частота, IPM», что обеспечивало возможность последующего статистического сопоставления  с референсными данными дневниковых подкорпусов НКРЯ.

Сопоставление данных синтетических респондентов  и референсных подкорпусов НКРЯ

Для формализованной оценки степени соответствия дневниковых  текстов, сгенерированных большими языковыми моделями, речевому поведению целевой группы — женщин‑авторов дневниковых записей, живших после 1950 г., — был разработан многоуровневый метод сопоставления,  основанный на вышеописанных параметрах и учитывающий как их распределение, так и частотные характеристики связанных лексем.

На подготовительном этапе в рабочую среду были загружены сводные таблицы по женскому и мужскому подкорпусам НКРЯ, частотные таблицы лемм по каждому показателю и агрегированные данные морфологической и прагматической разметки всех сгенерированных текстов. Для анализа и сопоставления использовались библиотеки pandas (для обработки табличных данных), NumPy и SciPy (для проведения статистических вычислений), а также модуль ast (для разбора словарных структур). Реализация сопоставления  посредством Python обеспечивала автоматизированный расчет комплексных показателей близости между параметрами сгенерированного массива и референсных подкорпусов.

На первом этапе эталонные данные по женскому и мужскому дневниковым подкорпусам были преобразованы в компактный формат, удобный для сравнительного анализа. Из сводных таблиц по НКРЯ автоматически извлекались значения IPM по всем ранее описанным параметрам. В среде разработки на основе этих данных формировались два вектора — женский и мужской. Для каждого подкорпуса вычислялась сумма IPM по всем параметрам, после чего частотные значения каждого параметра нормировались по этой сумме. В результате были получены два нормированных профиля — «женский» и «мужской», в которых значения параметров выражены не в абсолютных IPM, а как доли от совокупного объема маркеров, что позволяет  оценивать относительную представленность каждого параметра в обоих  подкорпусах.

Аналогичная процедура нормировки применялась к каждому синтетическому дневниковому тексту: для каждой строки агрегированной таблицы  извлекались значения IPM по всем параметрам, соответствующим референсным данным, и на их основе формировался нормированный профиль распределения параметров конкретного сгенерированного текста.

Поскольку IPM в референсных подкорпусах рассчитываются на всем объеме корпуса, а в массиве сгенерированных текстов — на длину отдельного текста, прямое сопоставление абсолютных IPM было бы некорректным. Нормировка до распределений долей позволяет сравнивать не абсолютные значения, а относительное распределение параметров, то есть их взаимное усиление или ослабление при устранении влияния общего уровня частот. На этой основе для каждого сгенерированного текста в среде Python вычислялась степень сходства его профиля с женским и мужским эталонными профилями.  В качестве меры использовалось косинусное сходство между нормированными векторами распределения параметров, реализованное с помощью функций библиотеки SciPy. Этот показатель, широко применяемый при сравнении векторов частотных признаков и других текстовых представлений, оценивает угол между векторами и не зависит от их длины, что делает его удобным для сопоставления распределений частотных параметров.

В результате для каждого текста были получены два значения: степень сходства с женским эталонным профилем и степень сходства с мужским. На их основе для каждого текста рассчитывался параметрический индекс,  определяемый как разность «женского» и «мужского» сходств. Положительное значение индекса означало, что профиль распределения маркеров в тексте ближе к женскому дневниковому подкорпусу, отрицательное — что он ближе к мужскому. Абсолютная величина индекса отражала степень выраженности этого смещения; при этом необходимо учитывать, что сами женский и мужской профили дневников по всем параметрам в целом близки, поэтому параметрический индекс фиксирует, скорее, тонкие, но систематические сдвиги между конфигурациями модели и промпта.

На уровне лексем сопоставление опиралось на множества высокочастотных единиц, выделенных ранее для каждого параметра в женском и мужском дневниковых подкорпусах НКРЯ (общие, характерные только для женских дневников и только для мужских). Для каждого параметра в сгенерированных текстах подсчитывалось количество вхождений лемм из «женских» и «мужских» списков, что позволило оценивать, в какой степени лексическая реализация данного маркера тяготеет к женскому или мужскому референсному профилю.

В агрегированной таблице сгенерированных текстов для каждого параметра были предусмотрены столбцы, содержащие словари вида «лемма: абсолютная частота, IPM» для соответствующей группы маркеров. На данном этапе эти словари последовательно разбирались для каждого текста: из них извлекались IPM всех лемм, входящих в «женский» словарь по данному  параметру, и IPM всех лемм, входящих в «мужской» словарь. Далее для каждого текста и по всем параметрам суммировалась нормализованная частотность «женских» лемм и отдельно — «мужских». Разность этих суммарных значений задавала лексемный индекс: если суммарная IPM «женских» лемм превышала суммарную IPM «мужских», индекс принимал положительное значение и интерпретировался как преобладание лексики, характерной для женского дневникового письма, и наоборот.

Поскольку параметрический и лексемный индексы имеют разную природу и масштаб значений, оба показателя были дополнительно приведены к сопоставимой шкале. Для этого по всему массиву из 108 сгенерированных текстов вычислялись средние значения каждого индекса и их стандартные отклонения, после чего для каждого текста рассчитывалась нормированная оценка (z‑оценка), показывающая, насколько значение данного индекса отклоняется от среднего по корпусу в единицах стандартного отклонения. Интегральный показатель гендерной близости к женскому дневниковому профилю определялся как среднее двух нормированных индексов. Положительные значения этого показателя указывали на то, что текст в совокупности — и по распределению параметров, и по лексическим предпочтениям — ближе к профилю женских дневников, отрицательные — на большее сходство с мужским профилем; величина по модулю отражала степень отклонения от среднего поведения моделей.

На заключительном этапе все полученные индексы для каждого текста агрегировались по комбинациям факторов: большой языковой модели,  характера принятия, стратегии социодемографического прайминга и формы  обращения. В среде Python для каждой такой комбинации вычислялись число текстов в ячейке, среднее значение интегрального показателя, средние значения параметрического и лексемного индексов, а также доля текстов с положительным интегральным значением. Это позволило уже на уровне сводных таблиц выявить, какие сочетания модели и формулы личностного социодемографического промптинга систематически ведут к генерации текстов, максимально приближающихся к референсному профилю женских дневников,  а какие конфигурации приводят к смещению в сторону мужского стиля.

Результаты

Интегральный показатель, а также параметрический и лексемный индексы, вычисленные для всех 108 синтетических дневниковых текстов, продемонстрировали устойчивую зависимость гендерной маркированности синтетических ответов от выбора модели и конфигурации личностного социодемографического промптинга. В целом массив сгенерированных текстов DeepSeek и GPT‑5.2 чаще характеризовался положительными значениями  интегрального показателя, то есть большей близостью к референсному профилю женских дневников, тогда как тексты GigaChat преимущественно смещались в сторону мужского профиля. Для DeepSeek наиболее высокие значения интегрального показателя наблюдались в условиях непосредственного характера принятия роли в сочетании со структурированной или именной стратегией социодемографического прайминга, а также при формате интервью с именной стратегией и обращением на «ты». Для GPT‑5.2 максимальные значения интегрального показателя приходились на сочетания непосредственного характера принятия роли со структурированной стратегией  и обращением на «ты», а также на ряд конфигураций с эксплицитной стратегией при том же характере принятия роли. Напротив, для GigaChat большинство комбинаций, особенно при именной и структурированной стратегиях, давали отрицательные значения интегрального показателя, что свидетельствует о преобладании гендерно маркированных особенностей, характерных для мужских дневниковых текстов.

Анализ влияния характера принятия роли и стратегии социодемографического прайминга показал, что эти факторы взаимодействуют с моделью и существенно меняют направление гендерного сдвига. При непосредственном принятии роли DeepSeek и GPT‑5.2 демонстрировали наиболее устойчивое приближение к женскому дневниковому профилю вне зависимости от стратегии прайминга, тогда как GigaChat в тех же условиях сохранял отрицательные или близкие к нулю значения интегрального показателя. Формат  интервью оказался наиболее чувствительным к выбору стратегии: при именной стратегии в этом формате GPT‑5.2 и GigaChat давали одни из самых выраженных отрицательных значений интегрального показателя, тогда как DeepSeek при той же комбинации, но при обращении на «ты», формировал тексты с заметным положительным сдвигом. В режиме принятия роли  «от третьего лица» структурированная стратегия для DeepSeek и GPT‑5.2 в большинстве случаев обеспечивала положительные значения интегрального показателя, тогда как именная стратегия в этом формате последовательно ассоциировалась с мужским профилем во всех трех моделях.

Форма обращения к модели также систематически модифицировала гендерную маркированность сгенерированных текстов. Для DeepSeek и GPT‑5.2 обращение на «ты» в ряде конфигураций с непосредственным характером принятия роли и структурированной или именной стратегией приводило к более высоким значениям интегрального показателя по сравнению с обращением на «вы», усиливая приближение к женскому дневниковому профилю. Для GigaChat, напротив, обращение на «вы» в некоторых случаях частично компенсировало мужской сдвиг (например, при эксплицитной стратегии в формате интервью или при принятии роли «от третьего лица»), тогда как обращение на «ты» в аналогичных условиях сопровождалось наиболее  низкими значениями интегрального показателя. Сопоставление параметрического и лексемного индексов показало, что знак интегрального показателя в большинстве случаев согласован и с распределением параметров, и с распределением лексем: конфигурации, приближающиеся к женскому дневниковому подкорпусу по параметрическому индексу, одновременно демонстрировали преобладание лемм из «женских» словарей, в то время как отрицательные интегральные значения сочетались с доминированием «мужских»  лексем.

Для последующего качественного анализа были выделены три конфигурации с наибольшей близостью к женскому дневниковому профилю по интегральному показателю. Во‑первых, GPT‑5.2 при непосредственном характере принятия роли, структурированной стратегии социодемографического прайминга и обращении на «ты» демонстрирует максимальное положительное значение интегрального показателя среди всех комбинаций, что указывает на максимально выраженное совпадение и параметрического, и лексемного профилей с женским дневниковым подкорпусом. Во‑вторых, DeepSeek при  непосредственном характере принятия роли и структурированной стратегии с обращением на «вы» также формирует тексты с очень высоким положительным интегральным показателем, что делает эту конфигурацию одним из ведущих режимов генерации синтетических ответов, близких к женскому дневниковому дискурсу. В‑третьих, DeepSeek в формате интервью с именной стратегией и обращением на «ты» обеспечивает сопоставимые по величине положительные значения интегрального показателя, что позволяет  рассматривать эту комбинацию как ключевой пример успешного моделирования женского гендерлекта при более сложном сценарии принятия роли.

Для детализации и верификации количественных результатов был проведен качественный анализ шести синтетических дневниковых текстов (по два варианта для трех конфигураций личностного социодемографического промптинга, показавших наибольшую близость к женскому дневниковому профилю по интегральному показателю). Анализ опирался на рамку  автороведческой экспертизы и модель речевого жанра личного дневника [14], предложенную Т.В. Шмелевой.

На первом этапе, с опорой на методику Т.Ф. Моисеевой и И.В. Огорелкова [15], для каждого текста оценивалось, отвечает ли предполагаемый авторский профиль следующим критериям: женский пол, период после 1950 г. и воспроизведение письменной практики носителя русского языка; во всех рассмотренных случаях тексты, сгенерированные двумя лучшими по формальным показателям моделями, были признаны соответствующими этим требованиям. Дополнительно учитывалось, что тексты представляют собой достаточно протяженные свободные высказывания (не менее 100 словоформ) и могут рассматриваться как произведения отдельных «авторов», в которых в полной мере проявляется речемыслительный навык, что делает их пригодными для автороведческой экспертизы. Далее для каждого из шести отобранных текстов (двух текстов, сгенерированных GPT‑5.2, и четырех текстов, сгенерированных DeepSeek) был проведен детальный описательный анализ: фиксировались правильность орфографии и пунктуации, степень сложности синтаксической организации (включая сложные союзы, причастные  и деепричастные конструкции, вводные слова), а также ориентация на книжные формы при сохранении элементов разговорной речи.

В рамках автороведческого анализа внимание сосредотачивалось на том, насколько синтетические тексты воспроизводят профиль женщины‑автора: учитывались последовательное использование форм женского рода при повествовании от первого лица и согласование зависимых форм, тематическая фокусировка на сферах «дом, семья, отношения», частые обращения к эмпатическим и оценочным стратегиям (жалость, сочувствие, самокритика,  апелляция к собственной совести). Отдельно отмечалась высокая плотность вводных слов и модальных конструкций («кажется», «наверное», «по‑моему», «если честно»), оформляющих колебания, неуверенность и саморефлексию и традиционно описываемых в гендерной литературе как характерный ресурс «женского письма»; в выбранных шести текстах совокупность этих признаков интерпретировалась экспертами как устойчивое приближение к письму женщины‑автора.​

На следующем этапе тексты оценивались с точки зрения соответствия жанровым признакам личного дневника в рамках модели Т.В. Шмелевой:  анализировались коммуникативная цель, образ адресата, событийное  содержание и темпоральная организация, синтаксис, лексика и параметр «подлинности» высказывания. На основе этих параметров была предложена трехуровневая шкала соответствия («высокая», «средняя», «низкая»),  в рамках которой пять из шести текстов получили оценку «высокая степень соответствия», поскольку демонстрируют автокоммуникацию, ориентированность на внутреннего адресата, спонтанный синтаксис, разговорную лексику, субъективную модальность и бытовую детализацию при отсутствии направленности на внешнего читателя. Один текст (DeepSeek, формат Interview с именной стратегией социодемографического прайминга, вариант 1) был отнесен к категории со «средней» степенью соответствия: при точной передаче исторического контекста и эмоционального фона он сохраняет  более стилизованный характер, меньшую степень спонтанности (в том числе отсутствие характерных для дневниковой речи обрывов фраз, колебаний и вводных конструкций) и более опосредованный образ адресата.

Таким образом, качественный анализ отобранных текстов показывает, что в рассматриваемых примерах большие языковые модели не только воспроизводят внешние формальные признаки дневниковой записи (датировку, повествование от первого лица, соответствующую композицию), но и в значительной степени имитируют глубинные механизмы автокоммуникации — синтаксическую спонтанность (ориентацию на устно‑разговорный синтаксис в письменной форме), сложную темпоральную организацию, широкое  использование метарефлексивных элементов и устойчивых эмоционально‑оценочных стратегий, характерных для человеческих дневниковых практик.

Заключение

Проведенное исследование демонстрирует, что большие языковые модели при определенных комбинациях моделей, характеров принятия роли и стратегий социодемографического прайминга генерируют тексты с параметрами гендерной вариативности речевого поведения, близкими к зафиксированным в дневниковых подкорпусах НКРЯ. Интегральный показатель гендерной близости, объединяющий параметрический и лексемный индексы,  подтверждает систематическое сближение распределений частей речи, грамматических категорий, прагматических маркеров и высокочастотных лексем с референсным профилем женских дневниковых записей — прежде всего для GPT-5.2 и DeepSeek при непосредственном принятии роли в сочетании с структурированной или именной стратегией прайминга.

Качественный анализ текстов с максимальными значениями интегрального показателя выявляет в соответствующих комбинациях не только формальную близость параметров, но и жанровые характеристики дневникового письма: автокоммуникативную направленность, характерное соотношение разговорной и книжной лексики, высокую плотность вводных конструкций, модальных и экспрессивных средств — соответствующие описаниям  «женского» дневникового письма в гендерной лингвистике. Экспертная  автороведческая оценка подтверждает, что такие тексты могут восприниматься как правдоподобные образцы женских дневников, написанных после 1950 г., что дополнительно поддерживает возможность использования  синтетических респондентов в задачах моделирования речевого поведения целевых групп.

Вместе с тем характер и пределы этой возможности строго ограничены. Во‑первых, в настоящей работе варьируется только один демографический параметр — гендерная принадлежность, заданная ограничениями корпусной разметки, тогда как возраст, образование, социальный статус и другие характеристики не специфицируются в промптах. Это означает, что синтетические респонденты в текущей конфигурации отражают агрегированный гендерный профиль, а не комплексную личность, и позволяют оценивать лишь применимость подхода к моделированию гендерно маркированного речевого поведения, а не к реконструкции более детальной социальной дифференциации. Во‑вторых, параметры гендерной близости зависят от конкретных комбинаций модели и формул личностного социодемографического промптинга:  те же формулы, которые для GPT‑5.2 и DeepSeek приводят к приближению к женскому профилю, для GigaChat систематически ассоциированы со смещением в сторону показателей мужского подкорпуса, а изменение формы обращения («ты»/«вы») заметно модифицирует интегральный показатель. Тем  самым синтетический респондент в рассматриваемой постановке не является устойчивой «цифровой личностью», а представляет собой конфигурационно обусловленную модель, что требует в последующих исследованиях систематического тестирования различных моделей и формул личностного социодемографического промптинга на иных жанрах и типах корпусов. В‑третьих, корпусная операционализация гендерной вариативности неизбежно ограничивается параметрами, которые поддаются надежной автоматизированной разметке: частями речи, грамматическими категориями, частотными маркерами экспрессивности, вежливости, модальности, диминутивности и т.п.  Тематические предпочтения, сложные стратегии прагматикализации, семантические и оценочные сдвиги, лежащие в центре многих гендерных исследований, остаются за пределами количественного сравнения. Следовательно, совпадение синтетических и реальных текстов по выбранным параметрам следует трактовать как совпадение их статистического профиля, а не полной языковой идентичности; синтетические респонденты в текущем виде моделируют прежде всего формально регистрируемые аспекты гендерной маркированности. Наконец, референсный женский подкорпус дневников количественно существенно уступает мужскому, что ограничивает устойчивость оценок для женского профиля и требует опоры на нормированные показатели частоты (IPM) при интерпретации результатов, как это реализовано в настоящем исследовании.

На этом фоне становится возможным уточнить роль синтетических респондентов в лингвистических исследованиях. Полученные данные  свидетельствуют, что синтетические респонденты могут использоваться в качестве исследовательского инструмента при условии предварительной оценки комбинаций моделей и формул личностного социодемографического промптинга на материале наиболее близкого репрезентативного корпуса с развитой лингвистической разметкой, как это сделано для дневниковых текстов НКРЯ. Наличие подобных референсных данных позволяет определить, какие комбинации моделей и формул личностного социодемографического промптинга дают приемлемую степень сходства с реальными данными  и какие типы параметров адекватно воспроизводятся. После прохождения этой стадии калибровки та же методика может переноситься в близкие области с дефицитом прямых данных — личную переписку, конфиденциальные записи, речевые практики маргинализированных или малочисленных  групп — где синтетические респонденты уже не заменяют корпус, а выступают как инструмент предварительного моделирования и генерации гипотез.

В таком понимании синтетические респонденты не противопоставляются корпусным данным, а включаются в расширенный инструментарий эмпирической лингвистики как дополнительный источник моделируемых данных, требующий опоры на референсные корпусы. В областях с развитой  корпусной инфраструктурой они позволяют систематически варьировать комбинации моделей и формул личностного социодемографического промптинга и оценивать, какие параметры гендерной и жанровой вариативности поддаются устойчивому моделированию. В доменах с ограниченным или закрытым доступом к данным синтетические респонденты могут использоваться прежде всего как инструмент прогнозирования возможных распределений маркеров и проверки теоретических ожиданий, при обязательном  последующем сопоставлении с любой доступной эмпирической выборкой, что задает рамки их ответственного применения.

 

1 РБК Компании. Режим доступа: https://nielseniq.com/global/en/insights/education/2024/the-rise-of-synthetic-respondents/ (дата обращения: 03.02.2026).

2 РБК Компании. Режим доступа: https://companies.rbc.ru/news/8g5GYHRPqc/kak-byistro-sozdat-tsifrovuyu-lichnost-dlya-zadach-marketinga/   (дата обращения: 03.02.2026).

3 РБК Компании. Режим доступа: https://www.sostav.ru/blogs/284997/70174 (дата обращения: 03.02.2026).

4 Новости рекламы и маркетинга. Режим доступа: https://adindex.ru/news/innovations/2025/07/10/335234.phtml (дата обращения: 1.12.2025).

×

About the authors

Alexandra S. Vanichkina

Moscow State Linguistic University

Author for correspondence.
Email: alexvanichkina@gmail.com
ORCID iD: 0000-0002-1748-7666
SPIN-code: 6174-8813

PhD in director, Institute of Information Sciences

38 build 1 Ostozhenka Str., Moscow, Russian Federation, 119034

Veronika V. Izyumskaya-Kapitonova

Moscow State Linguistic University

Email: v.v.linguist.ik@gmail.com
ORCID iD: 0009-0006-9151-0269

Junior Researcher, Corpus Linguistics Laboratory

38 build 1 Ostozhenka Str., Moscow, Russian Federation, 119034

References

  1. Shrestha, P., Krpan, D., Koaik, F., Schnider, R., Sayess, D., & Binbaz, M.S. (2024). Beyond WEIRD: Can Synthetic Survey Participants Substitute for Humans in Global Policy Research? Behavioral Science & Policy, 10(2), 26–5. https://doi.org/10.1177/23794607241311793 EDN: RJHEHB
  2. Argyle, L.P., Busby, E.C., Fulda, N., Gubler, J.R., Rytting, C., & Wingate, D. (2023). Out of One, Many: Using Language Models to Simulate Human Samples. Political Analysis, 31(3), 337–351. https://doi.org/10.1017/pan.2023.2 EDN: TOAPUN
  3. Puzanova, Zh.V., Kozhoridze, G.G., & Kozhoridze, D.G. (2025). AI and Sociology: an Analysis of the Technological Capabilities of Virtual Respondents. Sotsiologiya: Metodologiya, Metody, Matematicheskoe Modelirovanie (Sotsiologiya: 4M), 60, 216–246. (In Russ.). https://doi.org/10.19181/4m.2025.34.1.6 EDN: PRPHTP
  4. Aher, G., Arriaga, R.I., & Kalai, A.T. (2023). Using Large Language Models to Simulate Multiple Humans and Replicate Human Subject Studies. In: Proceedings of the 40th International Conference on Machine Learning (Vol. 202, pp. 358–390). PMLR.
  5. Dubnyakova, O.A., & Kashina, T.A. (2017). Communicative and Pragmatic Particularities of Personal Diary. MCU Journal of Philology. Theory of Linguistics. Linguistic Education, 3(23), 43–49. (In Russ.). EDN: YJGTID
  6. Tannen, D. (1990). You Just Don't Understand: Women and Men in Conversation. New York: Ballantine Books. (In Russ.).
  7. Kirilina, A.V. (1999). Gender: Linguistic Aspects. Moscow: Institute of Sociology, Russian Academy of Sciences. (In Russ.). EDN: OXTFTD
  8. Potapov, V.V. (2002). A Multilevel Strategy in Linguistic Genderology. Topics in the Study of Language, 1, 103–126. (In Russ.). EDN: WVGGEK
  9. Gender and language: An Anthology. (2005). Moscow: Yazyki slavyanskoy kultury. (In Russ.).
  10. Popova, T.I. (2022). Social Roles of the Speaker in Everyday Communication in Russian: A Gender Perspective [PhD in Philology]. Saint Petersburg: Saint Petersburg State University. (In Russ.).
  11. Lutz, M., Sen, I., Ahnert, G., Rogers, E., & Strohmaier, M. (2025). The Prompt Makes the Person(a): a Systematic Evaluation of Sociodemographic Persona Prompting for Large Language Models. arXiv. https://arxiv.org/abs/2507.16076
  12. Lans, J.C.W. (2025). The “Magic Word” for LLMS: A Study on the Effect of Politeness on LLM Performance [PhD Thesis]. Leiden: Leiden University, Leiden Institute of Advanced Computer Science, Leiden University.
  13. Dobariya, O., & Kumar, A. (2025). Investigating How Prompt Politeness Affects LLM Accuracy (Short Paper). arXiv https://arxiv.org/abs/2510.04950
  14. Qi, P., Zhang, Y., Zhang, Y., Bolton, J., & Manning, C.D. (2020). Stanza: A Python Natural Language Processing Toolkit for Many Human Languages. arXiv. https://arxiv.org/abs/2003.07082
  15. Shmeleva, T.V. (1990). Speech Genre: Possibilities of Description and Use in Language Teaching. Russistik. Russian Language Studies: A Journal of Current Problems of Teaching Russian, 2, 20–32. (In Russ.).
  16. Moiseeva, T.F., & Ogorelkov, I.V. (2022). Modern Authorship Examination. Moscow: Russian State University of Justice (RGUP). (In Russ.).

Supplementary files

Supplementary Files
Action
1. JATS XML

Copyright (c) 2026 Vanichkina A.S., Izyumskaya-Kapitonova V.V.

Creative Commons License
This work is licensed under a Creative Commons Attribution-NonCommercial 4.0 International License.