Towards an Algorithm for Identifying Text Generated by Neural Network Models through Linguistic Cues

Cover Page

Cite item

Full Text

Abstract

Since 2023, there has been a steady increase in research papers containing text generated by neural networks based on large language models. The development of machine and deep learning methods applied to natural language processing tasks is bringing the results of text generation closer to those of human authors. At this stage of development, linguistics lacks practical tools to distinguish between human-written text and text generated by a neural network. The goal of this study is to develop an algorithm for manuscripts formal verification by editors of scientific journals / academic supervisors, relying on (primarily open access) tools available to the scientific editor / supervisor for detecting text generated by neural networks in Russian language. The study methodology is based on results of computational and mathematical linguistics researches to describe the “writing style” of various neural networks when generating scientific texts in Russian language. We analyzed research papers issued from 2021 to 2025, accessible through scientific information databases, authored by researchers primarily affiliated with Russian scientific and educational organizations, as well as Russian technology companies. The study revealed that the use of Gen-AI in academic writing significantly outpaces the reflection of its results and the prediction of its long-term implications. Furthermore, the plethora of publications describing the distinctive features of the output generated by various neural networks allows for the development of an approach to detecting such texts based on generation errors at various linguistic levels.

Full Text

Генеративный искусственный интеллект —  новая текстовая реальность

В статье 5 Национальной стратегии развития искусственного интеллекта на период до 2030 г., утвержденной Указом Президента Российской Федерации от 10 октября 2019 г. № 4901, искусственный интеллект определяется как «комплекс технологических решений, позволяющий имитировать когнитивные функции человека (включая самообучение и поиск решений без заранее заданного алгоритма) и получать при выполнении конкретных задач результаты, сопоставимые с результатами интеллектуальной деятельности человека или превосходящие их»1. В стратегии говорится об ускоренном внедрении технологических решений, разработанных на основе искусственного интеллекта, в различные отрасли экономики и сферы общественных отношений.  В документе указывается как на позитивные изменения в ключевых сферах жизнедеятельности, которые сопровождаются использованием технологий искусственного интеллекта (ИИ), так и на негативные последствия, вызванные социальными и технологическими изменениями, которые сопутствуют развитию технологий искусственного интеллекта.

Многие эксперты и практики отмечают, что применение ИИ-инструментов имеет потенциал для преобразования различных сфер жизни, включая образование и научные исследования [1; 2]. Всплеск активности на уровне рядовых пользователей произошел после введения в массовое пользование предназначенных для генерации текста в письменной форме чат-ботов на основе предобученных нейронных сетевых языковых моделей, основанных на архитектуре типа «трансформеры» (generative pre-trained transformer, GPT),  на механизме самовнимания (self-attention) [3] и на парадигме самообучения (self-supervised learning) на огромном объеме текстовых данных. В отличие от традиционных задач классификации и регрессии генеративный ИИ (Gen-AI) обладает способностью автономно генерировать новые данные, включая изображения, музыку и текст [4; цит. по: 5].

Генерация текста реализуется с помощью двух базовых подходов  [6. С. 283]: (1) использование предопределенного шаблона для генерации текста на основе различных входных данных (например, используя предопределенный шаблон, искусственный интеллект может сгенерировать определенное описание продукта на основе типа продукта, его характеристик  и преимуществ); (2) использование метода неконтролируемого (глубоком) обучения, который изучает нюансы языковых структур и функционирует с условием наличия больших объемов входных данных — по сравнению с подходом на основе шаблонов результат генерации текста на основе метода глубокого обучения приближается к тексту, написанному человеком.

«Генеративные нейросети настроены на создание наиболее предсказуемых, статистически чаще встречающихся последовательностей слов, вызывающих наименьшее недоумение у читателя и с большей вероятностью воспринимаемых как осмысленные» [7. С. 91]. В основе работы моделей лежат статистические пермутации (перестановки элементов), «пропущенные через миллионные обучающие выборки на примерах» [8. С. 470]. Развитие методов машинного глубокого обучения применительно к задачам обработки  естественного языка «позволяет получать искусственно созданные тексты, степень сходства которых с написанными человеком с годами становится лишь выше» [9. С. 308]. Однако статистическое «понимание» языка, которым обладают генеративные нейросетевые модели, отлично от семантического понимания языка человеком [10. С. 235].

Сгенерированный текст как лингвистическая проблема

Начиная с 2020 г. мир захлестнула волна публикаций, искусственно сгенерированных с помощью технологии GPT под видом статей, написанных человеком [11]. К настоящему времени «сгенерированные нейросетями тексты уже стали частью нашей коммуникативной среды и культуры» [12. С. 790].  В частности, в образовательной среде возникла коллизия между широким функционалом Gen-AI (системами аннотирования, реферирования, перефразирования для подготовки и написания рефератов, обзорных и исследовательских статей, выпускных квалификационных работ) и развитием творческих исследовательских способностей у обучающихся вузов, а также возможностями преподавателей оценить интеллектуальные компетенции обучающихся в сложившейся ситуации [13. С. 58—59]. Опасность появления большого  количества синтетических данных заключается в том, что они становятся (пусть и формально) частью научной онтологии, материалом для обучения следующего поколения генеративных нейросетевых языковых моделей,  в то время как «программы-детекторы работают пока недостаточно надежно» [8. С. 476].

Можно выделить несколько типов недобросовестного использования генеративных нейросетей [9; 14]:

— из-за огромного объема данных для обучения модель генерирует ответ, который не всегда соответствует действительности, при этом пользователи не всегда проверяют информацию, полученную в результате генерации;

— генерация научного или учебного текста, гарантированно проходящего проверку на наличие плагиата;

— перефразирование текста для того, чтобы затруднить системам обнаружения заимствований выявление того, что текст был ранее опубликован.

Задача «проверяющего» усложняется тем, что текст чаще всего не генерируется моделями целиком: как правило, это умелая комбинация машинно сгенерированных и написанных человеком текстовых фрагментов [15; 16].

Следует зафиксировать, что на данном этапе развития лингвистика не располагает разработанным инструментарием (устойчивым комплексом признаков), позволяющим разграничить текст, написанный человеком, и текст, сгенерированный нейросетью [17. С. 165]. При этом «тексты одной жанровой принадлежности, но сгенерированные разными языковыми моделями, существенно различаются» как по языковым параметрам, так и по ошибкам, которые делают эти генеративные нейросети [18; цит. по: 12. С. 789]. Результат генерации зависит также и от задачи, которую пользователь формулирует в промпте (сбор, реферирование, аннотирование текстового материала,  его перефразирование и т.д.), и от субъективных показателей автора промпта [13. С. 62].

Цель проводимого нами исследования заключается в выработке алгоритма формальной проверки рукописи, поступившей в редакцию научного журнала / научному руководителю, с опорой на доступные научному редактору / научному руководителю инструменты (в основном открытого доступа) детекции сгенерированного нейросетями текста на русском языке.

Методология исследования опирается на результаты изысканий в области компьютерной лингвистики по описанию «стиля письма» различных нейросетей при генерации текстов научных жанров на русском языке.

Материалом для исследования послужили научные публикации  за 2021–2025 г., доступные через базы данных научной информации, авторами которых являются исследователи, аффилированные преимущественно с российскими научными и образовательными организациями, а также с российскими технологическими компаниями.

Автоматическая детекция сгенерированного текста

Как отмечается в ряде работ в области математической лингвистики, существующие методы не решают проблемы детекции текстов большого объема [9], так как длина фрагментов, на которые разбивается анализируемый текст, оказывает влияние на результат детекции [19; 20]. Для разных языков оптимальная длина варьируется, но в каждом существует плато, позволяющее зафиксировать качество классификации [9]. Для русского языка это порядка 4000 символов.

Высокий уровень полноты детекции и большая обобщающая способность модели достигаются при обучении детектирующей модели на мультидоменных текстах: чем больше разнородных по тематикам текстов будет на стадии обучения, тем выше будут метрики качества классификации при  использовании детектора в реальных задачах поиска искусственно сгенерированных фрагментов текста [21; цит. по: 9. С. 312].

Автоматическая детекция сгенерированного текста строится на различных статистических метриках [6; 7; 22–24]: частоте совместной встречаемости n-грамм, вычислении коэффициентов перекрытия слов, длины предложений, распределения слов в предложении, значений «бурности» (burstiness)  и «недоумения» (perplexity), вычислении различных метрик сложности  текста. Если после генерации текста нейросетью проводится постредактирование, его идентификация становится еще более сложной. Известны следующие подходы к детекции такого типа искусственно сгенерированных текстов [25. С. 963]:

— обнаружение неконтекстуальных токенов (non-contextual tokens): например, ChatGPT-модель часто вставляет специальные токены или маркеры в свои ответы для указания начала или конца ответа;

— анализ статистических свойств сгенерированного текста: распределение слов, грамматические или стилистические особенности (проверка  использования редких или специфичных слов и фраз, обнаружение неправильной грамматики или «плохого» стиля);

— выявление метаданных: для обнаружения применения, например, ChatGPT-модели используется дополнительная информация, такая как сведения о запросах, метаданные сеанса и временные отметки;

— анализ контекста вопросов и ответов: если в ответах модели отсутствуют устойчивые или явные связи с предыдущими вопросами либо контекст быстро теряется, это может быть признаком автоматической генерации;

— сравнение следующих токенов при совпадающих предыдущих (идентичном левом контексте) в проверяемом тексте и в тексте, генерируемом GPT-подобной моделью;

— проверка фрагментов текста путем их поиска в интернет-архивах.

Системы, детектирующие искусственно сгенерированный текст, широко представлены в сети Интернет2. Результат детекции подается либо в виде ответа типа «текст сгенерирован / текст написан человеком», либо в виде указания доли предположительно искусственно сгенерированного текста.

Экспертное обнаружение сгенерированного текста

В результате анализа научной литературы было принято решение  объединить выявленные маркеры сгенерированности текста в три группы. Макроуровень охватывает всю рукопись и также касается взаимодействия структурных частей рукописи между собой, мезоуровень относится к отдельным абзацам и взаимодействию между ними, микроуровень характеризует особенности текста на уровне предложения и взаимодействия между предложениями в рамках одного абзаца.

Макроуровень

Наиболее частотной ошибкой, упоминаемой в научной литературе, которая отличает сгенерированный текст от текста, написанного человеком,  является некорректная цитация и составление списка литературы. Внутритекстовые отсылки к списку литературы в сгенерированных текстах либо не соответствуют списку литературы, либо являются выдуманными, т.е. таких  источников в научной онтологии не существует, а указанные в списке идентификаторы (например DOI) связаны с иными публикациями [24; 26–28].  Частота данной особенности сгенерированных текстов вынуждает экспертов (научных редакторов и руководителей) проверять каждую цитату и каждую позицию в списке литературы.

Второй и более серьезной частотной погрешностью сгенерированных текстов является формулировка недостоверной информации и искажение фактов [5; 12; 25; 29], что требует высокой компетенции проверяющего в предметной области и тематике проверяемой рукописи. Фактчекинг — серьезный вызов, т.к. в случае включения недостоверной информации в научный оборот, впоследствии она может лечь в основу методологии исследования неопытного исследователя, что повлечет за собой дальнейшее искажение научных данных.

Исследователи отмечают, что сгенерированные нейросетью тексты носят поверхностный характер (на основе поверхностного анализа), отличаются неясностью формулировок, в таких текстах взаимосвязь между его частями не всегда прослеживается, исследуемый вопрос в полной мере не раскрывается, такие тексты содержат общую информацию и имеют более простую структуру [5; 7; 29–32]. При генерации текста обзорной части рукописи выявляются многочисленные ошибки при перефразировании, а также явный плагиат [33]. Такие тексты тяготеют к публицистическому, а иногда и обиходно- разговорному функциональному стилю письма. При этом «сгенерированные тексты отличает более четкая организация, соответствующая правилам IMRаD» [24. С. 1002].

Отмечается «неспособность языковых моделей выстраивать долгосрочные семантические зависимости в тексте, что иногда приводит к „вырождению“ текста» [34; цит. по: 17. С. 166]. В сгенерированных нейросетью текстах отмечается единообразный стиль изложения, в то время как текст, написанный человеком, «может иметь изменения стиля и тона по всему тексту»  [25. С. 962]. В силу программных особенностей больших языковых моделей в порождаемых нейросетями текстах высока лексическая плотность3 при низком лексическом разнообразии4 [5].

Сгенерированный нейросетью текст отличает «отсутствие идеи, объективно или субъективно характеризующей наличие нового знания» [7. С. 92]. Такой текст не содержит научной новизны, не имеет теоретической и практической значимости [29]. За сгенерированным текстом не «проглядывается» личность автора [24]. Эти особенности может обнаружить только человек — эксперт в предметной области, затронутой в тексте.

Мезоуровень

К особенностям, позволяющим обнаружить сгенерированные фрагменты текста, можно отнести [29. С. 155; 35. С. 50–51]:

— «закольцованность» темы (т.е. повтор темы без ввода рематического компонента);

— наличие множества рем, ни одна из которых в дальнейшем не преобразуется в тему и не продолжает свое текстовое развитие;

— недостаточный учет факторов автора и адресата;

— маркированность текста показателями модуса предположения, некатегоричности, сигнализирующими о наличии других, альтернативных вариантов ответа;

— повторение одной и той же мысли в разных предложениях;

— отсутствие связи сгенерированного фрагмента с остальным текстом.

Микроуровень

На уровне предложений сгенерированные тексты обладают меньшей степенью связности, чем тексты, написанные человеком. В сгенерированных текстах обнаруживается «достраивание нарратива причинно-следственными операторами поэтому, так что, вот и, действительно и т.п., что устраняет „нарушения“ в оригинальном тексте-источнике» [12. С. 789]. Генеративные «нейросети создают не только предсказуемый порядок слов, но и строят предложения с несложной структурой со средней длиной порядка 10–20 слов» [7. С. 91], в то время как текст, написанный человеком, более насыщен причастными и деепричастными оборотами.

В сгенерированных текстах встречаются нарушения синтаксической сочетаемости; избыточность клише, штампов, канцеляризмов и слов с более высоким уровнем формальности; неестественная сочетаемость и частота специфической терминологии, которая используется для создания более авторитетного или научного стиля текста; неуместные уточнения; формальные повторы словосочетаний и отдельных слов; аббревиатуры терминов на английском языке, которые приводятся в дополнении к терминам на русском; ошибки или искажения в лексической сочетаемости; нарушение сочетаемости слов по линии предсказуемости / непредсказуемости, обязательности / факультативности синтаксической связи; нарушение правил использования степени  сравнения прилагательного, лексической валентности слов, грамматической сочетаемости при использовании разговорных слов и жаргонизмов,  правил употребления предлогов перед согласными; наличие значительного (неоправданнго или избыточного) количества вводных слов и конструкций [5; 17; 24; 25; 29; 30; 35]. В тексте, сгенерированном нейросетью, отсутствует выражение собственного мнения, субъективные высказывания (авторская  позиция) [7].

В сгенерированных текстах слова, включенные в заголовок, встречаются по тексту значительно чаще, чем в текстах, написанных человеком [36]. В тексте, сгенерированном нейросетью, очень редко встречаются опечатки и орфографические ошибки, не встречаются разные типы тире (-, — и —) или кавычек (“” и «») [25; 37–39].

Заключение

На основе проведенного анализа научной литературы можно заключить, что практика применения Gen-AI при написании научных текстов намного опережает рефлексию ее результатов и прогнозирование последствий в долгосрочной перспективе. Вероятно, в ближайшие годы этот разрыв сократится5, так как в силу недостаточности обучающего материала генеративные нейронные сети придут к морфологически более стройному и стабильному набору характеристик (например, стереотипных ошибок на разных уровнях языка) результата генерации, который позволит разработать автоматические системы — детекторы генерации текста. До тех пор научный редактор / руководитель / рецензент вынуждены подкреплять интуитивное обнаружение сгенерированного текста разношерстными данными из научной литературы и из личных проб работы с системами-детекторами. Наряду с этим обобщение результатов экспертной оценки позволяет сформулировать следующие выводы.

  1. Необходимо сочетать автоматические и ручные способы подтверждения наличия в рукописи сгенерированного текста. Следует использовать параллельно несколько систем автоматической проверки, так как каждая из них «натренирована» на материале конкретных Gen-AI-моделей и на специфическом языковом материале (например, на массиве текстов, написанных в публицистическом стиле). При ручной проверке можно опереться на  предложенный в этой статье подход поуровневого анализа ошибок и погрешностей, обнаруживаемых в тексте.
  2. Проверку (особенно автоматическую) следует проводить автономно относительно каждого раздела рукописи (для статей это аннотация, введение, обзор литературы / история вопроса, описание методики исследования, описание результатов исследования, обсуждение, выводы / заключение, список литературы). Запрещать использование инструментов Gen-AI, вероятно, непродуктивно, но обозначить границы приемлемого использования необходимо. По нашему мнению, недопустимо передавать на откуп пока еще «сырой» технологии задачу по аналитике практического материала, описанию и обобщению полученных данных. Особенно значимо требование самостоятельности выполнения научной работы и ее описания для начинающих исследователей, которые находятся в процессе освоения профессиональных навыков, погружения в предметную область исследования, становления исследовательской позиции, выработки индивидуального стиля письма.
  3. При использовании AI-инструментов на любом этапе подготовки и написания научного текста для авторов должно стать правилом декларирование того, какие именно инструменты, в каком объеме и для генерации какой конкретно части текста применялись.

 

1 См.: Указ Президента РФ от 10 октября 2019 г. № 490 «О развитии искусственного интеллекта в Российской Федерации» URL: https://base.garant.ru/72838946/?ysclid= ml9m8kv11q126675642 (дата обращения: 05.12.2025).

2 См., например: GigaCheck. URL: https://developers.sber.ru/portal/products/gigacheck (accessed: 05.12.2025); GPTZero. URL:  https://gptzero.me (accessed: 05.12.2025); ZeroGPT. URL: https://www.zerogpt.com (accessed: 05.12.2025); Copyleaks. URL: https://copyleaks.com  (accessed: 05.12.2025); Contentatscale. URL: https://ai.tenorshare.com/products/contentatscale-ai-detector (accessed: 05.12.2025) и др.

3 Количественная характеристика обширности словарного запаса — соотношение содержательных слов (самостоятельных частей речи: имен существительных, имен прилагательных, глаголов и наречий) в тексте к общему количеству слов в тексте.

4 Количественная характеристика текста, отражающая степень разнообразия словаря при  построении текста заданной длины — соотношение отдельных лексических единиц (лемм) и количества их употребления в тексте (словоформ).

5 См., например: Комерсантъ. URL: https://www.kommersant.ru/doc/6849411 (дата обращения: 05.12.2025).

×

About the authors

Liliya R. Komalova

Institute of Scientific Information for Social Sciences of the Russian Academy of Sciences; Moscow State Linguistic University

Author for correspondence.
Email: komalova@inion.ru
ORCID iD: 0000-0002-0955-5315
SPIN-code: 9330-0170
Scopus Author ID: 55873286400
ResearcherId: O-2238-2019

Dr.Sc. (Philology), Associate Professor, Leading Research Fellow and Head of the Centre for Emerging Practices, Institute of Scientific Information for Social Sciences of the Russian Academy of Sciences ; Professor at the Department of Applied and Experimental Linguistics, Moscow State Linguistic University

51/21 Nakhimovsky Prospekt, Moscow, Russian Federation, 117418;38 build 1 Ostozhenka Str., Moscow, Russian Federation, 119034

References

  1. Lebedev, A.N., & Konstanta, M.N. (2008). Livanov and Psychophysiological Patterns of Brain Function. Psychological Journal, 29(1), 133–137. (In Russ.) EDN: INMIWB
  2. Kuzminov, Ya.I., Kruchinskaia, E.V., Gruzdev, I.A., & Naumov, A.A. (2025). Falling Behind and Getting Ahead: Student Use of Generative AI in Education. Higher Education in Russia, 34(6), 9–35. (In Russ.). https://doi.org/10.31992/0869-3617-2025-34-6-9-35 EDN: RXDTXQ
  3. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is All You Need. In: Guyon, I., et al. (eds.). Advances in Neural Information Processing Systems 30 (рр. 6000–6010). Long Beach: Neural Information Processing Systems Foundation.
  4. Yu, H., & Guo, Y. (2023). Generative Artificial Intelligence Empowers Educational Reform: Current Status, Issues, and Prospects. Frontiers in Education, 11(7). https://doi.org/10.31992/0869-3617-2025-34-6-9-35 EDN: RXDTXQ
  5. Telitsyna, A.Yu. (2024). Optimization of Scientific Activities Through AI Integration: Neural Networks as a Tool in Working with Academic Literature. Monitoring of Public Opinion: Economic and Social Changes, 5, 218–236. (In Russ.). https://doi.org/10.14515/monitoring.2024.5.2623 EDN: FEHOZO
  6. Golubinskiy, A., Tolstykh, A., & Tolstykh, M. (2025). Automatic Generation of Scientific Articles Abstracts Based on Large Language Models. Informatics and Automation, 24(1), 275–301. (In Russ.). https://doi.org/10.15622/ia.24.1.10
  7. Osipenko, L.E., & Korotkov, A.V. (2024). Text Generative Neural Networks in Students’ Research Activities. Mir Nauki, Kultury, Obrazovaniya, 4 (107), 90–93. (In Russ.). https://doi.org/10.24412/1991-5497-2024-4107-90-93 EDN: COOBKW
  8. Gavrilova, T.A. (2024). “Stochastic parrot” as the servant of Business: Achievements and Challenges of Generative Artificial Intelligence. Russian Management Journal, 2(3), 461–482. (In Russ.). https://doi.org/10.21638/spbu18.2024.305 EDN: VZIVZB
  9. Gritsay, G.M., Grabovoy, A.V., Kildyakov, A.S., & Checkovich, Yu.V. (2023). Artificially Generated Text Fragments Search in Academic Documents. Doklady Rossijskoj Akademii Nauk. Matematika, Informatika, Processy Upravleniya, 514(2), 308–317. (In Russ.). https://doi.org/10.31857/S2686954323601677 EDN: GQRWLF
  10. Zashikhina, I.M. (2024). Scientific Publications and Large Language Models: will Neural Networks Understand Russian Science? Science Editor and Publisher, 9(52), 31–46. (In Russ.). https://doi.org/10.24069/SEP-24-11 EDN: KOZFIO
  11. Pavlov, A.A. (2024). Artificially Generated “Scientific” Texts: Current Status and Future Perspectives. Methodological Problems of the Civil Law Researches, 6, 111–127. (In Russ.). https//doi.org/10.33397/2619-0559-2024-6-6-111-127 EDN: LNFESF
  12. Gusarenko, S.V., & Gusarenko, M.K. (2024). Functionalsemantic, Macrostructural and Presuppositional-Pragmatic Parameters of Generated Russian-Language Texts in the Linguistic Neural Networks Gigachat, Chatgpt Marty and Yandex Alice. Humanities and Law Research, 11(4), 788–800. (In Russ.). https://doi.org/10.37493/24091030.2024.4.23 EDN: JXCRGC
  13. Fomin, V.V., Fomina, I.K., & Taranukha, S.N. (2024). Analysis of the System of Automatic Verification of Text Documents for the Presence of Borrowings when Students Use Generative Artificial Intelligence Tools. Informatization of Education and Science, 3 (63), 57–67. (In Russ.).
  14. Nikolaev, V.V., & Rakhkonen, M.E. (2023). The Use of Various Tools and the Use of the Chatgpt Chatbot When Writing Scientific Papers Tested in the Antiplagiate Program. Professional Legal Education and Science, 1(9), 78–81 (In Russ.).
  15. Liu, Y., Zhang, Z., Zhang, W., Yue, S., Zhao, X., Cheng, X., Zhang, Y., & Hu, H. (2023). ArguGPT: Evaluating, Understanding and Identifying Argumentative Essays Generated by GPT Models. arXiv. https://doi.org/10.48550/arXiv.2304.07666
  16. Ma, Y., Liu, J., Yi, F., Cheng, Q., Huang, Y., Lu, W., & Liu, X. (2023). AI vs. Human – Differentiation Analysis of Scientific Content Generation. arXiv, 1(1). https://doi.org/arxiv.org/abs/2301.10416
  17. Ogorelkov, I.V., & Makhaeva, E.V. (2025). Artificial Neural Network Text Generation as а New Type of Masking the Authorship. Virtual Communication and Social Networks, 4(2), 163–171. (In Russ.). https://doi.org/10.21603/2782-4799-2025-4-2-163-171 EDN: ENIMQP
  18. Gusarenko, S.V. (2009). Defects in Cognitive-Semantic Structures as a Cause of High Entropy in Contemporary Discourse. Proceedings of Southern Federal University. Philology, 2, 68–74. (In Russ.). EDN: KVLHWD
  19. Gritsay, G., Grabovoy, A., & Chekhovich, Yu. (2022). Automatic Detection of Machine Generated Texts: Need More Tokens. In: Ivannikov Memorial Workshop (IVMEM) (pp. 20–26). Moscow. https://doi.org/10.1109/IVMEM57067.2022.9983964
  20. Ye, J., Chen, X., Xu, N., Zu, C., Shao, Z., Liu, S., Cui, Y., Zhou, Z., Gong, C., Shen, Y., Zhou, J., Chen, S., Gui, T., Zhang, Q., & Huang, X. (2023). A Comprehensive Capability Analysis of GPT-3 and GPT-3.5 Series Models. arXiv. https://doi.org/10.48550/arXiv.2405.10913
  21. Rodriguez, J.D., Hay, T., Gros, D., Shamsi, Z., & Srinivasan, R. (2022). Cross-Domain Detection of GPT-2-Generated Technical Text. In: Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (pp. 1213–1233). Association for Computational Linguistics. https://doi.org/10.18653/v1/2022.naacl-main.88
  22. Herbold, S., Hautli-Janisz, A., Heuer, U., Kikteva, Z., & Trautsch, A. (2023). A Large-Scale Comparison of Human-Written Versus ChatGPT-Generated Essays. Scientific Reports, 13(1), 18617–18627. https://doi.org/10.1038/s41598-023-45644-9
  23. Prokhorov, A.I., & Asadchaya, K.V. (2023). Tools for Determining the Text Generated Using a Neural Network. Nauchny Vektor, 9, 250–253. (In Russ.). EDN: MGTGIE
  24. Khokhlova, M.V., & Koryshev, M.V. (2024). Comparative Analysis of AI-Generated and Original Abstracts of Academic Articles on Philology. Scientific and Technical Journal of Information Technologies, Mechanics and Optics, 24(6), 999–1006. (In Russ.). https://doi.org/10.17586/2226-1494-2024-24-6-999-1006 EDN: KDMIJI
  25. Kuleshov, S.V., Zaytseva, A.A., & Aksenov, A.Yu. (2024). Analysis of Statistical Characteristics of Artificially Generated Texts. Journal of Instrument Engineering, 67(11), 958–968. (In Russ.). https://doi.org/10.17586/0021-3454-2024-67-11-958-968 EDN: HIYQAL
  26. Zhao, B., Zhang, S., Xu, C., Sun, Y., & Deng, C. (2021). Deep Fake Geography? When Geospatial Data Encounter Artificial Intelligence. Cartography and Geographic Information Science, 48(4), 338–352. https://doi.org/10.1080/15230406.2021.1910075 EDN: MBHDAY
  27. Misra, D.P., & Chandwar, K. (2023). ChatGPT, Artificial Intelligence and Scientific Writing: What Authors, Peer Reviewers and Editors Should Know. Journal of the Royal College of Physicians of Edinburgh, 53(2), 90–93. https://doi.org/10.1177/14782715231181023
  28. Kacena, M.A., Plotkin, L.I., & Fehrenbacher, J.C. (2024). The Use of Artificial Intelligence in Writing Scientific Review Articles. Current Osteoporosis Reports, 22, 115–121. https://doi.org/10.1007/s11914023008520 EDN: PDAEEH
  29. Aidagulova, A.R. (2023). Features of Texts Generated by Artificial Intelligence. Vestnik Bashkirskogo Gosudarstvennogo Pedagogicheskogo Universiteta imeni M. Akmully, 4, 154–156. (In Russ.). EDN: ROEFNK
  30. Kozlovsky, A.V., Melnik, Ya.E., & Voloshchuk, V.I. (2022). On The Approach for Automatic Generation of Narrative-Linked Text. Izvestiya TulGU. Tekhnicheskie Nauki, 9, 160–167. (In Russ.). https://doi.org/10.24412/2071-6168-2022-9-160-168 EDN: DIRFGA
  31. Cherkasova, M.N., & Taktarova, A.V. (2024). Attributes Of Generated Text in Academic Discourse: The Problem of Identification. Philology. Theory & Practice, 17(7), 2226–2232. (In Russ.). https://doi.org/10.30853/phil20240307 EDN: BEJDOU
  32. Kolmogorova, A.V., & Margolina, A.V. (2024). Written vs Generated Text: “Naturalness” as a Textual and Psycholinguistic Category. Research Result. Theoretical and Applied Linguistics, 10(2), 71–99. https://doi.org/10.18413/2313-8912-2024-10-2-0-4 EDN: CCESHE
  33. Aydın, Ö., & Karaarslan, E. (2022). OpenAI ChatGPT Generated Literature Review: Digital Twin in Healthcare. In: Emerging Computer Technologies 2 (pp. 22–31). İzmir: İzmir Akademi Dernegi. https://doi. org/10.2139/ssrn.4308687
  34. Mikhaylovskiy, N., & Churilov, I. (2023). Autocorrelations Decay in Texts and Applicability Limits of Language Models. In: Computational Linguistics and Intellectual Technologies: Papers from the Annual International Conference “Dialogue” (Vol. 22, pp. 350–360). https://doi.org/10.48550/arXiv.2305.06615
  35. Osetrova, EV., & Sedova, A.V. (2025). Characteristics of the generated Text: Linguistic and Social-Communicative Analysis. Siberian Philological Forum, 2(31), 45–55. (In Russ.). https://doi.org/10.24412/2587-7844-2025-2-45-55 EDN: WYGEFZ
  36. Telpov, R.E., & Lartsina, S.V. (2023). Typological Differences of Natural and Neural Network-Generated Texts in a Quantitative Aspect. Nauchnyi dialog, 12(7), 47–65. (In Russ.). https://doi.org/10.24224/2227-1295-2023-12-7 47-65 EDN: ZZRRKN
  37. Chaka, C. (2023). Detecting AI Content in Responses Generated by ChatGPT, YouChat, and Chatsonic: The Case of Five AI Content Detection Tools. Journal of Applied Learning and Teaching, 6(2), 94–104. doi: 10.37074/jalt.2023.6.2.12
  38. Weber-Wulff, D., Anohina-Naumeca, A., Bjelobaba, S., Foltýnek, T., Guerrero-Dib, J., Popoola, O., Šigut, P., & Waddington, L. (2023). Testing of Detection Tools for AI-Generated Text. International Journal for Educational Integration, 19, 26. https://doi.org/10.1007/s40979-023-00146-z EDN: VCYINN
  39. Yang, X., Cheng, W., Petzold, L., Wang, W.Y., & Chen, H. (2023). DNA-GPT: divergent N-Gram Analysis for Training-Free Detection of GPT-Generated Text. ArXiv. https://doi.org/10.48550/arXiv.2305.17359

Supplementary files

Supplementary Files
Action
1. JATS XML

Copyright (c) 2026 Komalova L.R.

Creative Commons License
This work is licensed under a Creative Commons Attribution-NonCommercial 4.0 International License.