Введи Конституцию США 1787 года в детектор ИИ — и он с высокой вероятностью скажет тебе: написано ИИ. Текст, появившийся на 236 лет раньше ChatGPT.

Это не отдельный подобранный случай, а чистый эксперимент: основатель GPTZero Эдвард Тян (Edward Tian) сам объяснил причину — Конституция — это текст, который снова и снова скармливали тем же языковым моделям. Детектор распознаёт в нём именно то, что распознаёт и в настоящем ИИ. Только здесь — ошибочно.

И именно в этом проблема. Детектор ИИ не измеряет, написан ли текст ИИ. Он измеряет нечто другое — и путает это с происхождением от ИИ.

Что детектор измеряет на самом деле

Сканер плагиата кладёт рядом с твоим текстом оригинальный источник. Можно проверить: вот списанный абзац, вот образец. Это можно перепроверить и опровергнуть.

Детектор ИИ так не может. У него нет образца. Он измеряет, насколько предсказуем текст — на профессиональном языке: его перплексию (perplexity). Языковые модели порождают вероятные, гладкие, ожидаемые последовательности слов. Поэтому обратное считается подозрительным: кто пишет гладко и предсказуемо, для детектора выглядит как машина.

В этом весь трюк. И в этом же вся ошибка.

Ведь кто пишет гладко и предсказуемо? Не только ИИ. Ещё и люди, которые выучили язык как иностранный и опираются на надёжные стандартные обороты. Люди, которые пишут просто и ясно. Некоторые нейроотличные авторы. Детектор не может отличить этих людей от ИИ, потому что он никогда не искал ИИ — только гладкость.

Доказательство того, что дело в языке, а не в ИИ

Исследование Stanford University (Liang et al., опубликовано в Patterns издательства Cell Press, 10.07.2023) протестировало семь коммерческих детекторов на настоящих, гарантированно человеческих текстах.

На эссе американских восьмиклассников доля ошибок была близка к нулю. На эссе TOEFL — написанных людьми, для которых английский является иностранным языком, — те же детекторы в среднем ошибочно классифицировали 61,22 % как написанные ИИ. Почти 98 % сочинений были помечены хотя бы одним инструментом, каждое пятое — единогласно всеми семью.

А дальше начинается часть, которая всё объясняет. Исследователи попросили GPT-4 стилистически отполировать эссе TOEFL — более изысканный выбор слов, и больше ничего. Доля ложной классификации как ИИ упала с 61,22 % до 11,77 %.

То же содержание, те же люди, те же детекторы. Только более богатый язык. Если более совершенная лексика превращает «текст ИИ» в «человеческий текст», значит детектор измеряет не ИИ. Он измеряет уровень владения языком. И наказывает за более низкий.

Что происходит, когда тестируют много инструментов одновременно

Самое широкое на сегодняшний день независимое исследование провели Weber-Wulff, Anohina-Naumeca, Foltýnek с коллегами (International Journal for Educational Integrity 19:26, рецензируемое издание, 25.12.2023). Они проверили 14 детекторов на 54 документах известного происхождения — 756 отдельных тестов.

Результат: ни один инструмент не достиг точности 80 %, лишь пять превысили 70 %. Доля ложных срабатываний колебалась от 0 % (Turnitin в этом тесте) до 50 % (GPTZero в этом тесте). Около 20 % настоящих текстов ИИ были приписаны человеку — а после лёгкой доработки таких оказалась уже половина.

Авторы пишут, что системы «не подходят для академического использования». И называют главную суть: в отличие от сканера плагиата, здесь нет исходного источника. У студента, обвинённого только на этом основании, не было бы «никакой возможности защититься» — в оригинале: no possibility for a defence.

Нельзя опровергнуть то, что ничем не подтверждено.

Самый честный свидетель: сам OpenAI

Если уж кто-то и должен уметь распознавать текст ИИ, так это создатель ChatGPT. OpenAI попробовал — с собственным «AI Text Classifier», выпущенным в январе 2023 года.

Меньше чем через шесть месяцев OpenAI убрал его. В собственном примечании к обновлению указана причина: due to its low rate of accuracy — из-за слишком низкой точности. Инструмент распознавал лишь 26 % текстов ИИ и ошибочно относил к ИИ 9 % человеческих текстов. Для коротких текстов до 1000 символов он был, по их собственным словам, «очень ненадёжен».

Создатель, построивший модель, не смог надёжно распознавать её же результаты — и оказался достаточно честен, чтобы отозвать продукт.

Что сами поставщики пишут мелким шрифтом

Самое показательное — не в маркетинге, а в разделах FAQ.

Turnitin, лидер рынка в сфере образования, указывает долю ложных срабатываний по всему документу «менее 1 %». Если читать дальше, эта цифра действует только для документов с долей ИИ выше 20 %; на уровне предложения показатель составляет около 4 %; ниже 20 % инструмент вообще не показывает цифру, только звёздочку. И сам Turnitin пишет, что результат «не должен быть единственным основанием для мер».

GPTZero пишет в своём собственном FAQ, что его результаты «не должны использоваться для наказания учащихся» — these results should not be used to punish students. И: обучающий датасет состоит преимущественно из английской прозы взрослых авторов. Именно это объясняет предвзятость.

В этом и состоит красная нить: сами поставщики предостерегают именно от того применения — наказания по подозрению, — для которого преподаватели используют эти инструменты.

Справедливости ради есть и контраргумент, и его стоит привести: Turnitin опубликовал собственное исследование (26.10.2023), согласно которому начиная с 300 слов статистически значимого недостатка для изучающих английский как иностранный не наблюдается. Это лишь частично противоречит Stanford — применительно к длинным текстам. Для коротких сам Turnitin признаёт более высокую долю ошибок. И это свидетель в собственном деле. Короткие задания, резюме, ответы на два абзаца — обычная студенческая практика, и именно там показатели хуже всего.

Почему маленький процент всё равно опасен

«Менее 1 %» звучит успокаивающе. Пересчитай на масштаб.

В 2022 году Vanderbilt University сдал на проверку около 75 000 работ. Арифметически — не по факту измерения — собственные «менее 1 %» Turnitin дали бы отсюда около 750 случаев, когда человека пометили бы ошибочно. Были ли эти случаи на самом деле, расчёт не говорит. Но Vanderbilt сделал вывод и 16.08.2023 отключил детектор, обосновав это тем, что не считает программы обнаружения ИИ эффективным инструментом, который стоит использовать.

При массовом использовании низкая доля ошибок — не маленькое число. Это трёхзначное число подозрений в год — и за каждым стоит человек, который ничего не сделал.

А как обстоит дело с немецким законодательством?

Самое важное — сначала, и это почти нигде не упоминается: в Германии бремя доказывания лежит на вузе. Обман должен доказать экзаменационный орган — а сам обман и санкция за него должны быть заранее прописаны в положении об экзаменах. Показатель детектора не переворачивает это бремя доказывания.

Самое свежее решение вынес Административный суд Касселя (Verwaltungsgericht Kassel, 25.02.2026, дело № 7 K 2134/24.KS и 7 K 2515/25.KS). Суд подтвердил санкции за использование ИИ — но при этом прямо не опирался на детектор, а основывался на проверяемых человеком признаках: заметное расхождение между письменной и устной успеваемостью, чрезмерно повторяющиеся стандартные обороты. Решения ещё не вступили в законную силу (по состоянию на 24.07.2026); подтвердит ли их вышестоящая инстанция — пока неизвестно.

Практическое руководство Digitale Lehre Hub Niedersachsen (Baresel, Horn & Schorer, по состоянию на 24.02.2025) советует вузам отказаться от использования детекторов ИИ. Их аргументы: персональные данные об экзаменах (ст. 6 GDPR), запрет исключительно автоматизированных решений (ст. 22 GDPR), возможная классификация как ИИ высокого риска согласно EU AI Act. В упомянутых срочных разбирательствах Административного суда Мюнхена результаты детектора каждый раз считались лишь одним из признаков, но никогда не доказательством.

Некоторые немецкие университеты делают из этого самый однозначный вывод и сознательно вообще не предоставляют детекторы ИИ — как официальную линию, а не как чьё-то частное мнение.

Что делать, если детектор несправедливо тебя пометил

Всё это — журналистская систематизация, а не юридическая консультация по твоему конкретному случаю: для этого нужен человек, знакомый с делом. Но направление, на которое указывают подтверждённые факты и упомянутые рекомендации, можно назвать:

Сам по себе показатель — не доказательство. Он называет вероятность, а не проверяемый источник. Спроси об основании: какой инструмент, какая версия, какая цифра, относительно чего измерено? «Высокий показатель ИИ» без этих данных — не подтверждение, а утверждение.

Покажи процесс создания текста. Это самое сильное встречное доказательство, которое детектор как раз не может предоставить: история версий твоего документа (Google Docs, Word — каждое облако её хранит), промежуточные варианты, заметки, вкладки с исследованиями, источники. Настоящий процесс письма оставляет следы. Вероятность — нет.

Назови предвзятость, если она касается тебя. Если немецкий — или английский — не твой родной язык, исследование Stanford — твой источник: те же самые инструменты, которые почти безошибочно пропускают носителей языка, массово помечают тех, для кого язык иностранный. Это не повод для подозрений против тебя, а известный, измеренный конструктивный недостаток самих инструментов.

Знай, на ком лежит бремя доказывания. В Германии обман должна доказать сама образовательная организация, а не ты — свою невиновность. Если дело дойдёт до этого, им должны заниматься юридическая служба твоего вуза, профильный адвокат или уполномоченный по защите данных.

Честный контраргумент

Чтобы всё это не превратилось в удобную однобокость: есть две вещи, которые говорят в пользу детекторов, — и о них тоже нужно сказать.

Во-первых, люди распознают текст ИИ ещё хуже. Исследование научного письма (Cheng et al., 2025) обнаружило: человеческие рецензенты показали результат 19 % — уровень случайности. Детекторы явно их превзошли. Только то же исследование одновременно измерило долю ложных срабатываний 72,2 % на чисто человеческом тексте. «Лучше людей в распознавании» и «непригоден как доказательство» вовсе не исключают друг друга.

Во-вторых: распознавание на уровне источника работает. Google DeepMind показал в Nature (23.10.2024) текстовый водяной знак (SynthID-Text), который надёжно маркирует результаты работы ИИ, не снижая измеримо качество текста — протестировано примерно на 20 миллионах ответов Gemini. Разница здесь принципиальна: сигнал встраивается в момент генерации, а не угадывается постфактум. Именно поэтому на это делает ставку и регулирование: с 2 августа 2026 года статья 50 EU AI Act (согласно FAQ Европейской комиссии) требует, чтобы поставщики генеративного ИИ маркировали свои результаты в машиночитаемом виде — с переходным периодом для уже существующих систем до 2 декабря 2026 года. (Это правовая ситуация согласно первоисточнику, а не юридическая консультация; проверь актуальность на дату своего прочтения.)

Значит, путь вперёд — это маркировка на уровне источника, а не угадывание по результату. То, что политика выбирает именно этот путь, — тихое признание: детектор, работающий постфактум, проблему не решает.

Одна фраза на вынос

Детектор ИИ — это повод для разговора, а не судебный приговор. Он может вызвать уточняющий вопрос — «расскажи мне, как появился этот текст». Но он никогда не должен иметь последнего слова. Не потому, что так было бы просто вежливо, а потому, что технически он не способен ни на что другое: он измеряет гладкость, называет вероятность и не прикладывает никакого источника. Тот, кто опирается на это при выставлении оценки или обвинении, путает предположение с доказательством.

А Конституция 1787 года доказательством не была.

Источники

Все проверены 24 июля 2026 года. Цифры приведены на указанную дату измерения; показатели детекторов и правовой статус могли с тех пор измениться.

Если тебе кажется, что здесь что-то устарело или неверно: напиши мне.