Ложные обвинения: почему мы переписали логику детекции для академических текстов

Самый страшный кошмар любого инструмента для верификации текста — это не пропустить сгенерированный нейросетью фрагмент, а ошибочно обвинить живого человека в плагиате или использовании ИИ. Для студента, защитника диплома или журналиста такое «ложное срабатывание» (false positive) может стоить репутации, оценки или работы. Мы долго смотрели на логи и аналитику и поняли: наша предыдущая эвристика слишком сурово относилась к формальному стилю.

Недавно мы провели жесткий стресс-тест на корпусе академических и новостных текстов (RAID). Результаты оказались предсказуемыми, но болезненными. Детектор срабатывал там, где быть не должен. Проблема крылась в механике анализа повторов. Старый алгоритм видел в многократном использовании ключевых слов и устойчивых оборотов признак машинного самоплеоназма — когда ИИ начинает «залипать» и перефразировать самого себя, чтобы набрать объем. Но в реальной жизни, в сухих научных работах и технических статьях, авторы тоже вынуждены повторять термины.

Почему формальный стиль ломает старую логику

Академическое письмо — это не беллетристика. Здесь нельзя каждый раз синонимизировать «квантовую запутанность» или «гипотезу эффективного рынка». Доменные термины должны оставаться неизменными ради точности. Наша же модель интерпретировала эту законную повторяемость как сигнал тревоги. Это классическая ловушка для алгоритмов: путать стилистическую сухость с алгоритмической генерацией.

Мы взяли реальные примеры из корпуса RAID. Человеческий автор описывает сложный физический эксперимент. Слово «спектрометр» встречается в абзаце пять раз. Для старой версии детектора это выглядело как шаблонный паттерн GPT-4, который часто мусолит одни и те же словосочетания. Наказание следовало мгновенно: высокий процент вероятности ИИ. Но это была ошибка. Мы наказывали профессионалов за их профессиональный язык.

Нам нужно было научить систему разделять две эти сущности: скуку терминологии и лень машинного интеллекта.

Разложение сигнала: дословный оборот против контекста

Мы решили не просто менять настройки, а разложить сигнал на составляющие. Инженеры группы проанализировали тысячи примеров, где детектор «сглючил», и сравнили их с настоящими текстами от ИИ. Мы искали грань, которая их отделяет. И нашли её в природе повторения.

Оказалось, что разница кроется в дословности. Настоящий AI-шаблон любит повторять целые обороты дословно три и более раз подряд. Это механизм «залипания»: нейросеть генерирует предложение, затем пытается его перефразировать, но меняет только одно-два слова, оставляя каркас идентичным. Живой автор, даже пишущий сухим техническим языком, редко повторяет длинный оборот дословно. Он может использовать термин снова, но грамматическая обвязка, предлоги и порядок слов в предложении будут меняться.

Это позволило нам переписать эвристику. Теперь система смотрит не просто на частотность слов (N-граммы), а на структуру повторов. Если видит термин — ок. Если видит один и тот же длинный «хвост» слов трижды подряд — это триггер.

Парето-безопасный порог и оптимизация ресурсов

На основе этих данных мы ужесточили порог срабатывания. Мы стремились к состоянию, которое можно назвать «Парето-безопасным»: мы не хотим жертвовать точностью (recall), но ложные обвинения формальных авторов должны стремиться к нулю. Новые настройки показали рост recall на сложных корпусах, при этом количество ложных срабатываний на человеческих техтекстах упало до статистической погрешности.

Кроме точности, мы получили еще один бонус — производительность. Поскольку новая эвристика умеет быстро отсекать «человеческие» повторы на ранней стадии, мы смогли вычистить лишние обращения к тяжелой вычислительной модели при анализе формальных текстов. Система теперь не тратит ресурсы GPU на глубокий анализ там, где достаточно поверхностной проверки структуры предложения.

Это делает проверку быстрее и дешевле для нас, а результат — надежнее для вас. Студенты могут проверять свои курсовые, а копирайтеры — технические задания, не боясь, что детектор накажет их за профессиональную лексику. Мы убрали главный источник страха при работе с инструментом анализа текста. Теперь он работает не как полиция, настроенная на нарушения, а как точный прибор.

Вопросы и ответы

Почему детектор считал академические тексты сгенерированными?

Старая эвристика воспринимала многократное повторение доменных терминов как признак машинного самоплеоназма. Формальный стиль требует точности, что приводило к ложным обвинениям.

Как вы отличили человеческий текст от машинного в формальном стиле?

Мы проанализировали структуру повторов. ИИ склонен дословно повторять длинные обороты 3+ раза, в то время как человек меняет структуру предложения, даже если использует те же термины.

Повлияли ли изменения на скорость работы детектора?

Да, мы оптимизировали логику, чтобы отсекать ложные тревоги на ранней стадии. Это уменьшило количество обращений к тяжелой модели и ускорило проверку формальных текстов.

Попробуй сам: проверь любой текст на ИИ бесплатным детектором Neuroslop.

Читайте также