Как мы починили детектор для китайского языка: от AUC 0.66 до 0.85
Внутренняя валидация часто дает успокаивающие результаты. Модель кажется идеальной, пока не столкнешься с реальным, «грязным» миром. Мы поняли это, когда запустили нейтральный held-out бенчмарк. В отличие от синтетических тестов, где данные часто подгоняются под модель, здесь мы использовали внешние выборки HC3-Chinese и MAGE. Результаты оказались холодным душем.
Наш детектор уверенно работал с английским текстом (AUC 0.823), но на китайском языке метрика проседала до 0.665. Это уровень случайного угадывания. Ошибка была критической, но она указала на вектор движения. Проблема крылась не в иероглифах или грамматике, а в специфике «учительского тона» больших моделей. LLM любят поучать, и в китайском это проявляется особым образом.
Почему внешний бенчмарк важнее внутренних тестов?
Разработчики часто попадают в ловушку оптимизации под известные данные. Вы тестируете модель на том, на чем она училась, и получаете отличные графики. Но стоит подать текст из другой доменной области или с иным стилем изложения, как точность падает. Именно поэтому мы отказались от самопроверки в пользу HC3 и MAGE.
Эти наборы данных содержат реальные ответы людей и нейросетей, которые модель никогда не видела. Разрыв в 0.15 пунктов AUC между английским и китайским был недопустим. Это означало, что для пользователей из Китая инструмент практически бесполезен. Мы не могли просто «дотюнить» веса, не понимая природы сбоя. Нужно было копать глубже — в саму структуру генерации.
Анатомия ошибки: не грамматика, а риторика
Первым делом мы проверили гипотезу о языковых особенностях. Может быть, токенайзер хуже работает с иероглифами? Или синтаксис китайского языка слишком отличается от европейских языков, на которых обучалась базовая модель? Анализ показал, что дело не в этом.
Оказалось, что ChatGPT (и аналогичные модели) в китайской локализации используют специфические объяснительные обороты. Это своего рода риторические костыли или скаффолды. В английском языке это классические фразы вроде «it is important to note» или «in conclusion». Они служат связками, делая текст структурированным, но искусственным.
В китайском языке эти маркеры имеют свои лингвистические формы. Человеческая речь в чатах и постах редко бывает такой структурированной. Мы обнаружили, что наш детектор не «видел» эти связки как сигналы ИИ, воспринимая их как часть нормального, хоть и формального человеческого языка. Обычные статистические методы упускали этот стилистический отпечаток.
Майнинг скаффолдов: как мы собрали словарь
Мы не стали писать правила вручную. Вместо этого мы запустили процесс майнинга данных. Наш алгоритм проанализировал массивы ответов нейросетей на китайском, вычленив наиболее частотные обороты, которые свойственны именно машинному генеративному стилю.
Эти фразы были добавлены в словарь детектора как специальные сигналы. Теперь, если модель видела в тексте характерный для ИИ «переход» или «вводную конструкцию», она учитывала это с большим весом. Это похоже на то, как опытный редактор определяет текст студента, написанного «на шару», по заезженным клише из учебников.
Результаты: скачок AUC и проблема энциклопедий
После обновления словаря картина изменилась мгновенно. Показатель AUC для китайского языка подскочил с 0.665 до 0.848. Это не просто закрытие разрыва с английским (0.823), но и его surpass. Китайский сегмент стал самым детектируемым в системе.
Более того, нам удалось добитьсяrecall при нуле ложных срабатываний на живых людях. Это значит, что обычные пользователи, пишущие на естественном китайском, теперь помечаются как люди с вероятностью, близкой к абсолютной. Мы пожертвовали небольшой долей детекции краевых случаев ради безопасности пользователей.
Однако есть нюанс. Мы заметили, что формальный энциклопедический китайский текст (например, статьи из Baidu Baihu или научные рефераты) иногда проходит мимо детектора. Логика понятна: энциклопедический стиль сух, лаконичен и лишен тех самых «учительских» скаффолдов, которые ищет наша модель. Нейросети обычно более многословны и «воспитательны», поэтому сухой человеческий текст остается в тени. Это компромисс, на который мы пойдем ради исключения ложных обвинений.
Вы можете проверить работу обновленного алгоритма самостоятельно, используя наш инструмент анализа текста. Система теперь гораздо точнее чувствует контекст и риторические уловки, характерные для больших языковых моделей.
Вопросы и ответы
Почему AUC китайского языка был ниже английского?
Первоначально модель не учитывала специфические риторические обороты (скаффолды), которые ChatGPT использует в китайском. Проблема была не в грамматике, а в избыточной «воспитательности» стиля ИИ.
Что такое скаффолды в контексте ИИ?
Это слова-связки и объяснительные обороты (аналог английского 'it is important to note'), которые используют нейросети для структурирования ответа. Люди в естественном общении используют их реже.
Детектор теперь ошибается на живых людях?
Нет, мы добились нуля ложных срабатываний (false positives) на реальных людях. Исключение составляют только очень сухие энциклопедические тексты, которые по стилю отличаются от обычной речи.
Попробуй сам: проверь любой текст на ИИ бесплатным детектором Neuroslop.