Блокнот · Заметка 003 · Контент

У ИИ свой почерк в каждом языке

Если перевести английский список «слов, по которым узнают ИИ», пользы не будет. Немецкий редактор замечает одни обороты, польский редактор другие.

Serhat Belen

Основатель BLN Global · · Читать 6 мин

Короткий ответ

Если перевести английский список «слов ИИ» на другой язык, получится бесполезный чек-лист. В каждом языке читателя раздражает своё. В немецком выдаёт структура фразы, в арабском ошибки в предлогах, которые тянутся из перевода. Мы составили отдельные списки для девяти языков и проверили 181 шаблон в 113 тысячах слов. Срабатываний нет. Но пройденная проверка ещё не делает текст хорошим.

Мы написали текст сайта на турецком и выпустили ещё на девяти языках. Не переводили. Для каждого языка писали заново. Это важно: машинный перевод и нейросеть часто узнаются в одной и той же фразе.

Списки «слов-маркеров ИИ» из интернета составлены для английского: копнуть, полотно, когда сроки горят. Переводить этот список на немецкий бессмысленно. Немецкий читатель спотыкается не о слово, структураэто.

У каждого языка своя струна

Список для английского и так у всех есть: копнуть, полотно, без стыков, когда сроки горят. Эти слова знают уже все. Проблема в том, что список заточен под английский.

В немецком читателя раздражает не само слово структураэто: вместо глаголов наваливать существительные, прятаться за пассивом. В польском цепляет одно, в арабском совсем другое. В арабском самый явный след дает ошибка с предлогом из перевода. Она сразу показывает, что текст не писали, а переводили.

Мы собрали списки для девяти языков по их редакторским гайдам и спорам редакторов, вручную по каждому языку. Сами списки не публикуем. Это часть работы, которую покупает клиент. Главная мысль здесь не в списке: Переводить английский список бесполезно.

Общее вот что: в каждом языке tel оказывается самым легко запоминаемым шаблоном. Модель выучила его, потому что в текстах он встречается чаще всего.

Измерять и читать, это разные задачи

Список готов, но читать страницы глазами недостаточно. Их 150. Мы написали проверку, которая считает шаблоны. Вот результат:

EN · 15 страниц · 13028 слов · чисто DE · 15 страниц · 11968 слов · чисто FR · 15 страниц · 13947 слов · чисто ES · 15 страниц · 13298 слов · чисто IT · 15 страниц · 13276 слов · чисто NL · 15 страниц · 12730 слов · чисто PL · 15 страниц · 11937 слов · чисто RU · 15 страниц · 11544 слова · чисто AR · 15 страниц · 11254 слова · чисто всего битых ссылок: 0
9 языков, 181 шаблон, 112.982 слова. «Чисто» значит: ни один шаблон не вышел за порог.

Ошибка самого инструмента: он превращает текст в одну строку

При первом запуске аудит нашёл на немецких страницах тире внутри сплошного текста. С текстом всё было в порядке. Ошибался инструмент. При извлечении текста из HTML он заменял теги пробелами. Страница превращалась в одну строку, и знак между меткой и пояснением выглядел частью обычной фразы.

s = re.sub(r'<[^>]+>', '\n', s) # тег = граница блока
Когда теги начали превращаться в конец строки, а не в пробел, ложная тревога ушла.

Вторая ложная тревога: польские кавычки

Проверка польского считал этот знак следом ИИ. В польском закрывающая кавычка выглядит именно так: „…”. То есть инструмент языка верно подсвечивал это написание как ошибку.

Правило сузили: английская кавычка, попавшая в польский текст, правда отдельный знак, а не закрывающая кавычка этого языка. На этом сайте мы второй раз получили тот же урок: при проверке доступности четверть предупреждений тоже оказалась ложной. Если править текст вместо инструмента, испортишь то, что было верным.

Проверка еще не значит, что текст хорош

Ноль срабатываний не делает текст хорошим. Это лишь значит, что проверка не нашла известных шаблонов. Текст может пройти все списки и остаться безжизненным.

Проверка нужна для двух вещей: поймать пропущенное и не дать одному обороту тихо расползтись на сто пятьдесят страниц. Читабельность текста всё равно оценивает человек, который говорит на этом языке. Инструмент не решает за него. Он экономит ему время.

Как это выглядит в продукте AdForge пишет рекламные тексты Открой страницу: там каждый сгенерированный текст проходит порог перед публикацией.

Частые вопросы

Можно просто перевести английский список слов-маркеров ИИ?

Нет. Этот список собран из слов, которые живут в английском. В немецком читателя чаще раздражает даже не слово, а устройство фразы. Переведенный список ловит лишнее и пропускает настоящие следы.

Текст прошел проверку. Публиковать?

Проверка говорит только, что известных шаблонов нет. Текст может не попасть ни в один список и всё равно звучать мёртво. Задача проверки: поймать пропущенное и не дать одному обороту тихо расползтись на сотни страниц. Читабельность всё равно оценивает человек, который говорит на этом языке.

Google наказывает за контент, созданный ИИ?

Важны цель и качество, а не способ производства. Google относит массовый контент ради манипуляции выдачей к спаму. Саму автоматизацию он не запрещает и советует прямо писать о ней там, где это уместно.

Что делать, если инструмент проверки выдал предупреждение?

Сначала проверь предупреждение. Наш аудит польского текста принимал местную закрывающую кавычку за ошибку. При проверке доступности 6 из 24 замечаний о контрасте тоже оказались ложными. Предупреждение лишь указывает на возможную проблему. Исправишь без проверки и сломаешь то, что работало.

Источники

Похожие работы