Блокнот · Заметка 003 · Контент
У ИИ свой почерк в каждом языке
Если перевести английский список «слов, по которым узнают ИИ», пользы не будет. Немецкий редактор замечает одни обороты, польский редактор другие.
Основатель BLN Global · · Читать 6 мин
Короткий ответ
Если перевести английский список «слов ИИ» на другой язык, получится бесполезный чек-лист. В каждом языке читателя раздражает своё. В немецком выдаёт структура фразы, в арабском ошибки в предлогах, которые тянутся из перевода. Мы составили отдельные списки для девяти языков и проверили 181 шаблон в 113 тысячах слов. Срабатываний нет. Но пройденная проверка ещё не делает текст хорошим.
Мы написали текст сайта на турецком и выпустили ещё на девяти языках. Не переводили. Для каждого языка писали заново. Это важно: машинный перевод и нейросеть часто узнаются в одной и той же фразе.
Списки «слов-маркеров ИИ» из интернета составлены для английского: копнуть, полотно, когда сроки горят. Переводить этот список на немецкий бессмысленно. Немецкий читатель спотыкается не о слово, структураэто.
У каждого языка своя струна
Список для английского и так у всех есть: копнуть, полотно, без стыков, когда сроки горят. Эти слова знают уже все. Проблема в том, что список заточен под английский.
В немецком читателя раздражает не само слово структураэто: вместо глаголов наваливать существительные, прятаться за пассивом. В польском цепляет одно, в арабском совсем другое. В арабском самый явный след дает ошибка с предлогом из перевода. Она сразу показывает, что текст не писали, а переводили.
Мы собрали списки для девяти языков по их редакторским гайдам и спорам редакторов, вручную по каждому языку. Сами списки не публикуем. Это часть работы, которую покупает клиент. Главная мысль здесь не в списке: Переводить английский список бесполезно.
Общее вот что: в каждом языке tel оказывается самым легко запоминаемым шаблоном. Модель выучила его, потому что в текстах он встречается чаще всего.
Измерять и читать, это разные задачи
Список готов, но читать страницы глазами недостаточно. Их 150. Мы написали проверку, которая считает шаблоны. Вот результат:
EN · 15 страниц · 13028 слов · чисто DE · 15 страниц · 11968 слов · чисто FR · 15 страниц · 13947 слов · чисто ES · 15 страниц · 13298 слов · чисто IT · 15 страниц · 13276 слов · чисто NL · 15 страниц · 12730 слов · чисто PL · 15 страниц · 11937 слов · чисто RU · 15 страниц · 11544 слова · чисто AR · 15 страниц · 11254 слова · чисто всего битых ссылок: 0
Ошибка самого инструмента: он превращает текст в одну строку
При первом запуске аудит нашёл на немецких страницах тире внутри сплошного текста. С текстом всё было в порядке. Ошибался инструмент. При извлечении текста из HTML он заменял теги пробелами. Страница превращалась в одну строку, и знак между меткой и пояснением выглядел частью обычной фразы.
s = re.sub(r'<[^>]+>', '\n', s) # тег = граница блока
Вторая ложная тревога: польские кавычки
Проверка польского ” считал этот знак следом ИИ. В польском закрывающая кавычка выглядит именно так: „…”. То есть инструмент языка верно подсвечивал это написание как ошибку.
Правило сузили: английская кавычка, попавшая в польский текст, правда отдельный знак, а не закрывающая кавычка этого языка. На этом сайте мы второй раз получили тот же урок: при проверке доступности четверть предупреждений тоже оказалась ложной. Если править текст вместо инструмента, испортишь то, что было верным.
Проверка еще не значит, что текст хорош
Ноль срабатываний не делает текст хорошим. Это лишь значит, что проверка не нашла известных шаблонов. Текст может пройти все списки и остаться безжизненным.
Проверка нужна для двух вещей: поймать пропущенное и не дать одному обороту тихо расползтись на сто пятьдесят страниц. Читабельность текста всё равно оценивает человек, который говорит на этом языке. Инструмент не решает за него. Он экономит ему время.
Как это выглядит в продукте AdForge пишет рекламные тексты Открой страницу: там каждый сгенерированный текст проходит порог перед публикацией.