Notes · Notatka 003 · Treść
AI zostawia inny odcisk w każdym języku
Jeśli przetłumaczysz angielską listę „słów brzmiących jak AI”, dostaniesz bezużyteczny zestaw. Niemieckiego redaktora drażnią inne zwroty niż polskiego.
Założyciel, BLN Global · · 6 min czytania
Krótka odpowiedź
Jeśli przetłumaczysz angielską listę „słów AI”, dostaniesz bezużyteczny zestaw. W każdym języku czytelnika drażni coś innego. W niemieckim chodzi o budowę zdań, a w arabskim o błędy w przyimkach przeniesione z tłumaczenia. Przygotowaliśmy osobne listy dla dziewięciu języków i sprawdziliśmy 181 wzorców w 113 tys. słów. Wynik: zero naruszeń. Sam audyt nie świadczy jednak o dobrym tekście.
Tekst tej strony powstał po turecku, a potem dostał dziewięć wersji językowych. Nie tłumaczyliśmy go. Napisaliśmy go od nowa w każdym języku. To robi różnicę, bo kalka z tłumaczenia często brzmi tak samo sztucznie jak tekst wygenerowany przez AI.
Krążące w sieci listy „słów AI” dotyczą angielskiego: delve, tapestry, w pędzącym świecie. Jeśli przełożysz tę listę na niemiecki, nic nie zyskasz. Niemieckiego czytelnika nie uwiera samo słowo, strukturajest.
Każdy język brzmi inaczej
Listę dla angielskiego i tak każdy ma: delve, tapestry, seamless, w pędzącym świecie. Te słowa zna już każdy. Problem w tym, że lista działa pod angielski.
W niemieckim czytelnika drażni nie samo słowo strukturato: upychanie rzeczowników zamiast czasowników i chowanie się za stroną bierną. W polszczyźnie zgrzyta co innego, w arabskim co innego. W arabskim najczytelniejszy ślad to błąd przyimka po tłumaczeniu, bo zdradza, że tekst nie powstał od zera.
Listy dla dziewięciu języków zebraliśmy osobno, patrząc na lokalne poradniki pisania i spory redakcyjne. Samych list nie publikujemy, bo są częścią pracy, którą sprzedajemy klientom. Zresztą sedno nie leży w liście: Tłumaczenie listy z angielskiego nie działa.
Wspólny mianownik: w każdym języku „tel” jest najłatwiejszym do zapamiętania schematem. Model go zapamiętał, bo to on najczęściej wraca w tekstach.
Mierzenie to inna praca niż czytanie
Przy 150 stronach samo czytanie nie wystarczy. Napisaliśmy skrypt, który zlicza wzorce. Oto wynik:
EN · 15 stron · 13028 słów · czysto DE · 15 stron · 11968 słów · czysto FR · 15 stron · 13947 słów · czysto ES · 15 stron · 13298 słów · czysto IT · 15 stron · 13276 słów · czysto NL · 15 stron · 12730 słów · czysto PL · 15 stron · 11937 słów · czysto RU · 15 stron · 11544 słów · czysto AR · 15 stron · 11254 słów · czysto łącznie wiszących ciągów: 0
Błąd samego narzędzia: sprowadza tekst do jednego wiersza
Przy pierwszym uruchomieniu audyt zgłosił na niemieckich stronach myślnik w tekście ciągłym. Tekst był poprawny. Myliło się narzędzie. Podczas wyciągania tekstu z HTML zamieniało znaczniki na spacje. Cała strona trafiała do jednego wiersza, a znak między etykietą i opisem wyglądał jak część zdania.
s = re.sub(r'<[^>]+>', '\n', s) # etykieta = granica bloku
Drugi fałszywy alarm: polski cudzysłów
Kontrola polszczyzny ” uznawał ten znak za ślad AI. A po polsku cudzysłów zamykający wygląda właśnie tak: „…”. Narzędzie więc języka poprawnie oznaczał tę pisownię jako błąd.
Zawęziliśmy regułę: angielski cudzysłów, który wchodzi do polskiego tekstu, naprawdę jest znakiem, a nie cudzysłowem zamykającym danego języka. Ta strona dała nam tę samą lekcję drugi raz: także w audycie dostępności co czwarte ostrzeżenie było fałszywe. Jeśli poprawisz tekst bez naprawy narzędzia, zepsujesz to, co działa.
Przejście kontroli nie znaczy, że tekst brzmi dobrze
Zero naruszeń nie oznacza dobrego tekstu. Oznacza tylko brak znanych schematów. Tekst potrafi być martwy, choć nie trafi na żadną listę.
Po to mamy kontrolę: łapie to, co umknęło, i nie pozwala, żeby jeden schemat po cichu rozlał się na sto pięćdziesiąt stron. O tym, czy tekst naprawdę się czyta, wciąż decyduje człowiek, który mówi tym językiem. Narzędzie nie podejmuje tej decyzji za niego. Oszczędza mu czas.
O tym samym podejściu po stronie produktu AdForge tworzący teksty reklam Zajrzyj na stronę: tam zespół przepuszcza każdy wygenerowany tekst przez próg przed publikacją.