Logboek · Notitie 003 · Content

AI laat in elke taal andere sporen na

Vertaal je een Engelse lijst met woorden die naar AI ruiken, dan houd je een nutteloze lijst over. Een Duitse redacteur stoort zich aan andere dingen dan een Poolse.

Serhat Belen

Oprichter, BLN Global · · 6 min lezen

Kort antwoord

Vertaal je de Engelse lijst met zogeheten AI-woorden, dan houd je in een andere taal een nutteloze lijst over. Lezers storen zich per taal aan iets anders: in het Duits aan de zinsbouw, in het Arabisch aan voorzetsels die verkeerd uit de vertaling meekomen. We maakten voor negen talen aparte lijsten en controleerden 181 patronen in 113 duizend woorden. Geen enkele overschrijding. Toch zegt slagen voor een controle niets over hoe goed de tekst is.

De tekst van deze site is in het Turks geschreven en daarna in negen talen uitgebracht. Niet vertaald, maar per taal opnieuw geschreven. Dat verschil telt. Een tekst die naar een vertaling ruikt, klinkt vaak ook alsof AI hem schreef.

Lijstjes met AI-woorden die online rondgaan, zijn voor het Engels: uitdiepen, weefsel, vandaag gaat het snel. Die lijst naar het Duits vertalen helpt niet. Een Duitse lezer struikelt niet over het woord, bouwis.

Elke taal heeft een eigen snaar

De Engelse lijst kent iedereen al: uitdiepen, weefsel, soepel, vandaag gaat het snel. Iedereen kent deze woorden nu. Het probleem: de lijst is gemaakt voor Engels.

In het Duits stoort de lezer zich niet aan het woord bouwis: zelfstandige naamwoorden stapelen in plaats van werkwoorden gebruiken, en wegkruipen in de lijdende vorm. In het Pools valt iets anders op, in het Arabisch weer iets heel anders. In het Arabisch is het duidelijkste signaal een voorzetsel dat uit de vertaling is meegekomen. Je ziet dan meteen dat de tekst niet geschreven is, maar vertaald.

We hebben de lijsten voor negen talen één voor één gemaakt op basis van schrijfgidsen en redactiediscussies in die talen. We zetten de lijsten zelf niet online. Ze horen bij het werk dat we aan klanten verkopen. De echte les hier is niet de lijst: De Engelse lijst vertalen werkt niet.

De gemene deler: in elke taal is tel het patroon dat je het makkelijkst onthoudt. Het model kent dat patroon uit zijn hoofd, omdat het in teksten het vaakst terugkomt.

Meten is iets anders dan lezen

Met de lijst in handen kom je er niet door pagina’s zelf te lezen. Het zijn er 150. Daarom schreven we een controle die patronen telt. Dit kwam eruit:

EN · 15 pagina's · 13028 woorden · in orde DE · 15 pagina's · 11968 woorden · in orde FR · 15 pagina's · 13947 woorden · in orde ES · 15 pagina's · 13298 woorden · in orde IT · 15 pagina's · 13276 woorden · in orde NL · 15 pagina's · 12730 woorden · in orde PL · 15 pagina's · 11937 woorden · in orde RU · 15 pagina's · 11544 woorden · in orde AR · 15 pagina's · 11254 woorden · in orde totaal aantal meldingen: 0
9 talen, 181 patronen, 112.982 woorden. Schoon betekent: geen enkel patroon ging over de drempel.

De fout van de tool: tekst terugbrengen tot één regel

Bij de eerste controle kregen de Duitse pagina’s een melding over een gedachtestreepje in lopende tekst. De tekst klopte. De tool niet. Bij het uitlezen van HTML verving hij tags door spaties. Zo werd de hele pagina één regel en leek het teken tussen een label en de uitleg midden in een zin te staan.

s = re.sub(r'<[^>]+>', '\n', s) # label = blokgrens
Toen labels naar regeleindes gingen in plaats van spaties, verdween het valse alarm.

Tweede vals alarm: Poolse aanhalingstekens

Poolse check zag dat teken als AI-signaal. In het Pools is dat juist het sluitende aanhalingsteken: „…”. Dus de tool, de taal juist markeerde de spelling als fout.

De regel is aangescherpt: een Engels aanhalingsteken dat in Poolse tekst binnensluipt is echt een teken, niet het sluitteken van die taal. Op deze site leerden we die les nu voor de tweede keer: ook de toegankelijkheidscontrole sloeg in een kwart van de gevallen onterecht aan. Wie de tekst aanpast zonder de tool te repareren, maakt iets goeds kapot.

Door de controle komen betekent niet dat een tekst goed geschreven is

Nul overtredingen zeggen niet dat een tekst goed is. Alleen dat bekende patronen ontbreken. Een tekst kan elke controle doorstaan en toch doods aanvoelen.

Daar is de check voor: hij vangt wat je mist en voorkomt dat één trucje stilletjes over honderdvijftig pagina’s kruipt. Of de tekst echt leest, bepaalt nog steeds iemand die de taal spreekt. De tool neemt dat oordeel niet over. Hij bespaart tijd.

Voor de productkant van diezelfde discipline AdForge schrijft advertentieteksten Kijk naar de pagina: ook daar gaat elke gegenereerde tekst langs een drempel voordat hij live gaat.

Veelgestelde vragen

Kan ik de Engelse lijst met AI-woorden niet gewoon vertalen?

Nee. Die lijst bestaat uit woorden die alleen in het Engels werken. In het Duits stoort de lezer zich vaak niet aan een woord, maar aan de bouw van de zin. Een vertaalde lijst pakt dus de verkeerde dingen en mist de echte signalen.

Mag je publiceren als de tekst door de check komt?

De check zegt alleen dat bekende patronen niet zijn gevonden. Een tekst kan door geen enkele lijst worden geraakt en toch doods aanvoelen. De check vangt wat je mist en voorkomt dat één trucje stilletjes over honderden pagina’s kruipt. Of het echt leest, bepaalt nog steeds iemand die de taal spreekt.

Straft Google content af die met AI is gemaakt?

Het gaat niet om hoe je produceert, maar om doel en kwaliteit. Google rekent grootschalige content voor rankingmanipulatie tot zijn spambeleid. Automatisering zelf is niet verboden. Google raadt wel aan om het gebruik te melden waar dat logisch is.

Wat doe je als een audittool waarschuwt?

Controleer eerst of de melding klopt. Onze Poolse controle zag het eigen afsluitende aanhalingsteken van de taal als fout. Bij de toegankelijkheidscontrole bleken 6 van de 24 contrastmeldingen onterecht. Een melding is een bewering, geen bewijs. Wie zonder controle iets aanpast, maakt soms juist iets kapot.

Bronnen

Gerelateerd werk