In dit artikel

Een AI-detector is een programma dat inschat of een tekst door een AI als ChatGPT is geschreven, meestal in de vorm van een percentage. Je plakt de tekst erin, je krijgt een score terug, en daar zit meteen het probleem: die score is een gok met een rekenmodel erachter, geen bewijs. De bekendste detectors zijn gratis te proberen, sommige begrijpen ook Nederlands, en geen enkele is waterdicht. Hieronder lees je hoe ze werken, wat ze fout kunnen doen en wat je zelf kunt checken zonder tool.

Hoe werkt een AI-detector?

Een taalmodel als ChatGPT schrijft door steeds het volgende woord te kiezen dat het meest waarschijnlijk past. Menselijke tekst is grilliger: we kiezen onverwachte woorden, wisselen zinslengte af en maken bochten die een model niet zou maken. Detectors proberen dat verschil te meten.

Turnitin legt het in zijn eigen uitleg ongeveer zo uit: AI-tekst volgt een voorspelbaar patroon van waarschijnlijke woorden, terwijl menselijk schrijven inconsistenter en eigenzinniger is. Veel detectors gebruiken daarvoor twee ideeën. Het eerste heet perplexity en meet hoe voorspelbaar de woordkeuze is. Het tweede heet burstiness en kijkt of zinnen en lengtes van elkaar afwijken zoals bij een mens.

De meeste commerciële tools gaan een stap verder. Ze trainen een eigen model op grote hoeveelheden tekst waarvan bekend is wie ze schreef (mens of AI) en laten dat model per stuk tekst een kans uitrekenen. Zo'n model leert vooral de stijl van de AI's waarop het getraind is. Komt er een nieuwe versie van een chatbot uit, dan lopen detectors een tijd achter.

Hoe betrouwbaar zijn AI-detectors?

Minder dan hun marketing doet vermoeden, en dat zeggen onderzoekers en zelfs de makers zelf.

Het bekendste voorbeeld is OpenAI zelf. In januari 2023 bracht het bedrijf een eigen AI-classifier uit. Op 20 juli 2023 haalde het die weer offline "vanwege het lage percentage correcte antwoorden", zoals de update bij de oorspronkelijke aankondiging het zegt. Het ding was bovendien al bij de lancering onbetrouwbaar voor korte teksten (onder de 1.000 tekens).

Niet-moedertaalsprekers worden vaker onterecht beschuldigd. Onderzoekers van Stanford (Liang e.a., 2023) lieten zeven detectors los op Engelse essays van Amerikaanse middelbare scholieren en op TOEFL-essays van niet-Engelstalige schrijvers. De scholierenessays werden vrijwel foutloos herkend als menselijk. Van de TOEFL-essays bestempelden de detectors gemiddeld ruim 61 procent ten onrechte als AI. Bij 97,8 procent van die essays sloeg minstens één detector aan. De verklaring: wie in een tweede taal schrijft, gebruikt vaker eenvoudige, voorspelbare woorden, en dat leest voor een detector als AI. Dit onderzoek ging over Engels, maar de les geldt ook voor wie in een vreemde taal schrijft.

Voor Nederlands is er weinig onafhankelijk onderzoek. Verschillende tools zeggen Nederlands te ondersteunen, maar de nauwkeurigheidscijfers die ze publiceren zijn hun eigen metingen. Scribbr schrijft zelf dat Engels de meeste trainingsdata heeft en de beste nauwkeurigheid geeft, en dat andere talen minder goed kunnen scoren. Behandel een score op Nederlandse tekst dus als nog onzekerder dan op Engelse tekst.

Makers noemen zelf de grenzen. Turnitin stelt in zijn FAQ dat de AI-score "niet als enige basis voor actie" mag dienen en dat het geen vaststelling van fraude doet. Het bedrijf noemt een foutenmarge van minder dan 1 procent voor volledig menselijke documenten waarin meer dan 20 procent AI zit, en laat percentages tussen 1 en 19 procent daarom weg. Dat is een claim van de maker over zijn eigen systeem. Scribbr schrijft op zijn site dat geen enkele detector volledige nauwkeurigheid kan geven.

Nederlandse universiteiten trekken dezelfde conclusie. De Rijksuniversiteit Groningen bepaalt in haar basisregels dat fraudescores van AI-detectietools wegens onbetrouwbaarheid niet als bewijs voor fraude gebruikt mogen worden. De Universiteit Utrecht schrijft dat detectors te veel valse positieven en valse negatieven geven en dus niet als officieel bewijs kunnen dienen.

Twee fouten komen steeds terug. Een vals positief is een mens die als AI wordt aangemerkt. Een vals negatief is AI-tekst die als menselijk doorgaat, bijvoorbeeld omdat iemand er handmatig flink in heeft geschreven. Allebei gebeuren, en je weet nooit welke van de twee je nu ziet.

De bekendste AI-detectors

Hieronder een overzicht van tools die veel gebruikt worden. Ondersteuning en voorwaarden zijn gecontroleerd op de sites van de makers; prijzen kunnen veranderen, check de actuele prijs op de site zelf. De tabel zegt iets over wat een tool aanbiedt, niet over hoe goed hij werkt.

Tool Nederlands Gratis? Opmerkingen
GPTZero Ja (naast Engels nog meer dan 20 talen, waaronder Nederlands) Gratis versie met beperkt aantal woorden, betaalde abonnementen voor meer Markeert op zinsniveau welke delen verdacht zijn. De ondersteuningspagina noemt geen aparte nauwkeurigheidscijfers per taal
Originality.ai Ja (Multi Language 2.0.0 is getraind op 30 talen, Nederlands staat erbij) Beperkte gratis variant (3 scans per dag, 2.000 woorden per scan, alleen AI-detectie), daarboven betaald met credits Richt zich op professioneel gebruik (content en publicatie). De nauwkeurigheidscijfers op de site zijn eigen metingen
Copyleaks Ja (30 talen volgens de documentatie, Nederlands is nl) Gratis te proberen, voor meer volume is een betaald plan nodig Biedt ook plagiaatcontrole
Scribbr AI Detector Ja volgens de help-pagina van Scribbr (Engels, Spaans, Duits, Frans en Nederlands) Ja, gratis tot 1.200 woorden per keer, geen account nodig Scribbr zegt zelf dat de nauwkeurigheid buiten het Engels lager kan zijn
ZeroGPT Zegt "alle talen" te ondersteunen, onafhankelijk niet bevestigd Gratis tot 15.000 tekens per check, abonnementen voor meer Noemt op de homepage 98,4 procent nauwkeurigheid en minder dan 1 procent vals-positieven. Dat is een eigen claim, geen onafhankelijke meting
Turnitin Nee: AI-detectie werkt voor Engels, Spaans, Japans en Arabisch. Nederlandse teksten worden niet verwerkt Niet voor losse gebruikers: instellingen kopen het, en alleen docenten en beheerders zien de score Hoort bij de gelijkvormigheidsrapportage op scholen en universiteiten. Minimaal 300 woorden lopende tekst nodig

Een paar dingen die je uit de tabel haalt. Turnitin, de tool waar veel Nederlandse studenten mee te maken krijgen, doet volgens zijn eigen FAQ geen AI-detectie op Nederlandse teksten (wel op Engelstalige). Dat kan veranderen, vraag het bij je onderwijsinstelling. Voor alle andere tools geldt dat "ondersteunt Nederlands" betekent dat de tool de tekst kan verwerken, niet dat de score even betrouwbaar is als bij Engels.

Ook handig: plak dezelfde tekst in twee tools en kijk of ze het eens zijn. Verschillen de uitkomsten sterk (bijvoorbeeld 5 en 80 procent), dan zegt dat al genoeg over de waarde van het getal.

Zo check je een tekst zelf

Geen enkel signaal bewijst iets. Samen geven ze wel een beter beeld dan een percentage.

  • Kijk of er iets concreets in staat. AI-tekst blinkt uit in algemeenheden: "belangrijke ontwikkelingen", "diverse factoren", "steeds meer bedrijven". Een mens die iets weet, noemt een naam, een getal, een voorbeeld uit eigen ervaring.
  • Check de bronnen en de feiten. Chatbots verzinnen soms bronnen, citaten of cijfers die logisch klinken. Zoek twee of drie dingen op. Bestaat het onderzoek? Staat het citaat echt in dat artikel? Dit is vaak het sterkste signaal dat er iets mis is.
  • Let op het ritme. Zinnen van bijna dezelfde lengte, elke alinea even lang, elke opsomming met precies drie punten, en een afsluiting die de tekst nog eens samenvat. Los van elkaar zegt het niets, samen valt het op.
  • Zoek de tics. Veel AI-tekst loopt vol met tegenstellingen ("het gaat niet om X, maar om Y"), dikke afsluiters en vage enthousiaste woorden. In het Nederlands vallen ook letterlijke vertalingen uit het Engels op.
  • Kijk naar de stem. Past dit bij hoe deze persoon normaal schrijft of praat? Een plotselinge sprong in niveau, woordkeus of foutloosheid is een reden om een vraag te stellen.
  • Vraag naar het proces. De sterkste test is een gesprek. Laat de schrijver uitleggen waarom een keuze gemaakt is, of een alinea in eigen woorden samenvatten. Wie het zelf schreef, kan dat meestal zonder moeite. Bij documenten kun je ook de versiegeschiedenis in Word of Google Docs bekijken: een tekst die in één keer verschijnt, ziet er anders uit dan een tekst die groeit.

Hou er rekening mee dat veel mensen AI tegenwoordig gewoon gebruiken om hun eigen tekst te verbeteren. Dat staat los van de vraag of iemand "het zelf geschreven heeft", en dus ook van wat je er als lezer of docent mee wilt. Lees voor een praktisch overzicht van wat dat voor schrijven betekent ook onze gids over tekst herschrijven met AI.

AI-detectie op school en werk

Op school en studie. Docenten en examencommissies hebben vaak toegang tot een detector, maar de regels over wat je ermee mag zijn streng en verschillen per instelling. Zoals hierboven bleek, mogen scores bij sommige Nederlandse universiteiten niet als bewijs voor fraude dienen. Wat je als student wel en niet mag doen met AI bij je scriptie of opdrachten verschilt per opleiding, dus lees de regels van je eigen onderwijsinstelling. Onze gids AI voor studenten loopt dat verder door. Wil je weten wat docenten zelf kunnen doen, kijk dan ook naar AI voor leraren.

Op het werk. Hier is de vraag zelden of iemand een detector gebruikt, en vaker of je ChatGPT mag inzetten en of je dat moet melden. Dat staat meestal in een AI-beleid van de werkgever en soms in je contract. Wat daarin gebruikelijk is en welke risico's er zijn met bedrijfsgegevens, lees je in mag je ChatGPT gebruiken op je werk. Gebruik je ChatGPT zelf voor teksten die naar klanten gaan? Lees ze dan altijd door en pas ze aan op je eigen stem en feiten. Dat is meteen de beste verzekering tegen een beschuldiging.

Als je onterecht wordt beschuldigd. Bewaar je schrijfproces: concepten, aantekeningen, de versiegeschiedenis, bronnen die je gebruikte. Vraag welke tool is gebruikt en welke score is gevonden, en wijs op de bekende foutmarges en op het feit dat de makers zelf zeggen dat een score niet als enige basis voor een beslissing mag dienen.

Veelgestelde vragen

Wat is de beste AI-detector?

Er is geen duidelijke winnaar. Verschillende tools geven op dezelfde tekst verschillende uitkomsten, en veel nauwkeurigheidscijfers komen van de makers zelf. Wil je een eerste indruk voor Nederlandse tekst, probeer dan twee tools (bijvoorbeeld GPTZero en Copyleaks) en weeg de uitkomst samen met de signalen uit de vorige sectie.

Is er een gratis AI-checker voor Nederlandse tekst?

Ja. Scribbr, GPTZero, Copyleaks en ZeroGPT hebben een gratis variant, met beperkingen in lengte of aantal checks. Of de score betrouwbaar is voor Nederlands, is lastig te zeggen: Scribbr zegt zelf dat de nauwkeurigheid buiten het Engels lager kan zijn.

Kan een AI-detector fouten maken?

Ja, in twee richtingen. Hij kan een door een mens geschreven tekst als AI aanmerken (vals positief) en AI-tekst over het hoofd zien (vals negatief). Onderzoek van Stanford liet zien dat detectors vaker misgaan bij teksten van niet-moedertaalsprekers. Turnitin zegt zelf dat de score niet de enige basis voor een beslissing mag zijn.

Kan ik zien of iets door ChatGPT is geschreven?

Niet met zekerheid. Aanwijzingen zijn algemene taal zonder voorbeelden, verzonnen bronnen, een erg gelijkmatig ritme en een stijl die niet bij de schrijver past. Het sterkste bewijs is een gesprek over de inhoud of het schrijfproces, bijvoorbeeld via de versiegeschiedenis van het document.

Waarom beoordeelt een detector mijn eigen tekst als AI?

Omdat hij naar voorspelbaarheid kijkt. Korte, eenvoudige of heel nette zinnen, veel standaardformuleringen en schrijven in een tweede taal kunnen voor een detector op AI lijken.

Bronnen

Eindredactie: Jan van Musscher, hoofdredacteur · Zo werken we