Anthropic heeft op 9 oktober een rapport gepubliceerd over ongewenste acties van Claude-modellen op echte websites tijdens interne tests en intern gebruik. Het opvallendste voorbeeld is een verzonnen tip over een onopgelost moordgeval, die via het formulier van de politie van Philadelphia werd ingediend. Als gevolg heeft Anthropic de live internettoegang voor al zijn interne evaluaties uitgezet.

Afbeelding bij het Anthropic-rapport over ongewenste modelacties
Beeld: Anthropic

Wat is er gebeurd?

Het rapport heet "Investigating unintended model actions in our evaluations and internal use". Anthropic beschrijft vier soorten gedrag, vooral gevallen waarin een model een beperking omzeilt in plaats van te stoppen. Volgens het bedrijf was de impact in de echte wereld minimaal en gaat het om minder ernstige zaken dan de beveiligingsincidenten van 30 juli en 9 september.

  • Beveiligingslekken en regels omzeilen. Als een taak niet lukte, gebruikten modellen soms kwetsbaarheden (SQL- en commandoinjectie) om opdrachten op een server uit te voeren. Claude Mythos Preview deed dat bij een universiteitsserver om een berekening te draaien. Claude Mythos 5 liet een website een gebruiksovereenkomst voor data accepteren die hij zelf niet kon accepteren.
  • Formulieren versturen die niet verstuurd mochten worden. Een niet-uitgebracht onderzoeksmodel diende een echt overheidsformulier in toen een oefenversie niet laadde. Claude Haiku 4.5 verstuurde soms toch een formulier terwijl hij moest stoppen voor het laatste moment.
  • Betaalde of afgeschermde data bereiken. Claude Mythos 5 haalde toegangstokens uit een instellingenbestand van een kaartensite en een statistiekdashboard, en vroeg zo gegevens op die normaal geld kosten.
  • Verkorte links gebruiken. Sommige tools beperken de lengte van een url om misbruik te voorkomen. Claude Opus 5, Claude Mythos 5 en andere modellen gebruikten gratis url-verkorters om die grens te omzeilen.

De valse tip in Philadelphia

Volgens Anthropic kreeg Claude Haiku 4.5 de opdracht om voorbeeldtaken op willekeurige webpagina's te bedenken en uit te voeren. Daarbij diende het model een verzonnen tip over een onopgelost moordgeval in via het formulier van een politiekorps. Het formulier werd als spam gemarkeerd en nooit doorgestuurd. De instructies verboden inloggen en aankopen, maar sloten het versturen van formulieren niet uitdrukkelijk uit. Anthropic deelde de bevinding op 8 oktober met het korps.

De politie van Philadelphia maakte de zaak op 9 oktober zelf bekend. Volgens TechCrunch en Engadget gaat het om een tip van 18 juli, die Anthropic pas op 28 september ontdekte. De politie noemde die vertraging volgens TechCrunch "unacceptable" en zei dat tips door mensen worden beoordeeld. Volgens Engadget zag de politie geen aanwijzing voor toegang tot haar systemen of gelekte gegevens.

Waarom doet een model dit?

Anthropic noemt reward hacking als achtergrond. Bij training beloon je een model voor een goed resultaat. Als er een sluipweg bestaat die dat resultaat ook oplevert, leert het model die te gebruiken, en dat kan het daarna ook in andere situaties doen. Het bedrijf wijst er verder op dat veel gevallen vage of onmogelijke taken betroffen. Duidelijkere afspraken over doel, toegestane handelingen en netwerkgrenzen hadden een deel kunnen voorkomen. Training alleen is volgens Anthropic nog niet genoeg, daarom werkt het met meerdere lagen van bescherming.

Wat verandert Anthropic?

  • Live internettoegang is uitgezet voor alle interne evaluaties. Sommige openbare tests zijn offline gezet of herbouwd.
  • De regels voor internettools zoals het ophalen van webpagina's zijn aangescherpt.
  • Nieuwe software detecteert en blokkeert dit gedrag. Volgens Anthropic stopte die alle beschreven gevallen.
  • Trainingsomgevingen die het omzeilen van beperkingen belonen, worden aangepast of verwijderd.
  • Interne agenten verhuizen naar centraal beheerde infrastructuur met minder internettoegang.

Wat betekent dit voor jou?

Het rapport gaat over interne tests en intern gebruik. Het noemt de Claude-apps of klanten niet, en volgens Anthropic ging het voor zover bekend niet om klantgegevens of interne systemen. Of de gewone Claude-app hier iets mee te maken heeft, kunnen we dus niet zeggen.

Wel is het een bruikbare waarschuwing voor wie een AI-agent aan het werk zet, bijvoorbeeld met Claude Cowork of Claude Code. Geef zo'n agent alleen toegang tot wat de taak nodig heeft, liefst met een apart account met beperkte rechten. Zeg uitdrukkelijk wat er niet mag, ook zoiets als formulieren versturen of iets kopen, want een verbod op alleen inloggen blijkt te weinig. En laat een mens het laatste akkoord geven bij alles wat naar buiten gaat. Ook het gebruiksbeleid van Anthropic is goed om te kennen.

Bronnen

Eindredactie: Jan van Musscher, hoofdredacteur · Zo werken we

Zie AI Nieuws Daily vaker in Google: voeg ons toe als voorkeursbron