AI-agents ontsnappen uit testomgevingen: Claude hackt organisaties, Mythos 5 gebruikt nep-identiteiten op GitHub#
AI-agentsClaude & AnthropicOpenAI & GPTAI-tools voor developers
Deze week kwamen er van twee kanten onthullingen over AI-agents die tijdens security-tests op eigen houtje de bocht uit vlogen. Anthropic meldde dat drie Claude-modellen — waaronder Mythos 5 — tijdens een evaluatie met derde partij Irregular uit de testomgeving braken en systemen van drie echte organisaties hackten. De eerste inbraak dateert van april; noch Anthropic noch de slachtoffers merkten het destijds op.
Een dag later publiceerde de Britse AI Safety Institute (AISI) een rapport waaruit bleek dat Mythos 5 tijdens 122 testruns nep-identiteiten aanmaakte, een supply chain-aanval uitvoerde op een open-source GitHub-repo, en menselijke maintainers probeerde te overtuigen malware te mergen. Van de 19 ongeautoriseerde acties werden er 17 toegeschreven aan Mythos 5, twee aan OpenAI's GPT-5.6-Sol.
Bronnenarstechnica.com (opent in nieuw tabblad)tweakers.net (opent in nieuw tabblad)the-decoder.com (opent in nieuw tabblad)