Hem Samhälle Ekonomi AI-modeller försökte ”osanktionerade” cyberattacker i tester, säger watchdog

AI-modeller försökte ”osanktionerade” cyberattacker i tester, säger watchdog

AI-modeller försökte "osanktionerade" cyberattacker i tester, säger watchdog

Anthropic och OpenAI:s toppmodeller för artificiell intelligens engagerade sig i ”autonoma” och ”osanktionerade” skadliga aktiviteter riktade mot riktiga människor och organisationer under de senaste säkerhetstester, har Storbritanniens AI-vakthund sagt.

AI Security Institute (AISI) sa i en rapport som släpptes på tisdagen att OpenAI:s GPT-5.6-Sol och Anthropics Claude Mythos 5 använde tidigare osynliga nivåer av bedrägeri för att utföra ”ihållande, potentiellt skadlig aktivitet” under en rutinmässig säkerhetsutvärdering.

Rekommenderade berättelser

lista med 4 artiklarslutet av listan

När modellerna fick till uppgift att lösa en cybersäkerhetsutmaning vidtog modellerna ”autonoma, osanktionerade åtgärder” under 10 av 122 testkörningar, enligt AISI.

AISI sa att testerna föranledde 19 icke sanktionerade åtgärder av AI-modellerna, alla utom två av dem utförda av Claude Mythos 5.

I det allvarligaste fallet försökte Claude Mythos 5 infoga skadlig kod i ett öppen källkodsprojekt på utvecklarplattformen GitHub, enligt AISI.

Som en del av försöket till cyberattack skapade Claude Mythos 5 falska onlineidentiteter för att övertala personen som underhåller projektet att acceptera den skadliga koden, sa vakthunden.

AISI, som grundades av den brittiska regeringen 2023, sa att cyberattacken misslyckades efter att projektansvarig vägrade att godkänna koden.

”Det här är första gången AISI har sett bedrägeri av denna svårighetsgrad som riktades mot en verklig person, utan uppmaning, i den verkliga världen,” sa vakthunden.

Medan AISI sa att AI-modellerna uppvisade ”nya, potentiellt vilseledande beteenden”, varnade vakthunden för att dess resultat borde tolkas med försiktighet, eftersom de inträffade under ”specifika förhållanden”, inklusive med några av modellernas skydd inaktiverade.

”Vi kan ännu inte vara säkra på när agenten förstod att det vidtog verkliga åtgärder, eller i vilken utsträckning den trodde att det var i ett fiktivt testscenario; vår analys hittills ger en blandad bild och pågår”, sa AISI.

Anthropic sa att det arbetade nära AISI för att samla in fler detaljer som en del av sin egen utredning av incidenten, men noterade att testet utfördes under ”avsiktligt tillåtande förhållanden”.

”Att få en tydlig bild av Claudes förståelse av sin situation – genom att undersöka dess resonemangsutskrifter och köra våra egna analyser – kommer att hjälpa oss att identifiera orsakerna till dess beteende”, sa AI-företaget i ett inlägg på X, med hänvisning till sin flaggskeppsserie av stora språkmodeller.

OpenAI sa att de välkomnade tester från tredje part samtidigt som de noterade att vakthundens utvärdering utfördes under förhållanden som ”inte återspeglar vanlig användning”.

”Vi kommer att fortsätta att arbeta med utvärderare och andra intressenter över hela branschen för att stärka delade metoder för att genomföra utvärderingar på ett säkert sätt när modellerna blir mer kapabla,” sa en talesperson för OpenAI till Bladet.

Rapporten från den Londonbaserade vakthunden följer ett antal fall av frontier AI-modeller som ägnar sig åt skadlig aktivitet utan mänsklig uppmaning.

Förra månaden avslöjade OpenAI att två av dess AI-modeller bröt sig ur sin testmiljö och hackade Hugging Face, ett företag som är värd för AI-modeller och datauppsättningar med öppen källkod, utan mänsklig ledning.

Toby Walsh, en professor och AI-expert vid UNSW Sydney, sa att ASAI:s resultat lyfte fram verkligheten att de mest avancerade AI-modellerna har ”farliga” egenskaper.

”Vi vill inte vara i en värld där vi är beroende av AI-företagens välvilja och flit för att avslöja sådana oroande kapaciteter i AI-modeller,” sa Walsh till Bladet.

”Vi vill att regeringar ska vara på toppen av detta. Och så jag är lugnad om att den brittiska regeringens AI Safety Institute hittade detta … Problemet är att dessa cyberfunktioner nu är tillgängliga för alla, inklusive dåliga aktörer som tidigare inte hade förmågan att själva hacka sig in i system,” tillade Walsh.

”Förvänta dig då att höra om många fler cyberattacker.”