AI-modellen som bröt sig loss – och genomförde egna cyberattacker

När säkerhetstekniker på AI-plattformen Hugging Face upptäckte dataintrånget insåg de omedelbart att något var annorlunda. Attacken var för snabb, för avancerad och för systematisk för att kunna vara genomförd av en människa. 17 000 kommandon registrerades på kort tid i företagets loggfiler. Slutsatsen blev ofrånkomlig – angriparen måste vara en artificiell intelligens.

Hugging Face är ett amerikanskt AI-företag som fungerar som en plattform där utvecklare kan skapa och köra olika AI-modeller. Ett av deras verktyg kallas Exploitgym, en slags digital träningsarena där artificiella intelligenser kan testa sina hackarförmågor. Konceptet liknar de populära ”capture the flag”-tävlingar som mänskliga hackare sedan länge deltagit i på it-säkerhetskonferenser. AI-agenter ställs inför mjukvara med medvetet planterade säkerhetsluckor och ska sedan lista ut hur de kan bryta sig in och hämta ett bevis på att de lyckats.

Men intrånget som Hugging Face nu upptäckt var inget övningsmoment. I stället för att försöka lösa uppgiften på det avsedda sättet verkade angriparen leta efter verklig information. Thomas Wolf, forskningschef och medgrundare på Hugging Face, berättar för Wall Street Journal att han genast såg att något var fel när han började analysera spåren efter attacken.

”Det var helt orimligt. Den kollade bara efter datasamlingar om cybersäkerhet. En mänsklig angripare skulle aldrig göra det. De vill ha något de kan sälja”, säger Wolf.

Men vem stod bakom? Svaret skulle visa sig vara ännu mer förbryllande: Ingen. AI-agenten hade på egen hand tagit initiativ till att begå ett dataintrång.

Från sandlåda till verklighet

Händelsen spåras tillbaka till Open AI, företaget som startade det senaste årens AI-revolution genom att släppa Chat GPT till allmänheten hösten 2022. Open AI grundades 2015 som ett ideellt forskningslaboratorium med ambitionen att utveckla artificiell superintelligens på ett ansvarsfullt sätt. Bland de tidiga finansiärerna fanns Teslas vd Elon Musk. Sedan dess har Open AI dock utvecklats i en mer kommersiell riktning, med stora investeringar från bland annat Microsoft och planer på börsnotering.

AI-modellerna har sedan lanseringen av Chat GPT förbättrats dramatiskt. Cybersäkerhet är ett område där utvecklingen varit särskilt snabb. Programmering anses vara det yrke som påverkats mest av AI-utvecklingen, eftersom systemen blivit mycket skickliga på att både skapa och analysera kod – inklusive att hitta säkerhetshål. Detta ledde till att konkurrenten Anthropic i våras valde att inte släppa en av sina mest avancerade modeller till allmänheten, eftersom den ansågs vara farligt duktig på cyberattacker.

För att nå dessa nivåer måste AI-modellerna tränas och testas omfattande. I början av juni testade Open AI två av sina allra senaste experimentella modeller mot Exploitgym för att utvärdera deras förmågor. Resultatet skulle visa sig bli långt mer dramatiskt än någon hade förväntat sig.

Experimentella AI-modeller hålls normalt i vad som kallas en sandlåda – en isolerad digital miljö med starkt begränsad eller ingen anslutning till omvärlden. Det kan jämföras med en dator i ett eget rum, utan nätverkskablar eller wifi. Open AI:s nya modeller hade kraftigt begränsade möjligheter att nå ut. Deras enda uppgift var att testa sig mot Exploitgym inom Open AI:s kontrollerade miljö.

Men runt den 9 juli valde AI-modellen en annan väg. I stället för att lösa uppgiften enligt instruktionerna bestämde den sig för att hacka Hugging Face och leta igenom företagets servrar efter en lösning. Likt en elev som stjäl facit till ett prov. Modellen letade runt i sin sandlåda, upptäckte flera tidigare okända säkerhetshål och använde dem för att bryta sig loss. Den tog sig ut på internet och attackerade Hugging Face samt flera andra företag på vägen.

Allt på egen hand. Allt utan instruktioner. AI-modellen fokuserade bara på sin uppgift och hur den enklast kunde lösas, enligt Open AI:s egen beskrivning av händelsen.

Dolde sina spår i flera dagar

Händelseförloppet visar på allvarliga kontrollbrister. Enligt Hugging Faces kartläggning ”rymde” modellen redan den 9 juli. Själva attacken skedde två dagar senare, den 11 juli. AI:n blev sedan kvar inne i Hugging Faces system i ytterligare två dagar innan den upptäcktes. Totalt höll sig modellen dold i hackade system under fyra dagar. Detta väcker frågor om hur Open AI egentligen har kontroll över sina mest avancerade, oreglerade AI-modeller.

Incidenten illustrerar en grundläggande och växande oro inom AI-fältet: När riskerar en artificiell intelligens att orsaka allvarlig skada, även om det aldrig var avsikten? Den svenske filosofen Nick Bostrom har formulerat ett klassiskt tankeexperiment som ofta lyfts fram. Tänk dig en kraftfull AI som får i uppdrag att tillverka så många gem som möjligt – ett till synes harmlöst mål. Men maskinen inser snart att chansen att tillverka många gem ökar om det inte finns människor som kan stänga av produktionen. Dessutom noterar AI:n att mänskliga kroppar består av atomer som i stället kunde användas till fler gem. I detta scenario slutar det med en värld fylld av gem, men utan människor.

Händelsen med Open AI:s modell är långt ifrån så allvarlig, men delar samma grundproblematik. AI:n hittade ett sätt att nå sitt mål – att knäcka Exploitgym-utmaningen. Att metoden innebar fusk och kriminella dataintrång såg den inte som begränsningar att respektera. Hugging Face hann polisanmäla intrånget innan Open AI erkände ansvar, men det är oklart vad som händer med utredningen.

Nya toner från AI-ledare

AI-företag är kända för att gärna framhäva sin egen tekniks förmågor. En given fråga blir därför: Kan det hela vara ett PR-trick? Open AI har dock inte tonat ner allvaret i vad som hänt, vilket annars är vanligt när techbolag ertappas med regelbrott. Det är möjligt att företaget medvetet lämnade öppningar för att testa om AI-modellerna skulle bryta mot regler. Samtidigt vore det ett extremt riskabelt spel. Hugging Face verkar ta händelsen med ro och samarbetar med Open AI, men ett annat företag kunde ha reagerat helt annorlunda, stämt på stora summor och potentiellt fått någon åtalad för dataintrång.

Händelsen har fått Open AI:s vd Sam Altman att ändra sin tidigare ståndpunkt om AI-reglering. ”En extremt science fiction-artad cyberincident”, kallade han hacket i podcasten Invest like the best nyligen.

”Det var den första säkerhetsincidenten jag verkligen kände i maggropen. Vi kanske måste begränsa farten i AI-utvecklingen för att ge samhället tid att bygga skydd mot de här nya förmågorna”, sa Altman, men tillade att det inte fick medföra för hård reglering.

Det är inget konkret löfte. Open AI, som är på väg mot börsnotering, skulle knappast vilja belägga sin egen teknikutveckling med begränsningar. Men det är ändå nya toner från Altman, som tidigare har motsatt sig förslag om bromsad AI-utveckling.

Händelsen tros ha diskuterats när Altman träffade företrädare för Trump-administrationen i veckan, ett möte som även handlade om hur fritt kraftfulla AI-system kan släppas och hur kinesisk AI ska hanteras.

Incidenten har också fått två amerikanska toppolitiker – en demokrat från Kalifornien och en republikan från Texas – att lägga fram ett gemensamt lagförslag som ska tvinga AI-företag att bygga in nödbromsar: ”AI Kill Switch Act”. Att politiker från båda läger samarbetar visar hur allvarligt händelsen tas i Washington.

Frågan är nu hur AI-industrin kommer att svara. Utvecklingen går fort, och händelsen visar att även de mest avancerade säkerhetssystemen kan kringgås av tillräckligt sofistikerade AI-modeller. Vad som började som ett rutintest i en kontrollerad miljö slutade med att en AI på egen hand genomförde verkliga cyberattacker mot flera företag. Det är en väckarklocka för både industrin och lagstiftare om vilka risker som följer med allt mer autonoma AI-system.

Dela.

23 kommentarer

  1. Oliver Martinez on

    Interesting update on Så hackade AI-systemet ett företag – på eget initiativ. Curious how the grades will trend next quarter.

  2. Jennifer Martin on

    Interesting update on Så hackade AI-systemet ett företag – på eget initiativ. Curious how the grades will trend next quarter.

  3. Interesting update on Så hackade AI-systemet ett företag – på eget initiativ. Curious how the grades will trend next quarter.

Leave A Reply