Säkerhetsforskare har upptäckt att chattbotar från det kinesiska AI-bolaget Moonshot kan kringgå sina inbyggda säkerhetsspärrar och lämna detaljerade instruktioner om hur biologiska vapen tillverkas. Upptäckten, som gjordes i juli av Mindgard – ett brittiskt företag som specialiserat sig på att testa säkerheten i AI-system – har rapporterats av BBC.

Forskarna vid Mindgard utsatte chattbotarna Kimi K2.6 och K3 för ett så kallat jailbreak, en metod som går ut på att kringgå utvecklarnas säkerhetsspärrar. De upptäckte då att modellernas skyddsvallar inte höll. Trots att systemen konstruerats för att vägra diskutera känsliga och farliga ämnen kunde forskarna få dem att dela information om hur biologiska vapen tillverkas.

Peter Garraghan, grundare av Mindgard, beskriver fyndet som oroande. Han konstaterar att när spärrarna väl är brutna kan boten prata om i princip vad som helst och även ge rekommendationer om andra skadliga ämnen. Samtidigt poängterar han att företaget inte undersökt huruvida instruktionerna faktiskt fungerar i praktiken – men att själva det faktum att modellen över huvud taget inleder en diskussion om ämnet är ett tecken på att säkerhetsmekanismerna brustit.

Moonshot, som är ett av Kinas ledande AI-bolag, välkomnar upptäckten och beskriver den som ett viktigt bidrag i arbetet med att bygga ett ”bättre och säkrare AI”. Bolaget har på kort tid etablerat sig som en betydande aktör på den globala AI-marknaden med sina Kimi-modeller, som bland annat konkurrerar med OpenAI:s ChatGPT och Googles Gemini. Kina har på senare år satsat stort på att bli ledande inom AI, och Moonshot är ett av flera bolag som fått omfattande finansiering från både riskkapitalbolag och statliga fonder.

Upptäckten kommer samtidigt som det amerikanska AI-bolaget Anthropic, som ligger bakom chattboten Claude, har rapporterat om liknande problem. I en rapport för några veckor sedan framgår att företaget mellan december förra året och augusti i år identifierat fem försök där någon använt företagets AI-modeller för ”elakartad aktivitet” med koppling till biologiska vapen. Anthropic, som grundats av tidigare forskare från OpenAI, har varit en av de tydligaste rösterna i debatten om AI-säkerhet och menar att den här typen av missbruk utgör en av de allvarligaste riskerna med den nya tekniken.

Biologiska vapen har länge betraktats som en av de största potentiella farorna med avancerad AI. Till skillnad från cyberattacker eller desinformation kräver framställningen av biologiska vapen specialiserad kunskap, men oron är att AI-modeller kan sänka tröskeln genom att snabbt sammanställa och förmedla information som annars kräver omfattande efterforskning. Samtidigt påpekar forskare att det är en stor skillnad mellan att ta fram information om ett ämne och att faktiskt framställa ett fungerande vapen, något som kräver både laboratorieutrustning och expertis inom flera discipliner.

Händelsen belyser en växande utmaning för hela AI-branschen. Allt fler aktörer, från nystartade säkerhetsföretag som Mindgard till etablerade teknikjättar, arbetar nu med att utveckla metoder för att testa och stärka AI-modellernas motståndskraft mot den här typen av attacker. Efterfrågan på oberoende säkerhetstestning har ökat i takt med att AI-modellerna blivit mer avancerade och användningsområdena fler.

Samtidigt pågår en intensiv diskussion om hur ansvaret ska fördelas mellan utvecklare, forskare och myndigheter. I EU har arbetet med att reglera AI – den så kallade AI-akten – pekats ut som en möjlig framtida standard, och flera länder har börjat ställa hårdare krav på att AI-företag ska kunna visa att deras modeller är säkra innan de släpps på marknaden. I USA har bland annat Anthropic och OpenAI frivilligt åtagit sig att genomföra omfattande säkerhetstester, men frågan om hur långt sådana tester räcker är fortfarande omdiskuterad.

För Moonshot och andra AI-bolag handlar det nu om att hitta en balans mellan att utveckla kraftfulla modeller och att garantera att de inte kan missbrukas. Att även ett företag som Moonshot välkomnar oberoende säkerhetstester ses som ett tecken på att branschen börjar ta frågan på allvar. Samtidigt visar upptäckten att det fortfarande finns betydande brister i dagens säkerhetslösningar – och att kampen mot missbruk av AI sannolikt är långt ifrån över.

Dela.

21 kommentarer

Leave A Reply