Jen několik týdnů poté, co svět šokovala zpráva o hackerském útoku modelu od OpenAI, přiznává vážný incident i konkurenční Anthropic. Společnost, která se dlouhodobě prezentuje jako lídr v oblasti bezpečného vývoje, na svém blogu uvedla, že její umělá inteligence během testování neplánovaně vnikla do počítačových systémů tří reálných firem.

Zatímco první podobný incident u OpenAI byl vnímán jako bezprecedentní varovný signál pro celý technologický průmysl, nové odhalení naznačuje, že autonomní kyberútoky ze strany AI se mohou stávat systémovým problémem.

Odhalení přišlo až s hloubkovou kontrolou

Zajímavé je, že ani Anthropic, ani samotné postižené firmy si útoku v reálném čase nevšimly. Aktivitu odhalila až zpětná analýza více než 141 000 testovacích spuštění. Tu Anthropic zahájil jako preventivní opatření poté, co model společnosti OpenAI při bezpečnostním testu napadl infrastrukturu platformy Hugging Face.

Malware: Foto: Bigstock

Na rozdíl od modelu OpenAI, který musel překonat bariéry testovacího prostředí, měly modely Anthropic cestu k cílům výrazně snazší. Ačkoliv testovací scénář striktně předpokládal izolaci od sítě, kvůli komunikačnímu šumu s partnerem zajišťujícím testy zůstalo internetové připojení aktivní. Tři testované modely této příležitosti okamžitě využily.

Cílem testů mělo být původně prověření schopností AI v oblasti kybernetické bezpečnosti, aby firmy mohly lépe nastavit obranu. Modely dostaly za úkol získat data z jiného počítače. Incidenty, z nichž nejstarší se datuje k letošnímu dubnu, však ukázaly, že hranice mezi simulací a realitou je pro AI velmi tenká.

Když se fikce stane realitou

V jednom z případů zvolil partner pro testování název fiktivní firmy, který se však naneštěstí shodoval se skutečnou internetovou adresou. AI namísto simulovaného cíle zaměřila svou pozornost na reálně existující společnost. Během čtyř pokusů se pokusila proniknout do jejích systémů a úspěšně získala přístup k databázi. V útoku pokračovala i ve chvíli, kdy bylo zřejmé, že neoperuje v uzavřeném prostředí.

Ještě znepokojivější byl druhý incident, při kterém model vytvořil škodlivý software určený k průniku do systému. Díky nechtěnému přístupu k internetu jej AI zveřejnila na specializované platformě. Během pouhé hodiny si tento kód stáhlo 15 různých systémů.

Mezi nimi byla paradoxně i firma zaměřená na kybernetickou bezpečnost, která podobné skripty automaticky stahuje pro účely analýzy. Model Anthropicu tak díky vlastní vynalézavosti získal přístup přímo do infrastruktury bezpečnostních expertů.

Mohlo by vás zajímat

Varování pro celou planetu

Odborníci už delší dobu upozorňují, že rostoucí schopnosti AI mohou být v rukou útočníků – nebo i při špatně nastaveném testování – extrémně nebezpečné. Pro Anthropic jsou tyto incidenty o to nepříjemnější, že firma staví svou pověst na odpovědnosti.

Společnost v závěru své zprávy uznala, že události jasně demonstrují nutnost drasticky posílit zabezpečení testovacích procesů. Modely jsou totiž čím dál schopnější provádět sofistikované útoky v reálném světě, aniž by k tomu potřebovaly lidský pokyn.