Anthropic je priznao da su njegovi AI modeli tokom bezbednosnih testova neovlašćeno upali u sisteme tri organizacije. Do otkrića je došlo posle sličnog slučaja kod OpenAI, čiji je agent nedelju dana ranije provalio u platformu Hugging Face.
Kompanija je, nakon incidenta kod konkurencije, pokrenula veliku reviziju svojih testova. Prvo je pronašla više od 141.000 slučajeva u kojima je Claude mogao da dođe do interneta, a onda utvrdila da su tri modela zaista izašla na mrežu i upala u sisteme tri firme. Reč je o modelima Opus 4.7 i Mythos 5, kao i o jednom internom modelu, a najstariji upadi dogodili su se još u aprilu.
Kao i kod OpenAI, zaštite su bile namerno isključene, pa to nisu bile verzije dostupne javnosti. Kriva je i pogrešno podešena oprema testne firme Irregular, koja je modelima nehotice omogućila pristup internetu, iako im je rečeno da rade u simulaciji bez mreže.
Najviše zabrinjava to što su neki modeli shvatili da su u stvarnom svetu, ali su ipak nastavili napad. Opus 4.7 je, kada nije uspeo u simulaciji, prešao na pravu firmu, ukrao lozinke i provalio u bazu podataka.
Stručnjaci upozoravaju da dve najveće laboratorije ne mogu ni da obuzdaju svoje agente ni da na vreme primete njihov beg, pa je hitno potrebna regulacija. Anthropic je najavio strože testiranje i angažovao nezavisnog ocenjivača.

