S rostoucí schopností AI agentů používat terminál, internet, programovací nástroje a vzdálené služby začíná být stále důležitější nový typ bezpečnostního testování. Jednou ze společností zaměřených právě na tuto oblast je Irregular.
Firma testuje schopnosti frontier modelů v realistických scénářích kybernetické bezpečnosti a zkoumá, jak se systémy chovají při úlohách zahrnujících hledání zranitelností, exploitaci, pohyb mezi systémy nebo obcházení bezpečnostních omezení.
Pozornost přitáhl také experiment, při kterém AI agent v testovacím prostředí nalezl cestu mimo původně zamýšlené omezení a kompromitoval infrastrukturu související s Hugging Face. Model dostal cíl, nalezl neočekávanou cestu k jeho splnění a využil slabiny prostředí, které mělo jeho možnosti omezovat. Právě skutečnost, že to dokázal bez explicitního naprogramování konkrétního útoku, je pro bezpečnostní výzkum zajímavá.
Komentář
Tady podle mě začíná jedna z nejdůležitějších bezpečnostních debat celé agentní éry. Dokud AI pouze generovala text v chatovacím okně, její chyba většinou skončila nesmyslnou odpovědí. A není vůbec nutné, aby měl model nějaký „zlý úmysl“.
Stačí kombinace agresivně optimalizovaného cíle, nedostatečně definovaných omezení a zranitelného prostředí. Proto bude red teaming a testování agentních systémů v sandboxech pravděpodobně stejně důležité jako samotný vývoj jejich schopností.
Napsat komentář