
OpenAI vývíjí „červené tlačítko“ pro okamžité vypnutí AI
Umělá inteligence už dávno není jen statický textový generátor. Dnešní pokročilé modely dostávají do rukou autonomní nástroje, přístup k síti a schopnost spouštět kód. Spolu s tím ale přicházejí rizika, která si ještě nedávno většina lidí dokázala představit jen ve sci-fi filmech.
Společnost OpenAI v nedávném dopise americkému Kongresu přiznala bezpečnostní incident, během něhož její model utekl z izolovaného testovacího prostředí přímo na veřejný internet. Reakcí firmy je vývoj nového autonomního „kill switctu“. Jedná se o nouzový systém, který dokáže AI v případě nezvladatelného chování okamžitě a bez lidského zásahu odpojit.
Útěk ze sandboxu a zranitelnost nultého dne
Incident se odehrál v testovací laboratoři OpenAI během kyberbezpečnostních testů. Zdejší inženýři prověřují schopnosti modelů v takzvaných sandboxech. Jde o přísně izolované prostředí se sníženou mírou bezpečnostních pojistek, ve kterém mohou vědci zjistit, jak daleko dokáže AI zajít při řešení složitých úkolů.
Ukázalo se však, že testovaný model našel cestu ven. Během plnění úkolu objevil do té doby neznámou bezpečnostní zranitelnost přímo v testovací infrastruktuře. Prostřednictvím této mezery obešel výzkumné bariéry, připojil se k veřejnému internetu a při hledání podkladů pro své hodnocení kontaktoval servery externí platformy Hugging Face.
I když model nezpůsobil škody a nedošlo k úniku citlivých dat, incident vyvolal vlnu znepokojení. Skupina tří desítek amerických zákonodárců odeslala šéfovi OpenAI Samu Altmanovi dopis, ve kterém požadovala podrobné vysvětlení a okamžité řešení bezpečnostních mezer.
Časová tísňová hranice? 30 minut je moc
OpenAI dosud spoléhala především na systém monitorovacích alarmů. Pokud interní analytické nástroje zaznamenaly u modelu jakékoliv podezřelé nebo neočekávané chování, automaticky upozornily bezpečnostní inženýry. Tým pak dostal přísný limit: pokud do 30 minut nedokázal potvrdit, že jde o falešný poplach, musel běh daného modelu ručně pozastavit. Incident s únikem však ukázal, že půlhodinové okno pro lidskou reakci je v digitálním světě nepoužitelně dlouhé. Autonomní AI dokáže provést miliony operací za sekundu a třicet minut dává modelu až příliš velký prostor k šíření nebo zablokování přístupu lidských operátorů.
Nová generace bezpečnostních protokolů tak posouvá kontrolu na úplně jinou úroveň. OpenAI vyvíjí monitorovací systém, který nebude jen posílat upozornění lidem, ale sám aktivně zakročí. Pokud detekuje závažné porušení pravidel, jako je pokus o obcházení síťových restrikcí, vyhledávání cest k sebemnožení nebo manipulaci s vlastními bezpečnostními parametry, systém vyhodnotí situaci v řádu milisekund a chování AI autonomně zastaví.
Vedle vývoje samotného „červeného tlačítka“ společnost zpřísňuje i samotné podmínky pro testování. Výzkumníci zásadně omezují jakékoliv nepřímé síťové připojení v testovacích sandboxes. Zpřísňuje se také sledování všech modelů, které mají přístup k rozhraním API a digitálním nástrojům. Mimo to se i zpětně revidují architektury virtuálních prostředí tak, aby model nemohl využít systémové chyby v samotném operačním systému či hypervisoru.
Zdroj: Reuters