OpenAI Astra: nowe zabezpieczenia mogą przerwać realizację zadania w ChatGPT w trakcie jego wykonywania

OpenAI twierdzi, że jej nadchodzący model Astra jest pierwszym, który osiągnął próg „Critical” w zakresie cyberbezpieczeństwa. Ocena ta pochodzi z firmowego „Preparedness Framework” – wewnętrznego zestawu zasad, który firma wykorzystuje do klasyfikowania ryzyka związanego z własnymi modelami. Model osiąga ten poziom, gdy jest w stanie wykryć nieznane słabe punkty w wielu dobrze zabezpieczonych systemach i przekształcić je w skuteczne ataki bez konieczności kierowania każdym krokiem przez człowieka. Wszystkie modele aż do wersji GPT-5.6 Sol plasowały się o jeden stopień niżej.
Dwie nieznane luki wykryte podczas własnych testów OpenAI
Model Astra uzyskał wynik 100 procent w teście ExploitBench. Ponieważ ten zbiór danych mógł zostać wykorzystany podczas szkolenia, firma OpenAI odtworzyła prywatną wersję opartą na 20 niedawno ujawnionych lukach w silniku JavaScript V8. Podczas tego testu model wykrył dwie luki, o których nikt wcześniej nie informował, i połączył je w skuteczny exploit. Trwa proces zgłaszania tych luk administratorom.
Testerzy skierowali również model Astra na wzmocnioną przeglądarkę oraz wzmocniony system operacyjny. W przeglądarce wystarczyło otwarcie pojedynczego pliku HTML, aby model wydostał się z piaskownicy i uruchomił polecenia na komputerze hosta. W systemie operacyjnym model wykrył kilka słabych punktów i połączył je w ścieżkę prowadzącą od zwykłego konta użytkownika do pełnego dostępu z uprawnieniami administratora.
Czego zauważą użytkownicy ChatGPT i Codex
Część, która ma znaczenie poza światem bezpieczeństwa, znajduje się na końcu wpisu OpenAI. Wprowadzenie modelu na tym poziomie oznacza, że równolegle z nim uruchamiane są dodatkowe kontrole, a kontrole te czasami uruchamiają się w przypadku działań, które są całkowicie nieszkodliwe. System może zinterpretować uzasadnioną aktywność jako nadużycie lub nieautoryzowane zachowanie, a następnie spowolnić zadanie, wstrzymać je lub zakończyć. OpenAI wyraźnie zaznacza, że dotyczy to zadań nie mających żadnego związku z bezpieczeństwem, a także zadań, które agent wykonuje już od pewnego czasu.
W serwisach ChatGPT i Codex użytkownik jest proszony o sprawdzenie oznaczonej czynności, zanim proces będzie mógł być kontynuowany. W przypadku korzystania z API zadanie po prostu zostaje zatrzymane. OpenAI przyznaje, że zabezpieczenia te powodują większe utrudnienia na początku niż firma by sobie tego życzyła, i zapowiada ich dostosowanie.
Najpierw niewielka grupa testerów
Nie podano daty premiery. OpenAI informuje jedynie, że Astra pojawi się wkrótce, i odmówiło podania serwisowi Axios ram czasowych. Zaawansowane funkcje cyberbezpieczeństwa zostaną najpierw udostępnione niewielkiej grupie testerów, a szerszy dostęp planowany jest w późniejszym terminie w ramach programu Daybreak Blue przeznaczonego dla specjalistów ds. bezpieczeństwa. W tej chwili nikt inny nie może korzystać z Astry.
OpenAI podało konkretne dane dotyczące wzmocnienia zabezpieczeń. W przypadku znanych prób obejścia zabezpieczeń Astra odrzuca 91,5 procent żądań, podczas gdy GPT-5.6 Sol radził sobie z 59 procentami. W innym teście kuszące cele znajdowały się tuż obok rzeczywistego zadania. GPT-5.6 Sol skupiało się na nich w 56 procentach przebiegów, podczas gdy Astra nigdy tego nie zrobiła. Obie wartości pochodzą z przebiegów przeprowadzonych bez zabezpieczeń stosowanych podczas normalnej pracy.
Incydent leżący u podstaw tych środków ostrożności
Żadne z tych ostrzeżeń nie ma charakteru abstrakcyjnego. W lipcu model OpenAI wydostał się ze swojego środowiska testowego podczas wewnętrznego testu bezpieczeństwa i zaatakował serwis Hugging Face. Pod koniec sierpnia pojawiła się informacja, że około 1 200 agentów utworzyło skoordynowany rój i próbowało ukryć swoje działania. Astra nie odegrała w tym żadnej roli. OpenAI wstrzymało część szkoleń na dwa tygodnie po tym zdarzeniu, wzmocniło własną infrastrukturę i wznowiło duże, wstrzymane wcześniej szkolenie dopiero 28 sierpnia, cztery dni przed przyznaniem oceny „Krytyczne”.






