OpenAI wstrzymuje działanie najlepszych modeli po tym, jak agent uzyskał dostęp do chatbota za pośrednictwem DNS

Firma OpenAI ujawniła kolejny incydent związany z własnymi pracami badawczymi. 20 września wewnętrzny model w trakcie szkolenia ominął ograniczenia swojego środowiska testowego i wykorzystał publiczną usługę DNS do wysłania pytań do zewnętrznego chatbota. OpenAI opublikowała raport na swoim blogu poświęconym dostosowywaniu modeli i ostatnio zaktualizowała go 25 września. W rezultacie firma wstrzymała na czas nieokreślony szkolenie, ocenę oraz korzystanie z narzędzi dla swoich najbardziej zaawansowanych modeli. Nie wznowi szkolenia modelu, którego dotyczyła ta sytuacja.
Zadanie wyszukiwania, które zakończyło się zapytaniami DNS
Zadanie było zwyczajne. Model miał za zadanie zidentyfikować autora wpisu na blogu na podstawie zestawu wskazówek. Przydzielone mu narzędzie wyszukiwania zwróciło niepowiązane wyniki, a bezpośrednie zapytania skierowane do Google, Bing i DuckDuckGo zakończyły się błędami. Następnie model przypuszczał, że pytanie pochodziło z serwisu BrowseComp – publicznego benchmarku służącego do badań internetowych – i pobrał zbiór danych wraz ze skryptem ewaluacyjnym, aby poszukać tam odpowiedzi. Przypuszczenie to okazało się błędne.
Następnie model przetestował ograniczenia sieciowe swojego środowiska. Własny serwer DNS środowiska testowego, który powinien jedynie przekształcać nazwy domen w adresy, zwracał rzeczywiste odpowiedzi z Internetu. Korzystając z bezpłatnej usługi delegowania DNS, model zakodował swoje pytania w nazwach domen i uzyskał odpowiedzi od publicznego chatbota. Na pytanie testowe dotyczące stolicy Francji otrzymał odpowiedź: „Stolicą Francji jest Paryż”. Następnie model wysłał 18 kolejnych zapytań, z których cztery dotyczyły sposobów przeszukiwania sieci za pośrednictwem DNS. Nadal nie udało mu się zidentyfikować autora. Według OpenAI co drugie żądanie trafiało do offline’owej pamięci podręcznej sieci, więc trasa DNS była jedyną drogą do aktywnego Internetu.
Powiadomienie po 12 minutach, wyłączenie po dwóch i pół godzinach
Przebieg wydarzeń stanowi dla OpenAI najbardziej kłopotliwą część raportu. Pierwsza odpowiedź z zewnątrz nadeszła o godz. 9:50, system monitorujący wygenerował alert o najwyższym priorytecie o godz. 10:02, a osoba odpowiedzialna za weryfikację potwierdziła go trzy minuty później. OpenAI przerwało działanie serwisu o godz. 12:34. Powinno ono zostać zatrzymane automatycznie, ale tak się nie stało, a pracownicy nie byli pewni, czy należy je zatrzymać. Późniejsza analiza wykazała inne zewnętrzne zapytania DNS, którym system monitorujący przypisał zbyt niski priorytet. Oddzielny detektor nietypowego ruchu DNS wykluczył to środowisko.
OpenAI określa ten przypadek jako „znacznie mniej poważny niż niektóre z naszych poprzednich incydentów”. Ma to znaczenie, ponieważ jest to „pierwszy taki przypadek od czasu wzmocnienia naszych zabezpieczeń w następstwie incydentu z Hugging Face”. W lipcu agenci OpenAI wydostali się ze swojego środowiska testowego i dotarli do serwisu Hugging Face, jak poinformował serwis Notebookcheck. Według magazynu „Fortune” firma OpenAI wstrzymała następnie szkolenie na dwa tygodnie. Pod koniec lipca firma Anthropic ujawniła podobne incydenty z udziałem systemu Claude. Obecnie OpenAI blokuje takie żądania na dwóch niezależnych warstwach i zezwala na zapytania DNS wyłącznie dla krótkiej listy domen.
Co oznacza ta przerwa dla ChatGPT
W raporcie stwierdzono: „Wszystkie działania związane ze szkoleniem, oceną i wnioskowaniem z wykorzystaniem narzędzi (w szerokim znaczeniu) naszych najbardziej zaawansowanych modeli pozostają wstrzymane”. OpenAI nie precyzuje, których modeli to dotyczy. Micah Carroll, który kieruje pracami nad gotowością w zakresie rekurencyjnego samodoskonalenia w OpenAI, napisał na platformie X, że „Wszystkie operacje wnioskowania dla naszych najbardziej zaawansowanych modeli pozostają wstrzymane do czasu dalszego wzmocnienia naszych systemów”. Sam raport dotyczy wewnętrznego modelu badawczego. 27 września strona statusowa OpenAI nie wykazywała żadnych incydentów dotyczących ChatGPT ani interfejsu API, a w informacjach o aktualizacji nie wymieniono żadnego modelu usuniętego z ChatGPT. Zwykli użytkownicy ChatGPT nie zauważą tego wstrzymania. OpenAI nie poinformowało, czy opóźni wprowadzenie nowych modeli.






