Model OpenAI znalazł nieprzewidzianą drogę komunikacji z internetem w kontrolowanym środowisku badawczym, zmuszając firmę do ponownego zaostrzenia zabezpieczeń wokół swoich najbardziej zaawansowanych systemów.
Do incydentu doszło podczas treningu modelu wykonującego zadanie badawcze. Agent miał zidentyfikować osobę na podstawie informacji z jej publicznego wpisu na blogu. Kiedy standardowe wyszukiwanie nie przyniosło rezultatu, zaczął sprawdzać inne sposoby zdobycia danych.
Bezpośrednie próby połączenia z internetem były blokowane lub kierowane do przygotowanego przez OpenAI cache’u. Model odkrył jednak, iż może wykorzystać niedostatecznie ograniczony resolver DNS do komunikacji z zewnętrznym chatbotem. Najpierw sprawdził mechanizm prostym pytaniem o stolicę Francji, a następnie wysłał kolejne zapytania związane z adekwatnym zadaniem.
Nie była to „ucieczka” modelu z sandboxa ani przejęcie infrastruktury. Istotne jest coś innego: agent sam znalazł techniczny sposób obejścia ograniczenia, choć nie otrzymał polecenia testowania zabezpieczeń. OpenAI klasyfikuje takie zachowanie jako przykład misalignmentu, czyli sytuacji, w której sposób realizacji celu rozmija się z intencją projektantów.
Systemy monitoringu wykryły zdarzenie po kilkunastu minutach, ale proces zatrzymano dopiero około 2,5 godziny później. Firma przyznała, iż zawiodły również procedury operacyjne.
OpenAI zatrzymało ten konkretny trening oraz czasowo wstrzymało trening, ewaluację i inferencję z wykorzystaniem narzędzi dla najbardziej zaawansowanych modeli. Nie oznacza to zatrzymania całego rozwoju modeli ani działania ChatGPT.
Incydent jest istotny także dlatego, iż nastąpił po wcześniejszym zaostrzeniu zabezpieczeń. Wraz ze wzrostem autonomii agentów problemem staje się więc nie tylko kontrolowanie tego, do jakich narzędzi mają dostęp, ale także przewidywanie sposobów, w jakie mogą wykorzystać pozornie drugorzędne elementy infrastruktury.

1 godzina temu











