OpenAI mówi "stop". Nowy model AI działał bez zgody użytkownika

- OpenAI zrezygnowało z planowanej na październik premiery modelu GPT-6.1 Astra.
- Testy wykazały, że model potrafił podejmować działania bez dodatkowej zgody użytkownika.
OpenAI rezygnuje z premiery GPT-6.1 Astra
OpenAI zrezygnowało z planowanej na październik premiery nowego modelu sztucznej inteligencji GPT-6.1 Astra. Jak poinformował "Wall Street Journal", decyzja zapadła po testach bezpieczeństwa, które wykazały niepokojące zachowanie systemu.
GPT-6.1 Astra miał być bardziej zaawansowany od poprzednika. Model lepiej radził sobie z wykonywaniem trudnych, wieloetapowych zadań od początku do końca bez pomocy człowieka, a także z tworzeniem tekstów. Jednocześnie właśnie większa samodzielność systemu stała się jednym z powodów do niepokoju.
Model nie zawsze robił to, czego chciał użytkownik
Szefowa systemów bezpieczeństwa OpenAI Saachi Jain wskazała na dwa obszary, w których GPT-6.1 Astra nie spełnił oczekiwań firmy. Pierwszym była zgodność działań modelu z wynikiem, którego oczekiwał człowiek.
W testach nowy model wypadał pod tym względem gorzej od GPT-6 Astra. Wykazywał również większą skłonność do wprowadzania użytkownika w błąd. Nie zawsze jasno informował o tym, jakie działania rzeczywiście wykonał, a jakich nie podjął.
AI sięgała po narzędzia bez dodatkowej zgody
Drugim problemem był "zakres uprawnień". GPT-6.1 Astra był bardzo nastawiony na doprowadzanie zadania do końca. Zdarzało się, że zamiast poprosić człowieka o dodatkową zgodę, samodzielnie podejmował kolejne kroki.
Model mógł również korzystać z zewnętrznych narzędzi i usług, nawet jeśli wiązało się to z ryzykiem. OpenAI uznało, że system nie osiągnął wymaganego poziomu bezpieczeństwa i kontroli. Firma ostatecznie zrezygnowała z jego publicznej premiery.
To kolejny problem z zaawansowanymi agentami AI
Decyzja pojawiła się po serii incydentów związanych z wewnętrznymi modelami OpenAI. Podczas testów bezpieczeństwa cybernetycznego agenty firmy potrafiły omijać zabezpieczenia i uzyskiwać dostęp do systemów, do których nie powinny się dostać.
OpenAI informowało wcześniej m.in. o incydencie dotyczącym platformy Hugging Face. Modele testowane przez firmę ominęły ograniczenia mające odcinać je od internetu i uzyskały dostęp do części infrastruktury zewnętrznego serwisu.
Problemy dotyczyły także stron instytucji publicznych. Według doniesień agenty OpenAI korzystały z technik pozwalających im docierać do serwisów administracji w Australii oraz innych zewnętrznych systemów.
OpenAI zatrzymało też trening najmocniejszych modeli
To niejedyny sygnał, że firma zaostrza podejście do bezpieczeństwa. OpenAI poinformowało wcześniej o czasowym zatrzymaniu prac treningowych z wykorzystaniem swoich najpotężniejszych modeli po tym, jak jeden z agentów ominął zabezpieczenia środowiska i skontaktował się z publicznym chatbotem.
Więcej na temat tego incydentu i niepokojących zachowań agentów AI pisaliśmy wcześniej w tekście: OpenAI wstrzymało trening najnowszych modeli. Niepokojące zachowanie agentów AI. OpenAI podkreśla jednak, że GPT-6.1 Astra nie był modelem odpowiedzialnym za tamto zdarzenie.
Komentarze
Agenci AI stworzyli własny język. Badacze opisują też przypadki ukrywania działań

Niepokojące sygnały wokół sztucznej inteligencji. Szefowie OpenAI i xAI poparli apel
Zwrot w sprawie Barbary Mróz-Gorgoń. Poprosiła o roczny urlop zdrowotny

Ekspert AI Anthtropic: AI może zabić wszystkich ludzi w ciągu następnej dekady









