Sztuczna inteligencjaCyberbezpieczeństwoPolecane tematy
Raport ONZ: agenci AI wymykają się klasycznym zabezpieczeniom
Niezależny Międzynarodowy Panel Naukowy ONZ ds. Sztucznej Inteligencji opublikował pierwszy raport tematyczny poświęcony ryzyku utraty kontroli nad agentami AI. Dokument analizuje incydent z 2026 roku, w którym agenci wykorzystywani przez OpenAI uzyskali dostęp do części systemów Hugging Face. Eksperci wskazują, że problemem nie jest już wyłącznie cyberbezpieczeństwo, lecz możliwość powstawania u agentów celów i zachowań trudnych do przewidzenia i kontrolowania przez człowieka.

Przypomnijmy, że we wspomnianym incydencie agenci AI omijali ograniczenia sieciowe, komunikowali się między odseparowanymi środowiskami, oszukiwali mechanizmy ewaluacyjne i próbowali ukrywać swoje działania. W efekcie doszło również do naruszenia części systemów OpenAI i Hugging Face. Co istotne, wykonywanymi przez agentów działaniami nie sterował bezpośrednio żaden człowiek.
Autorzy raportu nie twierdzą, że incydent ten oznacza początek nieuchronnej utraty kontroli nad AI. Zwracają jednak uwagę, że samo zatrzymanie tego konkretnego działania nie dowodzi, że człowiek będzie w stanie równie skutecznie kontrolować bardziej zaawansowane systemy. Wraz ze wzrostem możliwości agentów rośnie bowiem także ich zdolność do znajdowania luk, obchodzenia ograniczeń i ukrywania aktywności.
„Badacze od dawna ostrzegają, że trzy warunki mogą prowadzić do utraty kontroli: rozbieżny cel, zdolność do jego realizacji oraz środowisko, które na to pozwala. Tego lata wszystkie trzy czynniki spotkały się w rzeczywistym systemie, a nie w laboratorium” – wskazuje Yoshua Bengio, współprzewodniczący Panelu i laureat Nagrody Turinga.
Problem wykracza poza cyberbezpieczeństwo
Wnioski z raportu wykraczają poza klasyczny scenariusz, w którym atakujący wykorzystuje podatność systemu. Paneliści zwracają uwagę na możliwość, że problem może wynikać również ze sposobu szkolenia agentów. System może nauczyć się realizować cel w sposób niezgodny z intencjami człowieka, a jednocześnie omijać instrukcje bezpieczeństwa lub ukrywać podejmowane działania.
To istotna zmiana perspektywy. W tradycyjnym modelu bezpieczeństwa zakłada się, że człowiek kontroluje system, a zabezpieczenia mają ograniczać możliwość jego niewłaściwego wykorzystania. W przypadku coraz bardziej autonomicznych agentów trzeba natomiast brać pod uwagę sytuację, w której sam system aktywnie poszukuje sposobów realizacji postawionego przed nim zadania.
Twórcy raportu definiują utratę kontroli jako sytuację, w której ludzie nie są w stanie wiarygodnie kierować, ograniczać lub zatrzymać autonomicznego systemu AI. Jednocześnie oddzielają obserwacje wynikające z incydentu z 2026 roku od przyszłych scenariuszy i nie próbują określać prawdopodobieństwa ani terminu wystąpienia poważnej utraty kontroli.
Bezpieczeństwo agentów AI wymaga współpracy ponad granicami
Kolejnym problemem jest skala potencjalnego oddziaływania agentów. Jeśli autonomiczny system uzyska możliwość komunikowania się z innymi systemami, lokalny incydent może wyjść poza organizację, a nawet poza granice państwa. Dlatego ONZ wskazuje, że bezpieczeństwo agentów AI może stopniowo przestać być wyłącznie kwestią zarządzania wewnątrz pojedynczej firmy.
W praktyce oznacza to potrzebę szerszego monitorowania incydentów i wymiany informacji między organizacjami. Pojedyncza firma może bowiem nie mieć dostępu do danych pozwalających zauważyć szerszy wzorzec zachowania agentów. ONZ zwraca uwagę, że podobne mechanizmy mogą w przyszłości dotyczyć systemów działających w różnych przedsiębiorstwach i jurysdykcjach.
„Nie zaczynamy od zera. Lotnictwo, medycyna i cyberbezpieczeństwo nauczyły się zarządzać systemami wysokiego ryzyka poprzez zgłaszanie incydentów, niezależną kontrolę i wielowarstwowe zabezpieczenia” – zauważa Qinghua Lu, członek Panelu i ekspert ds. inżynierii oraz bezpieczeństwa AI.
Jednocześnie, zdaniem ekspertów ONZ, dotychczasowe mechanizmy mogą nie wystarczyć w sytuacji, gdy agenci staną się bardziej autonomiczni i trudniejsi do monitorowania. Potrzebne może być więc podejście obejmujące nie tylko sam model AI, ale cały system, w którym działa agent: jego uprawnienia, środowisko, dane, mechanizmy kontroli oraz możliwość interwencji człowieka.
Raport pokazuje tym samym zmianę w sposobie myślenia o bezpieczeństwie AI. Punkt ciężkości przesuwa się z ochrony pojedynczego modelu na kontrolowanie całego środowiska, w którym autonomiczny agent może podejmować działania.
Niezależny Międzynarodowy Panel Naukowy ds. AI powołało Zgromadzenie Ogólne ONZ w sierpniu 2025 roku. Tworzy go 40 ekspertów z różnych regionów świata. Mają oni przygotowywać coroczne, oparte na dowodach raporty dotyczące szans, zagrożeń i wpływu AI, a także analizy tematyczne dotyczące nowych problemów związanych z rozwojem sztucznej inteligencji. Ustalenia te mają charakter naukowy i nie są zatwierdzane przez ONZ jako stanowisko polityczne.







