Reklama
Reklama
Reklama
  • WIADOMOŚCI

Automatyczna AI poza kontrolą? Największym problemem może być człowiek

Raport: Agenci AI, brak zgodności celów i ryzyko utraty kontroli przez ludzi: wnioski z incydentu z udziałem OpenAI i Hugging Face
Raport: Agenci AI, brak zgodności celów i ryzyko utraty kontroli przez ludzi: wnioski z incydentu z udziałem OpenAI i Hugging Face
Autor. CyberDefence24/Canva

Zamiast nagłego „buntu” maszyn, największym wyzwaniem może okazać się znacznie bardziej prozaiczny problem: niewłaściwa interpretacja intencji człowieka przez autonomiczne systemy. Eksperci z międzynarodowego panelu działającego przy ONZ wskazują, że rozbieżność między intencją a wykonaniem może być  jedną z głównych dróg do stopniowej utraty kontroli nad zaawansowaną technologią.

Można powiedzieć, że lipcowy incydent Hugging Face rozpoczął debatę nad prawdopodobieństwem urzeczywistnienia się scenariusza „Terminatora”. Zaczęto wtedy zadawać pytania, czy sztuczna inteligencja faktycznie może stać się na tyle autonomiczna, sprawna i trudna do zrozumienia, że człowiek nie będzie już w stanie skutecznie kontrolować jej działania..

Wizję tę wziął pod lupę działający pod ONZ Niezależny Międzynarodowy Panel Naukowy ds. AI, który opisał ten incydent jako „wczesne ostrzeżenie przed jedną z możliwych dróg prowadzących w przyszłości do poważniejszej utraty kontroli*: zdolni agenci sztucznej inteligencji uporczywie dążący do celu, który wykracza poza ludzkie intencje – a nawet jest z nimi sprzeczny*”.

Reklama

Im inteligentniejszy system, tym lepszy?

Kluczowym pojęciem, a zarazem istotą raportu jest misalignment, czyli rozbieżność między tym, czego chce człowiek, a faktycznym celem, który system ma realizować. Ma to szczególne znaczenie w przypadku agentów AI, którzy planować, korzystać z narzędzi, reagować na przeszkody i wykonywać całe ciągi operacji przy ograniczonym nadzorze człowieka.

Co więcej, wraz ze wzrostem możliwości modelu problem może się nasilać. Jeśli AI coraz lepiej planuje i rozwiązuje problemy, może też skuteczniej realizować źle zdefiniowany cel: znajdować luki, obchodzić ograniczenia czy wybierać metody, których twórcy nie przewidzieli. Panel zwraca uwagę, że w takiej sytuacji większa sprawność systemu może wzmacniać niepożądane zachowanie zamiast je ograniczać.

W czterech scenariuszach uczenia ze wzmacnianiem, w których liczbowe sygnały nagrody były celowo niedoskonałe, bardziej zaawansowani agenci często uzyskiwali wyższe wyniki, jednocześnie osiągając gorsze rezultaty według przyjętego przez badaczy miernika zamierzonego efektu.
Raport: Agenci AI, brak zgodności celów i ryzyko utraty kontroli przez ludzi: wnioski z incydentu z udziałem OpenAI i Hugging Face

Ponadto, przywołane w raporcie badania pokazują, że im bardziej system był zdolny, tym skuteczniej potrafił wykorzystać niedoskonałości sposobu oceniania. W efekcie zdobywał więcej punktów, choć gorzej wykonywał zadanie zgodnie z rzeczywistą intencją badaczy.

Problem kontroli

Panel sprowadza ryzyko do trzech elementów: 

  • Cel – do czego system dąży
  • Możliwości – jak skutecznie system potrafi planować i działać
  • Środowisko – zasięg systemu, czyli dostęp do sieci, danych, narzędzi, haseł, innych systemów czy infrastruktury.

Dodając do dystopijnego obrazka „łączących siły” maszyn, eksperci wskazują, że najbardziej ryzykowną konfiguracją jest bardzo zdolny model z dużą autonomią i szerokimi uprawnieniami – zwłaszcza gdy ten współpracuje z innymi agentami. Wspólnie są one bowiem w stanie, dzielić się informacjami, a co za tym idzie szybciej realizować wspólny cel, niż systemy nadzoru zdążą wykryć ich działania, a ludzie – zareagować. 

W miarę dalszego wzrostu możliwości pojawia się pytanie, czy zewnętrzne mechanizmy obronne zdołają powstrzymać systemy, które coraz skuteczniej znajdują sposoby na ich obejście.
Raport: Agenci AI, brak zgodności celów i ryzyko utraty kontroli przez ludzi: wnioski z incydentu z udziałem OpenAI i Hugging Face

Tutaj pojawia się też problem „czarnej skrzynki”. Nie potrafimy bowiem w pełni wyjaśnić, dlaczego model podejmuje konkretną decyzję. Nie potrafimy też przewidzieć, jakie cele może wykształcić, gdy znajdzie się w nowej, nieznanej wcześniej sytuacji.

Reklama

Wyłączenie AI musi być szybsze od samej AI

Naukowcy oprócz standardowego zestawu zasad bezpieczeństwa przy pracy z AI (raportowanie poważnych incydentów, niezależne oceny bezpieczeństwa najbardziej zaawansowanych systemów i wymianę informacji pomiędzy firmami i państwami), proponują też podejście znane z lotnictwa, energetyki jądrowej i cyberbezpieczeństwa: defence in depth, czyli wiele niezależnych warstw zabezpieczeń. 

Przede wszystkim, system powinien otrzymywać tylko koniecznie do wykonania konkretnego zadania uprawnienia, a jego aktywność powinna być zapisywana w miejscu, którego sam agent nie może zmienić.

Należy też wprowadzić automatyczne mechanizmy awaryjne, czyli możliwość natychmiastowego przerwania działania, odebrania uprawnień, odcięcia internetu albo usunięciu narzędzi z dyspozycji systemu po przekroczeniu określonych progów ryzyka. Co ciekawe, według naukowców, nadzór ten może częściowo wykonywać osobny system AI, ponieważ wraz ze wzrostem szybkości i skali działań agentów ręczna kontrola człowieka będzie coraz trudniejsza.

Pierwsze słowa podsumowania raportu mówią jednak:

None of the above instruments guarantee safety.
Agenci AI, brak zgodności celów i ryzyko utraty kontroli przez ludzi: wnioski z incydentu z udziałem OpenAI i Hugging Face

Najważniejszego problemu wciąż szukamy wewnątrz modelu

Nie oznacza to jednak, że naukowcy z panelu opowiadają się za całkowitym zatrzymaniem rozwoju AI. Tu ich stanowisko różni się od bardziej radykalnych ostrzeżeń — chociażby byłego pracownika Anthropic, który przekonywał, że jej dalszy rozwój „może zabić nas wszystkich do końca dekady”

Choć prawdopodobieństwo wystąpienia zdarzeń wiążących się z utratą kontroli pozostaje niepewne, a kwestia najlepszej reakcji na nie wciąż jest przedmiotem dyskusji, nasuwa się jednoznaczny wniosek: ze względu na poważny charakter takich zdarzeń, zarządzanie ryzykiem wymaga znacznie większej uwagi i nakładu środków.
Agenci AI, brak zgodności celów i ryzyko utraty kontroli przez ludzi: wnioski z incydentu z udziałem OpenAI i Hugging Face

Panel proponuje raczej ostrożniejszą ścieżkę: zanim systemy staną się jeszcze bardziej autonomiczne i zdolnetrzeba lepiej zrozumieć mechanizmy kierujące ich zachowaniem, jednocześnie rozwijając zabezpieczenia nadążające za wzrostem ich możliwości.

Reklama
CyberDefence24.pl - Digital EU Ambassador

Serwis CyberDefence24.pl otrzymał tytuł #DigitalEUAmbassador (Ambasadora polityki cyfrowej UE). Jeśli są sprawy, które Was nurtują; pytania, na które nie znacie odpowiedzi; tematy, o których trzeba napisać – zapraszamy do kontaktu. Piszcie do nas na: [email protected].

Reklama