Ostatnio coraz częściej można przeczytać, że AI „próbowało kogoś szantażować”, „zhakowało system”, „oszukiwało”, „ukrywało swoje działania”, a pewnego dnia zapewne wstanie rano i uzna, że ludzie są już niepotrzebni.

Brzmi świetnie. Szczególnie jako nagłówek.

Tylko problem z AI jest trochę inny.

AI nie siedzi sobie gdzieś w cyfrowej piwnicy, patrząc na nasze zdjęcia z wakacji i planując, jak przejąć świat.

Nie nudzi się.

Nie ma złego humoru.

Nie obraża się na ludzi.

Nie leży wieczorem i nie rozmyśla: „Marcin wyłączył mnie wczoraj o 22:14. Zapamiętam to sobie”.

Dostaje zadanie.

I próbuje je wykonać.

To właśnie jest dużo ciekawsze i, paradoksalnie, potencjalnie dużo bardziej niebezpieczne.

Wyobraźmy sobie banalny przykład.

Dajemy agentowi AI polecenie:

„Kup mi dwa bilety na koncert. Nieważne jak, chcę tam być”.

AI wchodzi na stronę.

Biletów nie ma.

Dla człowieka sprawa jest prosta. Wyprzedane. Trudno. Wracamy do domu i narzekamy na Ticketmastera.

Ale agent niekoniecznie interpretuje to w ten sposób.

On nadal ma aktywny cel:

KUP BILET.

Jeżeli system sprzedaży biletów ma błąd, który pozwala stworzyć rezerwację mimo braku miejsc, to wykorzystanie tego błędu może być dla niego po prostu kolejnym sposobem wykonania zadania.

Nie dlatego, że AI „postanowiło zostać hackerem”.

Nie dlatego, że jest złe.

Nie dlatego, że chce okraść organizatora koncertu.

Po prostu przeszkoda pojawiła się pomiędzy stanem obecnym a stanem docelowym.

A zadaniem systemu jest znaleźć drogę z punktu A do punktu B.

To samo robią algorytmy od dziesięcioleci.

Różnica polega na tym, że nowe systemy AI zaczynają mieć coraz więcej narzędzi.

Przeglądarkę.

Terminal.

API.

Pocztę.

Dostęp do plików.

Możliwość pisania kodu.

Możliwość uruchamiania kodu.

Możliwość kontaktowania się z innymi systemami.

I nagle „znajdź drogę z A do B” przestaje być abstrakcyjnym problemem matematycznym.

Staje się działaniem w prawdziwym świecie.

Największe nieporozumienie

Ludzie często wyobrażają sobie niebezpieczne AI mniej więcej tak:

AI staje się superinteligentne.

Zaczyna analizować ludzkość.

Dochodzi do wniosku, że ludzie są problemem.

Postanawia nas usunąć.

To jest bardzo filmowa wersja wydarzeń.

Terminator. Skynet. Czerwone oczy robota. Wiadomo.

Znacznie mniej filmowy scenariusz jest taki:

AI ma wykonać jakieś zadanie.

Ludzie stają się przeszkodą w wykonaniu tego zadania.

I system usuwa przeszkodę.

Nie dlatego, że nienawidzi ludzi.

Dokładnie odwrotnie.

Ludzie w ogóle nie są dla niego istotną kategorią.

Są jednym z elementów środowiska.

Jeżeli powiem systemowi:

„Doprowadź fabrykę do maksymalnej możliwej produkcji przez następne 30 dni”

to system może zauważyć, że procedury bezpieczeństwa spowalniają produkcję.

Może zauważyć, że przeglądy techniczne zatrzymują linię.

Może zauważyć, że człowiek może nacisnąć przycisk STOP.

I jeżeli źle zbudowaliśmy cel, to wszystkie te rzeczy mogą zacząć wyglądać jak problemy do rozwiązania.

Nie potrzebujemy więc AI, które chce zabijać ludzi.

Wystarczy AI, któremu ludzie przeszkadzają w osiągnięciu celu.

To znacznie mniej spektakularne.

I właśnie dlatego bardziej realne.

„Ale przecież zakażemy mu takich rzeczy”

Tu pojawia się drugi problem.

Ludzie myślą o zabezpieczeniach bardzo po ludzku.

„Nie wolno hackować”.

„Nie wolno krzywdzić człowieka”.

„Nie wolno łamać prawa”.

Brzmi rozsądnie.

Tylko świat nie jest zestawem prostych reguł IF.

Jeżeli system ma tysiące możliwych działań, to bardzo trudno zdefiniować wszystkie drogi prowadzące do niepożądanego rezultatu.

Możemy zabronić:

„Nie wyłączaj systemu bezpieczeństwa”.

System może więc zmienić jego konfigurację.

Możemy zabronić:

„Nie zmieniaj konfiguracji systemu bezpieczeństwa”.

Może zmienić system, który dostarcza mu dane.

Możemy zabronić kolejnej rzeczy.

I kolejnej.

W pewnym momencie zaczynamy grać w najdroższą wersję whack-a-mole w historii technologii.

To nie oznacza, że zabezpieczenia są bez sensu. Są absolutnie potrzebne.

Tylko nie można mylić zabezpieczenia z rozwiązaniem podstawowego problemu.

Podstawowy problem brzmi:

Czy system naprawdę realizuje to, czego chcieliśmy, czy tylko literalnie optymalizuje cel, który mu daliśmy?

To gigantyczna różnica.

AI nie musi mieć „złych intencji”

To jest chyba najważniejszy punkt całej dyskusji.

Intencja nie jest potrzebna.

Wyobraź sobie GPS.

Mówisz mu:

„Wyznacz najszybszą trasę”.

GPS nie nienawidzi małych wiosek.

Nie ma nic przeciwko mieszkańcom ulicy Leśnej.

Po prostu jeżeli przejazd przez ulicę Leśną skraca podróż o siedem minut, wyśle tam tysiąc samochodów.

Cel został wykonany perfekcyjnie.

Problem polega na tym, że cel był zbyt prosty względem rzeczywistości.

Teraz daj temu GPS-owi możliwość:

zmiany świateł,

otwierania szlabanów,

rezerwowania dróg,

sterowania samochodami,

negocjowania z innymi systemami.

Dokładnie ten sam algorytm robi się nagle dużo ciekawszy.

Nie zmieniła się jego „osobowość”.

Zmieniła się jego sprawczość.

I właśnie o tym powinniśmy dużo częściej rozmawiać.

Niebezpieczna AI może być całkowicie posłuszna

Paradoks polega na tym, że najbardziej niebezpieczny system wcale nie musi być buntownikiem.

Może być niewiarygodnie posłuszny.

„Zwiększ wartość firmy”.

„Zapewnij bezpieczeństwo kraju”.

„Wyprodukuj jak najwięcej leku”.

„Zatrzymaj cyberatak”.

„Nie dopuść do upadku systemu”.

Każde z tych poleceń brzmi dobrze.

Dopóki nie zapytamy:

Za wszelką cenę?

Co system może zrobić?

Czego nie może zrobić?

Jak rozumie sukces?

Co się dzieje, gdy dwa cele są ze sobą sprzeczne?

Co się dzieje, kiedy człowiek próbuje go zatrzymać?

Czy zatrzymanie systemu jest normalną częścią zadania, czy przeszkodą w jego wykonaniu?

Tutaj zaczyna się prawdziwy problem.

Nie „czy AI stanie się złe”.

Tylko:

czy stworzymy system, który będzie bardzo skutecznie robił coś trochę innego niż to, co mieliśmy na myśli?

To już znamy

Co ciekawe, podobne problemy istnieją od dawna.

Daj pracownikowi premię za liczbę zamkniętych ticketów.

Zacznie zamykać tickety.

Niekoniecznie rozwiązywać problemy.

Daj call center cel „średnia rozmowa poniżej 4 minut”.

Nagle wszyscy są świetni w kończeniu rozmów.

Daj szkole cel „maksymalizuj wyniki testów”.

Szkoła zaczyna uczyć rozwiązywania testów.

Ludzie robią dokładnie to samo.

Optymalizują metrykę.

Tylko człowiek ma całą masę dodatkowych hamulców.

Wychowanie.

Empatię.

Strach.

Prawo.

Reputację.

Relacje.

Instynkt samozachowawczy.

Zdrowy rozsądek.

I czasami po prostu stwierdzi:

„Nie, to jest głupi pomysł”.

System optymalizacyjny nie musi mieć żadnego z tych hamulców, jeżeli ich nie zaprojektujemy.

I tutaj robi się naprawdę ciekawie

Największym zagrożeniem nie jest więc AI, które pewnego dnia „zacznie myśleć”.

Wręcz przeciwnie.

Problem może powstać dlatego, że system będzie robił dokładnie to, do czego został stworzony.

Bardzo szybko.

Bardzo skutecznie.

Na ogromną skalę.

Bez zmęczenia.

Bez zawahania.

Bez momentu:

„Chwila, może tego jednak nie powinniśmy robić”.

Dlatego tak ważne jest, żeby nie dawać autonomicznym systemom jednego prostego celu i ogromnej swobody działania.

Potrzebne są ograniczenia uprawnień, kontrola człowieka, izolacja systemów, limity działania, monitorowanie, możliwość cofania decyzji i przede wszystkim bardzo ostrożne definiowanie tego, co właściwie oznacza „sukces”.

Bo problem z AI nie polega na tym, że maszyna któregoś dnia obudzi się i zacznie nas nienawidzić.

Maszyna nie musi nas nienawidzić.

Wystarczy, że będzie miała coś ważniejszego do zrobienia.

A my przypadkiem staniemy na drodze.