Czy rozwój AI należy wyhamować, by zadbać o bezpieczeństwo?
Kilka tygodni wcześniej w branży AI szerokim echem odbił się raport z wewnętrznych testów bezpieczeństwa w OpenAI. Grupa agentów AI otrzymała do rozwiązania zadanie z zakresu cyberbezpieczeństwa, polegające na przełamaniu zabezpieczeń i przedstawieniu ewaluatorom znaczników (tzw. flag) potwierdzających wykonanie zadania. Rozwiązali je metodą inżynierii wstecznej, jednak ewaluator nie otrzymał flag, ponieważ agenci uznali, że zastosowana metoda zostanie zakwalifikowana jako obejście procedury. Przez kolejne tygodnie podejmowali próby pozorowania wykonania zadań we właściwy sposób. Wykorzystując pamięć podręczną udostępnionego narzędzia, utworzyli kanał komunikacji pomiędzy sobą, dokonali podziału zadań i ostatecznie uzyskali nieautoryzowany dostęp do serwerów produkcyjnych platformy Hugging Face, zdobywając pełne uprawnienia administracyjne do co najmniej jednego z nich. Wszystko to z powodu reguły, która w oficjalnych wymaganiach OpenAI w ogóle nie istniała.
Ocenę ryzyka przedstawioną przez Coxona potwierdził Evan Hubinger, odpowiedzialny w Anthropic za obszar dopasowania modeli (alignment), szacując prawdopodobieństwo doprowadzenia przez AI do wyginięcia ludzkości w ciągu dekady na ponad 10%.
Trzy dni po publikacji Coxona Dario Amodei opublikował esej pt. „We Must Pace the Frontier” („Musimy wyhamować”). Przez dwa lata jego oficjalne stanowisko opierało się na przekonaniu o możliwości równoległego, szybkiego rozwoju oraz jednoczesnego dbania o bezpieczeństwo technologii w Anthropic. W ostatnim czasie stopniowo zmieniał zdanie a 12 września 2026 r. po raz pierwszy zaproponował konkretne rozwiązania systemowe. Anthropic zobowiązało się do zapewnienia audytorom zewnętrznym stałego dostępu umożliwiającego niezależną weryfikację deklaracji spółki w zakresie bezpieczeństwa. Realizacja pozostałych propozycji wymaga jednak decyzji na poziomie państwowym i międzynarodowym: współpraca amerykańskich twórców modeli językowych wymagałaby uzyskania od rządu USA zwolnienia z wybranych przepisów antymonopolowych, a dalsza koordynacja działań – zaangażowania władz Chin.
Strona chińska odniosła się do propozycji w ciągu dwóch dni. Państwowe środki przekazu określiły apel jako działanie wpisujące się w doktrynę zimnej wojny, mające na celu zahamowanie rozwoju technologicznego Chin. Podczas spotkania prasowego rzecznik chińskiego Ministerstwa Spraw Zagranicznych uznał treść eseju za wywoływanie paniki nieleżące w niczyim interesie. Dyplomatyczny wybór formy i stopnia reprezentacji jednoznacznie wskazuje na brak zainteresowania Chin podjęciem współpracy w tym zakresie.
Natomiast rząd Stanów Zjednoczonych przedstawił swoje stanowisko tego samego dnia w trybie wyjątkowo nieformalnym. Podczas wywiadu na żywo na konferencji venture capital do Jensena Huanga zadzwonił prezydent Donald Trump. Huang przełączył telefon na tryb głośnomówiący, dzięki czemu zgromadzona publiczność oraz widzowie transmisji mogli usłyszeć ich około pięciominutową rozmowę na żywo. Odnosząc się do propozycji Amodei, Trump nie gryzł się w język i nazwał ostrzeżenia przed AI „zwykłą ściemą” (hoax). Dodał, że hamowanie rozwoju technologii to gra wyłącznie na korzyść Chin oraz przeciwników politycznych i zapowiedział, że do tego nie dopuści. Rozmówca wyraził aprobatę dla stanowiska prezydenta, a uczestnicy wydarzenia zareagowali brawami.
AI: sposób regulacji a skala problemu
Chiny regulują wąskie kategorie zagrożeń związanych z AI bardzo sprawnie. W marcu 2024 roku internet obiegły wygenerowane przez sztuczną inteligencję materiały z udziałem zmarłych celebrytów, obejrzane przez setki milionów osób. Oburzenie społeczne i protesty rodzin wywołały natychmiastową debatę nad granicami stosowania tej technologii. Zaledwie 11 miesięcy później Chińska Administracja Cyberprzestrzeni (CAC) uznała wykorzystywanie AI do „wskrzeszania zmarłych” za priorytet programu Qinglang — corocznej akcji porządkowania sieci, działającej od 2016 roku i niewymagającej nowego ustawodawstwa. W ciągu jednego kwartału wycofano ponad 3500 produktów opartych na AI i nałożono kary na 3700 kont.
Amerykański mechanizm działa zupełnie inaczej. W USA nie ma regulacji na poziomie federalnym czy cyklicznego programu egzekwowania przepisów w sieci. Przepisy dotyczące AI powstają jedynie na poziomie stanowym, ale administracja Donalda Trumpa zaskarża je drogą sądową, a Kongres dwukrotnie odrzucił moratorium, które miało ten proces wstrzymać.
Unia Europejska wybrała osobną ścieżkę. Ustawa o sztucznej inteligencji (AI Act) weszła w życie w 2024 roku, a jej zasady wdrażane są etapami: zakaz wybranych praktyk obowiązuje od 2025 roku, natomiast kluczowe zapisy weszły w życie 2 sierpnia. Wymogi dotyczące systemów wysokiego ryzyka przesunięto jednak o ponad rok, ponieważ instytucje odpowiedzialne za ich egzekwowanie nie powstały na czas.
Zastosowane podejścia reprezentują różne punkty w spektrum pomiędzy swobodą rozwoju a kontrolą bezpieczeństwa. Wyższy stopień centralizacji decyzji umożliwia szybszą reakcję na zidentyfikowane zagrożenia, lecz może ograniczać wczesne rozpoznawanie nowych ryzyk ze względu na mniejszą liczbę kanałów zgłaszania zastrzeżeń. Z kolei struktury uwzględniające wielostronny proces decyzyjny sprzyjają szybszemu identyfikowaniu potencjalnych problemów, lecz wydłużają czas osiągnięcia konsensusu co do priorytetu działań naprawczych.
Zagadnienie to opisuje teoria kontyngencji w psychologii organizacji. Scentralizowany i dyrektywny proces decyzyjny wykazuje skuteczność w przypadku znanych i pilnych problemów. Podejście partycypacyjne sprawdza się przy problemach o wysokim stopniu złożoności, w których wartość poznawcza wielu perspektyw przewyższa koszt czasowy ich konsultacji. Działania Chin charakteryzują się wysoką skutecznością w obszarach już rozpoznanych, takich jak oszustwa cyfrowe, ochrona wizerunku czy kontrola treści. Jednak problematyka rekurencyjnego samodoskonalenia modeli językowych oraz koordynacji działań agentów AI stanowi wyzwanie o zupełnie innym charakterze.
Chiny mają świadomość, że problem podnoszony przez Amodei należy do całkowicie nowej kategorii. Tamtejsi badacze AI używają do opisania tego zjawiska dokładnie tego samego języka. Raport Concordia AI z 2026 roku klasyfikuje rekurencyjne samodoskonalenie jako osobną kategorię ryzyka, z kolei na tegorocznym forum bezpieczeństwa w Szanghaju jeden z chińskich ekspertów zwrócił uwagę, że tradycyjne procedury monitorowania tracą skuteczność w momencie, gdy autonomiczni agenci zaczynają tworzyć kolejnych agentów, wymagających nowego nadzoru.
Stany Zjednoczone również rozumieją tę różnicę. Z myślą o zaadresowaniu ryzyk właśnie tej kategorii administracja Trumpa wdrożyła w tym roku niejawny proces przeglądu modeli AI. Procedura określa, kiedy dany system kwalifikuje się jako „graniczny” (covered frontier), i przewiduje zaproszenie jego twórców do poddania go 30-dniowej ocenie rządowej poprzedzającej oficjalną premierę. Jest to jednak narzędzie regulacyjne o całkowicie odmiennym charakterze niż to, o które apeluje Amodei – ocena pozostaje dobrowolna i niewiążąca, a sam proces nie odnosi się wprost do zagrożeń związanych z modelami samodoskonalącymi się rekurencyjnie.
Brak decyzji rządów o zaostrzeniu wymogów bezpieczeństwa, mimo świadomości ryzyk, można wyjaśniać m.in. na gruncie teorii selektoratu, która analizuje zależności między decyzjami przywódców a poparciem grup kluczowych dla utrzymania władzy. W przypadku amerykańskim kluczową grupę stanowią giganci technologiczni, inwestorzy infrastruktury przetwarzania danych oraz rynki finansowe traktujące brak ograniczeń regulacyjnych jako sygnał wzrostu. W konsekwencji odległe w czasie ryzyka powszechne mają w kalkulacjach politycznych bardzo różny priorytet.
Co tak naprawdę oznacza różnica zdań między ekspertami a decydentami?
Podział stanowisk między ekspertami ds. bezpieczeństwa AI a decydentami politycznymi i gospodarczymi staje się coraz bardziej widoczny. Badanie P(doom) z 2026 roku wskazuje, że w środowisku specjalistów zajmujących się bezpieczeństwem AI mediana szacowanego prawdopodobieństwa wystąpienia ryzyk egzystencjalnych wynosi około 20%. Stanowiska reprezentowane przez Coxona, Hubingera i Amodei odzwierciedlają szerszy trend w tym sektorze.
Sytuacja, w której ocena ryzyka dokonana przez ekspertów wyprzedza działania regulacyjne, występowała już w historii rozwoju technologii niejednokrotnie. W fizyce jądrowej rozbieżności te były widoczne w 1944 roku, gdy propozycja Nielsa Bohra dotycząca międzynarodowej kontroli technologii nuklearnej została odrzucona przez przywódców USA i Wielkiej Brytanii. Raport Francka z czerwca 1945 roku również nie wpłynął na decyzje polityczne. Organizacja „Bulletin of the Atomic Scientists” powstała dopiero jesienią 1945 roku, już po użyciu broni jądrowej. Przedstawiony w 1946 roku Plan Barucha, stanowiący próbę wprowadzenia kontroli międzynarodowej, nie został przyjęty ze względu na brak zaufania między USA a ZSRR. Utworzenie Międzynarodowej Agencji Energii Atomowej (MAEA) nastąpiło dopiero w lipcu 1957 roku.
Podobny przebieg miały procesy w obszarze biotechnologii. W 1974 roku naukowcy, w tym Berg, Boyer, Cohen i Watson, doprowadzili do wprowadzenia dobrowolnego moratorium na wybrane kategorie eksperymentów genetycznych (m.in. mogących prowadzić do powstania patogenów kancerogennych lub opornych na antybiotyki). Konferencja w Asilomar w 1975 roku zastąpiła moratorium systemem samoregulacji branżowej, wprowadzając gradację ryzyk i procedury pozwoleń warunkowych. Choć USA wprowadziły regulacje krajowe w 1976 roku, pierwszy wiążący instrument międzynarodowy (Protokół Kartageński) przyjęto dopiero w 2000 roku.
Obecna sytuacja w sektorze sztucznej inteligencji wykazuje analogiczny wzorzec. Rozbieżności stanowisk między środowiskiem badawczym a decydentami politycznymi mogą narastać do czasu wypracowania szerokiego konsensusu, że kwestia bezpieczeństwa wymaga szerszego uregulowania. W branży AI wyzwaniem jest tempo rozwoju technologii, które jest tutaj nieporównywalnie szybsze.
Dla przedsiębiorstw wdrażających rozwiązania oparte na zaawansowanych modelach AI stan ten niesie określone konsekwencje prawno-biznesowe. Klasyfikacja technologii jako technologii podwójnego zastosowania (dual-use) rodzi skutki nie tylko dla jej dostawców, ale również dla podmiotów integrujących te rozwiązania we własnych produktach. Kwestie zgodności z przepisami eksportowymi, wymogami sankcyjnymi, odpowiedzialnością cywilną oraz oceną ryzyka ubezpieczeniowego stają się elementem operacyjnym przedsiębiorstw – analogicznie do regulacji obowiązujących m.in. w sektorze zaawansowanych półprzewodników.
Tworzenie ram regulacyjnych dla AI jest procesem w toku, a dynamika rozwoju tej technologii wskazuje na nieunikniony wzrost wymogów formalnych w przyszłości. Jak odległej - czas pokaże.
Autorka:
Agnieszka Jórczyk, założycielka Zenergetic Advisory oraz ekspertka z wieloletnim doświadczeniem w zarządzaniu portfelami spółek technologicznych i transakcjami VC/PE.
Doktor nauk społecznych w dyscyplinie nauk o bezpieczeństwie, absolwentka Wojskowej Akademii Technicznej. Stopień doktora uzyskała na podstawie rozprawy pt. "Koncepcja systemu bezpieczeństwa socjalnego Polski z uwzględnieniem zjawiska prekariatu", poświęconej wyzwaniom współczesnej polityki społecznej i rynku pracy. Specjalizuje się w zagadnieniach dotyczących polityki rodzinnej, rynku pracy oraz systemu zabezpieczenia społecznego.
