Forsal logo

ChatGPT ze znakiem wodnym. Giganci muszą dostosować się do przepisów AI Act

Ten tekst przeczytasz w 5 minut
52 minut temu
Screen,With,Chatgpt,Chat,With,Ai,Or,Artificial,Intelligence.,Man
chatGPT/Shutterstock
Dostawcy modeli językowych na terenie Unii Europejskiej zaczynają wdrażanie kolejnych przepisów AI Act. Jednym z nich jest obowiązkowe oznaczanie tekstów generowanych przez AI niewidzialnym znakiem wodnym. Choć cel tego wydaje się rozsądny, tak obejście owych zabezpieczeń wydaje się dziecinnie proste.

Znak wodny w tekstach generowanych przez ChatGPT

Aktualnie modele językowe, generując teksty, piszą słowo po słowie na zasadzie wyboru pasujących słów. Nowe wymogi nałożone na dostawców LLM-ów przez Unię Europejską, wymagają, aby każdy generowany w ten sposób tekst był oznaczony w sposób niewidzialny dla użytkownika, ale możliwym do wychwycenia przez dedykowane narzędzia. Jest to możliwe dzięki art. 50 AI Act, a więc dokumentowi z 1 sierpnia 2024 roku.

Dokładne wytyczne dt. oznaczania generowanych tekstów opisuje unijny kodeks praktyk związanych z przejrzystością treści generowanych przez AI. Jest to dość ważny dokument, który podpisany został przez około 190 organizacji zajmujących się rozwojem narzędzi sztucznej inteligencji, a na liście sygnatariuszy znaleźli się przedstawiciele takich firm jak Anthropic, Google, Meta, Microsoft czy OpenAI.

To właśnie OpenAI zapowiedziało 5 października 2026 roku, że wdrażanie tego rozwiązania nastąpi w ciągu najbliższych tygodni. Co jednak dosyć istotne, znakowanie tekstów będzie aktywne tylko na terenie Unii Europejskiej, w innych regionach świata teksty generowane przez sztuczną inteligencję nie będą posiadały takiego znaku. Co więcej, firma deklaruje, że nie zamierza uczynić z tego nowego standardu.

Jak działa znak wodny w tekstach generowanych przez ChatGPT?

Działanie takich znaków wodnych w przypadku tekstów generowanych przez narzędzie od OpenAI nie do końca działa tak, jak mogłoby się początkowo wydawać. Zamiast stawiać na niewidzialny znak o zerowej szerokości, który rozpozna tylko program komputerowy, OpenAI postawiło na technologie textGrain, której działanie wydaje się zaskakująco proste.

Kiedy model językowy pisze zlecony tekst, generuje go słowo po słowie, dobierając kolejne wyrazy na zasadzie dopasowania. textGrain zaś w subtelny sposób modyfikuje te wybory tak, aby były zgodne z kluczem. W ten sposób oznaczeniem, które potwierdza tekst wygenerowany przez AI, jest ciąg kilku słów. W ten sposób zabezpieczenie to pozostaje w tekście i to nawet jeśli zostanie on przekopiowany z do nowego dokumentu. Jednocześnie czytelnik nie będzie w stanie dostrzec różnicy, a według Open AI jakość generowanych odpowiedzi w ogóle nie spadnie.

Czy więc wszystkie teksty będą tak oznaczane? Nie i to także regulują przepisy wspomnianego kodeksu. Otóż teksty poniżej 200 tokenów (1 token to najczęściej fragment słowa) są zwolnione z obowiązku ukrytego znakowania. A kto i jak będzie sprawdzał, czy dany tekst został wygenerowany przez AI?

Na początek OpenAI udostępni opracowany przez siebie detektor tylko zatwierdzonym badaczom oraz konkretnym organizacjom. Aby zakwalifikować się do tego programu, konieczne było złożenie specjalnego wniosku. Firma celowo nie udostępniła go od razu szerszemu gronu, ponieważ - jak sama wskazuje - narzędzie nadal cechuje dość ograniczona skuteczność.

To jednak z czasem się zmieni i dostęp do detektora zyskają różnego rodzaju organy nadzoru, organy ścigania, media, zawodowi fact chekerzy, badacze, ale przede wszystkim instytucje naukowe oraz akademickie. Oznacza to więc, że uczelnie i szkoły zyskają niezwykle przydatną funkcję, która pozwoli im sprawdzić, która praca wyszła spod ręki bota.

Zabezpieczenie, które łatwo obejść?

Choć samo stworzenie takiego systemu oraz oddanie w ręce odpowiednich instytucji detektora wydaje się dobrym rozwiązaniem, to jeszcze nie jest powód do świętowania. Nawet tego rodzaju zabezpieczenia nie są bowiem gwarantem tego, że teraz każdy tekst generowany przez AI będzie możliwy do wyłapania.

Pierwszym i zasadniczym problemem jest aktualna skuteczność detektora dostarczanego przez OpenAI. Według danych skuteczność oscyluje w granicach 95% przy tekście, którego wygenerowanie pochłonęło ok. 400 tokenów. Wartość ta jednak spada do 80% przy tekście za 200 tokenów. Pokazuje to więc, że im mniejszy tekst, tym trudniej jest wygenerować odpowiednio długi ciąg słów, który pozwala na identyfikację.

Kolejnym problematycznym aspektem jest fakt, że znak wodny gorzej działa na tekstach, które mają być tłumaczone i w przypadku języków innych niż angielski. Dla przykładu wartość podać tutaj przypadek tekstu wygenerowanego w języku rumuńskim, gdzie skuteczność detektora wyniosła zaledwie 42,2%. W przypadku języka polskiego skuteczność oscyluje w granicach 60%.

Na tym jednak problemy się nie kończą, bo skoro Open AI oznacza teksty ciągiem słów, to najsensowniejszym obejściem detektora jest odpowiednia redakcja danego tekstu. Często zmiana szyku wyrazów, zastosowanie synonimów lub zapisanie ich od nowa pozwala ominąć zabezpieczenie dość skutecznie. Teksty zajmujące ok. 400 tokenów, których 25% słów zamieniono na synonimy, były wykrywane przez detektor w zaledwie 17% przypadków. Jest to więc wyjątkowo niski wynik. Co więcej, przy tak niskiej skuteczności łatwo zarzuty o wygenerowanie sobie np. pracy dyplomowej odbić kwestią specyficznego stylu danego autora.

Wreszcie pozostaje kwestia lokalizacji i tego, że detektor działać ma tylko na terenie UE. To zaś oznacza, że na czas generowania tekstów można podłączyć się za pośrednictwem sieci VPN do serwerów w USA lub Azji, aby uniknąć wymaganego przez UE znakowania.

Trzeba także pamiętać, że znak wodny pozostawiony w tekście nie zawsze jest oznaką nieuczciwości danego pracownika, ucznia lub studenta. Jest to jedynie dowód na to, że dana praca lub tekst został przepuszczony przez AI, co nie skreśla tego, że autorem nadal jest człowiek. W końcu zastosowanie chatbotów nie ogranicza się tylko do generowania, ale np. do korekty gramatyki czy pisowni.

Copyright
Materiał chroniony prawem autorskim - wszelkie prawa zastrzeżone. Dalsze rozpowszechnianie artykułu za zgodą wydawcy INFOR PL S.A. Kup licencję
Źródło: forsal.pl
Zapisz się na newsletter
Zapraszamy na newsletter Forsal.pl zawierający najważniejsze i najciekawsze informacje ze świata gospodarki, finansów i bezpieczeństwa.

Zapisując się na newsletter wyrażasz zgodę na otrzymywanie treści reklam również podmiotów trzecich

Administratorem danych osobowych jest INFOR PL S.A. Dane są przetwarzane w celu wysyłki newslettera. Po więcej informacji kliknij tutaj