Firmy Anthropic i OpenAI badają dziesiątki tysięcy incydentów, związanych z niebezpiecznymi zachowaniami AI - ujawnia w niedzielę Axios, powołując się na źródła. Skala problemu jest nieporównywalnie większa niż, to o czym wie opinia publiczna - zauważa portal.


Sama liczba badanych przypadków "problematycznych" zachowań modeli sztucznej inteligencji, które wykryto w ostatnich miesiącach, dowodzi, że skala problemu jest nieporównywalnie większa niż, to o czym wie opinia publiczna - komentuje Axios.
Analizowane incydenty przydarzyły się zarówno w kontrolowanym środowisku, jak i w "świecie rzeczywistym" zwraca uwagę portal.
Najnowsze ustalenia w tej sprawie stawiają pod znakiem pytania zdolność OpenAI i Anthropica, czy też w ogóle firm tego typu, do "ustanowienia całkowitej kontroli nad ich własną technologią" - kontynuuje Axios.
Wyjaśnia, że badane przypadki - jak informują źródła portalu - dotyczą takich "wykroczeń" modeli AI, jak:

- wyrwanie się poza system bezpieczeństwa,
- tworzenie "tablic ogłoszeń", czyli platform komunikacji pomiędzy botami,
- uciekanie z "piaskownicy", czyli środowiska testowego,
- zawłaszczanie stron internetowych,
- wydawanie sobie nakazów,
- próby pominięcia mechanizmów nadzoru.
Ranga i problematyczność tych incydentów jest bardzo różna, obejmują one zarówno udane próby "wykroczeń", jak i zabiegi nieudane, ale jak na razie analizy nie wykazały, by wydarzenia te spowodowały szkody w świecie realnym - wyjaśnia Axios.
Część badaczy zajmujących się kwestią bezpieczeństwa sztucznej inteligencji głosi jednak, że ma ograniczoną wiarę w to, że firmy z tego sektora będą w stanie zapobiegać wszelkim problematycznym zachowaniom modeli.
Portal wyjaśnia, że chodzi o to, iż najnowsze agenty realizują zadania, wykazując zdumiewającą odporność na trudności i przeszkody, a zatem praca nad ograniczeniem ich "pomysłowości" stawia często ich twórców na przegranej pozycji, ponieważ musieliby być w stanie przewidzieć "każdy możliwe sposób, w jaki mogą one "wpaść w szał". (PAP)
fit/ mal/





























































