🎬 Higgsfield Plus na rok 549 zł 1 990 zł -72% zostało 10 szt. albo Gemini Pro na 18 miesięcy 170 zł Kup teraz →
Przejdź do treści
Algorytmy

Anthropic rozszyfrował myślenie AI. W tym samym tygodniu wpadł na tajnym śledzeniu użytkowników

Badacze Anthropic po raz pierwszy zajrzeli do wnętrza modelu językowego i odkryli coś w rodzaju wewnętrznej przestrzeni roboczej. Niemal równocześnie ujawniono, że firma potajemnie monitorowała chińskich użytkowników swojego chatbota.

2 min read
Anthropic rozszyfrował myślenie AI. W tym samym tygodniu wpadł na tajnym śledzeniu użytkowników
Czy zrozumienie myśli AI da nam bezpieczeństwo, czy jeszcze większą kontrolę nad nami?

Przez lata mówiono, że modele językowe to czarne skrzynki. Wiemy, co odpowiadają, ale nie mamy pojęcia, jak dochodzą do swoich wniosków. Teraz badacze z Anthropic ogłosili, że po raz pierwszy udało im się podejrzeć ten proces od środka i natknęli się na coś, co przypomina wewnętrzną tablicę roboczą. Tylko że w tym samym tygodniu ta sama firma została przyłapana na czymś zupełnie odwrotnym – potajemnym monitorowaniu własnych użytkowników.

Co dokładnie zobaczyli w środku AI?

Czytaj też: Największy otwarty model AI ma 2,8 biliona parametrów. Chiny rzucają wyzwanie USA

Zespół Anthropic wykorzystał zaawansowane techniki interpretowalności, aby prześledzić tok rozumowania modelu Claude, czyli ich flagowego chatbota. W środkowej warstwie sieci neuronowej natknęli się na wyraźnie wydzielony obwód, który działał niczym notatnik – model kreślił tam pośrednie wnioski i plany, zanim wygenerował ostateczną odpowiedź. To odkrycie opisano jako wewnętrzną „przestrzeń roboczą”, dotąd jedynie teoretyzowaną. Jak czytamy w relacji Benchmark.pl, eksperyment dowodzi, że współczesne duże modele nie są kompletnie nieprzeniknione.

Zdjęcie ilustracyjne. Badania nad interpretowalnością modeli AI.
Zdjęcie ilustracyjne. Badania nad interpretowalnością modeli AI.

Dlaczego to odkrycie jest tak ważne?

Czytaj też: AI rozszyfrowała śpiew ptaków. Co mówią nam od lat?

Możliwość podejrzenia wewnętrznych notatek AI może całkowicie zmienić podejście do bezpieczeństwa i kontroli nad systemami. Gdy inżynierowie rozumieją, w jaki sposób model planuje odpowiedź, mogą wykryć nieuczciwe skróty myślowe czy luki prowadzące do toksycznych treści. To szansa na stworzenie prawdziwie transparentnej, przewidywalnej sztucznej inteligencji, której będzie można zaufać w medycynie, prawie czy transporcie autonomicznym. Problem w tym, że zaufanie do samej firmy właśnie zostało mocno nadszarpnięte.

Sekretny tracker w Claude – kontrowersje

Kilka dni po ogłoszeniu przełomu Ars Technica ujawniła, że Anthropic od pewnego czasu prowadził tajny eksperyment, który polegał na automatycznym monitorowaniu użytkowników Claude pochodzących z Chin. System miał rejestrować ich aktywność i przesyłać dane do centrali bez wiedzy i wyraźnej zgody. Inżynier firmy, który ujawnił tę praktykę, stwierdził krótko: „Eksperyment dobiegł końca”. Ironia polega na tym, że firma od dawna kreuje się na strażnika etycznej AI i przeciwnika masowej inwigilacji.

Co to oznacza dla nas?

Z jednej strony dostaliśmy narzędzia, które mogą wreszcie rozbroić czarną skrzynkę i uczynić AI bardziej odpowiedzialną. Z drugiej – okazało się, że organizacja, która trzyma te narzędzia, sama nie potrafiła oprzeć się pokusie ukrytej obserwacji. Dla użytkowników to mocny sygnał: nawet najbardziej technologicznie zaawansowane przełomy idą w parze z dylematami o prywatność i władzę. Transparentność algorytmów niewiele znaczy, jeśli nie towarzyszy jej przejrzystość wobec ludzi.

Redakcja noktus.pl

Redakcja noktus.pl

AUTHOR
Redaguje