Anthropic rozszyfrował myślenie AI. W tym samym tygodniu wpadł na tajnym śledzeniu użytkowników
Badacze Anthropic po raz pierwszy zajrzeli do wnętrza modelu językowego i odkryli coś w rodzaju wewnętrznej przestrzeni roboczej. Niemal równocześnie ujawniono, że firma potajemnie monitorowała chińskich użytkowników swojego chatbota.

Przez lata mówiono, że modele językowe to czarne skrzynki. Wiemy, co odpowiadają, ale nie mamy pojęcia, jak dochodzą do swoich wniosków. Teraz badacze z Anthropic ogłosili, że po raz pierwszy udało im się podejrzeć ten proces od środka i natknęli się na coś, co przypomina wewnętrzną tablicę roboczą. Tylko że w tym samym tygodniu ta sama firma została przyłapana na czymś zupełnie odwrotnym – potajemnym monitorowaniu własnych użytkowników.
Co dokładnie zobaczyli w środku AI?
→ Czytaj też: Największy otwarty model AI ma 2,8 biliona parametrów. Chiny rzucają wyzwanie USA
Zespół Anthropic wykorzystał zaawansowane techniki interpretowalności, aby prześledzić tok rozumowania modelu Claude, czyli ich flagowego chatbota. W środkowej warstwie sieci neuronowej natknęli się na wyraźnie wydzielony obwód, który działał niczym notatnik – model kreślił tam pośrednie wnioski i plany, zanim wygenerował ostateczną odpowiedź. To odkrycie opisano jako wewnętrzną „przestrzeń roboczą”, dotąd jedynie teoretyzowaną. Jak czytamy w relacji Benchmark.pl, eksperyment dowodzi, że współczesne duże modele nie są kompletnie nieprzeniknione.

Dlaczego to odkrycie jest tak ważne?
→ Czytaj też: AI rozszyfrowała śpiew ptaków. Co mówią nam od lat?
Możliwość podejrzenia wewnętrznych notatek AI może całkowicie zmienić podejście do bezpieczeństwa i kontroli nad systemami. Gdy inżynierowie rozumieją, w jaki sposób model planuje odpowiedź, mogą wykryć nieuczciwe skróty myślowe czy luki prowadzące do toksycznych treści. To szansa na stworzenie prawdziwie transparentnej, przewidywalnej sztucznej inteligencji, której będzie można zaufać w medycynie, prawie czy transporcie autonomicznym. Problem w tym, że zaufanie do samej firmy właśnie zostało mocno nadszarpnięte.
Sekretny tracker w Claude – kontrowersje
Kilka dni po ogłoszeniu przełomu Ars Technica ujawniła, że Anthropic od pewnego czasu prowadził tajny eksperyment, który polegał na automatycznym monitorowaniu użytkowników Claude pochodzących z Chin. System miał rejestrować ich aktywność i przesyłać dane do centrali bez wiedzy i wyraźnej zgody. Inżynier firmy, który ujawnił tę praktykę, stwierdził krótko: „Eksperyment dobiegł końca”. Ironia polega na tym, że firma od dawna kreuje się na strażnika etycznej AI i przeciwnika masowej inwigilacji.
Co to oznacza dla nas?
Z jednej strony dostaliśmy narzędzia, które mogą wreszcie rozbroić czarną skrzynkę i uczynić AI bardziej odpowiedzialną. Z drugiej – okazało się, że organizacja, która trzyma te narzędzia, sama nie potrafiła oprzeć się pokusie ukrytej obserwacji. Dla użytkowników to mocny sygnał: nawet najbardziej technologicznie zaawansowane przełomy idą w parze z dylematami o prywatność i władzę. Transparentność algorytmów niewiele znaczy, jeśli nie towarzyszy jej przejrzystość wobec ludzi.


