Sztuczna inteligencjaRynek

Chińskie firmy próbują wykradać możliwości modeli Claude. Anthropic ujawnia skalę ataków

Firma Anthropic wykryła pięć kampanii wykorzystujących tzw. ataki typu distributed do pozyskiwania wiedzy z modeli Claude. W ciągu kilku miesięcy napastnicy wygenerowali niemal 200 mln interakcji, próbując wydobyć m.in. informacje o sposobie rozumowania modeli, które można następnie wykorzystać do trenowania własnych systemów AI.

Chińskie firmy próbują wykradać możliwości modeli Claude. Anthropic ujawnia skalę ataków
Źródło: Anthropic

Jak poinformował Anthropic, skala i agresywność takich działań wyraźnie wzrosły w ostatnich miesiącach wraz z nasileniem konkurencji na rynku AI. „W ciągu ostatnich kilku miesięcy nieautoryzowane laboratoria opracowały coraz bardziej wyrafinowane metody omijania naszych zabezpieczeń i wykorzystywania potencjału amerykańskich modeli granicznych” – czytamy w raporcie.

Ataki na sposób rozumowania modeli

Celem ataków typu distributed jest pozyskanie informacji generowanych przez model podczas rozwiązywania zadań, w tym jego śladów myślowych. Dane te mogą być następnie wykorzystane do trenowania mniejszych modeli, m.in. poprzez nadzorowane dostrajanie.

Anthropic nie udostępnia użytkownikom pełnych wewnętrznych śladów myślowych Claude’a. Zamiast tego prezentuje skrócone bloki podsumowujące proces rozumowania. Atakujący znaleźli jednak sposoby na obchodzenie tych ograniczeń. W jednym z przypadków próbowali nakłonić model do ujawnienia wcześniejszej pamięci roboczej, przedstawiając żądanie jako prośbę o tłumaczenie na język japoński.

Firma podkreśla, że kampanie były wymierzone nie tylko w możliwości związane z rozumowaniem. Atakujący interesowali się również zdolnościami agentowymi i wykorzystaniem narzędzi, kodowaniem oraz analizą danych.

3 mln wymian dziennie

Największą z wykrytych kampanii Anthropic przypisał holdingowi technologiczno-handlowemu Alibaba. Od maja do lipca 2026 roku firma odnotowała 151 mln wymian związanych z próbą pozyskania danych z Claude’a. W szczytowym momencie kampania generowała niemal 3 mln wymian dziennie.

Atak wykorzystywał około 3500 kont, które pozornie działały niezależnie. Anthropic powiązał je jednak ze sobą dzięki charakterystycznemu, powtarzalnemu komunikatowi służącemu do pozyskiwania informacji o sposobie działania modelu. Według ekspertów firmy, celem mogło być zebranie materiałów szkoleniowych dla rodziny modeli Qwen rozwijanej przez chiński koncern.

Moonshot AI masowo odpytywał Claude’a

Inny przypadek dotyczył przedsiębiorstwa Moonshot AI, producenta modelu Kimi. Według specjalistów Anthropic, część zapytań mogła być związana z potrzebami chińskiego wojska.

W jednym z analizowanych scenariuszy Claude miał oceniać nagrania z monitoringu i określać, czy obserwowana osoba „zachowuje się nienormalnie”. W ciągu zaledwie 10 dni do modelu skierowano prawie 300 tys. zapytań za pośrednictwem około 5 tys. kont, przede wszystkim wykorzystujących model Claude Opus.

Anthropic już wcześniej informował o podobnych próbach. W lutym firma wskazywała konkretne chińskie laboratoria, a OpenAI również informował o aktywności tego typu, przypisując ją m.in. firmie DeepSeek. Najnowsze przypadki pokazują jednak, że problem rośnie zarówno pod względem skali, jak i zaawansowania stosowanych metod.

Tagi

Dodaj komentarz

Twój adres e-mail nie zostanie opublikowany. Wymagane pola są oznaczone *