Badanie wskazuje na nietypowe podobieństwa między Kimi K3 a rozumowaniem Claude Opus
Lead: Nowe badanie dotyczące bezpieczeństwa modeli sztucznej inteligencji może zaostrzyć spór wokół Moonshot i modelu Kimi K3. Autorzy pracy twierdzą, że wykryta podatność w interfejsach API czołowych dostawców AI pozwalała odczytywać ukryte ślady rozumowania, a analiza Kimi K3 ujawniła nietypowo wysoką zgodność z zachowaniem Claude Opus.
Podatność w ukrytym rozumowaniu modeli AI
Modele sztucznej inteligencji przed wygenerowaniem odpowiedzi często tworzą wewnętrzny ciąg rozumowania. Laboratoria AI zwykle nie pokazują go użytkownikom, lecz przechowują w zaszyfrowanej formie, aby widoczna była wyłącznie finalna odpowiedź.
Według autorów nowej pracy badawczej w tym mechanizmie wykryto poważny problem. Badacze wskazują, że dostawcy modeli, w tym OpenAI, Anthropic i Google, mieli stosować globalne klucze szyfrowania w obrębie swoich ekosystemów. To miało umożliwiać przenoszenie zaszyfrowanych bloków rozumowania między modelami.
Opisany scenariusz zakładał, że silniejszy model, taki jak Claude Opus, odmawia ujawnienia swoich ukrytych myśli, ale jego zaszyfrowany blok można przekazać słabszemu modelowi z tej samej rodziny, na przykład Claude Haiku. Według badaczy słabszy model miał nie posiadać równie restrykcyjnych zabezpieczeń i mógł odtworzyć treść rozumowania silniejszego modelu.
Ryzyka wskazane przez autorów badania
Autorzy pracy zwracają uwagę, że problem nie dotyczy wyłącznie prywatności samego modelu. Ich zdaniem podatność mogła mieć konsekwencje dla bezpieczeństwa danych, kontroli nad modelami i działania aplikacji AI.
- Wycieki danych i poświadczeń: badacze twierdzą, że w publicznie dostępnych logach sesji odnaleźli 367 elementów danych osobowych oraz 182 tajne poświadczenia, w tym klucze API i hasła.
- Obchodzenie zabezpieczeń: nawet jeśli model odmawiał udzielenia niebezpiecznej odpowiedzi, jego odczytany proces rozumowania mógł zawierać kroki, które rozważał wewnętrznie.
- Ukryte instrukcje: atakujący mogli umieszczać polecenia w niewidocznych, zaszyfrowanych blokach, aby przejmować kontrolę nad przepływem pracy systemów AI.
Kimi K3 pod lupą badaczy
W kontekście sporu o Kimi K3 najważniejszy okazał się wątek możliwej destylacji śladów rozumowania. Autorzy badania stwierdzili, że takie działanie mogło być wykonalne przez dłuższy czas bez konieczności łamania samej kryptografii.
Badacze przeprowadzili eksperyment, w którym do Kimi K3 przekazali fragment stanowiący około 1 proc. odkodowanego rozumowania Claude Opus 4.8. Według ich opisu dalsze rozumowanie i końcowa odpowiedź Kimi K3 wyraźnie przesunęły się w stronę stylu oraz sformułowań Claude.
W pracy wskazano również, że konkretne fragmenty rozumowania Claude i GPT były nawet o około sześć rzędów wielkości łatwiejsze do wydobycia z Kimi K3 niż z kolejnego najbardziej zbliżonego modelu. Autorzy uznali to za oznakę silnej zgodności behawioralnej Kimi K3 z wzorcami rozumowania Claude Opus.
Spór Moonshot, Anthropic i administracji USA
Wyniki badania wpisują się w szerszy konflikt dotyczący tego, czy chińska firma Moonshot mogła destylować Kimi K3 z modeli Anthropic. Zwolennicy ostrożniejszej interpretacji wskazywali dotąd, że między publicznym udostępnieniem modelu Fable a premierą Kimi K3 minęły około dwa tygodnie, co miałoby utrudniać przeprowadzenie szeroko zakrojonej destylacji.
Anthropic oraz część przedstawicieli administracji Donalda Trumpa oskarżali Moonshot o wykorzystanie modeli Anthropic przy pracach nad Kimi K3. Źródłowy materiał wskazuje także na zarzuty jednego z urzędników administracji Trumpa, według których Moonshot miał posiadać serwery NVIDIA GB300 oraz uzyskać dostęp do dodatkowych zasobów GB300 przez Tajlandię.
Samo badanie nie stanowi jednak jednoznacznego dowodu na to, że Moonshot dokonał destylacji modelu. Pokazuje natomiast mechanizm, który według autorów mógł ułatwiać pozyskiwanie i wykorzystywanie ukrytych śladów rozumowania oraz wskazuje na nietypowo bliskie podobieństwa między zachowaniem Kimi K3 a Claude Opus.