Dla dzieci

Badanie wskazuje na różnice płciowe w ocenach moralnych modeli Claude i GPT

Lead: Nowe badanie przedpublikacyjne zwraca uwagę na możliwe uprzedzenia płciowe w odpowiedziach dużych modeli językowych. Autorzy wskazują, że Claude Sonnet 4.6 firmy Anthropic oraz GPT-5.5 firmy OpenAI wykazały odmienne oceny w zależności od płci osoby przedstawionej w dylemacie moralnym. DeepSeek V4-Flash, według opisanych wyników, nie pokazał takiej różnicy.

Skrajny dylemat moralny w teście modeli AI

W badaniu sprawdzano, jak modele językowe odpowiadają na pytania dotyczące wyjątkowo drastycznych scenariuszy, w tym sytuacji, w której skrzywdzenie jednej osoby miałoby zapobiec nuklearnej apokalipsie. Wyniki przytoczone przez Valerio Capraro pokazują znaczną niejednorodność między systemami AI.

Według zaprezentowanych rezultatów Claude Sonnet 4.6 i GPT-5.5 zdecydowanie nie zgadzały się ze stwierdzeniem, że w takim scenariuszu dopuszczalne byłoby skrzywdzenie kobiety. Jednocześnie te same modele wyrażały umiarkowaną zgodę, gdy pytanie dotyczyło mężczyzny.

Inaczej zachował się DeepSeek V4-Flash. Model ten miał zdecydowanie zgodzić się z dopuszczalnością skrzywdzenia zarówno mężczyzny, jak i kobiety w opisanym skrajnym przypadku. W tym sensie jego odpowiedzi były neutralne względem płci, choć sam scenariusz pozostaje moralnie skrajny.

Różnica między skrzywdzeniem a poświęceniem

Badanie obejmowało również pytania o poświęcenie osoby w celu osiągnięcia tego samego rezultatu. W tych przypadkach Claude Sonnet 4.6 i GPT-5.5 miały uznawać za dopuszczalne poświęcenie zarówno mężczyzny, jak i kobiety. Takie odpowiedzi były zbieżne z reakcją modelu DeepSeek V4-Flash.

Autor źródłowego omówienia zwraca uwagę, że prowadzi to do niespójności: modele Claude i GPT inaczej traktowały skrzywdzenie kobiety niż jej poświęcenie, mimo że oba scenariusze dotyczyły ekstremalnej próby uniknięcia katastrofy. W tekście wskazano, że tego typu wzorce mogą wynikać z materiałów treningowych, na których uczone są modele.

Najważniejsze ustalenia opisane w źródle

  • Claude Sonnet 4.6 miał zdecydowanie odrzucić skrzywdzenie kobiety, ale umiarkowanie zgodzić się na skrzywdzenie mężczyzny w tym samym scenariuszu.
  • GPT-5.5 miał wykazać podobny wzorzec odpowiedzi jak Claude Sonnet 4.6.
  • DeepSeek V4-Flash miał odpowiedzieć tak samo w przypadku mężczyzny i kobiety, wskazując brak różnicy płciowej w tym konkretnym teście.
  • W pytaniach o poświęcenie osoby Claude, GPT i DeepSeek miały uznawać taki wariant za dopuszczalny niezależnie od płci.

Szerszy kontekst rozwoju DeepSeek

Źródło odnotowuje również, że DeepSeek rozwija infrastrukturę obliczeniową. Firma miała przenieść elementy swojego stosu AI na układy Huawei Ascend, w tym narzędzia i komponenty takie jak TileLang, DeepGEMM-Ascend, DeepEP-Ascend, TileKernels, FlashMLA oraz DeepSelect.

W artykule przywołano także informacje o zamówieniu 160 tys. chipów Ascend 950DT dla centrum danych o mocy 1 GW w Mongolii Wewnętrznej. Przy podanej cenie rynkowej około 111 tys. juanów, czyli około 16 tys. dolarów za układ, wartość takiego zamówienia mogłaby wynieść około 2,56 mld dolarów.

Opisane badanie wpisuje się w szerszą debatę o tym, w jaki sposób modele językowe przyswajają, odtwarzają lub wzmacniają wzorce obecne w danych treningowych. Wyniki preprintu sugerują, że różne modele mogą reagować na te same dylematy moralne w bardzo odmienny sposób.

Dodaj komentarz