NVIDIA prezentuje Nemotron 3.5 Lightning. Szybsze generowanie tokenów nie rozwiązuje problemu agentów AI
NVIDIA wprowadziła model Nemotron 3.5 Lightning, otwarty model typu mixture-of-experts zaprojektowany z myślą o stale działających agentach AI. Choć firma wskazuje na nawet czterokrotny wzrost szybkości generowania tokenów, praktyczne przyspieszenie zadań agentowych jest znacznie mniejsze.
Nowy model z otwartymi wagami
Nemotron 3.5 Lightning to model MoE o 30 miliardach parametrów, z czego aktywne podczas działania są 3 miliardy parametrów. NVIDIA pozycjonuje go jako rozwiązanie dla agentów AI wykonujących duże wolumeny wyspecjalizowanych, powtarzalnych zadań.
Premiera wpisuje się w rosnącą rywalizację na rynku modeli z otwartymi wagami. Model NVIDIA został pokazany krótko po tym, jak Meta zaprezentowała własny model Muse Glimmer.
Kluczowe elementy architektury
Według informacji podanych przy premierze Nemotron 3.5 Lightning opiera się na kilku rozwiązaniach technicznych, które mają zwiększać wydajność generowania odpowiedzi.
- Hybrid Mamba-Transformer: połączenie architektury Transformer z podejściem Mamba, czyli modelami przestrzeni stanów, ma łączyć analizę kontekstu z wysoką sprawnością przetwarzania.
- Multi-Token Prediction: model przewiduje kilka tokenów jednocześnie, zamiast generować odpowiedź wyłącznie token po tokenie.
- Latent Mixture of Experts: mechanizm routingu wybiera odpowiednie wyspecjalizowane sieci ekspertów w trakcie inferencji, aby poprawić wydajność bez proporcjonalnego wzrostu kosztu obliczeniowego.
- Speculative Decoding: mniejszy model roboczy przygotowuje wstępną wersję odpowiedzi, którą następnie weryfikuje główny model, co ma zwiększać przepustowość generowania tekstu.
Czterokrotnie szybsze tokeny, ale tylko 30 procent w zadaniach agentowych
NVIDIA deklaruje, że Nemotron 3.5 Lightning generuje tokeny do czterech razy szybciej niż modele o podobnej wielkości. Jednocześnie w rzeczywistych zadaniach agentowych wzrost wydajności ma wynosić około 30 procent.
Ta różnica pokazuje, że samo przyspieszenie generowania tekstu nie przekłada się wprost na proporcjonalnie szybsze działanie agentów AI. W przypadku zadań wieloetapowych istotną rolę odgrywa warstwa orkiestracji, czyli oprogramowanie odpowiedzialne za rozdzielanie pracy, wybór agentów, przekazywanie kontekstu, utrzymywanie stanu oraz kontrolę poprawności wykonania kolejnych etapów.
Orkiestracja jako główskie ograniczenie
W zadaniach agentowych pojedynczy model nie jest jedynym elementem decydującym o czasie realizacji. System musi ustalić kolejność działań, przekazać dane między agentami i monitorować postęp. Jeśli ta warstwa działa wolno lub generuje narzut, szybsze wytwarzanie tokenów daje ograniczony efekt końcowy.
Nemotron 3.5 Lightning uzyskał wynik 24 w Artificial Analysis Intelligence Index, który ocenia m.in. możliwości agentowe, programistyczne, naukowe i ogólne modeli językowych. Jest to poprawa względem wcześniejszego modelu Nemotron 3 Nano.
Znaczenie premiery
Nowy model NVIDIA zwiększa wydajność w obszarze generowania odpowiedzi i może być użyteczny przy dużej liczbie wyspecjalizowanych zadań. Jednocześnie dane przedstawione przy premierze wskazują, że dla agentów AI kluczowym wyzwaniem pozostaje nie tylko szybkość modelu, ale także sprawność całego systemu zarządzającego pracą wielu komponentów.