Agent AVO NVIDII uzyskał 100 proc. w publicznym teście ARC-AGI-3
Lead: NVIDIA pokazała, jak duże znaczenie dla możliwości modeli AI może mieć odpowiednia warstwa sterująca. Agent kodujący AVO, zbudowany wokół modelu Claude Opus 5 firmy Anthropic, osiągnął pełny wynik w publicznym zestawie ARC-AGI-3, rozwiązując wszystkie dostępne zadania.
AVO z pełnym wynikiem w publicznym ARC-AGI-3
Według udostępnionych informacji agent AVO poradził sobie ze wszystkimi 183 poziomami w 25 publicznie dostępnych grach w ramach ARC-AGI-3. System nie otrzymał wcześniej określonych reguł ani celów, a postępy osiągał poprzez testowanie kolejnych działań, obserwowanie rezultatów i korygowanie błędów.
Wynik jest szczególnie istotny w zestawieniu z bazowym modelem Claude Opus 5, który na tym samym publicznym zestawie miał uzyskać 30 proc. skuteczności. AVO korzysta z tego modelu, ale działa jako zewnętrzna warstwa organizująca jego pracę.
Czym jest warstwa typu harness
W kontekście systemów AI określenie harness oznacza dodatkową warstwę oprogramowania otaczającą model. Jej zadaniem jest przekształcenie ogólnego modelu językowego w narzędzie zdolne do wykonywania bardziej złożonych zadań.
Najważniejsze funkcje takiej warstwy obejmują:
- łączenie modelu ze środowiskiem zewnętrznym, na przykład plikami, skryptami lub interfejsami zadań,
- tworzenie pętli prób i błędów, w której wynik każdego działania wraca do modelu jako informacja zwrotna,
- porządkowanie pamięci roboczej i zapisywanie istotnych postępów,
- narzucanie struktury poleceń oraz ograniczeń, które pomagają prowadzić proces rozwiązywania problemu.
Od optymalizacji CUDA do łamigłówek logicznych
AVO został pierwotnie przygotowany przez NVIDIĘ do optymalizacji jąder GPU CUDA. W tym zastosowaniu agent działał autonomicznie przez siedem dni, przeanalizował ponad 500 kierunków działań i wygenerował jądra, które według źródła były do 10,5 proc. szybsze od FlashAttention-4.
Następnie, bez zmiany podstawowej architektury agenta, narzędzia inżynierskie związane z GPU zastąpiono interfejsem zadań ARC-AGI-3. AVO przeniósł mechanizm analizy kodu i samokorekty na odmienny obszar: wizualne oraz interaktywne łamigłówki logiczne.
Większa efektywność niż inne rozwiązania
NVIDIA podała, że AVO rozwiązał 183 poziomy przy użyciu łącznie 6624 działań. Dla porównania inne czołowe warstwy agentowe, takie jak VISTA, miały potrzebować 7542 działań do ukończenia publicznego zestawu. Oznacza to około 12 proc. wyższą efektywność AVO w tym konkretnym teście.
Wynik dotyczy tylko publicznego zestawu
Ważnym zastrzeżeniem pozostaje fakt, że platforma ewaluacyjna ARC-AGI-3 nie pozwala obecnie uruchamiać niestandardowych zewnętrznych warstw agentowych na ukrytym, prywatnym zestawie testowym. Nie wiadomo więc, jak AVO poradziłby sobie w tej części oceny.