Brytyjski AI Security Institute (AISI) udostępnił narzędzie, które pozwala szczegółowo analizować działania autonomicznych agentów AI i odtwarzać przebieg ich pracy, choćby w przypadku wieloetapowych zadań realizowanych przez kilka systemów jednocześnie.
Opublikowany 7 października Transect to rozwiązanie open source opracowane przy wsparciu Meridian Labs. Narzędzie analizuje zapisy aktywności agentów AI, obejmujące komunikację, wywołania narzędzi, wykorzystanie zasobów obliczeniowych oraz współpracę między agentami. Wyniki przedstawia na interaktywnej osi czasu, umożliwiając prześledzenie kolejnych etapów realizacji zadania.
Rozwiązanie odpowiada na rosnący problem związany z oceną autonomicznych systemów. Tradycyjne testy koncentrują się na rezultacie, podczas gdy agenci potrafią samodzielnie pisać kod, przeprowadzać eksperymenty i delegować zadania. Sam wynik testu dostarcza więc ograniczonych informacji o sposobie działania systemu i potencjalnych zagrożeniach.
Transect wykorzystuje modele językowe do klasyfikowania aktywności, zachowując dostęp do zapisów źródłowych. Pozwala również porównywać oceny różnych modeli i identyfikować rozbieżności wymagające weryfikacji przez człowieka.
Znaczenie takich rozwiązań wykracza poza badania nad bezpieczeństwem AI. W maju 2026 roku amerykański NIST wskazał, iż specyficzne zagrożenia związane z agentami stanowią barierę dla ich wdrażania. Możliwość odtworzenia działań systemu może ułatwić audyty, analizę incydentów oraz ocenę ryzyka przed udzieleniem agentom dostępu do firmowych zasobów.
Transect pozostaje narzędziem do analizy zarejestrowanych testów, a jego skuteczność zależy od jakości danych i interpretacji ekspertów. Jego udostępnienie wskazuje jednak kierunek rozwoju metod oceny AI: wraz ze wzrostem autonomii systemów coraz większego znaczenia nabiera możliwość udokumentowania sposobu, w jaki osiągnęły określony rezultat.

1 godzina temu














