Aperture

Architektura decyzyjna agentów AI – jak maszyna wybiera następny krok

Kwestia tego, w jaki sposób agent AI podejmuje kolejne decyzje, sięga samego rdzenia jego architektury. U podstaw leży tak zwana pętla odbieranie–układanie planu–wykonywanie, w której program najpierw odbiera informacje z otoczenia, następnie rozkłada na czynniki dostępne możliwości, a wreszcie wykonuje wybraną akcję. Cały ten obieg powtarza się wielokrotnie, aż do osiągnięcia zamierzonego efektu.

Sercem tego procesu jest model językowy, który pełni rolę własnego głosu doradczego agenta. To on interpretuje instrukcje użytkownika, rozbija złożone zadanie na mniejsze podzadania i proponuje kolejność ich realizacji. Środowisko modelu stanowią pomocnicze narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent uruchamia wtedy, gdy potrzebuje konkretnych danych spoza swojej wiedzy treningowej.

Ciekawym elementem architektury jest tak zwana pamięć robocza, w której agent trzyma tło bieżącego zadania. Dzięki niej nie gubi nici nawet wtedy, gdy proces rozkłada się na kilka etapów i wymaga przełączania między różnymi źródłami informacji. To dokładnie ta zdolność wyróżnia agenta od podstawowego skryptu, który wykonuje jedynie z góry ustaloną listę poleceń.

Osobną sprawą pozostaje sposób oceny własnych działań. Odpowiednio skonstruowany agent potrafi rozpoznać, że otrzymany wynik odbiega od zamierzonego, i wrócić do poprzedniego etapu, by spróbować alternatywnej ścieżki. Taka autokorekta zbliża działanie maszyny do ludzkiego nawyku sprawdzania własnej pracy przed jej oddaniem.