Kwestia tego, w jaki sposób agent AI podejmuje kolejne decyzje, sięga samego serca jego architektury. U podstaw leży tak zwana pętla odbieranie–układanie planu–wykonywanie, w której program najpierw odbiera informacje z otoczenia, następnie rozkłada na czynniki dostępne możliwości, a wreszcie wykonuje wybraną akcję. Cały ten obieg powtarza się kilkakrotnie, aż do uzyskania zamierzonego efektu.
Trzonem tego procesu jest model językowy, który odgrywa rolę własnego głosu konsultacyjnego agenta. To on odczytuje polecenia użytkownika, dzieli złożone zadanie na mniejsze podzadania i sugeruje kolejność ich realizacji. Otoczenie modelu stanowią pomocnicze narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent uruchamia wtedy, gdy wymaga konkretnych danych spoza swojej wiedzy treningowej.
Interesującym elementem architektury jest tak zwana pamięć operacyjna, w której agent przechowuje tło bieżącego zadania. Dzięki niej nie gubi wątku nawet wtedy, gdy procedura rozkłada się na kilka etapów i potrzebuje przełączania między różnymi źródłami informacji. To dokładnie ta zdolność wyróżnia agenta od prostego skryptu, który wykonuje jedynie z góry ustaloną listę poleceń.
Osobną sprawą pozostaje mechanizm ewaluacji własnych działań. Dobrze skonstruowany agent potrafi zidentyfikować, że otrzymany wynik nie zgadza się od zamierzonego, i wrócić do poprzedniego etapu, by podjąć próbę innej ścieżki. Taka samokorekta przybliża działanie maszyny do ludzkiego zwyczaju weryfikowania własnej pracy przed jej złożeniem.