Sistemi che si governano da soli: come funzionano gli agent loops
Cosa sono gli agent loops: le definizioni di loop, supervisore, gate e remediation, con episodi reali dalla mia factory autonoma.
In breve. Un agent loop è un ciclo che osserva un progetto, sceglie un lavoro, lo esegue, lo fa verificare e impara dagli errori — e si governa da solo perché ogni fase ha un giudice indipendente da chi l'ha eseguita. Questa pagina definisce le quattro parole che uso sempre — loop, supervisore, gate, remediation — e mappa i sei articoli dove racconto gli episodi che le hanno plasmate. Solo fatti dalla mia factory, con i limiti dichiarati in fondo. Pubblicato il 10 ottobre 2026.
Quattro parole, quattro definizioni
Loop. Un ciclo chiuso di cinque fasi — osserva, seleziona, esegue, verifica, impara — dove ogni fase è giudicata da qualcuno diverso da chi l'ha eseguita: chi osserva non sceglie, chi esegue non verifica, chi impara non ricorda ma scrive test. Il disegno è nato quando ho scoperto che una routine era ferma da 33 giorni sotto gli occhi di un agente che diceva "tutto a posto": avevo costruito un monologo, non un loop. Il ciclo completo è nel loop che osserva, seleziona, esegue, verifica e impara.
Supervisore. Il componente che governa un run con misure osservate, mai dichiarate dal governato: budget, scadenze, stato di avanzamento. Il mio misurava il budget con il createdAt scritto dall'agente stesso — l'orologio del controllato — finché la PR #339 non lo ha spostato sul recordedAt osservato dal kernel. La regola che ne ho ricavato: mai fondare un controllo su un dato che il controllato può scrivere. Il caso è nel supervisore che si fidava dell'orologio dell'agente.
Gate. Un cancello che giudica se proseguire, fermarsi o scalare — e che vale solo se distingue la scala di ciò che governa. Il mio Governor scambiò un blocco umano globale per un'attesa locale (CONCERN gov1:c5d56f63, PR #296): contenuto giusto, scala sbagliata, via libera dove serviva uno stop. E i gate owner scattavano per scelte tecniche che nessun owner doveva decidere, finché le PR #294 e #309 non li hanno limitati alle scelte con impatto per chi usa il prodotto. I due casi: il Governor che ha letto male un blocco globale e i falsi gate owner.
Remediation. Una riparazione eseguita e verificata in un giro completo — osserva, seleziona, esegue, verifica, registra — con il verdetto emesso fuori dalla sessione di chi ha eseguito, sul codice davvero rilasciato. La mia factory ne ha chiuse quattro su un progetto vero, le PR numero 4, 5, 6 e 7, senza un mio intervento. Quattro casi: prova di esistenza, non statistica. La storia è nella fabbrica che ripara il software mentre dormiamo.
I sei articoli del cluster
Se le definizioni sopra sono la mappa, questi sono i territori — un episodio per articolo, ognuno con fatti e interpretazione separati:
- Il loop in cinque fasi: osserva, seleziona, esegue, verifica, impara — ogni fase col suo giudice.
- Il supervisore e l'orologio dell'agente: perché un controllo non può poggiare su dati scritti dal controllato.
- Il Governor e la scala dei blocchi: il blocco globale letto come attesa locale, e i campi diventati machine-readable.
- I falsi gate owner: quando chiedere all'umano è il difetto, e la regola dell'impatto per l'utente.
- La remediation di notte: quattro riparazioni chiuse mentre dormivo, con i receipt di ogni passaggio.
- Trace e audit come prova: le quattro proprietà che distinguono una prova dalla burocrazia.
Da dove cominciare
Se parti da zero, comincia da observe e da una misura: sette giorni di osservazione registrata insegnano sul tuo lavoro più di qualsiasi corso. Poi aggiungi le fasi una alla volta — selezione, esecuzione, verifica — e ognuna va meritata con misure che una macchina sa leggere. Il quadro d'insieme, con i limiti di quello che so, è in Building the Autonomous Company.
Fatti e limiti, separati
Fatti, con provenance (tutti già pubblicati negli articoli collegati):
- Routine ferma 33 giorni, audit di un'ora su 115 file, cache ferma da due mesi, 18 giornate mai vissute, 71 titoli a 0,00%, due strategie cieche da 78 giorni (articolo fabbrica del 3 ottobre 2026).
- Quattro riparazioni chiuse, PR numero 4, 5, 6 e 7, verdetto da un attore fuori dalla sessione sul codice rilasciato (articolo fabbrica; articolo loop del 5 ottobre 2026).
- Budget dal
createdAtdichiarato alrecordedAtosservato, PR #339; Governor, CONCERN gov1:c5d56f63, PR #295 e #296; falsi gate, PR #294 e #309, una voce uscita dal blocco umano senza che nessun owner rispondesse (articoli supervisore, governor e falsi gate del 5 ottobre 2026). - Trace in quattro proprietà — chiudibile da altri, machine-readable, append-only, perimetro dichiarato — e verdetto PASS solo per il perimetro provato (articolo trace del 6 ottobre 2026).
Limiti:
- Parlo per una persona e due factory: la tesi dei giudici indipendenti è interpretazione mia, non un risultato misurato.
- Il loop ha riparato guasti nel codice, non ha preso decisioni di prodotto: tra "ripara da solo" e "decide da solo" c'è un confine che non ho attraversato.
- La conformità del sistema alla sua specifica è 69,7 su 100, autovalutata, con soglia d'uso a 90: il voto me lo sono dato da solo.
Domande frequenti
Un agent loop decide da solo cosa fare?
Nel mio caso no: ripara guasti nel codice, non prende decisioni di prodotto. Gli esiti che contano li decido io; il sistema parcheggia esplicitamente i casi che non può risolvere. La linea tra "ripara da solo" e "decide da solo" è dichiarata come confine non attraversato.
Cosa distingue un gate vero da uno falso?
Un gate vero giudica su una misura machine-readable e scala ciò che non può risolvere; uno falso chiede all'umano una scelta tecnica, o dà via libera per silenzio. Il test a posteriori: se il confine è uscito dal blocco senza risposta owner, il gate non serviva.
Perché il registro è append-only?
Perché la storia di un confine si deve leggere come sequenza — decisione, risoluzione, cura, blocco, ripresa — mai come stato finale riscritto. Niente si corregge: una decisione si scioglie con una risoluzione, un'indagine inconclusiva si chiude con un piano datato.
Da cosa comincio se parto da zero?
Da observe e da una misura che una macchina sa leggere da sola: test, contratti, metriche. Senza quella, un loop gira a vuoto e dice "tutto verde" — peggio del silenzio, perché sembra una risposta.