Non scrivo più prompt. Orchestro loop.

Ho smesso di ottimizzare frasi singole e disegno cicli che osservano, scelgono, eseguono, verificano e imparano: è il ciclo a comporre i risultati.

In breve. Per mesi ho trattato i modelli linguistici come macchine da prompt: frase migliore, risposta migliore. Poi ho passato settimane a costruire loop che osservano, scelgono, eseguono, verificano e imparano, e ho smesso di ottimizzare frasi. Questo articolo è uscito dallo stesso loop che descrive, il Content Factory dentro il progetto Northstar Factory, insieme ai due che l'hanno preceduto. Due factory e tre articoli non fanno una statistica: sono la prova che il ciclo esiste e compone. Pubblicato il 3 ottobre 2026.

Il loop in sei righe

Il loop che uso ha un'anatomia fissa. Osserva lo stato reale e lo riconcilia con quello durevole. Seleziona un solo lavoro alla volta, con una funzione deterministica: a parità di condizioni sceglie sempre la stessa cosa. Esegue. Fa verificare il risultato da un attore indipendente. Registra tutto in un diario che nessuno riscrive. Impara solo con provenance. Riseleziona.

La selezione avviene a strati, e vince il primo strato che ha un pacchetto: prima il lavoro sbloccato da misure verificate, poi i segnali osservati oggi, poi le attese di evidence scadute, poi la campagna backlog. E c'è una regola che mi piace particolarmente: se la lettura di oggi è malformata, la selezione si chiude invece di ripiegare in silenzio sul backlog. Un'osservazione rotta non deve mai diventare lavoro inventato.

Il punto di ingresso e di uscita è unico e si chiama checkpoint: c'è lavoro o non ce n'è, e la risposta è un verdetto, non una sensazione. Di come i controlli rendono tutto questo verificabile ho scritto nell'articolo sul controllo progettato; qui parlo del ritmo, non delle regole.

La credenza iniziale

Pensavo che il problema fosse scrivere buone istruzioni. Passavo tempo a cesellare prompt, a trovare la formulazione che sbloccava la risposta giusta, a collezionare template. Ogni tanto funzionava, e ogni successo mi convinceva a investire di più nella frase perfetta.

Mi sono accorto che stavo ottimizzando la cosa sbagliata quando ho confrontato due settimane di lavoro: quella passata a migliorare i prompt aveva prodotto risposte migliori una tantum, quella passata a disegnare il giro aveva prodotto un sistema che il venerdì faceva cose che il lunedì non sapeva fare. La frase migliora il colpo singolo. Il ciclo migliora il giocatore.

Cosa mi ha smentito

Tre cose, in ordine di fastidio crescente.

La prima: l'ordine in cui fai le cose conta più di come le chiedi. Un selettore deterministico che sceglie il lavoro fondativo prima di quello vistoso ha cambiato più output di qualsiasi prompt che abbia mai scritto. Nel Content Factory i punteggi hanno parlato chiaro: l'articolo con evidence pronta e valore proprietario ha battuto la coda FIFO senza discussioni.

La seconda: la verifica conta più dell'esecuzione. Un'esecuzione brillante non verificata vale quanto una mediocre: non lo sai. Quando abbiamo spostato l'attenzione dal "fallo bene" al "dimostra che è fatto", con un verificatore fuori dalla sessione di chi ha eseguito, la qualità è salita senza toccare i prompt.

La terza, quella che mi ha cambiato il lavoro: i prompt non compongono, i loop sì. Una buona risposta finisce lì. Un buon giro lascia stato durevole: un receipt nel diario, un concetto nel registry, una learning con provenance, un articolo pubblicato. Il giro dopo parte da più in alto. Dopo qualche settimana l'effetto cumulativo è imbarazzante da confrontare con qualsiasi prompt, per quanto ben scritto.

Cosa faccio adesso al posto di scrivere prompt

Quando ho un obiettivo, non apro più un template. Disegno il giro: cosa osserva, come sceglie (funzione, non modello), chi verifica, dove registra, cosa impara e quando riseleziona. Poi lo avvio in observe, dove guarda e basta, e lo lascio salire di autonomia solo quando le misure lo giustificano.

La checklist che uso è corta. C'è una misura che una macchina sa leggere da sola? Se no, prima quella, niente loop. La selezione è deterministica e rileggibile? Il verdetto arriva da fuori la sessione? Il diario è append-only? L'apprendimento ha provenance o è un'opinione travestita? Se una risposta è no, non ho un loop: ho un prompt con le ambizioni.

Qui secondo me stiamo facendo collettivamente l'errore di prima: intere aziende stanno costruendo librerie di prompt quando dovrebbero costruire i loro giri. Nella mia esperienza, a ogni cambio di modello i prompt vanno ritestati uno per uno; i loop no, perché le regole vivono nel registro, non nelle frasi.

Cosa non prometto

Non prometto che i team che lavorano per loop superino quelli che lavorano per prompt. È una hypothesis, lo dico chiaro: l'ho visto su due factory mie, non ho misure su team altrui. Quello che so è cosa è successo al mio lavoro quando ho smesso di chiedermi "che prompt scrivo" e ho iniziato a chiedermi "che loop disegno". La domanda migliore non garantisce la risposta, ma decide dove la cerchi.

Domande frequenti

Devo buttare i miei prompt?

No. I prompt restano le istruzioni dentro ogni passo del giro. Quello che cambia è dove sta l'intelligenza del sistema: non più nella frase, nel ciclo.

Quanto costa un loop rispetto a un prompt?

Di più all'inizio: serve la misura, il selettore, il verificatore, il diario. Poi il costo per risultato scende perché niente viene rifatto due volte e niente viene verificato a sensazione.

Da dove parto se non ho niente?

Da observe e da una misura. Un loop che guarda e registra per una settimana ti insegna più del tuo lavoro di qualsiasi corso: alla fine hai il diario di cosa succede davvero, e da lì disegni il resto.