GPT, Claude o Qwen? Probabilmente è la domanda sbagliata
GPT, Claude o Qwen? Tre casi datati in cui il nome del modello non ha deciso niente: A/B appaiato, Mock provider e verdetto deterministico.
In breve. La domanda arriva in tre nomi: GPT, Claude o Qwen. La mia risposta, dopo tre casi datati nei miei sistemi: il nome del modello non ha mai deciso niente. Hanno deciso l'A/B appaiato con cui ho cambiato modello senza cambiare qualità, il Mock provider con cui il 98% dei test non sa che modello usi, e il verdetto deterministico che non chiama nessun modello. Scegliere il modello è una riga della risposta; le domande giuste sono altre tre: come lo confronti, come lo isoli, chi emette il verdetto.
Ho cambiato modello senza cambiare qualità
Dopo il repricing OpenAI del 30 luglio 2026 ho migrato SupportChat, l'assistente di supporto di Arvo, da gpt-5.4-mini a gpt-5.6-luna. Non l'ho trattato come un taglio di costo ma come un cambio di contratto di qualità: A/B appaiato su 200 casi congelati passati a entrambi i modelli, 83,0% contro 84,0% con p = 0,83, e condizioni di rollback scritte prima di accendere il nuovo modello. Il metodo completo — baseline, trigger, stime oneste — l'ho raccontato nella migrazione con A/B appaiato e rollback scritto prima.
Il punto che mi interessa qui è un altro: a migrazione finita, nessuno degli utenti ha notato niente, e io ho notato solo il listino. Se la domanda fosse stata "gpt-5.4-mini o gpt-5.6-luna?", la risposta corretta sarebbe stata un'alzata di spalle seguita dai 200 casi: con l'harness giusto, cambiare nome è un'operazione amministrativa. Senza, anche il modello migliore è una scommessa che non sai di aver fatto.
Il 98% dei test non sa che modello usi
Il secondo caso sta dietro un livello di astrazione: un AI Provider Layer con un Mock provider per i test, che simula latenza e fallimenti senza chiamare nessun modello a pagamento. Nei costi nascosti degli agenti AI racconto il risultato: il 98% delle chiamate GPT-4 in QA sostituite dal Mock, con un solo golden path reale eseguito una volta a notte.
Quando il 98% dei tuoi test passa per un Mock, la domanda "quale modello usiamo in QA?" non ha risposta perché non ha senso: in QA non usi nessun modello. E il golden path notturno è la spia che ti avvisa quando il mondo vero diverge dal finto. L'astrazione non ti rende agnostico per ideologia: ti rende libero di cambiare idea sul modello senza riscrivere i test, che è dove il costo vero si nasconde.
Il verdetto che non conosce il modello
Il terzo caso è il più radicale: lo strato che decide se il lavoro è fatto non chiama nessun modello per definizione. Nella factory il verdetto è codice deterministico — script che ricontrollano cluster, orfani, hreflang, build e SEO — eseguito fuori dalla sessione di chi ha costruito, sulla testa rilasciata. Decine di check, zero inferenze: il giudice non sa quale modello ha scritto il compito, e non gli serve saperlo.
È il rovesciamento della domanda iniziale. Non "quale modello è abbastanza bravo da fidarmi", ma "quale verdetto è abbastanza meccanico da non dovermi fidare". Come spiego nella guida su come verificare il lavoro di un agente AI, la fiducia non è un input del sistema: è un output del verdetto. E un verdetto che dipende dal modello che giudica non è un verdetto, è un secondo parere.
Quando la domanda è giusta
Il "probabilmente" del titolo è la parte seria. Ci sono casi in cui il nome del modello decide davvero: quando il costo per milione di token sposta il budget, quando la latenza rompe il contratto col cliente, quando la finestra di contesto non contiene il tuo caso d'uso. Per la lente dei costi ho scritto quanto costa investire in LLM: lì i nomi contano, perché i listini sono diversi.
Ma nota l'ordine: prima costruisci l'harness che ti permette di cambiare (A/B congelato, Mock, verdetto deterministico), poi scegli il nome sul listino. Chi sceglie il modello prima dell'harness non sta ottimizzando: sta sposando un fornitore a scatola chiusa, e lo scoprirà al primo repricing.
Fatti e limiti
FACT. Dopo il repricing OpenAI del 30 luglio 2026, SupportChat (Arvo) migra da gpt-5.4-mini a gpt-5.6-luna con A/B appaiato su 200 casi congelati: 83,0% contro 84,0%, p = 0,83, rollback scritto prima dello switch.
FACT. Con AI Provider Layer + Mock provider, il 98% delle chiamate GPT-4 in QA è sostituito dal Mock; un solo golden path reale gira una volta a notte.
FACT. Il verdetto della factory è codice deterministico (script di controllo, build, SEO) eseguito fuori dalla sessione del costruttore: decine di check, zero chiamate a modelli.
INTERPRETATION. Chiamo "domanda sbagliata" la scelta del modello perché nei miei tre casi la qualità è stata decisa dall'harness, non dal nome.
INTERPRETATION. Non ho confrontato GPT, Claude e Qwen sullo stesso benchmark: la tesi non è "sono uguali", è "la differenza che conta si misura con l'harness, non con il nome".
Limiti: tre meccanismi dai miei sistemi, non un benchmark tra modelli. Le cifre (200 casi, 83,0/84,0, 98%, golden path notturno) sono rilette nelle fonti approvate al momento della scrittura. Dove le fonti tacciono, taccio anch'io.
Domande frequenti
Quindi un modello vale l'altro?
No. Costo, latenza e finestra di contesto differiscono davvero, e a volte decidono. La tesi è più stretta: a parità di harness, cambiare nome è amministrativo; senza harness, anche il nome migliore è una scommessa cieca. Prima l'harness, poi il listino.
E Qwen, Claude e gli open weights dove entrano?
Entrano al momento della scelta sul listino, dopo che l'harness esiste. L'A/B appaiato funziona con qualunque coppia di modelli, il Mock non chiama nessuno, il verdetto non li conosce: è proprio questa indifferenza meccanica che rende la domanda sul nome secondaria.
Da dove comincio se oggi chiamo un solo modello ovunque?
Dal Mock: un provider finto dietro un'interfaccia, con latenza e fallimenti simulati, e i test che lo usano. Poi un golden path reale notturno. Quando il 98% dei test non sa che modello usi, cambiare modello smette di fare paura — e la domanda sui nomi trova la sua vera dimensione: una riga del listino.