Calcolatore durata A/B test

Inserisci tasso di conversione base, uplift che vuoi rilevare e traffico settimanale: ottieni il campione per variante e le settimane di test. In modalità avanzata verifichi la significatività di un test in corso e la durata per segmento. I valori già inseriti sono un esempio ipotetico.

Funziona nel tuo browser: i dati che inserisci non vengono inviati né salvati da nessuna parte.

Modalità
Es. 20 = da 10% a 12%.
100 = tutto il traffico entra nel test.
Campione per variante–
Durata stimata–

Le formule

  • Campione per variante = 2 × p̄(1 − p̄) × (1,96 + 0,84)² ÷ δ², con p̄ media delle due conversioni e δ differenza assoluta: test bilaterale al 95%, potenza 80%
  • Durata = (2 × campione per variante) ÷ traffico nel periodo
  • Significatività = test z a due proporzioni con p pooled; p-value bilaterale dalla normale standard
  • Segmenti = stessa dimensione totale divisa per il traffico del segmento

Esempio con i valori preimpostati: base 10% e uplift +20% relativo chiedono 3.838 visitatori per variante; con 10.000 visitatori a settimana il test chiude in 0,8 settimane. Il test avanzato di esempio (500/5000 contro 560/5000) dà p ≈ 0,051: non significativo al 95%, per un soffio. Sono numeri di fantasia.

Domande frequenti

Perché il mio test «non conclude mai»?

Quasi sempre per uno di tre motivi: traffico troppo basso per l’uplift che vuoi rilevare, uplift atteso irrealistico (un +50% relativo si rileva in giorni, un +2% in mesi), o sbirciate intermedie che fermano il test al primo verde. Questo calcolatore ti dice prima di partire se il test è fattibile col tuo traffico.

Cosa significa potenza 80%?

Se la differenza vera è quella che hai ipotizzato, hai l’80% di probabilità di rilevarla come significativa. Il restante 20% è il rischio di falso negativo: l’effetto c’è ma il test non lo vede. Alzare la potenza allunga la durata: per questo resta un’ipotesi fissa e dichiarata.

Posso fermarmi appena vedo p minore di 0,05?

No, non senza pagare il prezzo: guardare i risultati ogni giorno e fermarsi al primo verde gonfia i falsi positivi ben oltre il 5%. Decidi la dimensione del campione prima con la modalità semplice, poi aspetta di raggiungerla: la modalità avanzata serve a leggere il risultato, non a giustificare uno stop anticipato.

E se ho tre varianti invece di due?

Serve più traffico: ogni confronto aggiuntivo è un’altra occasione di falso positivo. Come regola pratica moltiplica per 1,5 la dimensione per variante e correggi la soglia (Bonferroni: 0,05 diviso il numero di confronti). Questo strumento calcola il caso A/B puro: per A/B/n chiedi allo statistico di turno.

I segmenti valgono come test separati?

Ogni segmento ha il suo traffico e quindi la sua durata: un segmento col 10% del traffico impiega dieci volte tanto. La tabella sotto mostra quando ciascun segmento matura, così eviti di leggere il mobile quando solo il desktop ha chiuso.

Quali limiti ha questo calcolatore?

Assume test bilaterale al 95% con potenza 80%, traffico stabile e conversioni indipendenti. Non considera stagionalità, novelty effect, interferenza tra utenti né randomizzazione sbilanciata: se il tuo contesto viola queste ipotesi, i numeri sono un punto di partenza, non una garanzia.

Per approfondire