PsyMeasureFDR

PsyMeasure · Laboratorio di statistica

Simulatore del tasso di false scoperte (FDR)

Confronta Bonferroni, Holm e Benjamini–Hochberg nel simulatore gratuito di test multipli. Esplora il tasso di false scoperte, FWER e la potenza con 11 metodi.

Quanti risultati significativi sono soltanto rumore? Esplora il compromesso tra false scoperte ed effetti mancati usando gli stessi esperimenti simulati per ogni metodo.

Confronta i risultati

Pronto per esplorare

Guarda la simulazione

Ogni riquadro è un test di un esperimento simulato. Il colore mostra la verità; il segno mostra cosa ha deciso il metodo.

I risultati compariranno qui dopo la simulazione.

Colore = effetto vero:negativonessunopositivo
Luminosità:quanto è risultato forte l’effetto in questo campione (|z|)
Ordine dei riquadri:

Lo stesso esperimento, metodo per metodo

Molti esperimenti a colpo d’occhio

Ogni riga è un intero esperimento: effetti reali a sinistra, rumore a destra. I riquadri luminosi a sinistra sono effetti rilevati; quelli gialli a destra sono false scoperte. Seleziona una riga per esaminarla qui sopra.

Tasso di false scoperte (FDR)

Quota media di false scoperte fra le scoperte. Gli esperimenti senza scoperte contribuiscono con zero.

Potenza statistica

Quota di effetti reali rilevati. Un valore più alto indica meno effetti mancati.

Tasso di errore familiare (FWER)

Quota di esperimenti con almeno una falsa scoperta.

L’obiettivo si applica a FDR o FWER a seconda del metodo, non alla potenza. Le stime simulate oscillano intorno ai valori teorici.

Risultati esatti

Medie degli esperimenti completati. FP = false scoperte; FN = effetti reali mancati.

Risultati esatti
MetodoFDRPotenzaFWERMedia FPMedia FN
Da dove provengono i valori p

I valori p sotto l’ipotesi nulla sono approssimativamente uniformi. Gli effetti reali tendono a produrre valori vicini a zero. Ogni gruppo è normalizzato separatamente; i gruppi vuoti non hanno barre.

Ipotesi nulle (rumore)Effetti reali

Ipotesi della simulazione

Ogni esperimento contiene test z indipendenti, bilaterali, a un campione e con varianza nota. I test nulli usano Z ~ N(0, 1); gli effetti reali usano Z ~ N(d√n, 1). Il numero di effetti reali è arrotondato a un intero. Il modello non simula test correlati, test t, arresto facoltativo o distorsione da pubblicazione.

Sono stime Monte Carlo, non garanzie per un singolo esperimento. Con 2.000 ripetizioni, una FWER stimata del 5% ha un errore standard di circa 0,5 punti percentuali. La FDR è la media delle proporzioni di false scoperte nei singoli esperimenti, non il rapporto fra il totale aggregato delle false scoperte e quello delle scoperte.

FDR / FWER

Confronti multipli: FDR e FWER

Testare molte ipotesi crea più occasioni di falsi positivi. Le correzioni cambiano la soglia per dichiarare significativo un risultato. Occorre confrontare sia il controllo degli errori sia la capacità di rilevare effetti reali.

Perché correggere i test multipli

Con 20 ipotesi nulle vere e indipendenti e α = 0.05, la probabilità di almeno un falso positivo è 1 − (1 − 0.05)²⁰ ≈ 64%. Il numero atteso di falsi positivi è 20 × 0.05 = 1. Sono quantità diverse: una probabilità e un conteggio.

Cos’è il tasso di false scoperte?

FDR = E[V / max(R, 1)], dove V è il numero di false scoperte e R il numero totale di scoperte. Un obiettivo FDR del 5% controlla questa proporzione in media su esperimenti ripetuti, sotto le ipotesi del metodo. Non significa che ogni risultato significativo abbia il 5% di probabilità di essere falso.

In cosa differisce la FWER?

FWER = P(V ≥ 1): la probabilità di effettuare anche una sola falsa scoperta in una famiglia di test. Bonferroni e Holm mirano alla FWER; Benjamini–Hochberg mira alla FDR. Controllare la FWER limita anche la FDR, ma spesso rileva meno effetti reali.

Esempio svolto: Bonferroni e BH

Prendi cinque valori p ordinati: 0.001, 0.008, 0.039, 0.041, 0.300, con α = q = 0.05. Bonferroni usa 0.05 / 5 = 0.01 e rifiuta le prime due ipotesi. BH confronta i ranghi con 0.01, 0.02, 0.03, 0.04, 0.05. Il rango più alto che soddisfa il criterio è 2, quindi BH rifiuta anch’esso le prime due. Se l’ultimo valore p fosse 0.045, BH rifiuterebbe tutte e cinque: usa il rango più alto che soddisfa il criterio, non il primo che fallisce.

Confronta tutti gli 11 metodi di correzione

Senza correzione

Rifiuta ogni ipotesi quando p < α. Nessun controllo dell’errore sull’intera famiglia. È un riferimento utile per vedere come si accumulano i falsi positivi.

Bonferroni

Bonferroni rifiuta quando p < α/m. Controlla la FWER per valori p validi con qualsiasi struttura di dipendenza, ma può mancare effetti reali quando si svolgono molti test.

Holm

Ordina i valori p dal più piccolo al più grande. Confronta il rango r con α/(m−r+1) e fermati al primo mancato superamento. Holm controlla la FWER con dipendenza arbitraria e rifiuta almeno tutte le ipotesi rifiutate da Bonferroni.

Šidák

Usa la soglia unica 1−(1−α)^(1/m). Šidák controlla la FWER per test indipendenti ed è leggermente meno conservativo di Bonferroni.

Holm–Šidák

Applica la procedura sequenziale discendente di Holm con soglie 1−(1−α)^(1/(m−r+1)). Questa simulazione usa test indipendenti; non presumere che il metodo gestisca dipendenza arbitraria.

Hochberg

Trova il rango massimo r per cui p(r) ≤ α/(m−r+1) e rifiuta tutti i ranghi fino a r. Hochberg controlla la FWER con indipendenza o adeguate condizioni di dipendenza positiva.

Hommel

Hommel usa una procedura di test chiusi basata sui test di Simes. Controlla la FWER con indipendenza o condizioni che sostengono la disuguaglianza di Simes ed è almeno potente quanto Hochberg. Richiede più calcolo.

Benjamini–Hochberg

Trova il rango massimo r per cui p(r) ≤ (r/m)q e rifiuta tutti i ranghi fino a r. Benjamini–Hochberg controlla la FDR per test indipendenti e con alcune condizioni di dipendenza positiva (PRDS).

Benjamini–Yekutieli

Usa BH dividendo q per Hm = Σ(1/k), k = 1…m. Benjamini–Yekutieli controlla la FDR con dipendenza arbitraria, di solito a scapito della potenza.

Stile Storey (esplorativo)

Questa variante esplorativa semplificata stima π₀ dalla quota di valori p superiori a 0.5, poi esegue BH con q/π̂₀. Non è un’implementazione completa dei q-value e non offre una garanzia universale sulla FDR per campioni finiti.

BH adattivo (esplorativo)

Questa variante esplorativa in due passaggi esegue prima BH con q, stima m₀ come max(1, m−R₁), poi esegue BH con q·m/m̂₀. Non è la procedura BKY e non viene presentata come dotata della sua garanzia per campioni finiti.

Domande frequenti

È un calcolatore FDR per i miei valori p?

È un simulatore didattico, non un calcolatore per caricare valori p. Genera esperimenti con una verità nota, così puoi osservare false scoperte ed effetti mancati, normalmente non conoscibili dai soli dati reali.

q = 0.05 garantisce solo il 5% di falsi positivi?

No. Un obiettivo q = 0.05 riguarda una proporzione attesa fra le scoperte sotto le ipotesi della procedura. Un singolo esperimento può avere una proporzione di false scoperte maggiore o minore.

Quale correzione dovrei scegliere?

Decidi quali errori deve controllare il tuo disegno di ricerca. I metodi FWER limitano il rischio di qualsiasi falsa scoperta nella famiglia di test. I metodi FDR controllano la quota media di false scoperte fra le scoperte. Verifica le ipotesi sulla dipendenza e definisci la famiglia di ipotesi prima di esaminare i risultati.

Fonti e approfondimenti