PsyMeasureFDR

PsyMeasure · Statistiklabbet

Simulator för falsk upptäcktsgrad (FDR)

Jämför Bonferroni, Holm och Benjamini–Hochberg i en gratis simulator för multipla tester. Utforska FDR, FWER och statistisk styrka med 11 metoder.

Hur många signifikanta resultat är bara brus? Utforska avvägningen mellan falska upptäckter och missade effekter med samma simulerade experiment för varje metod.

Jämför utfallen

Redo att utforska

Se simuleringen

Varje ruta är ett test i ett simulerat experiment. Färgen visar sanningen; markeringen visar vad metoden beslutade.

Resultaten visas här efter simuleringen.

Färg = verklig effekt:negativingenpositiv
Ljusstyrka:hur stark effekten var i det här stickprovet (|z|)
Rutornas ordning:

Samma experiment, metod för metod

Många experiment i en överblick

Varje rad är ett helt experiment: verkliga effekter till vänster, brus till höger. Ljusa rutor till vänster är hittade effekter; gula rutor till höger är falska upptäckter. Välj en rad för att granska den ovanför.

Falsk upptäcktsgrad (FDR)

Genomsnittlig andel falska bland upptäckterna. Experiment utan upptäckter bidrar med noll.

Statistisk styrka

Andel verkliga effekter som upptäckts. Högre värde innebär färre missade verkliga effekter.

Familjevis felrisk (FWER)

Andel experiment med minst en falsk upptäckt.

Målnivån gäller FDR eller FWER beroende på metod, inte styrkan. Simuleringsskattningar varierar kring de teoretiska värdena.

Exakta resultat

Genomsnitt för slutförda experiment. FP = falska upptäckter; FN = missade verkliga effekter.

Exakta resultat
MetodFDRStyrkaFWERMedelvärde FPMedelvärde FN
Varifrån kommer p-värdena?

P-värden under nollhypotesen är ungefär likformigt fördelade. Vid verkliga effekter tenderar de mot noll. Varje grupp normaliseras separat; tomma grupper har inga staplar.

Nollhypoteser (brus)Verkliga effekter

Vad simuleringen förutsätter

Varje experiment består av oberoende, tvåsidiga z-test för ett stickprov med känd varians. För nollhypoteser används Z ~ N(0, 1); för verkliga effekter Z ~ N(d√n, 1). Antalet verkliga effekter avrundas till ett heltal. Modellen simulerar inte beroende test, t-test, valfri stopptid eller publikationsbias.

Det här är Monte Carlo-skattningar, inte garantier för ett enskilt experiment. Vid 2 000 upprepningar har en skattad FWER på 5 % ett standardfel på cirka 0,5 procentenheter. FDR är medelvärdet av andelarna falska upptäckter per experiment, inte kvoten mellan sammanlagda falska upptäckter och alla upptäckter.

FDR / FWER

Multipla jämförelser: FDR jämfört med FWER

När många hypoteser testas ökar möjligheterna till falskt positiva resultat. Korrigeringarna ändrar tröskeln för att kalla ett resultat signifikant. Det är relevant att jämföra både felkontroll och förmågan att upptäcka verkliga effekter.

Varför kräver multipla test en korrigering?

Med 20 oberoende sanna nollhypoteser och α = 0.05 är sannolikheten för minst ett falskt positivt resultat 1 − (1 − 0.05)²⁰ ≈ 64 %. Det förväntade antalet falskt positiva resultat är 20 × 0.05 = 1. Det är olika storheter: en sannolikhet och ett antal.

Vad är falsk upptäcktsgrad?

FDR = E[V / max(R, 1)], där V är antalet falska upptäckter och R är det totala antalet upptäckter. Ett FDR-mål på 5 % kontrollerar denna andel i genomsnitt över upprepade experiment under metodens antaganden. Det betyder inte att varje signifikant resultat har 5 % sannolikhet att vara falskt.

Hur skiljer sig FWER?

FWER = P(V ≥ 1): sannolikheten för minst en falsk upptäckt inom en testfamilj. Bonferroni och Holm är inriktade på FWER; Benjamini–Hochberg på FDR. Kontroll av FWER begränsar också FDR, men upptäcker ofta färre verkliga effekter.

Genomgånget exempel: Bonferroni jämfört med BH

Ta fem sorterade p-värden: 0.001, 0.008, 0.039, 0.041, 0.300, med α = q = 0.05. Bonferroni använder 0.05 / 5 = 0.01 och förkastar de två första. BH jämför rangordningen med 0.01, 0.02, 0.03, 0.04, 0.05. Den högsta rang som klarar gränsen är 2, så BH förkastar också de två första. Om det sista p-värdet vore 0.045 skulle BH förkasta alla fem: använd den högsta rang som klarar gränsen, inte den första som misslyckas.

Jämför alla 11 korrigeringsmetoder

Utan korrigering

Förkasta varje hypotes när p < α. Ingen kontroll av fel på familjenivå. Detta är en användbar jämförelsegrund för att se hur falskt positiva resultat samlas.

Bonferroni

Bonferroni förkastar när p < α/m. Metoden kontrollerar FWER för giltiga p-värden under alla beroendestrukturer, men kan missa verkliga effekter när många test görs.

Holm

Sortera p-värden från lägst till högst. Jämför rang r med α/(m−r+1) och stanna vid första misslyckandet. Holm kontrollerar FWER vid godtyckligt beroende och förkastar minst allt som Bonferroni förkastar.

Šidák

Använd den gemensamma tröskeln 1−(1−α)^(1/m). Šidák kontrollerar FWER för oberoende test och är något mindre konservativ än Bonferroni.

Holm–Šidák

Tillämpa Holms stegvisa nedåtgående förfarande med trösklarna 1−(1−α)^(1/(m−r+1)). Den här simuleringen använder oberoende test; anta inte att metoden hanterar godtyckligt beroende.

Hochberg

Hitta den högsta rang r som uppfyller p(r) ≤ α/(m−r+1) och förkasta alla ranger till och med r. Hochberg kontrollerar FWER vid oberoende eller lämpliga villkor för positivt beroende.

Hommel

Hommel använder ett slutet testförfarande baserat på Simes-test. Metoden kontrollerar FWER vid oberoende eller villkor där Simes olikhet gäller, och har minst lika hög styrka som Hochberg. Den kräver mer beräkning.

Benjamini–Hochberg

Hitta den högsta rang r som uppfyller p(r) ≤ (r/m)q och förkasta sedan alla ranger till och med r. Benjamini–Hochberg kontrollerar FDR för oberoende test och vissa villkor för positivt beroende (PRDS).

Benjamini–Yekutieli

Använd BH med q dividerat med Hm = Σ(1/k), k = 1…m. Benjamini–Yekutieli kontrollerar FDR vid godtyckligt beroende, oftast på bekostnad av styrkan.

Storey-liknande (explorativ)

Den här förenklade explorativa varianten skattar π₀ från andelen p-värden över 0.5 och kör sedan BH vid q/π̂₀. Den är ingen fullständig implementering av q-värden och ger ingen universell FDR-garanti för ändliga stickprov.

Adaptiv BH (explorativ)

Den här explorativa varianten med två omgångar kör först BH vid q, skattar m₀ som max(1, m−R₁) och kör sedan BH vid q·m/m̂₀. Den är inte BKY-förfarandet och framställs inte som om den hade dess garanti för ändliga stickprov.

Vanliga frågor

Är detta en FDR-kalkylator för mina egna p-värden?

Det här är en pedagogisk simulator, inte en kalkylator dit du laddar upp p-värden. Den genererar experiment där sanningen är känd så att du kan se falska upptäckter och missade effekter, något som vanligtvis inte går att veta enbart från verkliga data.

Garanterar q = 0.05 att bara 5 % är falskt positiva?

Nej. Målet q = 0.05 gäller en förväntad andel bland upptäckterna under förfarandets antaganden. Ett enskilt experiment kan ha en högre eller lägre andel falska upptäckter.

Vilken korrigering bör jag välja?

Avgör vilka fel din forskningsdesign måste kontrollera. FWER-metoder begränsar risken för någon falsk upptäckt i testfamiljen. FDR-metoder kontrollerar den genomsnittliga andelen falska bland upptäckterna. Kontrollera antaganden om beroende och definiera hypotesfamiljen innan du granskar resultaten.

Källor och vidare läsning