FDR / FWER
Multipla jämförelser: FDR jämfört med FWER
När många hypoteser testas ökar möjligheterna till falskt positiva resultat. Korrigeringarna ändrar tröskeln för att kalla ett resultat signifikant. Det är relevant att jämföra både felkontroll och förmågan att upptäcka verkliga effekter.
Varför kräver multipla test en korrigering?
Med 20 oberoende sanna nollhypoteser och α = 0.05 är sannolikheten för minst ett falskt positivt resultat 1 − (1 − 0.05)²⁰ ≈ 64 %. Det förväntade antalet falskt positiva resultat är 20 × 0.05 = 1. Det är olika storheter: en sannolikhet och ett antal.
Vad är falsk upptäcktsgrad?
FDR = E[V / max(R, 1)], där V är antalet falska upptäckter och R är det totala antalet upptäckter. Ett FDR-mål på 5 % kontrollerar denna andel i genomsnitt över upprepade experiment under metodens antaganden. Det betyder inte att varje signifikant resultat har 5 % sannolikhet att vara falskt.
Hur skiljer sig FWER?
FWER = P(V ≥ 1): sannolikheten för minst en falsk upptäckt inom en testfamilj. Bonferroni och Holm är inriktade på FWER; Benjamini–Hochberg på FDR. Kontroll av FWER begränsar också FDR, men upptäcker ofta färre verkliga effekter.
Genomgånget exempel: Bonferroni jämfört med BH
Ta fem sorterade p-värden: 0.001, 0.008, 0.039, 0.041, 0.300, med α = q = 0.05. Bonferroni använder 0.05 / 5 = 0.01 och förkastar de två första. BH jämför rangordningen med 0.01, 0.02, 0.03, 0.04, 0.05. Den högsta rang som klarar gränsen är 2, så BH förkastar också de två första. Om det sista p-värdet vore 0.045 skulle BH förkasta alla fem: använd den högsta rang som klarar gränsen, inte den första som misslyckas.
Jämför alla 11 korrigeringsmetoder
Utan korrigering
Förkasta varje hypotes när p < α. Ingen kontroll av fel på familjenivå. Detta är en användbar jämförelsegrund för att se hur falskt positiva resultat samlas.
Bonferroni
Bonferroni förkastar när p < α/m. Metoden kontrollerar FWER för giltiga p-värden under alla beroendestrukturer, men kan missa verkliga effekter när många test görs.
Holm
Sortera p-värden från lägst till högst. Jämför rang r med α/(m−r+1) och stanna vid första misslyckandet. Holm kontrollerar FWER vid godtyckligt beroende och förkastar minst allt som Bonferroni förkastar.
Šidák
Använd den gemensamma tröskeln 1−(1−α)^(1/m). Šidák kontrollerar FWER för oberoende test och är något mindre konservativ än Bonferroni.
Holm–Šidák
Tillämpa Holms stegvisa nedåtgående förfarande med trösklarna 1−(1−α)^(1/(m−r+1)). Den här simuleringen använder oberoende test; anta inte att metoden hanterar godtyckligt beroende.
Hochberg
Hitta den högsta rang r som uppfyller p(r) ≤ α/(m−r+1) och förkasta alla ranger till och med r. Hochberg kontrollerar FWER vid oberoende eller lämpliga villkor för positivt beroende.
Hommel
Hommel använder ett slutet testförfarande baserat på Simes-test. Metoden kontrollerar FWER vid oberoende eller villkor där Simes olikhet gäller, och har minst lika hög styrka som Hochberg. Den kräver mer beräkning.
Benjamini–Hochberg
Hitta den högsta rang r som uppfyller p(r) ≤ (r/m)q och förkasta sedan alla ranger till och med r. Benjamini–Hochberg kontrollerar FDR för oberoende test och vissa villkor för positivt beroende (PRDS).
Benjamini–Yekutieli
Använd BH med q dividerat med Hm = Σ(1/k), k = 1…m. Benjamini–Yekutieli kontrollerar FDR vid godtyckligt beroende, oftast på bekostnad av styrkan.
Storey-liknande (explorativ)
Den här förenklade explorativa varianten skattar π₀ från andelen p-värden över 0.5 och kör sedan BH vid q/π̂₀. Den är ingen fullständig implementering av q-värden och ger ingen universell FDR-garanti för ändliga stickprov.
Adaptiv BH (explorativ)
Den här explorativa varianten med två omgångar kör först BH vid q, skattar m₀ som max(1, m−R₁) och kör sedan BH vid q·m/m̂₀. Den är inte BKY-förfarandet och framställs inte som om den hade dess garanti för ändliga stickprov.
Vanliga frågor
Är detta en FDR-kalkylator för mina egna p-värden?
Det här är en pedagogisk simulator, inte en kalkylator dit du laddar upp p-värden. Den genererar experiment där sanningen är känd så att du kan se falska upptäckter och missade effekter, något som vanligtvis inte går att veta enbart från verkliga data.
Garanterar q = 0.05 att bara 5 % är falskt positiva?
Nej. Målet q = 0.05 gäller en förväntad andel bland upptäckterna under förfarandets antaganden. Ett enskilt experiment kan ha en högre eller lägre andel falska upptäckter.
Vilken korrigering bör jag välja?
Avgör vilka fel din forskningsdesign måste kontrollera. FWER-metoder begränsar risken för någon falsk upptäckt i testfamiljen. FDR-metoder kontrollerar den genomsnittliga andelen falska bland upptäckterna. Kontrollera antaganden om beroende och definiera hypotesfamiljen innan du granskar resultaten.