PsyMeasureFDR

PsyMeasure · Statistieklab

Simulator voor het percentage foutieve ontdekkingen (FDR)

Vergelijk Bonferroni, Holm en Benjamini–Hochberg in een gratis simulator voor meervoudig toetsen. Verken FDR, FWER en statistische power met 11 methoden.

Hoeveel significante resultaten zijn alleen maar ruis? Verken de afweging tussen foutieve ontdekkingen en gemiste effecten met dezelfde gesimuleerde experimenten voor elke methode.

Vergelijk de uitkomsten

Klaar om te verkennen

Bekijk de simulatie

Elke tegel is één toets in een gesimuleerd experiment. De kleur toont de werkelijkheid; het teken toont wat de methode besliste.

De resultaten verschijnen hier na de simulatie.

Kleur = echt effect:negatiefgeenpositief
Helderheid:hoe sterk het effect in deze steekproef was (|z|)
Volgorde van de tegels:

Hetzelfde experiment, methode voor methode

Veel experimenten in één oogopslag

Elke rij is één volledig experiment: echte effecten links, ruis rechts. Heldere tegels links zijn gevonden effecten; gele tegels rechts zijn foutieve ontdekkingen. Kies een rij om die hierboven te bekijken.

Percentage foutieve ontdekkingen (FDR)

Gemiddeld fout aandeel onder de ontdekkingen. Experimenten zonder ontdekkingen tellen als nul.

Statistische power

Aandeel gevonden echte effecten. Hoger betekent minder gemiste effecten.

Familiegewijze foutkans (FWER)

Aandeel experimenten met minstens één foutieve ontdekking.

Het doel geldt voor FDR of FWER, afhankelijk van de methode, niet voor power. Simulatieschattingen schommelen rond de theoretische waarden.

Precieze resultaten

Gemiddelden over voltooide experimenten. FP = foutieve ontdekkingen; FN = gemiste echte effecten.

Precieze resultaten
MethodeFDRPowerFWERGemiddelde FPGemiddelde FN
Waar de p-waarden vandaan komen

p-waarden onder de nulhypothese zijn ongeveer uniform verdeeld. Echte effecten leveren vaker waarden dicht bij nul op. Elke groep wordt afzonderlijk genormaliseerd; lege groepen hebben geen balken.

Nulhypothesen (ruis)Echte effecten

Aannames van deze simulatie

Elk experiment bevat onafhankelijke, tweezijdige z-toetsen voor één steekproef met bekende variantie. Nultoetsen gebruiken Z ~ N(0, 1); echte effecten gebruiken Z ~ N(d√n, 1). Het aantal echte effecten wordt afgerond op een geheel getal. Dit model simuleert geen gecorreleerde toetsen, t-toetsen, optioneel stoppen of publicatiebias.

Dit zijn Monte Carlo-schattingen, geen garanties voor één experiment. Bij 2.000 herhalingen heeft een geschatte FWER van 5% een standaardfout van ongeveer 0,5 procentpunt. FDR is het gemiddelde van de aandelen foutieve ontdekkingen per experiment, niet de verhouding tussen alle foutieve ontdekkingen en alle ontdekkingen samen.

FDR / FWER

Meervoudige vergelijkingen: FDR versus FWER

Veel hypothesen toetsen schept meer kansen op fout-positieve resultaten. Correcties veranderen de grens voor significantie. Vergelijk zowel foutcontrole als het vermogen om echte effecten te vinden.

Waarom meervoudig toetsen correctie vraagt

Bij 20 onafhankelijke, ware nulhypothesen en α = 0.05 is de kans op minstens één fout-positief resultaat 1 − (1 − 0.05)²⁰ ≈ 64%. Het verwachte aantal fout-positieve resultaten is 20 × 0.05 = 1. Dit zijn verschillende grootheden: een kans en een aantal.

Wat is het percentage foutieve ontdekkingen?

FDR = E[V / max(R, 1)], waarbij V het aantal foutieve ontdekkingen is en R het totale aantal ontdekkingen. Een FDR-doel van 5% beheerst dit aandeel gemiddeld over herhaalde experimenten onder de aannames van de methode. Het betekent niet dat elk significant resultaat 5% kans heeft om fout te zijn.

Wat is het verschil met FWER?

FWER = P(V ≥ 1): de kans op zelfs maar één foutieve ontdekking in een familie van toetsen. Bonferroni en Holm richten zich op FWER; Benjamini–Hochberg op FDR. FWER beheersen begrenst ook FDR, maar vindt vaak minder echte effecten.

Uitgewerkt voorbeeld: Bonferroni versus BH

Neem vijf gesorteerde p-waarden: 0.001, 0.008, 0.039, 0.041, 0.300, met α = q = 0.05. Bonferroni gebruikt 0.05 / 5 = 0.01 en verwerpt de eerste twee hypothesen. BH vergelijkt de rangen met 0.01, 0.02, 0.03, 0.04, 0.05. De hoogste rang die voldoet is 2, dus BH verwerpt ook de eerste twee. Als de laatste p-waarde 0.045 was, zou BH alle vijf verwerpen: gebruik de hoogste rang die voldoet, niet de eerste die faalt.

Vergelijk alle 11 correctiemethoden

Ongecorrigeerd

Verwerp elke hypothese als p < α. Geen foutcontrole voor de hele familie. Dit is een nuttige referentie om te zien hoe fout-positieve resultaten oplopen.

Bonferroni

Bonferroni verwerpt als p < α/m. Het beheerst FWER voor geldige p-waarden bij elke afhankelijkheidsstructuur, maar kan echte effecten missen als er veel toetsen zijn.

Holm

Sorteer p-waarden oplopend. Vergelijk rang r met α/(m−r+1) en stop bij de eerste mislukking. Holm beheerst FWER bij willekeurige afhankelijkheid en verwerpt minstens alles wat Bonferroni verwerpt.

Šidák

Gebruik de enkele grens 1−(1−α)^(1/m). Šidák beheerst FWER voor onafhankelijke toetsen en is iets minder conservatief dan Bonferroni.

Holm–Šidák

Pas de stapsgewijs aflopende logica van Holm toe met grenzen 1−(1−α)^(1/(m−r+1)). Deze simulatie gebruikt onafhankelijke toetsen; ga er niet van uit dat deze methode willekeurige afhankelijkheid aankan.

Hochberg

Zoek de hoogste rang r waarvoor p(r) ≤ α/(m−r+1) en verwerp alle rangen tot en met r. Hochberg beheerst FWER bij onafhankelijkheid of passende positieve afhankelijkheid.

Hommel

Hommel gebruikt een gesloten toetsprocedure op basis van Simes-toetsen. Het beheerst FWER bij onafhankelijkheid of omstandigheden waarin de ongelijkheid van Simes geldt, en is minstens zo krachtig als Hochberg. Het kost meer rekenwerk.

Benjamini–Hochberg

Zoek de hoogste rang r waarvoor p(r) ≤ (r/m)q en verwerp alle rangen tot en met r. Benjamini–Hochberg beheerst FDR bij onafhankelijke toetsen en bepaalde vormen van positieve afhankelijkheid (PRDS).

Benjamini–Yekutieli

Gebruik BH met q gedeeld door Hm = Σ(1/k), k = 1…m. Benjamini–Yekutieli beheerst FDR bij willekeurige afhankelijkheid, doorgaans ten koste van power.

Storey-achtig (verkennend)

Deze vereenvoudigde verkennende variant schat π₀ uit het aandeel p-waarden boven 0.5 en voert daarna BH uit met q/π̂₀. Het is geen volledige q-waarde-implementatie en biedt geen universele FDR-garantie voor eindige steekproeven.

Adaptieve BH (verkennend)

Deze verkennende variant met twee doorgangen gebruikt eerst BH met q, schat m₀ als max(1, m−R₁) en gebruikt dan BH met q·m/m̂₀. Het is niet de BKY-procedure en claimt niet de garantie daarvan voor eindige steekproeven.

Veelgestelde vragen

Kan ik hiermee FDR berekenen voor mijn eigen p-waarden?

Dit is een educatieve simulator, geen rekenmachine waarin je p-waarden uploadt. Hij genereert experimenten waarvan de waarheid bekend is, zodat je foutieve ontdekkingen en gemiste effecten kunt zien. Die zijn meestal niet uit echte gegevens alleen af te leiden.

Garandeert q = 0.05 maximaal 5% fout-positieve resultaten?

Nee. Een doel q = 0.05 betreft een verwacht aandeel onder de ontdekkingen, gegeven de aannames van de procedure. Een enkel experiment kan een hoger of lager aandeel foutieve ontdekkingen hebben.

Welke correctie moet ik kiezen?

Bepaal welke fouten je onderzoeksopzet moet beheersen. FWER-methoden beperken het risico op een foutieve ontdekking in de toetsfamilie. FDR-methoden beheersen het gemiddelde foutieve aandeel onder de ontdekkingen. Controleer de aannames over afhankelijkheid en definieer de hypothesefamilie voordat je de resultaten bekijkt.

Bronnen en verder lezen