PsyMeasureFDR

PsyMeasure · Statistiklabor

Simulator für die Falschentdeckungsrate (FDR)

Vergleichen Sie Bonferroni, Holm und Benjamini–Hochberg im kostenlosen Simulator für multiples Testen. Erkunden Sie FDR, FWER und statistische Power mit 11 Methoden.

Wie viele signifikante Ergebnisse sind bloß Rauschen? Erkunden Sie den Zielkonflikt zwischen falschen Entdeckungen und übersehenen Effekten anhand derselben simulierten Experimente für jedes Verfahren.

Ergebnisse vergleichen

Bereit zum Erkunden

Die Simulation im Bild

Jede Kachel ist ein Test in einem simulierten Experiment. Die Farbe zeigt die Wahrheit, die Markierung zeigt, wie das Verfahren entschieden hat.

Die Ergebnisse erscheinen nach der Simulation hier.

Farbe = wahrer Effekt:negativkeinerpositiv
Helligkeit:wie stark der Effekt in dieser Stichprobe war (|z|)
Reihenfolge der Kacheln:

Dasselbe Experiment, Verfahren für Verfahren

Viele Experimente auf einen Blick

Jede Zeile ist ein ganzes Experiment: echte Effekte links, Rauschen rechts. Helle Kacheln links sind erkannte Effekte, gelbe Kacheln rechts sind falsche Entdeckungen. Wählen Sie eine Zeile aus, um sie oben genauer anzusehen.

Falschentdeckungsrate (FDR)

Mittlerer Anteil falscher unter den Entdeckungen. Experimente ohne Entdeckungen gehen mit null ein.

Statistische Teststärke

Anteil erkannter echter Effekte. Höher bedeutet weniger übersehene Effekte.

Familienweise Fehlerrate (FWER)

Anteil der Experimente mit mindestens einer falschen Entdeckung.

Der Zielwert bezieht sich je nach Verfahren auf FDR oder FWER, nicht auf die Teststärke. Simulationsschätzungen schwanken um theoretische Werte.

Genaue Ergebnisse

Mittelwerte über abgeschlossene Experimente. FP = falsche Entdeckungen; FN = übersehene echte Effekte.

Genaue Ergebnisse
VerfahrenFDRTeststärkeFWERMittlere FPMittlere FN
Woher die p-Werte kommen

p-Werte unter der Nullhypothese sind annähernd gleichverteilt. Echte Effekte führen häufiger zu Werten nahe null. Jede Gruppe wird getrennt normiert; leere Gruppen haben keine Balken.

Nullhypothesen (Rauschen)Echte Effekte

Annahmen dieser Simulation

Jedes Experiment enthält unabhängige, zweiseitige Einstichproben-z-Tests mit bekannter Varianz. Für Nullhypothesen gilt Z ~ N(0, 1), für echte Effekte Z ~ N(d√n, 1). Die Anzahl echter Effekte wird auf eine ganze Zahl gerundet. Das Modell simuliert weder korrelierte Tests noch t-Tests, optionales Stoppen oder Publikationsverzerrung.

Dies sind Monte-Carlo-Schätzungen, keine Garantien für ein einzelnes Experiment. Bei 2.000 Wiederholungen hat eine geschätzte FWER von 5 % einen Standardfehler von etwa 0,5 Prozentpunkten. FDR ist der Mittelwert der Anteile falscher Entdeckungen je Experiment, nicht das Verhältnis der zusammengefassten Zahlen falscher und aller Entdeckungen.

FDR / FWER

Multiple Vergleiche: FDR und FWER

Viele Hypothesentests schaffen mehr Gelegenheiten für falsch positive Ergebnisse. Korrekturen verändern die Schwelle für statistische Signifikanz. Entscheidend sind sowohl die Fehlerkontrolle als auch die Fähigkeit, echte Effekte zu erkennen.

Warum multiples Testen eine Korrektur braucht

Bei 20 unabhängigen, wahren Nullhypothesen und α = 0.05 beträgt die Wahrscheinlichkeit für mindestens ein falsch positives Ergebnis 1 − (1 − 0.05)²⁰ ≈ 64 %. Die erwartete Anzahl falsch positiver Ergebnisse ist 20 × 0.05 = 1. Das sind unterschiedliche Größen: eine Wahrscheinlichkeit und eine Anzahl.

Was ist die Falschentdeckungsrate?

FDR = E[V / max(R, 1)], wobei V die Anzahl falscher Entdeckungen und R die Gesamtzahl der Entdeckungen ist. Ein FDR-Ziel von 5 % kontrolliert diesen Anteil im Mittel über wiederholte Experimente unter den Annahmen des Verfahrens. Es bedeutet nicht, dass jedes signifikante Ergebnis mit 5 % Wahrscheinlichkeit falsch ist.

Wie unterscheidet sich die FWER?

FWER = P(V ≥ 1): die Wahrscheinlichkeit für auch nur eine falsche Entdeckung in einer Testfamilie. Bonferroni und Holm zielen auf FWER, Benjamini–Hochberg auf FDR. Die Kontrolle der FWER begrenzt auch die FDR, erkennt aber oft weniger echte Effekte.

Rechenbeispiel: Bonferroni und BH

Betrachten wir fünf sortierte p-Werte: 0.001, 0.008, 0.039, 0.041, 0.300, bei α = q = 0.05. Bonferroni verwendet 0.05 / 5 = 0.01 und verwirft die ersten zwei Hypothesen. BH vergleicht die Ränge mit 0.01, 0.02, 0.03, 0.04, 0.05. Der größte erfüllte Rang ist 2, also verwirft BH ebenfalls die ersten zwei. Wäre der letzte p-Wert 0.045, würde BH alle fünf verwerfen: Maßgeblich ist der größte erfüllte Rang, nicht der erste nicht erfüllte.

Alle 11 Korrekturverfahren vergleichen

Unkorrigiert

Verwerfen Sie jede Hypothese bei p < α. Keine Fehlerkontrolle für die Testfamilie. Diese Referenz zeigt, wie sich falsch positive Ergebnisse anhäufen.

Bonferroni

Bonferroni verwirft bei p < α/m. Das Verfahren kontrolliert die FWER für gültige p-Werte bei beliebiger Abhängigkeitsstruktur, kann aber bei vielen Tests echte Effekte übersehen.

Holm

Sortieren Sie p-Werte aufsteigend. Vergleichen Sie Rang r mit α/(m−r+1) und stoppen Sie beim ersten Fehlschlag. Holm kontrolliert die FWER bei beliebiger Abhängigkeit und verwirft mindestens alles, was Bonferroni verwirft.

Šidák

Verwenden Sie die einheitliche Schwelle 1−(1−α)^(1/m). Šidák kontrolliert die FWER für unabhängige Tests und ist etwas weniger konservativ als Bonferroni.

Holm–Šidák

Wenden Sie Holms schrittweise absteigende Logik mit Schwellen 1−(1−α)^(1/(m−r+1)) an. Diese Simulation nutzt unabhängige Tests; für beliebige Abhängigkeit ist die Eignung nicht vorauszusetzen.

Hochberg

Finden Sie den größten Rang r mit p(r) ≤ α/(m−r+1) und verwerfen Sie alle Ränge bis r. Hochberg kontrolliert die FWER bei Unabhängigkeit oder geeigneter positiver Abhängigkeit.

Hommel

Hommel verwendet ein geschlossenes Testverfahren auf Basis von Simes-Tests. Es kontrolliert die FWER bei Unabhängigkeit oder unter Bedingungen für die Simes-Ungleichung und ist mindestens so teststark wie Hochberg. Der Rechenaufwand ist höher.

Benjamini–Hochberg

Finden Sie den größten Rang r mit p(r) ≤ (r/m)q und verwerfen Sie alle Ränge bis r. Benjamini–Hochberg kontrolliert die FDR für unabhängige Tests und unter bestimmten Bedingungen positiver Abhängigkeit (PRDS).

Benjamini–Yekutieli

Verwenden Sie BH mit q geteilt durch Hm = Σ(1/k), k = 1…m. Benjamini–Yekutieli kontrolliert die FDR bei beliebiger Abhängigkeit, meist zulasten der Teststärke.

Nach Storey (explorativ)

Diese vereinfachte explorative Variante schätzt π₀ aus dem Anteil der p-Werte über 0.5 und führt dann BH mit q/π̂₀ aus. Sie ist keine vollständige q-Wert-Implementierung und bietet keine allgemeine FDR-Garantie für endliche Stichproben.

Adaptives BH (explorativ)

Diese explorative Variante mit zwei Durchläufen verwendet zuerst BH mit q, schätzt m₀ als max(1, m−R₁) und verwendet dann BH mit q·m/m̂₀. Sie ist nicht das BKY-Verfahren und beansprucht dessen Garantie für endliche Stichproben nicht.

Häufige Fragen

Ist dies ein FDR-Rechner für meine eigenen p-Werte?

Dies ist ein Lehrsimulator, kein Rechner zum Hochladen von p-Werten. Er erzeugt Experimente mit bekannter Wahrheit, damit Sie falsche Entdeckungen und übersehene Effekte beobachten können, die sich aus realen Daten allein meist nicht bestimmen lassen.

Garantiert q = 0.05 höchstens 5 % falsch positive Ergebnisse?

Nein. Ein Zielwert q = 0.05 betrifft unter den Annahmen des Verfahrens einen erwarteten Anteil unter den Entdeckungen. Ein einzelnes Experiment kann einen höheren oder niedrigeren Anteil falscher Entdeckungen aufweisen.

Welches Korrekturverfahren sollte ich wählen?

Entscheiden Sie, welche Fehler Ihr Forschungsdesign kontrollieren muss. FWER-Verfahren begrenzen das Risiko irgendeiner falschen Entdeckung in der Testfamilie. FDR-Verfahren kontrollieren den mittleren falschen Anteil unter den Entdeckungen. Prüfen Sie Abhängigkeitsannahmen und legen Sie die Hypothesenfamilie vor der Betrachtung der Ergebnisse fest.

Quellen und weiterführende Literatur