FDR / FWER
Multiple Vergleiche: FDR und FWER
Viele Hypothesentests schaffen mehr Gelegenheiten für falsch positive Ergebnisse. Korrekturen verändern die Schwelle für statistische Signifikanz. Entscheidend sind sowohl die Fehlerkontrolle als auch die Fähigkeit, echte Effekte zu erkennen.
Warum multiples Testen eine Korrektur braucht
Bei 20 unabhängigen, wahren Nullhypothesen und α = 0.05 beträgt die Wahrscheinlichkeit für mindestens ein falsch positives Ergebnis 1 − (1 − 0.05)²⁰ ≈ 64 %. Die erwartete Anzahl falsch positiver Ergebnisse ist 20 × 0.05 = 1. Das sind unterschiedliche Größen: eine Wahrscheinlichkeit und eine Anzahl.
Was ist die Falschentdeckungsrate?
FDR = E[V / max(R, 1)], wobei V die Anzahl falscher Entdeckungen und R die Gesamtzahl der Entdeckungen ist. Ein FDR-Ziel von 5 % kontrolliert diesen Anteil im Mittel über wiederholte Experimente unter den Annahmen des Verfahrens. Es bedeutet nicht, dass jedes signifikante Ergebnis mit 5 % Wahrscheinlichkeit falsch ist.
Wie unterscheidet sich die FWER?
FWER = P(V ≥ 1): die Wahrscheinlichkeit für auch nur eine falsche Entdeckung in einer Testfamilie. Bonferroni und Holm zielen auf FWER, Benjamini–Hochberg auf FDR. Die Kontrolle der FWER begrenzt auch die FDR, erkennt aber oft weniger echte Effekte.
Rechenbeispiel: Bonferroni und BH
Betrachten wir fünf sortierte p-Werte: 0.001, 0.008, 0.039, 0.041, 0.300, bei α = q = 0.05. Bonferroni verwendet 0.05 / 5 = 0.01 und verwirft die ersten zwei Hypothesen. BH vergleicht die Ränge mit 0.01, 0.02, 0.03, 0.04, 0.05. Der größte erfüllte Rang ist 2, also verwirft BH ebenfalls die ersten zwei. Wäre der letzte p-Wert 0.045, würde BH alle fünf verwerfen: Maßgeblich ist der größte erfüllte Rang, nicht der erste nicht erfüllte.
Alle 11 Korrekturverfahren vergleichen
Unkorrigiert
Verwerfen Sie jede Hypothese bei p < α. Keine Fehlerkontrolle für die Testfamilie. Diese Referenz zeigt, wie sich falsch positive Ergebnisse anhäufen.
Bonferroni
Bonferroni verwirft bei p < α/m. Das Verfahren kontrolliert die FWER für gültige p-Werte bei beliebiger Abhängigkeitsstruktur, kann aber bei vielen Tests echte Effekte übersehen.
Holm
Sortieren Sie p-Werte aufsteigend. Vergleichen Sie Rang r mit α/(m−r+1) und stoppen Sie beim ersten Fehlschlag. Holm kontrolliert die FWER bei beliebiger Abhängigkeit und verwirft mindestens alles, was Bonferroni verwirft.
Šidák
Verwenden Sie die einheitliche Schwelle 1−(1−α)^(1/m). Šidák kontrolliert die FWER für unabhängige Tests und ist etwas weniger konservativ als Bonferroni.
Holm–Šidák
Wenden Sie Holms schrittweise absteigende Logik mit Schwellen 1−(1−α)^(1/(m−r+1)) an. Diese Simulation nutzt unabhängige Tests; für beliebige Abhängigkeit ist die Eignung nicht vorauszusetzen.
Hochberg
Finden Sie den größten Rang r mit p(r) ≤ α/(m−r+1) und verwerfen Sie alle Ränge bis r. Hochberg kontrolliert die FWER bei Unabhängigkeit oder geeigneter positiver Abhängigkeit.
Hommel
Hommel verwendet ein geschlossenes Testverfahren auf Basis von Simes-Tests. Es kontrolliert die FWER bei Unabhängigkeit oder unter Bedingungen für die Simes-Ungleichung und ist mindestens so teststark wie Hochberg. Der Rechenaufwand ist höher.
Benjamini–Hochberg
Finden Sie den größten Rang r mit p(r) ≤ (r/m)q und verwerfen Sie alle Ränge bis r. Benjamini–Hochberg kontrolliert die FDR für unabhängige Tests und unter bestimmten Bedingungen positiver Abhängigkeit (PRDS).
Benjamini–Yekutieli
Verwenden Sie BH mit q geteilt durch Hm = Σ(1/k), k = 1…m. Benjamini–Yekutieli kontrolliert die FDR bei beliebiger Abhängigkeit, meist zulasten der Teststärke.
Nach Storey (explorativ)
Diese vereinfachte explorative Variante schätzt π₀ aus dem Anteil der p-Werte über 0.5 und führt dann BH mit q/π̂₀ aus. Sie ist keine vollständige q-Wert-Implementierung und bietet keine allgemeine FDR-Garantie für endliche Stichproben.
Adaptives BH (explorativ)
Diese explorative Variante mit zwei Durchläufen verwendet zuerst BH mit q, schätzt m₀ als max(1, m−R₁) und verwendet dann BH mit q·m/m̂₀. Sie ist nicht das BKY-Verfahren und beansprucht dessen Garantie für endliche Stichproben nicht.
Häufige Fragen
Ist dies ein FDR-Rechner für meine eigenen p-Werte?
Dies ist ein Lehrsimulator, kein Rechner zum Hochladen von p-Werten. Er erzeugt Experimente mit bekannter Wahrheit, damit Sie falsche Entdeckungen und übersehene Effekte beobachten können, die sich aus realen Daten allein meist nicht bestimmen lassen.
Garantiert q = 0.05 höchstens 5 % falsch positive Ergebnisse?
Nein. Ein Zielwert q = 0.05 betrifft unter den Annahmen des Verfahrens einen erwarteten Anteil unter den Entdeckungen. Ein einzelnes Experiment kann einen höheren oder niedrigeren Anteil falscher Entdeckungen aufweisen.
Welches Korrekturverfahren sollte ich wählen?
Entscheiden Sie, welche Fehler Ihr Forschungsdesign kontrollieren muss. FWER-Verfahren begrenzen das Risiko irgendeiner falschen Entdeckung in der Testfamilie. FDR-Verfahren kontrollieren den mittleren falschen Anteil unter den Entdeckungen. Prüfen Sie Abhängigkeitsannahmen und legen Sie die Hypothesenfamilie vor der Betrachtung der Ergebnisse fest.