PsyMeasureFDR

PsyMeasure · Laboratorium statystyki

Symulator odsetka fałszywych odkryć (FDR)

Porównaj Bonferroniego, Holma i Benjaminiego–Hochberga w darmowym symulatorze testowania wielokrotnego. Poznaj FDR, FWER i moc statystyczną dla 11 metod.

Ile istotnych wyników to tylko szum? Zobacz kompromis między fałszywymi odkryciami a przeoczonymi efektami, korzystając z tych samych symulowanych eksperymentów dla każdej metody.

Porównaj wyniki

Gotowe do eksploracji

Zobacz symulację

Każdy kafelek to jeden test w symulowanym eksperymencie. Kolor pokazuje, jak jest naprawdę; znacznik pokazuje, co zdecydowała metoda.

Wyniki pojawią się tutaj po symulacji.

Kolor = prawdziwy efekt:ujemnybrakdodatni
Jasność:jak silny okazał się efekt w tej próbie (|z|)
Kolejność kafelków:

Ten sam eksperyment, metoda po metodzie

Wiele eksperymentów w jednym widoku

Każdy wiersz to cały eksperyment: rzeczywiste efekty po lewej, szum po prawej. Jasne kafelki po lewej to wykryte efekty; żółte kafelki po prawej to fałszywe odkrycia. Wybierz wiersz, aby obejrzeć go powyżej.

Odsetek fałszywych odkryć (FDR)

Średni odsetek fałszywych odkryć wśród wszystkich odkryć. Eksperymenty bez odkryć wnoszą zero.

Moc statystyczna

Odsetek wykrytych rzeczywistych efektów. Wyższa wartość oznacza mniej przeoczonych efektów.

Rodzinny błąd pierwszego rodzaju (FWER)

Odsetek eksperymentów z co najmniej jednym fałszywym odkryciem.

Cel dotyczy FDR lub FWER zależnie od metody, a nie mocy. Oszacowania z symulacji wahają się wokół wartości teoretycznych.

Dokładne wyniki

Średnie z ukończonych eksperymentów. FP = fałszywe odkrycia; FN = przeoczone rzeczywiste efekty.

Dokładne wyniki
MetodaFDRMocFWERŚrednia FPŚrednia FN
Skąd pochodzą wartości p

Wartości p dla prawdziwych hipotez zerowych mają w przybliżeniu rozkład jednostajny. Przy rzeczywistych efektach skupiają się bliżej zera. Każda grupa jest normalizowana osobno; puste grupy nie mają słupków.

Hipotezy zerowe (szum)Rzeczywiste efekty

Założenia tej symulacji

Każdy eksperyment obejmuje niezależne, dwustronne testy z dla jednej próby ze znaną wariancją. Testy zerowe używają Z ~ N(0, 1), a rzeczywiste efekty Z ~ N(d√n, 1). Liczba rzeczywistych efektów jest zaokrąglana do liczby całkowitej. Model nie symuluje skorelowanych testów, testów t, opcjonalnego zatrzymania ani stronniczości publikacyjnej.

To oszacowania Monte Carlo, a nie gwarancje dla pojedynczego eksperymentu. Przy 2000 powtórzeniach oszacowane FWER równe 5% ma błąd standardowy około 0,5 punktu procentowego. FDR to średnia z proporcji fałszywych odkryć w poszczególnych eksperymentach, a nie stosunek łącznej liczby fałszywych odkryć do łącznej liczby odkryć.

FDR / FWER

Porównania wielokrotne: FDR a FWER

Testowanie wielu hipotez zwiększa liczbę okazji do wyników fałszywie dodatnich. Korekty zmieniają próg uznania wyniku za istotny. Należy porównywać zarówno kontrolę błędów, jak i zdolność wykrywania rzeczywistych efektów.

Dlaczego testowanie wielokrotne wymaga korekty

Przy 20 niezależnych, prawdziwych hipotezach zerowych i α = 0.05 prawdopodobieństwo co najmniej jednego wyniku fałszywie dodatniego wynosi 1 − (1 − 0.05)²⁰ ≈ 64%. Oczekiwana liczba takich wyników to 20 × 0.05 = 1. To różne wielkości: prawdopodobieństwo i liczba.

Czym jest odsetek fałszywych odkryć?

FDR = E[V / max(R, 1)], gdzie V to liczba fałszywych odkryć, a R to łączna liczba odkryć. Docelowe FDR 5% kontroluje tę proporcję średnio w powtarzanych eksperymentach przy założeniach danej metody. Nie oznacza to, że każdy istotny wynik jest fałszywy z prawdopodobieństwem 5%.

Czym różni się FWER?

FWER = P(V ≥ 1): prawdopodobieństwo choćby jednego fałszywego odkrycia w rodzinie testów. Metody Bonferroniego i Holma kontrolują FWER, a metoda Benjamini–Hochberga FDR. Kontrola FWER ogranicza też FDR, ale często wykrywa mniej rzeczywistych efektów.

Przykład: Bonferroni a BH

Weź pięć uporządkowanych wartości p: 0.001, 0.008, 0.039, 0.041, 0.300, przy α = q = 0.05. Bonferroni stosuje 0.05 / 5 = 0.01 i odrzuca dwie pierwsze hipotezy. BH porównuje rangi z 0.01, 0.02, 0.03, 0.04, 0.05. Najwyższa ranga spełniająca warunek to 2, więc BH również odrzuca dwie pierwsze. Gdyby ostatnia wartość p wynosiła 0.045, BH odrzuciłaby wszystkie pięć: wybiera się najwyższą rangę spełniającą warunek, nie pierwszą niespełniającą.

Porównaj wszystkie 11 metod korekty

Bez korekty

Odrzuć każdą hipotezę, gdy p < α. Brak kontroli błędu dla całej rodziny. To przydatny punkt odniesienia pokazujący narastanie wyników fałszywie dodatnich.

Bonferroni

Bonferroni odrzuca hipotezę przy p < α/m. Kontroluje FWER dla poprawnych wartości p przy dowolnej strukturze zależności, ale przy wielu testach może przeoczyć rzeczywiste efekty.

Holm

Posortuj wartości p rosnąco. Porównaj rangę r z α/(m−r+1), kończąc przy pierwszym niespełnionym warunku. Holm kontroluje FWER przy dowolnej zależności i odrzuca co najmniej wszystko, co odrzuca Bonferroni.

Šidák

Użyj jednego progu 1−(1−α)^(1/m). Šidák kontroluje FWER dla niezależnych testów i jest nieco mniej zachowawczy niż Bonferroni.

Holm–Šidák

Zastosuj zstępującą procedurę Holma z progami 1−(1−α)^(1/(m−r+1)). Ta symulacja używa niezależnych testów; nie zakładaj, że metoda działa przy dowolnej zależności.

Hochberg

Znajdź najwyższą rangę r spełniającą p(r) ≤ α/(m−r+1) i odrzuć wszystkie rangi do r. Hochberg kontroluje FWER przy niezależności lub odpowiednich warunkach dodatniej zależności.

Hommel

Hommel używa procedury testów zamkniętych opartej na testach Simesa. Kontroluje FWER przy niezależności lub warunkach zapewniających nierówność Simesa i ma co najmniej taką moc jak Hochberg. Wymaga więcej obliczeń.

Benjamini–Hochberg

Znajdź najwyższą rangę r spełniającą p(r) ≤ (r/m)q i odrzuć wszystkie rangi do r. Benjamini–Hochberg kontroluje FDR dla niezależnych testów i przy pewnych warunkach dodatniej zależności (PRDS).

Benjamini–Yekutieli

Użyj BH z q podzielonym przez Hm = Σ(1/k), k = 1…m. Benjamini–Yekutieli kontroluje FDR przy dowolnej zależności, zwykle kosztem mocy.

W stylu Storeya (eksploracyjna)

Ten uproszczony wariant eksploracyjny szacuje π₀ z odsetka wartości p powyżej 0.5, a następnie stosuje BH z q/π̂₀. Nie jest pełną implementacją q-value i nie zapewnia uniwersalnej gwarancji FDR dla skończonych prób.

Adaptacyjna BH (eksploracyjna)

Ten eksploracyjny wariant dwuetapowy najpierw stosuje BH z q, szacuje m₀ jako max(1, m−R₁), po czym stosuje BH z q·m/m̂₀. Nie jest to procedura BKY ani nie przypisuje się jej gwarancji BKY dla skończonych prób.

Częste pytania

Czy mogę tu obliczyć FDR dla własnych wartości p?

To symulator edukacyjny, a nie kalkulator do wgrywania wartości p. Generuje eksperymenty ze znaną prawdą, aby pokazać fałszywe odkrycia i przeoczone efekty, których zwykle nie da się ustalić na podstawie samych danych rzeczywistych.

Czy q = 0.05 gwarantuje tylko 5% wyników fałszywie dodatnich?

Nie. Cel q = 0.05 dotyczy oczekiwanej proporcji wśród odkryć przy założeniach procedury. Pojedynczy eksperyment może mieć wyższy lub niższy odsetek fałszywych odkryć.

Którą korektę wybrać?

Ustal, które błędy ma kontrolować projekt badania. Metody FWER ograniczają ryzyko choćby jednego fałszywego odkrycia w rodzinie testów. Metody FDR kontrolują średni odsetek fałszywych odkryć. Sprawdź założenia dotyczące zależności i określ rodzinę hipotez przed obejrzeniem wyników.

Źródła i dalsza lektura