PsyMeasureFDR

PsyMeasure · Statistická laboratoř

Simulátor míry falešných objevů (FDR)

Porovnejte Bonferroniho, Holmovu a Benjaminiho–Hochbergovu metodu v bezplatném simulátoru vícenásobného testování. Prozkoumejte FDR, FWER a sílu 11 metod.

Kolik významných výsledků je jen šum? Prozkoumejte kompromis mezi falešnými objevy a přehlédnutými efekty na stejných simulovaných experimentech pro každou metodu.

Porovnejte výsledky

Připraveno k prozkoumání

Prohlédněte si simulaci

Každá dlaždice je jeden test v simulovaném experimentu. Barva ukazuje skutečnost, značka ukazuje, jak metoda rozhodla.

Výsledky se zde zobrazí po simulaci.

Barva = skutečný efekt:zápornýžádnýkladný
Jas:jak silný byl efekt v tomto vzorku (|z|)
Pořadí dlaždic:

Tentýž experiment, metodu po metodě

Mnoho experimentů na jeden pohled

Každý řádek je jeden celý experiment: skutečné efekty vlevo, šum vpravo. Jasné dlaždice vlevo jsou nalezené efekty; žluté dlaždice vpravo jsou falešné objevy. Vyberte řádek a prohlédněte si ho výše.

Míra falešných objevů (FDR)

Průměrný podíl falešných objevů mezi všemi objevy. Experimenty bez objevů přispívají nulou.

Statistická síla

Podíl zjištěných skutečných efektů. Vyšší hodnota znamená méně přehlédnutých efektů.

Rodinná chybovost (FWER)

Podíl experimentů s alespoň jedním falešným objevem.

Cíl se podle metody vztahuje k FDR nebo FWER, nikoli ke statistické síle. Odhady ze simulace kolísají kolem teoretických hodnot.

Přesné výsledky

Průměry za dokončené experimenty. FP = falešné objevy; FN = přehlédnuté skutečné efekty.

Přesné výsledky
MetodaFDRSílaFWERPrůměr FPPrůměr FN
Odkud pocházejí p-hodnoty

p-hodnoty při platných nulových hypotézách jsou přibližně rovnoměrně rozdělené. Skutečné efekty mají častěji hodnoty blízko nuly. Každá skupina se normalizuje zvlášť; prázdné skupiny nemají sloupce.

Nulové hypotézy (šum)Skutečné efekty

Předpoklady této simulace

Každý experiment obsahuje nezávislé, oboustranné jednovýběrové z-testy se známým rozptylem. Nulové testy používají Z ~ N(0, 1), skutečné efekty Z ~ N(d√n, 1). Počet skutečných efektů se zaokrouhluje na celé číslo. Model nesimuluje korelované testy, t-testy, volitelné zastavení ani publikační zkreslení.

Jde o odhady Monte Carlo, nikoli záruky pro jednotlivý experiment. Při 2 000 opakováních má odhad FWER 5% směrodatnou chybu přibližně 0,5 procentního bodu. FDR je průměr podílů falešných objevů v jednotlivých experimentech, nikoli poměr souhrnného počtu falešných objevů k souhrnnému počtu všech objevů.

FDR / FWER

Vícenásobná porovnání: FDR a FWER

Testování mnoha hypotéz vytváří více příležitostí k falešně pozitivním výsledkům. Korekce mění práh pro označení výsledku za významný. Je třeba porovnat jak kontrolu chyb, tak schopnost zjistit skutečné efekty.

Proč vícenásobné testování vyžaduje korekci

Při 20 nezávislých pravdivých nulových hypotézách a α = 0.05 je pravděpodobnost alespoň jednoho falešně pozitivního výsledku 1 − (1 − 0.05)²⁰ ≈ 64%. Očekávaný počet falešně pozitivních výsledků je 20 × 0.05 = 1. Jde o různé veličiny: pravděpodobnost a počet.

Co je míra falešných objevů?

FDR = E[V / max(R, 1)], kde V je počet falešných objevů a R celkový počet objevů. Cíl FDR 5% kontroluje tento podíl v průměru přes opakované experimenty při splnění předpokladů metody. Neznamená to, že každý významný výsledek má 5% pravděpodobnost, že je chybný.

Čím se liší FWER?

FWER = P(V ≥ 1): pravděpodobnost byť jediného falešného objevu v rodině testů. Bonferroni a Holm cílí na FWER; Benjamini–Hochberg cílí na FDR. Kontrola FWER omezuje také FDR, ale často zjistí méně skutečných efektů.

Řešený příklad: Bonferroni a BH

Vezměme pět seřazených p-hodnot: 0.001, 0.008, 0.039, 0.041, 0.300, při α = q = 0.05. Bonferroni používá 0.05 / 5 = 0.01 a zamítne první dvě hypotézy. BH porovnává pořadí s 0.01, 0.02, 0.03, 0.04, 0.05. Nejvyšší pořadí splňující podmínku je 2, takže BH také zamítne první dvě. Kdyby poslední p-hodnota byla 0.045, BH by zamítl všech pět: použijte nejvyšší pořadí splňující podmínku, nikoli první nesplňující.

Porovnejte všech 11 korekčních metod

Bez korekce

Zamítněte každou hypotézu, když p < α. Žádná kontrola chyby na úrovni rodiny testů. Je to užitečné východisko pro sledování hromadění falešně pozitivních výsledků.

Bonferroni

Bonferroni zamítá při p < α/m. Kontroluje FWER pro platné p-hodnoty při libovolné struktuře závislosti, ale při mnoha testech může přehlédnout skutečné efekty.

Holm

Seřaďte p-hodnoty vzestupně. Porovnávejte pořadí r s α/(m−r+1) a zastavte se u prvního nesplnění. Holm kontroluje FWER při libovolné závislosti a zamítá přinejmenším vše, co Bonferroni.

Šidák

Použijte jediný práh 1−(1−α)^(1/m). Šidák kontroluje FWER pro nezávislé testy a je o něco méně konzervativní než Bonferroni.

Holm–Šidák

Použijte Holmův postupný sestupný princip s prahy 1−(1−α)^(1/(m−r+1)). Tato simulace používá nezávislé testy; nepředpokládejte, že metoda zvládá libovolnou závislost.

Hochberg

Najděte nejvyšší pořadí r splňující p(r) ≤ α/(m−r+1) a zamítněte všechna pořadí až do r. Hochberg kontroluje FWER při nezávislosti nebo vhodných podmínkách kladné závislosti.

Hommel

Hommel používá uzavřený testovací postup založený na Simesových testech. Kontroluje FWER při nezávislosti nebo za podmínek zajišťujících Simesovu nerovnost a má alespoň takovou sílu jako Hochberg. Je výpočetně náročnější.

Benjamini–Hochberg

Najděte nejvyšší pořadí r splňující p(r) ≤ (r/m)q a zamítněte všechna pořadí až do r. Benjamini–Hochberg kontroluje FDR u nezávislých testů a za určitých podmínek kladné závislosti (PRDS).

Benjamini–Yekutieli

Použijte BH s q děleným Hm = Σ(1/k), k = 1…m. Benjamini–Yekutieli kontroluje FDR při libovolné závislosti, obvykle za cenu nižší síly.

Podle Storeyho (explorační)

Tato zjednodušená explorační varianta odhaduje π₀ z podílu p-hodnot nad 0.5 a poté používá BH s q/π̂₀. Nejde o úplnou implementaci q-hodnot a neposkytuje univerzální záruku FDR pro konečné vzorky.

Adaptivní BH (explorační)

Tato explorační dvouprůchodová varianta nejprve používá BH s q, odhaduje m₀ jako max(1, m−R₁) a poté používá BH s q·m/m̂₀. Nejde o postup BKY a nepřisuzuje se jí jeho záruka pro konečné vzorky.

Časté otázky

Je to kalkulačka FDR pro mé vlastní p-hodnoty?

Jde o vzdělávací simulátor, nikoli kalkulačku pro nahrání p-hodnot. Vytváří experimenty se známou pravdou, abyste mohli pozorovat falešné objevy a přehlédnuté efekty, které z reálných dat samotných obvykle nelze určit.

Zaručuje q = 0.05 jen 5% falešně pozitivních výsledků?

Ne. Cíl q = 0.05 se týká očekávaného podílu mezi objevy při předpokladech daného postupu. Jednotlivý experiment může mít vyšší nebo nižší podíl falešných objevů.

Kterou korekci mám zvolit?

Určete, které chyby musí váš výzkumný plán kontrolovat. Metody FWER omezují riziko jakéhokoli falešného objevu v rodině testů. Metody FDR kontrolují průměrný podíl falešných objevů. Ověřte předpoklady o závislosti a vymezte rodinu hypotéz ještě před zkoumáním výsledků.

Zdroje a další čtení