FDR / FWER
Множественные сравнения: FDR и FWER
Проверка множества гипотез увеличивает число возможностей получить ложноположительный результат. Поправки меняют порог, при котором результат считают значимым. Сравнивать следует и контроль ошибок, и способность обнаруживать реальные эффекты.
Почему при множественных проверках нужна поправка
При 20 независимых истинных нулевых гипотезах и α = 0.05 вероятность хотя бы одного ложноположительного результата равна 1 − (1 − 0.05)²⁰ ≈ 64%. Ожидаемое число ложноположительных результатов равно 20 × 0.05 = 1. Это разные величины: вероятность и число.
Что такое доля ложных открытий?
FDR = E[V / max(R, 1)], где V — число ложных открытий, а R — общее число открытий. Целевой уровень FDR 5% контролирует эту долю в среднем по повторным экспериментам при выполнении допущений метода. Он не означает, что каждый значимый результат имеет 5%-ную вероятность быть ложным.
Чем отличается FWER?
FWER = P(V ≥ 1): вероятность хотя бы одного ложного открытия в семействе проверок. Методы Бонферрони и Холма нацелены на FWER; метод Бенджамини — Хохберга — на FDR. Контроль FWER также ограничивает FDR, но часто обнаруживает меньше реальных эффектов.
Разобранный пример: Бонферрони и BH
Возьмём пять упорядоченных p-значений: 0.001, 0.008, 0.039, 0.041, 0.300, при α = q = 0.05. Метод Бонферрони использует порог 0.05 / 5 = 0.01 и отклоняет первые две гипотезы. BH сравнивает ранги с порогами 0.01, 0.02, 0.03, 0.04, 0.05. Наибольший прошедший ранг — 2, поэтому BH также отклоняет первые две гипотезы. Если бы последнее p-значение было 0.045, BH отклонил бы все пять: нужно брать наибольший прошедший ранг, а не первый не прошедший.
Сравните все 11 методов поправки
Без поправки
Отклонять каждую гипотезу при p < α. Нет контроля ошибок на уровне семейства. Это полезная отправная точка, чтобы увидеть, как накапливаются ложноположительные результаты.
Bonferroni
Метод Бонферрони отклоняет гипотезу при p < α/m. Он контролирует FWER при корректных p-значениях при любой структуре зависимости, но может пропускать реальные эффекты при большом числе проверок.
Holm
Упорядочить p-значения по возрастанию. Сравнивать ранг r с α/(m−r+1), останавливаясь при первом несоответствии. Метод Холма контролирует FWER при произвольной зависимости и отклоняет как минимум все гипотезы, отклонённые методом Бонферрони.
Šidák
Использовать единый порог 1−(1−α)^(1/m). Метод Шидака контролирует FWER для независимых проверок и немного менее консервативен, чем метод Бонферрони.
Holm–Šidák
Применить нисходящую процедуру Холма с порогами 1−(1−α)^(1/(m−r+1)). Эта симуляция использует независимые проверки; нельзя считать, что метод работает при произвольной зависимости.
Hochberg
Найти наибольший ранг r, для которого p(r) ≤ α/(m−r+1), и отклонить все гипотезы до ранга r включительно. Метод Хохберга контролирует FWER при независимости или подходящих условиях положительной зависимости.
Hommel
Метод Хоммеля использует процедуру замкнутого тестирования на основе тестов Саймса. Он контролирует FWER при независимости или условиях, при которых выполняется неравенство Саймса, и обладает не меньшей мощностью, чем метод Хохберга. Вычислительно он более затратен.
Benjamini–Hochberg
Найти наибольший ранг r, для которого p(r) ≤ (r/m)q, затем отклонить все гипотезы до ранга r включительно. Метод Бенджамини — Хохберга контролирует FDR при независимых проверках и некоторых условиях положительной зависимости (PRDS).
Benjamini–Yekutieli
Использовать BH с q, делённым на Hm = Σ(1/k), k = 1…m. Метод Бенджамини — Йекутиели контролирует FDR при произвольной зависимости, обычно ценой снижения мощности.
Вариант Стори (исследовательский)
Этот упрощённый исследовательский вариант оценивает π₀ по доле p-значений выше 0.5, затем применяет BH с q/π̂₀. Это не полноценная реализация q-значений, и она не даёт универсальной гарантии контроля FDR для конечной выборки.
Адаптивный BH (исследовательский)
Этот исследовательский двухпроходный вариант сначала применяет BH с q, оценивает m₀ как max(1, m−R₁), затем применяет BH с q·m/m̂₀. Это не процедура BKY, и гарантия для конечной выборки, связанная с ней, здесь не заявляется.
Частые вопросы
Это калькулятор FDR для моих p-значений?
Это учебный симулятор, а не калькулятор для загрузки p-значений. Он создаёт эксперименты с известной истиной, чтобы можно было наблюдать ложные открытия и пропущенные эффекты. По одним лишь реальным данным их обычно установить нельзя.
Гарантирует ли q-значение 0.05, что ложноположительных результатов будет только 5%?
Нет. Целевой q = 0.05 относится к ожидаемой доле среди открытий при выполнении допущений процедуры. В отдельном эксперименте доля ложных открытий может быть больше или меньше.
Какой метод поправки выбрать?
Определите, какие ошибки необходимо контролировать в вашем исследовании. Методы FWER ограничивают риск хотя бы одного ложного открытия в семействе проверок. Методы FDR контролируют среднюю долю ложных среди открытий. Проверьте допущения о зависимости и определите семейство гипотез до просмотра результатов.