PsyMeasureFDR

PsyMeasure · Статистическая лаборатория

Симулятор доли ложных открытий (FDR)

Сравните Бонферрони, Холма и Бенджамини — Хохберга в бесплатном симуляторе множественных проверок. Изучите FDR, FWER и статистическую мощность для 11 методов.

Сколько значимых результатов — всего лишь шум? Исследуйте компромисс между ложными открытиями и пропущенными эффектами на одних и тех же симулированных экспериментах для каждого метода.

Сравните результаты

Можно начинать

Посмотрите на симуляцию

Каждая плитка — одна проверка в симулированном эксперименте. Цвет показывает истину, а отметка — решение метода.

Результаты появятся здесь после симуляции.

Цвет = истинный эффект:отрицательныйнетположительный
Яркость:насколько сильным оказался эффект в этой выборке (|z|)
Порядок плиток:

Один и тот же эксперимент — метод за методом

Много экспериментов с одного взгляда

Каждая строка — целый эксперимент: реальные эффекты слева, шум справа. Яркие плитки слева — найденные эффекты; жёлтые плитки справа — ложные открытия. Выберите строку, чтобы рассмотреть её выше.

Доля ложных открытий (FDR)

Средняя доля ложных среди обнаруженных эффектов. Эксперименты без открытий вносят ноль.

Статистическая мощность

Доля обнаруженных реальных эффектов. Чем она выше, тем меньше реальных эффектов пропущено.

Вероятность хотя бы одной ошибки (FWER)

Доля экспериментов с хотя бы одним ложным открытием.

Целевой уровень относится к FDR или FWER в зависимости от метода, но не к мощности. Оценки симуляции колеблются вокруг теоретических значений.

Точные результаты

Средние значения по завершённым экспериментам. FP — ложные открытия; FN — пропущенные реальные эффекты.

Точные результаты
МетодFDRМощностьFWERСреднее FPСреднее FN
Откуда берутся p-значения

При нулевых гипотезах p-значения приблизительно равномерны. При реальных эффектах они тяготеют к нулю. Каждая группа нормирована отдельно; для пустых групп столбцов нет.

Нулевые гипотезы (шум)Реальные эффекты

Допущения симуляции

Каждый эксперимент состоит из независимых двусторонних одновыборочных z-критериев с известной дисперсией. Для нулевых гипотез Z ~ N(0, 1); для реальных эффектов Z ~ N(d√n, 1). Число реальных эффектов округляется до целого. Эта модель не симулирует зависимые проверки, t-критерии, необязательную остановку или публикационное смещение.

Это оценки Монте-Карло, а не гарантии для отдельного эксперимента. При 2000 повторениях оценка FWER 5% имеет стандартную ошибку около 0,5 процентного пункта. FDR — среднее долей ложных открытий по отдельным экспериментам, а не отношение суммарного числа ложных открытий к общему числу открытий.

FDR / FWER

Множественные сравнения: FDR и FWER

Проверка множества гипотез увеличивает число возможностей получить ложноположительный результат. Поправки меняют порог, при котором результат считают значимым. Сравнивать следует и контроль ошибок, и способность обнаруживать реальные эффекты.

Почему при множественных проверках нужна поправка

При 20 независимых истинных нулевых гипотезах и α = 0.05 вероятность хотя бы одного ложноположительного результата равна 1 − (1 − 0.05)²⁰ ≈ 64%. Ожидаемое число ложноположительных результатов равно 20 × 0.05 = 1. Это разные величины: вероятность и число.

Что такое доля ложных открытий?

FDR = E[V / max(R, 1)], где V — число ложных открытий, а R — общее число открытий. Целевой уровень FDR 5% контролирует эту долю в среднем по повторным экспериментам при выполнении допущений метода. Он не означает, что каждый значимый результат имеет 5%-ную вероятность быть ложным.

Чем отличается FWER?

FWER = P(V ≥ 1): вероятность хотя бы одного ложного открытия в семействе проверок. Методы Бонферрони и Холма нацелены на FWER; метод Бенджамини — Хохберга — на FDR. Контроль FWER также ограничивает FDR, но часто обнаруживает меньше реальных эффектов.

Разобранный пример: Бонферрони и BH

Возьмём пять упорядоченных p-значений: 0.001, 0.008, 0.039, 0.041, 0.300, при α = q = 0.05. Метод Бонферрони использует порог 0.05 / 5 = 0.01 и отклоняет первые две гипотезы. BH сравнивает ранги с порогами 0.01, 0.02, 0.03, 0.04, 0.05. Наибольший прошедший ранг — 2, поэтому BH также отклоняет первые две гипотезы. Если бы последнее p-значение было 0.045, BH отклонил бы все пять: нужно брать наибольший прошедший ранг, а не первый не прошедший.

Сравните все 11 методов поправки

Без поправки

Отклонять каждую гипотезу при p < α. Нет контроля ошибок на уровне семейства. Это полезная отправная точка, чтобы увидеть, как накапливаются ложноположительные результаты.

Bonferroni

Метод Бонферрони отклоняет гипотезу при p < α/m. Он контролирует FWER при корректных p-значениях при любой структуре зависимости, но может пропускать реальные эффекты при большом числе проверок.

Holm

Упорядочить p-значения по возрастанию. Сравнивать ранг r с α/(m−r+1), останавливаясь при первом несоответствии. Метод Холма контролирует FWER при произвольной зависимости и отклоняет как минимум все гипотезы, отклонённые методом Бонферрони.

Šidák

Использовать единый порог 1−(1−α)^(1/m). Метод Шидака контролирует FWER для независимых проверок и немного менее консервативен, чем метод Бонферрони.

Holm–Šidák

Применить нисходящую процедуру Холма с порогами 1−(1−α)^(1/(m−r+1)). Эта симуляция использует независимые проверки; нельзя считать, что метод работает при произвольной зависимости.

Hochberg

Найти наибольший ранг r, для которого p(r) ≤ α/(m−r+1), и отклонить все гипотезы до ранга r включительно. Метод Хохберга контролирует FWER при независимости или подходящих условиях положительной зависимости.

Hommel

Метод Хоммеля использует процедуру замкнутого тестирования на основе тестов Саймса. Он контролирует FWER при независимости или условиях, при которых выполняется неравенство Саймса, и обладает не меньшей мощностью, чем метод Хохберга. Вычислительно он более затратен.

Benjamini–Hochberg

Найти наибольший ранг r, для которого p(r) ≤ (r/m)q, затем отклонить все гипотезы до ранга r включительно. Метод Бенджамини — Хохберга контролирует FDR при независимых проверках и некоторых условиях положительной зависимости (PRDS).

Benjamini–Yekutieli

Использовать BH с q, делённым на Hm = Σ(1/k), k = 1…m. Метод Бенджамини — Йекутиели контролирует FDR при произвольной зависимости, обычно ценой снижения мощности.

Вариант Стори (исследовательский)

Этот упрощённый исследовательский вариант оценивает π₀ по доле p-значений выше 0.5, затем применяет BH с q/π̂₀. Это не полноценная реализация q-значений, и она не даёт универсальной гарантии контроля FDR для конечной выборки.

Адаптивный BH (исследовательский)

Этот исследовательский двухпроходный вариант сначала применяет BH с q, оценивает m₀ как max(1, m−R₁), затем применяет BH с q·m/m̂₀. Это не процедура BKY, и гарантия для конечной выборки, связанная с ней, здесь не заявляется.

Частые вопросы

Это калькулятор FDR для моих p-значений?

Это учебный симулятор, а не калькулятор для загрузки p-значений. Он создаёт эксперименты с известной истиной, чтобы можно было наблюдать ложные открытия и пропущенные эффекты. По одним лишь реальным данным их обычно установить нельзя.

Гарантирует ли q-значение 0.05, что ложноположительных результатов будет только 5%?

Нет. Целевой q = 0.05 относится к ожидаемой доле среди открытий при выполнении допущений процедуры. В отдельном эксперименте доля ложных открытий может быть больше или меньше.

Какой метод поправки выбрать?

Определите, какие ошибки необходимо контролировать в вашем исследовании. Методы FWER ограничивают риск хотя бы одного ложного открытия в семействе проверок. Методы FDR контролируют среднюю долю ложных среди открытий. Проверьте допущения о зависимости и определите семейство гипотез до просмотра результатов.

Источники и дополнительное чтение