PsyMeasureFDR

PsyMeasure · Статистична лабораторія

Симулятор частки хибних відкриттів (FDR)

Порівняйте Бонферроні, Холма та Бенджаміні — Гохберга у безкоштовному симуляторі множинних перевірок. Дослідіть FDR, FWER і статистичну потужність для 11 методів.

Скільки значущих результатів є лише шумом? Дослідіть компроміс між хибними відкриттями й пропущеними ефектами на однакових симульованих експериментах для кожного методу.

Порівняйте результати

Готово до дослідження

Подивіться на симуляцію

Кожна плитка — одна перевірка в симульованому експерименті. Колір показує істину, а позначка — рішення методу.

Результати з’являться тут після симуляції.

Колір = справжній ефект:негативнийнемаєпозитивний
Яскравість:наскільки сильним виявився ефект у цій вибірці (|z|)
Порядок плиток:

Той самий експеримент — метод за методом

Багато експериментів з одного погляду

Кожен рядок — цілий експеримент: реальні ефекти ліворуч, шум праворуч. Яскраві плитки ліворуч — знайдені ефекти; жовті плитки праворуч — хибні відкриття. Виберіть рядок, щоб роздивитися його вгорі.

Частка хибних відкриттів (FDR)

Середня частка хибних серед відкриттів. Експерименти без відкриттів дають нуль.

Статистична потужність

Частка виявлених реальних ефектів. Вище значення означає менше пропущених ефектів.

Сімейна ймовірність помилки (FWER)

Частка експериментів із принаймні одним хибним відкриттям.

Залежно від методу ціль стосується FDR або FWER, а не потужності. Симуляційні оцінки коливаються навколо теоретичних значень.

Точні результати

Середні значення за завершеними експериментами. FP — хибні відкриття; FN — пропущені реальні ефекти.

Точні результати
МетодFDRПотужністьFWERСереднє FPСереднє FN
Звідки беруться p-значення

За нульових гіпотез p-значення приблизно рівномірні. За реальних ефектів вони тяжіють до нуля. Кожну групу нормовано окремо; порожні групи не мають стовпчиків.

Нульові гіпотези (шум)Реальні ефекти

Припущення симуляції

Кожен експеримент містить незалежні двобічні одновибіркові z-тести з відомою дисперсією. Для нульових гіпотез Z ~ N(0, 1), для реальних ефектів Z ~ N(d√n, 1). Кількість реальних ефектів округлюється до цілого числа. Модель не симулює корельовані перевірки, t-тести, необов’язкову зупинку чи публікаційне упередження.

Це оцінки методом Монте-Карло, а не гарантії для окремого експерименту. За 2 000 повторень оцінка FWER у 5% має стандартну похибку близько 0,5 відсоткового пункту. FDR — це середнє часток хибних відкриттів в окремих експериментах, а не відношення сумарних хибних відкриттів до сумарної кількості відкриттів.

FDR / FWER

Множинні порівняння: FDR проти FWER

Перевірка багатьох гіпотез створює більше можливостей для хибнопозитивних результатів. Корекції змінюють поріг значущості. Важливо порівнювати і контроль помилок, і здатність виявляти реальні ефекти.

Навіщо коригувати множинні перевірки

За 20 незалежних істинних нульових гіпотез і α = 0.05 ймовірність принаймні одного хибнопозитивного результату становить 1 − (1 − 0.05)²⁰ ≈ 64%. Очікувана кількість хибнопозитивних результатів — 20 × 0.05 = 1. Це різні величини: ймовірність і кількість.

Що таке частка хибних відкриттів?

FDR = E[V / max(R, 1)], де V — кількість хибних відкриттів, а R — загальна кількість відкриттів. Ціль FDR у 5% контролює цю частку в середньому за повторними експериментами за виконання припущень методу. Це не означає, що кожен значущий результат має 5% ймовірності бути хибним.

Чим відрізняється FWER?

FWER = P(V ≥ 1): ймовірність хоча б одного хибного відкриття в сімействі перевірок. Методи Бонферроні й Голма контролюють FWER; метод Бенджаміні — Гохберга контролює FDR. Контроль FWER також обмежує FDR, але часто виявляє менше реальних ефектів.

Приклад: Бонферроні проти BH

Візьмімо п’ять впорядкованих p-значень: 0.001, 0.008, 0.039, 0.041, 0.300 за α = q = 0.05. Бонферроні використовує поріг 0.05 / 5 = 0.01 і відхиляє перші дві гіпотези. BH порівнює ранги з 0.01, 0.02, 0.03, 0.04, 0.05. Найбільший ранг, що проходить поріг, — 2, тому BH теж відхиляє перші дві. Якби останнє p-значення дорівнювало 0.045, BH відхилив би всі п’ять: беріть найбільший ранг, що проходить поріг, а не перший, що його не проходить.

Порівняйте всі 11 методів корекції

Без корекції

Відхиляйте кожну гіпотезу за p < α. Контролю помилки на рівні сімейства немає. Це корисна базова лінія, щоб побачити накопичення хибнопозитивних результатів.

Bonferroni

Бонферроні відхиляє за p < α/m. Метод контролює FWER для коректних p-значень за будь-якої структури залежності, але може пропускати реальні ефекти за великої кількості перевірок.

Holm

Впорядкуйте p-значення від найменшого до найбільшого. Порівнюйте ранг r із α/(m−r+1), зупиняючись на першому непроходженні порога. Метод Голма контролює FWER за довільної залежності й відхиляє щонайменше все, що відхиляє Бонферроні.

Šidák

Використовуйте єдиний поріг 1−(1−α)^(1/m). Метод Шидака контролює FWER для незалежних перевірок і трохи менш консервативний, ніж Бонферроні.

Holm–Šidák

Застосовуйте покрокову процедуру Голма з порогами 1−(1−α)^(1/(m−r+1)). У цій симуляції перевірки незалежні; не припускайте, що метод працює за довільної залежності.

Hochberg

Знайдіть найбільший ранг r, для якого p(r) ≤ α/(m−r+1), і відхиліть усі гіпотези до рангу r включно. Метод Гохберга контролює FWER за незалежності або відповідних умов позитивної залежності.

Hommel

Метод Гоммеля використовує процедуру замкненого тестування на основі тестів Саймса. Він контролює FWER за незалежності або умов, що забезпечують нерівність Саймса, і має потужність не нижчу за метод Гохберга. Обчислювально він дорожчий.

Benjamini–Hochberg

Знайдіть найбільший ранг r, для якого p(r) ≤ (r/m)q, і відхиліть усі гіпотези до рангу r включно. Метод Бенджаміні — Гохберга контролює FDR за незалежних перевірок і певних умов позитивної залежності (PRDS).

Benjamini–Yekutieli

Застосовуйте BH із q, поділеним на Hm = Σ(1/k), k = 1…m. Метод Бенджаміні — Єкутієлі контролює FDR за довільної залежності, зазвичай ціною меншої потужності.

У стилі Сторі (дослідницький)

Цей спрощений дослідницький варіант оцінює π₀ за часткою p-значень понад 0.5, а потім застосовує BH на рівні q/π̂₀. Це не повна реалізація q-value; вона не має універсальної гарантії контролю FDR на скінченній вибірці.

Адаптивний BH (дослідницький)

Цей дослідницький двопрохідний варіант спочатку застосовує BH на рівні q, оцінює m₀ як max(1, m−R₁), а потім застосовує BH на рівні q·m/m̂₀. Це не процедура BKY; її гарантія для скінченної вибірки тут не заявляється.

Поширені запитання

Чи можна тут розрахувати FDR для власних p-значень?

Це навчальний симулятор, а не калькулятор для завантаження p-значень. Він генерує експерименти з відомою істиною, щоб можна було спостерігати хибні відкриття й пропущені ефекти, які зазвичай неможливо встановити лише за реальними даними.

Чи гарантує q = 0.05 лише 5% хибнопозитивних результатів?

Ні. Ціль q = 0.05 стосується очікуваної частки серед відкриттів за припущень процедури. В окремому експерименті частка хибних відкриттів може бути більшою або меншою.

Який метод корекції обрати?

Визначте, які помилки має контролювати ваше дослідження. Методи FWER обмежують ризик бодай одного хибного відкриття в сімействі перевірок. Методи FDR контролюють середню частку хибних серед відкриттів. Перевірте припущення щодо залежності й визначте сімейство гіпотез до перегляду результатів.

Джерела й додаткове читання