FDR / FWER
Comparaciones múltiples: FDR frente a FWER
Probar muchas hipótesis crea más oportunidades de obtener falsos positivos. Las correcciones modifican el umbral para declarar significativo un resultado. Hay que comparar tanto el control del error como la capacidad de detectar efectos reales.
Por qué hay que corregir las pruebas múltiples
Con 20 hipótesis nulas verdaderas e independientes y α = 0.05, la probabilidad de al menos un falso positivo es 1 − (1 − 0.05)²⁰ ≈ 64%. El número esperado de falsos positivos es 20 × 0.05 = 1. Son magnitudes distintas: una probabilidad y un recuento.
¿Qué es la tasa de falsos descubrimientos?
FDR = E[V / max(R, 1)], donde V es el número de falsos descubrimientos y R el número total de descubrimientos. Un objetivo de FDR del 5% controla esta proporción en promedio a lo largo de experimentos repetidos, bajo los supuestos del método. No significa que cada resultado significativo tenga un 5% de probabilidad de ser falso.
¿En qué se diferencia la FWER?
FWER = P(V ≥ 1): la probabilidad de cometer siquiera un falso descubrimiento en una familia de pruebas. Bonferroni y Holm controlan FWER; Benjamini–Hochberg controla FDR. Controlar FWER también acota FDR, pero a menudo detecta menos efectos reales.
Ejemplo resuelto: Bonferroni frente a BH
Toma cinco valores p ordenados: 0.001, 0.008, 0.039, 0.041, 0.300, con α = q = 0.05. Bonferroni usa 0.05 / 5 = 0.01 y rechaza las dos primeras hipótesis. BH compara los rangos con 0.01, 0.02, 0.03, 0.04, 0.05. El mayor rango que cumple el criterio es 2, así que BH también rechaza las dos primeras. Si el último valor p fuera 0.045, BH rechazaría las cinco: utiliza el mayor rango que cumple el criterio, no el primero que falla.
Compara los 11 métodos de corrección
Sin corrección
Rechaza cada hipótesis cuando p < α. No controla el error a nivel de familia. Es una referencia útil para ver cómo se acumulan los falsos positivos.
Bonferroni
Bonferroni rechaza cuando p < α/m. Controla FWER con valores p válidos bajo cualquier estructura de dependencia, pero puede omitir efectos reales cuando se realizan muchas pruebas.
Holm
Ordena los valores p de menor a mayor. Compara el rango r con α/(m−r+1) y detente ante el primer incumplimiento. Holm controla FWER bajo dependencia arbitraria y rechaza al menos todo lo que rechaza Bonferroni.
Šidák
Usa el umbral único 1−(1−α)^(1/m). Šidák controla FWER para pruebas independientes y es ligeramente menos conservador que Bonferroni.
Holm–Šidák
Aplica la lógica descendente de Holm con umbrales 1−(1−α)^(1/(m−r+1)). Esta simulación usa pruebas independientes; no supongas que el método admite dependencia arbitraria.
Hochberg
Encuentra el mayor rango r que cumpla p(r) ≤ α/(m−r+1) y rechaza todos los rangos hasta r. Hochberg controla FWER bajo independencia o condiciones adecuadas de dependencia positiva.
Hommel
Hommel usa un procedimiento de pruebas cerradas basado en pruebas de Simes. Controla FWER bajo independencia o condiciones que respaldan la desigualdad de Simes, y tiene al menos tanta potencia como Hochberg. Su coste computacional es mayor.
Benjamini–Hochberg
Encuentra el mayor rango r que cumpla p(r) ≤ (r/m)q y rechaza todos los rangos hasta r. Benjamini–Hochberg controla FDR con pruebas independientes y bajo ciertas condiciones de dependencia positiva (PRDS).
Benjamini–Yekutieli
Usa BH con q dividido entre Hm = Σ(1/k), k = 1…m. Benjamini–Yekutieli controla FDR bajo dependencia arbitraria, normalmente a costa de potencia.
Tipo Storey (exploratorio)
Esta variante exploratoria simplificada estima π₀ a partir de la fracción de valores p superiores a 0.5 y luego aplica BH con q/π̂₀. No es una implementación completa de valores q ni ofrece una garantía universal de FDR para muestras finitas.
BH adaptativo (exploratorio)
Esta variante exploratoria de dos pasadas ejecuta primero BH con q, estima m₀ como max(1, m−R₁) y después ejecuta BH con q·m/m̂₀. No es el procedimiento BKY ni se presenta como si tuviera su garantía para muestras finitas.
Preguntas frecuentes
¿Es una calculadora de FDR para mis propios valores p?
Es un simulador educativo, no una calculadora para cargar valores p. Genera experimentos con una verdad conocida para que puedas observar falsos descubrimientos y efectos no detectados, que normalmente no se conocen solo a partir de datos reales.
¿Garantiza q = 0.05 que solo el 5% sean falsos positivos?
No. Un objetivo q = 0.05 se refiere a una proporción esperada entre los descubrimientos, bajo los supuestos del procedimiento. Un experimento individual puede tener una proporción mayor o menor de falsos descubrimientos.
¿Qué corrección debo elegir?
Decide qué errores debe controlar tu diseño de investigación. Los métodos FWER limitan el riesgo de cualquier falso descubrimiento en la familia de pruebas. Los métodos FDR controlan la proporción falsa media entre los descubrimientos. Comprueba los supuestos de dependencia y define la familia de hipótesis antes de examinar los resultados.