FDR / FWER
השוואות מרובות: FDR מול FWER
בדיקה של השערות רבות יוצרת יותר הזדמנויות לתוצאות חיוביות שגויות. שיטות התיקון משנות את הסף לקביעה שתוצאה מובהקת. יש להשוות גם את הבקרה על שגיאות וגם את היכולת לזהות השפעות אמיתיות.
למה צריך לתקן עבור בדיקות מרובות?
עם 20 השערות אפס נכונות ובלתי תלויות ו־α = 0.05, ההסתברות לתוצאה חיובית שגויה אחת לפחות היא 1 − (1 − 0.05)²⁰ ≈ 64%. המספר הצפוי של תוצאות חיוביות שגויות הוא 20 × 0.05 = 1. אלה כמויות שונות: הסתברות ומניין.
מהו שיעור התגליות השגויות?
FDR = E[V / max(R, 1)], כאשר V הוא מספר התגליות השגויות ו־R הוא מספר התגליות הכולל. יעד FDR של 5% שולט בשיעור הזה בממוצע לאורך ניסויים חוזרים, בכפוף להנחות השיטה. הוא אינו אומר שלכל תוצאה מובהקת יש הסתברות של 5% להיות שגויה.
במה FWER שונה?
FWER = P(V ≥ 1): ההסתברות לתגלית שגויה אחת לפחות במשפחת בדיקות. בונפרוני והולם מכוונים ל־FWER; בנימיני–הוכברג מכוון ל־FDR. שליטה ב־FWER גם מגבילה את FDR, אך לרוב מזהה פחות השפעות אמיתיות.
דוגמה מפורטת: בונפרוני מול BH
ניקח חמישה ערכי p ממוינים: 0.001, 0.008, 0.039, 0.041, 0.300, כאשר α = q = 0.05. בונפרוני משתמש בסף 0.05 / 5 = 0.01 ודוחה את שתי ההשערות הראשונות. BH משווה את הדרגות לספים 0.01, 0.02, 0.03, 0.04, 0.05. הדרגה הגבוהה ביותר שעוברת היא 2, ולכן גם BH דוחה את שתי הראשונות. אילו ערך p האחרון היה 0.045, BH היה דוחה את כל החמש: יש להשתמש בדרגה הגבוהה ביותר שעוברת, ולא בדרגה הראשונה שנכשלת.
השוואת כל 11 שיטות התיקון
ללא תיקון
דוחים כל השערה כאשר p < α. אין שליטה בשגיאה ברמת משפחת הבדיקות. זוהי נקודת ייחוס שימושית כדי לראות כיצד תוצאות חיוביות שגויות מצטברות.
Bonferroni
בונפרוני דוחה כאשר p < α/m. הוא שולט ב־FWER עבור ערכי p תקפים תחת כל מבנה תלות, אך עלול להחמיץ השפעות אמיתיות כשמבצעים בדיקות רבות.
Holm
ממיינים ערכי p מהקטן לגדול. משווים את הדרגה r ל־α/(m−r+1), ועוצרים בכישלון הראשון. הולם שולט ב־FWER תחת תלות שרירותית ודוחה לפחות את כל מה שבונפרוני דוחה.
Šidák
משתמשים בסף יחיד 1−(1−α)^(1/m). שידק שולט ב־FWER עבור בדיקות בלתי תלויות, והוא מעט פחות שמרני מבונפרוני.
Holm–Šidák
מיישמים את הליך הירידה ההדרגתי של הולם עם הספים 1−(1−α)^(1/(m−r+1)). בסימולציה זו הבדיקות בלתי תלויות; אין להניח שהשיטה מתאימה לתלות שרירותית.
Hochberg
מוצאים את הדרגה הגבוהה ביותר r המקיימת p(r) ≤ α/(m−r+1), ודוחים את כל הדרגות עד r. הוכברג שולט ב־FWER תחת אי־תלות או בתנאים מתאימים של תלות חיובית.
Hommel
הומל משתמש בהליך של בדיקות סגורות המבוסס על מבחני סימס. הוא שולט ב־FWER תחת אי־תלות או תנאים שבהם אי־שוויון סימס מתקיים, ועוצמתו אינה נמוכה מזו של הוכברג. הוא דורש יותר חישוב.
Benjamini–Hochberg
מוצאים את הדרגה הגבוהה ביותר r המקיימת p(r) ≤ (r/m)q, ואז דוחים את כל הדרגות עד r. בנימיני–הוכברג שולט ב־FDR בבדיקות בלתי תלויות ובתנאים מסוימים של תלות חיובית (PRDS).
Benjamini–Yekutieli
משתמשים ב־BH עם q מחולק ב־Hm = Σ(1/k), k = 1…m. בנימיני–יקותיאלי שולט ב־FDR תחת תלות שרירותית, לרוב במחיר של ירידה בעוצמה.
בסגנון סטורי (ניסיוני)
הגרסה הניסיונית הפשוטה הזו אומדת את π₀ לפי שיעור ערכי p הגדולים מ־0.5, ואז מפעילה BH ב־q/π̂₀. זה אינו מימוש מלא של ערכי q, והוא אינו מעניק ערובה כללית ל־FDR במדגם סופי.
BH אדפטיבי (ניסיוני)
הגרסה הניסיונית הדו־שלבית הזו מפעילה תחילה BH ב־q, אומדת את m₀ בתור max(1, m−R₁), ואז מפעילה BH ב־q·m/m̂₀. היא אינה הליך BKY ואינה מוצגת כבעלת הערובה שלו למדגם סופי.
שאלות נפוצות
האם זה מחשבון FDR לערכי p שלי?
זהו סימולטור לימודי, ולא מחשבון להעלאת ערכי p. הוא יוצר ניסויים שבהם האמת ידועה כדי שתוכלו לראות תגליות שגויות והשפעות שהוחמצו, שבדרך כלל אי אפשר לדעת עליהן מנתונים אמיתיים בלבד.
האם ערך q של 0.05 מבטיח שרק 5% מהתוצאות החיוביות יהיו שגויות?
לא. יעד q = 0.05 נוגע לשיעור צפוי מבין התגליות, בכפוף להנחות ההליך. בניסוי יחיד שיעור התגליות השגויות עשוי להיות גבוה או נמוך יותר.
איזו שיטת תיקון כדאי לבחור?
החליטו אילו שגיאות מחקרכם צריך להגביל. שיטות FWER מגבילות את הסיכון לתגלית שגויה כלשהי במשפחת הבדיקות. שיטות FDR שולטות בשיעור הממוצע של תגליות שגויות מבין התגליות. בדקו את הנחות התלות והגדירו את משפחת ההשערות לפני בחינת התוצאות.