PsyMeasureFDR

PsyMeasure · מעבדת הסטטיסטיקה

סימולטור שיעור התגליות השגויות (FDR)

השוו בונפרוני, הולם ובנימיני–הוכברג בסימולטור חינמי לבדיקות מרובות. בחנו את שיעור התגליות השגויות, FWER ועוצמה סטטיסטית ב־11 שיטות.

כמה תוצאות מובהקות הן בעצם רעש? בחנו את האיזון בין תגליות שגויות לבין השפעות שהוחמצו, בעזרת אותם ניסויים מדומים לכל שיטה.

השוואת התוצאות

מוכן לבדיקה

צפו בסימולציה

כל אריח הוא בדיקה אחת בניסוי מדומה. הצבע מראה את האמת; הסימן מראה מה השיטה החליטה.

התוצאות יופיעו כאן לאחר הסימולציה.

צבע = ההשפעה האמיתית:שליליתאיןחיובית
בהירות:עד כמה ההשפעה הייתה חזקה במדגם הזה (|z|)
סדר האריחים:

אותו ניסוי, שיטה אחר שיטה

ניסויים רבים במבט אחד

כל שורה היא ניסוי שלם: השפעות אמיתיות משמאל, רעש מימין. אריחים בהירים משמאל הם השפעות שנמצאו; אריחים צהובים מימין הם תגליות שגויות. בחרו שורה כדי לבחון אותה למעלה.

שיעור התגליות השגויות (FDR)

השיעור הממוצע של תגליות שגויות מבין התגליות. ניסויים ללא תגליות תורמים אפס.

עוצמה סטטיסטית

שיעור ההשפעות האמיתיות שזוהו. ככל שהוא גבוה יותר, כך פחות השפעות אמיתיות מוחמצות.

שיעור השגיאה המשפחתית (FWER)

שיעור הניסויים שבהם התגלתה לפחות תגלית שגויה אחת.

היעד חל על FDR או על FWER בהתאם לשיטה, ולא על העוצמה. אומדני הסימולציה משתנים סביב הערכים התיאורטיים.

תוצאות מפורטות

ממוצעים על פני הניסויים שהושלמו. FP = תגליות שגויות; FN = השפעות אמיתיות שהוחמצו.

תוצאות מפורטות
שיטהFDRעוצמהFWERממוצע FPממוצע FN
מהיכן מגיעים ערכי p

ערכי p של השערות אפס מתפלגים בקירוב באופן אחיד. ערכים של השפעות אמיתיות נוטים לאפס. כל קבוצה מנורמלת בנפרד; קבוצות ריקות אינן מציגות עמודות.

השערות אפס (רעש)השפעות אמיתיות

הנחות הסימולציה

כל ניסוי כולל מבחני z בלתי תלויים, דו־צדדיים, למדגם יחיד עם שונות ידועה. עבור השערות אפס Z ~ N(0, 1); עבור השפעות אמיתיות Z ~ N(d√n, 1). מספר ההשפעות האמיתיות מעוגל למספר שלם. המודל אינו מדמה בדיקות תלויות, מבחני t, עצירה אופציונלית או הטיית פרסום.

אלה אומדני מונטה קרלו, ולא ערובות לניסוי יחיד. ב־2,000 חזרות, לאומדן FWER של 5% יש שגיאת תקן של כ־0.5 נקודות אחוז. FDR הוא ממוצע שיעורי התגליות השגויות ברמת הניסוי, ולא היחס בין סך התגליות השגויות לסך כל התגליות.

FDR / FWER

השוואות מרובות: FDR מול FWER

בדיקה של השערות רבות יוצרת יותר הזדמנויות לתוצאות חיוביות שגויות. שיטות התיקון משנות את הסף לקביעה שתוצאה מובהקת. יש להשוות גם את הבקרה על שגיאות וגם את היכולת לזהות השפעות אמיתיות.

למה צריך לתקן עבור בדיקות מרובות?

עם 20 השערות אפס נכונות ובלתי תלויות ו־α = 0.05, ההסתברות לתוצאה חיובית שגויה אחת לפחות היא 1 − (1 − 0.05)²⁰ ≈ 64%. המספר הצפוי של תוצאות חיוביות שגויות הוא 20 × 0.05 = 1. אלה כמויות שונות: הסתברות ומניין.

מהו שיעור התגליות השגויות?

FDR = E[V / max(R, 1)], כאשר V הוא מספר התגליות השגויות ו־R הוא מספר התגליות הכולל. יעד FDR של 5% שולט בשיעור הזה בממוצע לאורך ניסויים חוזרים, בכפוף להנחות השיטה. הוא אינו אומר שלכל תוצאה מובהקת יש הסתברות של 5% להיות שגויה.

במה FWER שונה?

FWER = P(V ≥ 1): ההסתברות לתגלית שגויה אחת לפחות במשפחת בדיקות. בונפרוני והולם מכוונים ל־FWER; בנימיני–הוכברג מכוון ל־FDR. שליטה ב־FWER גם מגבילה את FDR, אך לרוב מזהה פחות השפעות אמיתיות.

דוגמה מפורטת: בונפרוני מול BH

ניקח חמישה ערכי p ממוינים: 0.001, 0.008, 0.039, 0.041, 0.300, כאשר α = q = 0.05. בונפרוני משתמש בסף 0.05 / 5 = 0.01 ודוחה את שתי ההשערות הראשונות. BH משווה את הדרגות לספים 0.01, 0.02, 0.03, 0.04, 0.05. הדרגה הגבוהה ביותר שעוברת היא 2, ולכן גם BH דוחה את שתי הראשונות. אילו ערך p האחרון היה 0.045, BH היה דוחה את כל החמש: יש להשתמש בדרגה הגבוהה ביותר שעוברת, ולא בדרגה הראשונה שנכשלת.

השוואת כל 11 שיטות התיקון

ללא תיקון

דוחים כל השערה כאשר p < α. אין שליטה בשגיאה ברמת משפחת הבדיקות. זוהי נקודת ייחוס שימושית כדי לראות כיצד תוצאות חיוביות שגויות מצטברות.

Bonferroni

בונפרוני דוחה כאשר p < α/m. הוא שולט ב־FWER עבור ערכי p תקפים תחת כל מבנה תלות, אך עלול להחמיץ השפעות אמיתיות כשמבצעים בדיקות רבות.

Holm

ממיינים ערכי p מהקטן לגדול. משווים את הדרגה r ל־α/(m−r+1), ועוצרים בכישלון הראשון. הולם שולט ב־FWER תחת תלות שרירותית ודוחה לפחות את כל מה שבונפרוני דוחה.

Šidák

משתמשים בסף יחיד 1−(1−α)^(1/m). שידק שולט ב־FWER עבור בדיקות בלתי תלויות, והוא מעט פחות שמרני מבונפרוני.

Holm–Šidák

מיישמים את הליך הירידה ההדרגתי של הולם עם הספים 1−(1−α)^(1/(m−r+1)). בסימולציה זו הבדיקות בלתי תלויות; אין להניח שהשיטה מתאימה לתלות שרירותית.

Hochberg

מוצאים את הדרגה הגבוהה ביותר r המקיימת p(r) ≤ α/(m−r+1), ודוחים את כל הדרגות עד r. הוכברג שולט ב־FWER תחת אי־תלות או בתנאים מתאימים של תלות חיובית.

Hommel

הומל משתמש בהליך של בדיקות סגורות המבוסס על מבחני סימס. הוא שולט ב־FWER תחת אי־תלות או תנאים שבהם אי־שוויון סימס מתקיים, ועוצמתו אינה נמוכה מזו של הוכברג. הוא דורש יותר חישוב.

Benjamini–Hochberg

מוצאים את הדרגה הגבוהה ביותר r המקיימת p(r) ≤ (r/m)q, ואז דוחים את כל הדרגות עד r. בנימיני–הוכברג שולט ב־FDR בבדיקות בלתי תלויות ובתנאים מסוימים של תלות חיובית (PRDS).

Benjamini–Yekutieli

משתמשים ב־BH עם q מחולק ב־Hm = Σ(1/k), ‏k = 1…m. בנימיני–יקותיאלי שולט ב־FDR תחת תלות שרירותית, לרוב במחיר של ירידה בעוצמה.

בסגנון סטורי (ניסיוני)

הגרסה הניסיונית הפשוטה הזו אומדת את π₀ לפי שיעור ערכי p הגדולים מ־0.5, ואז מפעילה BH ב־q/π̂₀. זה אינו מימוש מלא של ערכי q, והוא אינו מעניק ערובה כללית ל־FDR במדגם סופי.

BH אדפטיבי (ניסיוני)

הגרסה הניסיונית הדו־שלבית הזו מפעילה תחילה BH ב־q, אומדת את m₀ בתור max(1, m−R₁), ואז מפעילה BH ב־q·m/m̂₀. היא אינה הליך BKY ואינה מוצגת כבעלת הערובה שלו למדגם סופי.

שאלות נפוצות

האם זה מחשבון FDR לערכי p שלי?

זהו סימולטור לימודי, ולא מחשבון להעלאת ערכי p. הוא יוצר ניסויים שבהם האמת ידועה כדי שתוכלו לראות תגליות שגויות והשפעות שהוחמצו, שבדרך כלל אי אפשר לדעת עליהן מנתונים אמיתיים בלבד.

האם ערך q של 0.05 מבטיח שרק 5% מהתוצאות החיוביות יהיו שגויות?

לא. יעד q = 0.05 נוגע לשיעור צפוי מבין התגליות, בכפוף להנחות ההליך. בניסוי יחיד שיעור התגליות השגויות עשוי להיות גבוה או נמוך יותר.

איזו שיטת תיקון כדאי לבחור?

החליטו אילו שגיאות מחקרכם צריך להגביל. שיטות FWER מגבילות את הסיכון לתגלית שגויה כלשהי במשפחת הבדיקות. שיטות FDR שולטות בשיעור הממוצע של תגליות שגויות מבין התגליות. בדקו את הנחות התלות והגדירו את משפחת ההשערות לפני בחינת התוצאות.

מקורות וקריאה נוספת