PsyMeasureFDR

PsyMeasure · सांख्यिकी प्रयोगशाळा

खोट्या शोधांचा दर (FDR) सिम्युलेटर

मोफत बहुचाचणी सिम्युलेटरमध्ये बोनफेरोनी, होल्म आणि बेंजामिनी–होखबर्ग यांची तुलना करा. 11 पद्धतींतील FDR, FWER आणि सांख्यिकीय शक्ती जाणून घ्या.

महत्त्वपूर्ण वाटणारे किती निकाल केवळ गोंगाट आहेत? प्रत्येक पद्धतीसाठी तीच सिम्युलेट केलेली प्रयोगमालिका वापरून खोटे शोध आणि हुकलेले परिणाम यांतील तडजोड पाहा.

निकालांची तुलना करा

पाहण्यासाठी तयार

सिम्युलेशन पाहा

प्रत्येक चौकोन म्हणजे सिम्युलेट केलेल्या प्रयोगातील एक चाचणी. रंग सत्य दाखवतो; खूण पद्धतीने काय ठरवले ते दाखवते.

सिम्युलेशननंतर निकाल येथे दिसतील.

रंग = खरा परिणाम:ऋणनाहीधन
उजळपणा:या नमुन्यात परिणाम किती तीव्र दिसला (|z|)
चौकोनांचा क्रम:

तोच प्रयोग, प्रत्येक पद्धतीनुसार

अनेक प्रयोग एका नजरेत

प्रत्येक ओळ म्हणजे एक संपूर्ण प्रयोग: डावीकडे खरे परिणाम, उजवीकडे गोंगाट. डावीकडील उजळ चौकोन म्हणजे सापडलेले परिणाम; उजवीकडील पिवळे चौकोन म्हणजे खोटे शोध. वर तपशीलवार पाहण्यासाठी एखादी ओळ निवडा.

खोट्या शोधांचा दर (FDR)

शोधांपैकी खोट्या शोधांचे सरासरी प्रमाण. एकही शोध नसलेल्या प्रयोगांचे योगदान शून्य असते.

सांख्यिकीय शक्ती

ओळखले गेलेल्या खऱ्या परिणामांचे प्रमाण. अधिक मूल्य म्हणजे कमी खरे परिणाम हुकले.

चाचणी-कुटुंबातील त्रुटी दर (FWER)

किमान एक खोटा शोध असलेल्या प्रयोगांचे प्रमाण.

पद्धतीनुसार लक्ष्य FDR किंवा FWER ला लागू होते; शक्तीला नाही. सिम्युलेशनचे अंदाज सैद्धांतिक मूल्यांभोवती बदलतात.

तपशीलवार निकाल

पूर्ण झालेल्या प्रयोगांमधील सरासरी. FP = खोटे शोध; FN = हुकलेले खरे परिणाम.

तपशीलवार निकाल
पद्धतFDRशक्तीFWERसरासरी FPसरासरी FN
p-मूल्ये कुठून येतात?

शून्य परिकल्पनांची p-मूल्ये साधारणपणे समान रीतीने वितरित असतात. खऱ्या परिणामांची मूल्ये शून्याकडे झुकतात. प्रत्येक गट स्वतंत्रपणे सामान्यीकृत केला जातो; रिकाम्या गटांसाठी पट्टे दिसत नाहीत.

शून्य परिकल्पना (गोंगाट)खरे परिणाम

या सिम्युलेशनची गृहीतके

प्रत्येक प्रयोगात ज्ञात प्रसरण असलेल्या स्वतंत्र, द्विपक्षीय, एक-नमुना z-चाचण्या असतात. शून्य परिकल्पनांसाठी Z ~ N(0, 1); खऱ्या परिणामांसाठी Z ~ N(d√n, 1). खऱ्या परिणामांची संख्या पूर्णांकात गोल केली जाते. हे मॉडेल परस्परावलंबी चाचण्या, t-चाचण्या, ऐच्छिक थांबा किंवा प्रकाशनातील पक्षपात सिम्युलेट करत नाही.

हे मॉन्टे कार्लो अंदाज आहेत; एका प्रयोगासाठी हमी नाहीत. २,००० पुनरावृत्त्यांमध्ये ५% असा अंदाजित FWER असल्यास मानक त्रुटी सुमारे ०.५ टक्केवारी-बिंदू असते. FDR म्हणजे प्रत्येक प्रयोगातील खोट्या शोधांच्या प्रमाणांची सरासरी; एकत्रित खोट्या शोधांचे एकूण शोधांशी गुणोत्तर नव्हे.

FDR / FWER

अनेक तुलना: FDR विरुद्ध FWER

अनेक परिकल्पना तपासल्याने खोटे सकारात्मक निकाल मिळण्याच्या संधी वाढतात. सुधारणा पद्धती निकाल महत्त्वपूर्ण मानण्याची मर्यादा बदलतात. त्रुटीवरील नियंत्रण आणि खरे परिणाम शोधण्याची क्षमता या दोन्हींची तुलना करणे गरजेचे आहे.

अनेक चाचण्यांना सुधारणा का लागते?

२० स्वतंत्र आणि खऱ्या शून्य परिकल्पना व α = 0.05 असताना किमान एक खोटा सकारात्मक निकाल मिळण्याची शक्यता 1 − (1 − 0.05)²⁰ ≈ 64% असते. अपेक्षित खोट्या सकारात्मक निकालांची संख्या 20 × 0.05 = 1 असते. या दोन वेगळ्या राशी आहेत: एक शक्यता आणि दुसरी संख्या.

खोट्या शोधांचा दर म्हणजे काय?

FDR = E[V / max(R, 1)], येथे V ही खोट्या शोधांची संख्या आणि R ही एकूण शोधांची संख्या आहे. पद्धतीची गृहीतके लागू असताना ५% FDR लक्ष्य पुनरावृत्त प्रयोगांमध्ये या प्रमाणावर सरासरी नियंत्रण ठेवते. याचा अर्थ प्रत्येक महत्त्वपूर्ण निकाल खोटा असण्याची शक्यता ५% आहे असा नाही.

FWER कसा वेगळा आहे?

FWER = P(V ≥ 1): चाचण्यांच्या एका कुटुंबात किमान एक खोटा शोध लागण्याची शक्यता. बोनफेरोनी आणि होल्म FWER ला लक्ष्य करतात; बेंजामिनी–होखबर्ग FDR ला. FWER नियंत्रित केल्यास FDR वरही मर्यादा येते, परंतु अनेकदा कमी खरे परिणाम सापडतात.

सोडवलेले उदाहरण: बोनफेरोनी विरुद्ध BH

क्रमाने लावलेली पाच p-मूल्ये घ्या: 0.001, 0.008, 0.039, 0.041, 0.300; येथे α = q = 0.05. बोनफेरोनी 0.05 / 5 = 0.01 वापरून पहिल्या दोन परिकल्पना नाकारते. BH क्रमांकांची तुलना 0.01, 0.02, 0.03, 0.04, 0.05 शी करते. अट पूर्ण करणारा सर्वात मोठा क्रमांक 2 आहे, म्हणून BH देखील पहिल्या दोन परिकल्पना नाकारते. शेवटचे p-मूल्य 0.045 असते, तर BH पाचही नाकारली असती: प्रथम अपयशी क्रमांकाऐवजी अट पूर्ण करणारा सर्वात मोठा क्रमांक वापरा.

सर्व ११ सुधारणा पद्धतींची तुलना

सुधारणेविना

p < α असल्यास प्रत्येक परिकल्पना नाकारा. चाचणी-कुटुंबाच्या पातळीवर त्रुटी नियंत्रण नाही. खोटे सकारात्मक निकाल कसे वाढतात हे पाहण्यासाठी हा उपयुक्त आधार आहे.

Bonferroni

बोनफेरोनी p < α/m असल्यास नाकारते. वैध p-मूल्यांसाठी कोणत्याही अवलंबित्वाच्या रचनेत ती FWER नियंत्रित करते, पण अनेक चाचण्या असताना खरे परिणाम हुकू शकतात.

Holm

p-मूल्ये लहान ते मोठी क्रमाने लावा. क्रमांक r ची तुलना α/(m−r+1) शी करा आणि प्रथम अट अपूर्ण राहिल्यावर थांबा. होल्म कोणत्याही प्रकारच्या अवलंबित्वात FWER नियंत्रित करते आणि बोनफेरोनीने नाकारलेल्या किमान सर्व परिकल्पना नाकारते.

Šidák

एकच मर्यादा 1−(1−α)^(1/m) वापरा. शिदाक स्वतंत्र चाचण्यांसाठी FWER नियंत्रित करते आणि बोनफेरोनीपेक्षा थोडी कमी सावध आहे.

Holm–Šidák

होल्मची टप्प्याटप्प्याने खाली जाणारी प्रक्रिया 1−(1−α)^(1/(m−r+1)) या मर्यादांसह वापरा. हे सिम्युलेशन स्वतंत्र चाचण्या वापरते; ही पद्धत कोणतेही अवलंबित्व हाताळते असे समजू नका.

Hochberg

p(r) ≤ α/(m−r+1) पूर्ण करणारा सर्वात मोठा क्रमांक r शोधा आणि r पर्यंतचे सर्व क्रमांक नाकारा. होखबर्ग स्वतंत्रता किंवा योग्य सकारात्मक अवलंबित्वाच्या अटींमध्ये FWER नियंत्रित करते.

Hommel

होमेल साइम्स चाचण्यांवर आधारित बंद-चाचणी प्रक्रिया वापरते. स्वतंत्रता किंवा साइम्स असमानता लागू होण्याच्या अटींमध्ये ती FWER नियंत्रित करते आणि तिची शक्ती होखबर्गपेक्षा कमी नसते. तिचा संगणकीय खर्च अधिक असतो.

Benjamini–Hochberg

p(r) ≤ (r/m)q पूर्ण करणारा सर्वात मोठा क्रमांक r शोधा आणि r पर्यंतचे सर्व क्रमांक नाकारा. बेंजामिनी–होखबर्ग स्वतंत्र चाचण्या आणि काही सकारात्मक अवलंबित्वाच्या अटींमध्ये (PRDS) FDR नियंत्रित करते.

Benjamini–Yekutieli

Hm = Σ(1/k), k = 1…m ने q भागून BH वापरा. बेंजामिनी–येकुतिएली कोणत्याही अवलंबित्वात FDR नियंत्रित करते, पण सहसा शक्ती कमी होते.

स्टोरी-सदृश (अन्वेषणात्मक)

हा सोपा अन्वेषणात्मक पर्याय 0.5 पेक्षा मोठ्या p-मूल्यांच्या प्रमाणावरून π₀ चा अंदाज घेतो आणि मग q/π̂₀ वर BH चालवतो. ही q-मूल्यांची पूर्ण अंमलबजावणी नाही आणि मर्यादित नमुन्यात FDR ची सार्वत्रिक हमी देत नाही.

अनुकूलनीय BH (अन्वेषणात्मक)

हा दोन टप्प्यांचा अन्वेषणात्मक पर्याय आधी q वर BH चालवतो, m₀ चा अंदाज max(1, m−R₁) असा घेतो आणि मग q·m/m̂₀ वर BH चालवतो. ही BKY प्रक्रिया नाही आणि तिची मर्यादित नमुन्याची हमी या पर्यायासाठी सांगितलेली नाही.

सामान्य प्रश्न

माझ्या स्वतःच्या p-मूल्यांसाठी हा FDR गणक आहे का?

हे शैक्षणिक सिम्युलेटर आहे; p-मूल्ये अपलोड करण्यासाठीचा गणक नाही. ज्ञात सत्य असलेले प्रयोग तयार करून हे खोटे शोध आणि हुकलेले परिणाम पाहू देते; वास्तविक डेटावरून एवढेच वापरून ते सहसा कळत नाहीत.

q-मूल्य 0.05 असल्यास फक्त ५% खोटे सकारात्मक निकाल असतील याची हमी मिळते का?

नाही. q = 0.05 हे लक्ष्य पद्धतीच्या गृहीतकांतर्गत शोधांमधील अपेक्षित प्रमाणाशी संबंधित आहे. एका प्रयोगात खोट्या शोधांचे प्रमाण अधिक किंवा कमी असू शकते.

कोणती सुधारणा पद्धत निवडावी?

तुमच्या संशोधन आराखड्याला कोणत्या त्रुटींवर नियंत्रण हवे ते ठरवा. FWER पद्धती चाचणी-कुटुंबातील कोणत्याही खोट्या शोधाचा धोका मर्यादित करतात. FDR पद्धती शोधांमधील खोट्या शोधांचे सरासरी प्रमाण नियंत्रित करतात. निकाल पाहण्यापूर्वी अवलंबित्वाची गृहीतके तपासा आणि परिकल्पनांचे कुटुंब निश्चित करा.

स्रोत आणि पुढील वाचन