PsyMeasureFDR

PsyMeasure · Phòng thí nghiệm thống kê

Trình mô phỏng tỷ lệ phát hiện sai (FDR)

So sánh Bonferroni, Holm và Benjamini–Hochberg trong trình mô phỏng kiểm định nhiều giả thuyết miễn phí. Khám phá FDR, FWER và lực thống kê với 11 phương pháp.

Bao nhiêu kết quả có ý nghĩa thực ra chỉ là nhiễu? Dùng cùng các thí nghiệm mô phỏng cho mọi phương pháp để khám phá sự đánh đổi giữa phát hiện sai và bỏ sót hiệu ứng thật.

So sánh kết quả

Sẵn sàng khám phá

Xem mô phỏng

Mỗi ô là một phép kiểm định trong một thí nghiệm mô phỏng. Màu cho biết sự thật; dấu cho biết phương pháp đã quyết định ra sao.

Kết quả sẽ xuất hiện ở đây sau khi mô phỏng.

Màu = hiệu ứng thật:âmkhông códương
Độ sáng:hiệu ứng đã thể hiện mạnh đến đâu trong mẫu này (|z|)
Thứ tự ô:

Cùng một thí nghiệm, theo từng phương pháp

Tổng quan nhiều thí nghiệm

Mỗi hàng là trọn một thí nghiệm: hiệu ứng thật ở bên trái, nhiễu ở bên phải. Ô sáng bên trái là hiệu ứng được phát hiện; ô vàng bên phải là phát hiện sai. Chọn một hàng để xem chi tiết ở phía trên.

Tỷ lệ phát hiện sai (FDR)

Trung bình tỷ lệ phát hiện sai trong số các phát hiện. Thí nghiệm không có phát hiện được tính là 0.

Sức mạnh thống kê

Tỷ lệ hiệu ứng thật được phát hiện. Càng cao thì càng ít hiệu ứng thật bị bỏ sót.

Tỷ lệ lỗi theo họ (FWER)

Tỷ lệ thí nghiệm có ít nhất một phát hiện sai.

Mục tiêu áp dụng cho FDR hoặc FWER tùy phương pháp, không áp dụng cho sức mạnh. Ước lượng mô phỏng dao động quanh giá trị lý thuyết.

Kết quả chi tiết

Giá trị trung bình qua các thí nghiệm đã hoàn tất. FP = phát hiện sai; FN = hiệu ứng thật bị bỏ sót.

Kết quả chi tiết
Phương phápFDRSức mạnhFWERFP trung bìnhFN trung bình
Giá trị p đến từ đâu?

Giá trị p của giả thuyết không gần như phân bố đều. Giá trị p của hiệu ứng thật có xu hướng gần 0. Mỗi nhóm được chuẩn hóa riêng; nhóm trống không có cột.

Giả thuyết không (nhiễu)Hiệu ứng thật

Các giả định của mô phỏng

Mỗi thí nghiệm gồm các kiểm định z một mẫu, hai phía, độc lập với phương sai đã biết. Kiểm định giả thuyết không dùng Z ~ N(0, 1); hiệu ứng thật dùng Z ~ N(d√n, 1). Số hiệu ứng thật được làm tròn thành số nguyên. Mô hình này không mô phỏng các phép kiểm định có tương quan, kiểm định t, dừng tùy ý hoặc thiên lệch công bố.

Đây là các ước lượng Monte Carlo, không phải bảo đảm cho một thí nghiệm. Với 2.000 lần lặp, FWER ước lượng là 5% có sai số chuẩn khoảng 0,5 điểm phần trăm. FDR là trung bình tỷ lệ phát hiện sai ở từng thí nghiệm, không phải tỷ số giữa tổng phát hiện sai và tổng phát hiện gộp lại.

FDR / FWER

So sánh nhiều lần: FDR và FWER

Kiểm định nhiều giả thuyết tạo thêm cơ hội cho kết quả dương tính giả. Hiệu chỉnh làm thay đổi ngưỡng để gọi một kết quả là có ý nghĩa. Cần so sánh cả khả năng kiểm soát sai số lẫn khả năng phát hiện hiệu ứng thật.

Vì sao kiểm định nhiều lần cần hiệu chỉnh?

Với 20 giả thuyết H0 đều đúng và độc lập cùng α = 0.05, xác suất có ít nhất một dương tính giả là 1 − (1 − 0.05)²⁰ ≈ 64%. Số dương tính giả kỳ vọng là 20 × 0.05 = 1. Đây là hai đại lượng khác nhau: một xác suất và một số lượng.

Tỷ lệ phát hiện sai là gì?

FDR = E[V / max(R, 1)], trong đó V là số phát hiện sai và R là tổng số phát hiện. Mục tiêu FDR 5% kiểm soát trung bình tỷ lệ này qua các thí nghiệm lặp lại khi giả định của phương pháp được đáp ứng. Điều đó không có nghĩa mỗi kết quả có ý nghĩa đều có xác suất sai là 5%.

FWER khác gì?

FWER = P(V ≥ 1): xác suất có dù chỉ một phát hiện sai trong một họ kiểm định. Bonferroni và Holm nhắm đến FWER; Benjamini–Hochberg nhắm đến FDR. Kiểm soát FWER cũng đặt giới hạn cho FDR, nhưng thường phát hiện ít hiệu ứng thật hơn.

Ví dụ tính toán: Bonferroni và BH

Xét năm giá trị p đã sắp xếp: 0.001, 0.008, 0.039, 0.041, 0.300, với α = q = 0.05. Bonferroni dùng 0.05 / 5 = 0.01 và bác bỏ hai giả thuyết đầu. BH so sánh các thứ hạng với 0.01, 0.02, 0.03, 0.04, 0.05. Thứ hạng lớn nhất đạt điều kiện là 2 nên BH cũng bác bỏ hai giả thuyết đầu. Nếu giá trị p cuối là 0.045, BH sẽ bác bỏ cả năm: dùng thứ hạng lớn nhất đạt điều kiện, không phải thứ hạng đầu tiên không đạt.

So sánh cả 11 phương pháp hiệu chỉnh

Không hiệu chỉnh

Bác bỏ từng giả thuyết khi p < α. Không kiểm soát sai số ở cấp họ kiểm định. Đây là mốc tham chiếu hữu ích để thấy dương tính giả tích lũy như thế nào.

Bonferroni

Bonferroni bác bỏ khi p < α/m. Phương pháp kiểm soát FWER với các giá trị p hợp lệ dưới mọi cấu trúc phụ thuộc, nhưng có thể bỏ sót hiệu ứng thật khi có nhiều phép kiểm định.

Holm

Sắp xếp giá trị p từ nhỏ đến lớn. So sánh thứ hạng r với α/(m−r+1), dừng ở lần không đạt đầu tiên. Holm kiểm soát FWER dưới sự phụ thuộc bất kỳ và ít nhất bác bỏ mọi giả thuyết mà Bonferroni bác bỏ.

Šidák

Dùng một ngưỡng duy nhất 1−(1−α)^(1/m). Šidák kiểm soát FWER cho các phép kiểm định độc lập và ít bảo thủ hơn Bonferroni một chút.

Holm–Šidák

Áp dụng logic từng bước đi xuống của Holm với ngưỡng 1−(1−α)^(1/(m−r+1)). Mô phỏng này dùng các phép kiểm định độc lập; đừng cho rằng phương pháp xử lý được mọi dạng phụ thuộc.

Hochberg

Tìm thứ hạng lớn nhất r thỏa p(r) ≤ α/(m−r+1), rồi bác bỏ mọi thứ hạng đến r. Hochberg kiểm soát FWER khi độc lập hoặc có điều kiện phụ thuộc dương phù hợp.

Hommel

Hommel dùng quy trình kiểm định đóng dựa trên kiểm định Simes. Phương pháp kiểm soát FWER khi độc lập hoặc trong điều kiện hỗ trợ bất đẳng thức Simes, và có sức mạnh ít nhất bằng Hochberg. Chi phí tính toán cao hơn.

Benjamini–Hochberg

Tìm thứ hạng lớn nhất r thỏa p(r) ≤ (r/m)q, rồi bác bỏ mọi thứ hạng đến r. Benjamini–Hochberg kiểm soát FDR khi các phép kiểm định độc lập và trong một số điều kiện phụ thuộc dương (PRDS).

Benjamini–Yekutieli

Dùng BH với q chia cho Hm = Σ(1/k), k = 1…m. Benjamini–Yekutieli kiểm soát FDR dưới sự phụ thuộc bất kỳ, thường phải đánh đổi bằng sức mạnh thấp hơn.

Kiểu Storey (thăm dò)

Biến thể thăm dò đơn giản này ước lượng π₀ từ tỷ lệ giá trị p lớn hơn 0.5, rồi chạy BH ở mức q/π̂₀. Đây không phải cách triển khai giá trị q đầy đủ và không bảo đảm FDR phổ quát cho mẫu hữu hạn.

BH thích ứng (thăm dò)

Biến thể thăm dò hai lượt này trước tiên chạy BH ở mức q, ước lượng m₀ bằng max(1, m−R₁), rồi chạy BH ở mức q·m/m̂₀. Đây không phải quy trình BKY và không được trình bày là có bảo đảm cho mẫu hữu hạn của quy trình đó.

Câu hỏi thường gặp

Đây có phải công cụ tính FDR cho giá trị p của tôi không?

Đây là trình mô phỏng để học, không phải công cụ tải giá trị p lên để tính toán. Nó tạo ra các thí nghiệm có sự thật nền đã biết để bạn quan sát phát hiện sai và hiệu ứng bị bỏ sót, những điều thường không thể biết chỉ từ dữ liệu thực.

q = 0.05 có bảo đảm chỉ 5% dương tính giả không?

Không. Mục tiêu q = 0.05 liên quan đến tỷ lệ kỳ vọng trong số các phát hiện theo giả định của quy trình. Một thí nghiệm đơn lẻ có thể có tỷ lệ phát hiện sai cao hơn hoặc thấp hơn.

Nên chọn cách hiệu chỉnh nào?

Hãy xác định loại sai số mà thiết kế nghiên cứu cần kiểm soát. Các phương pháp FWER giới hạn nguy cơ có bất kỳ phát hiện sai nào trong họ kiểm định. Các phương pháp FDR kiểm soát tỷ lệ phát hiện sai trung bình trong số các phát hiện. Kiểm tra giả định về phụ thuộc và xác định họ giả thuyết trước khi xem kết quả.

Nguồn và tài liệu đọc thêm