Diễn giải trị số P và khoảng tin cậy 95%

Mô hình kiểm định ý nghĩa thống kê

Bước 2, thu thập dữ liệu liên quan đến giả thuyết. Trong ví dụ trên, số liệu sẽ là số trường hợp tử vong. Gọi dữ liệu là D. Bước 3, ước tính xác suất quan sát dữ liệu D nếu giả thuyết H0 đúng. Nói cách khác và viết theo ngôn ngữ toán, bước này ước tính P(D | H0). Đây chính là trị số P (P-value).

Mô hình Kiểm định giả thuyết

Một cách đơn giản, mô hình kiểm định giả thuyết của Neyman và Pearson có thể thực hiện qua các bước như sau:

Bước 1, phát biểu giả thuyết chính (H1) và giả thuyết vô hiệu (H0). Bước 2, quyết định mức độ a và b có thể chấp nhận được và ước tính cỡ mẫu cần thuyết. a là xác suất bác bỏ giả thuyết H1 nhưng đó là giả thuyết đúng. b là xác suất bác bỏ H0 trong khi H0 đúng. Bước 3, thu thập dữ liệu liên quan đến giả thuyết. Bước 4, nếu dữ liệu nằm trong khoảng bác bỏ giả thuyết H0. thì chấp nhận giả thuyết H1; nếu không thì chấp nhận giả thuyết H0. Chú ý rằng “chấp nhận” một giả thuyết không có nghĩa là chúng ta tin vào giả thuyết đó, mà chỉ có nghĩa là chúng ta hành động với điều kiện đó là giả thuyết đúng.

Nguyên lí của mô hình Neyman và Pearson là chúng ta dựa vào dữ liệu để chọn một giả thuyết sao cho về lâu về dài chúng ta không quá sai. Chính vì thế mà ngày nay chúng ta thường chọn a = 5% và b = 10% đến 20%.

Một mô hình hỗn hợp

Bước 2, xác định xác suất a (còn gọi là sai số loại I) và b (còn gọi là sai số loại II), và ước tính cỡ mẫu dựa vào hai xác suất này. Bước 3, thu thập dữ liệu liên quan đến giả thuyết. Gọi dữ liệu là D. Bước 4, sử dụng phương pháp kiểm định ý nghĩa thống kê của Fisher ước tính xác suất P(D | H0). Gọi trị số này là P. Bước 5, nếu P < 0.05, bác bỏ giả thuyết H0. Chú ý, bác bỏ H0 không có nghĩa là chúng ta chấp nhận giả thuyết H1.

HOPE/HOPE-TOO Study Investigators. Long-term effects of Ramipril on cardiovascular events and diabetes. Results of the HOPE Study Extension. Circulation 2005; 112:1339-1346.

Vấn đề của trị số P

Vấn đề logic

Như qua minh họa trên, trị số P không cho chúng ta biết gì về sự khả dĩ của một giả thuyết, bởi vì nó là một xác suất có điều kiện. Trị số P cho chúng ta biết xác suất của dữ liệu (data) nếu một giả thuyết là đúng. Cái khiếm khuyết lớn nhất của trị số P là nó thiếu tính logic. Thật vậy, nếu chúng ta chịu khó xem xét lại ví dụ trên, có thể khái quát tiến trình của một nghiên cứu y học (dựa vào trị số P) như sau:

Đề ra một giả thuyết chính vô hiệu (H0)Từ giả thuyết vô hiệu, đề ra một giả thuyết chính (H1)Tiến hành thu thập dữ liệu (D)Phân tích dữ kiện: tính toán xác suất D xảy ra nếu H0 là thật. Nói theo ngôn ngữ toán xác suất, bước này chính là bước tính toán trị số P hay P(D | H0).

Logic đằng sau của trị số P có thể được hiểu như là một qui trình chứng minh đảo ngược (proof by contradiction):

Mệnh đề 1: Nếu giả thuyết vô hiệu đúng, thì sự kiện này không thể xảy ra;Mệnh đề 2: Sự kiện xảy ra;Mệnh đề 3 (kết luận): Giả thuyết vô hiệu không thể đúng.

Nếu cách lập luận trên khó hiểu, chúng ta thử xem một ví dụ cụ thể như sau:

Nếu ông Tuấn bị tăng huyết áp, thì ông không thể có triệu chứng rụng tóc (hai hiện tượng sinh học này không liên quan với nhau, ít ra là theo kiến thức y khoa hiện nay);Ông Tuấn bị rụng tóc;Do đó, ông Tuấn không thể bị tăng huyết áp.

Vấn đề kiểm định nhiều giả thuyết

Vấn đề là như sau: nếu chúng ta kiểm định một giả chúng ta chấp nhận một sai sót 5% (giả dụ chúng ta chấp nhận tiêu chuẩn P = 0.05 để tuyên bố có ý nghĩa hay không có ý nghĩa thống kê). Nói cách khác, sự thật là không thuốc có hiệu quả sai, nhưng kết quả kiểm định thống kê cho ra kết quả có ý nghĩa thống kê, và chúng ta chấp nhận rằng sự kiện này có thể xảy ra với tần số 5%. Vấn đề đặt ra là trong bối cảnh kiểm định nhiều giả thuyết là như sau: nếu trong số n thử nghiệm, chúng ta tuyên bố k thử nghiệm “có ý nghĩa thống kê” (tức là P<0.05), thì xác suất có ít nhất một giả thuyết sai là bao nhiêu?

Nói chung, nếu chúng ta thử nghiệm n giả thuyết, và mỗi lần thử nghiệm chúng ta chấp nhận một xác suất sai lầm là p, thì xác suất có ít nhất 1 sai lầm trong n lần thử nghiệm đó là . Khi số lần kiểm định là n = 10 và p=0.05 thì xác suất có ít nhất một kết luận sai lầm lên đến 40%! “Bài học” rút ra từ cách lí giải trên là như sau: nếu chúng ta đọc một bài báo khoa học mà trong đó nhà nghiên cứu tiến hành nhiều thử nghiệm khác nhau với các kết quả trị số P < 0.05, chúng ta có lí do để cho rằng xác suất mà một trong những cái-gọi-là “significant” (hay “có ý nghĩa thống kê”) đó rất cao. Chúng ta cần phải dè dặt với những kết quả phân tích như thế.

Ý nghĩa thống kê không tương đương với ý nghĩa lâm sàng

Trong thực tế, có rất nhiều nghiên cứu mà độ khác biệt giữa hai nhóm rất nhỏ, nhưng vẫn có ý nghĩa thống kê [10-11]. Điều đáng quan tâm là kết quả có ý nghĩa thống kê như thế được các nhà nghiên cứu diễn dịch với hàm ý có ý nghĩa lâm sàng.

Khoảng tin cậy 95%

Thứ hai, dưới vài giả định cơ bản, có thể phát biểu rằng khoảng tin cậy 95% dao động trong khoảng 0.75 đến 0.91 có nghĩa là xác suất mà RR dao động trong khoảng khoảng 0.75 đến 0.91 bằng 95%. Cũng có thể nói cách khác: nếu nghiên cứu được lặp lại 100 lần trong điều kiện giống như nghiên cứu Ramipril thì hiệu quả trung bình của 100 nghiên cứu sẽ là 0.83, và có 95 nghiên cứu sẽ có RR thấp 0.91 hay cao đến 0.75.

Thứ ba, một khoảng tin cậy 95% [KTC95%] của RR không bao gồm 1 cũng có nghĩa là trị số P phải thấp hơn 0.05. Nói cách khác, một RR với khoảng tin cậy 95% không bao gồm 1 cũng có nghĩa là kết quả đó có ý nghĩa thống kê, hiểu theo nghĩa P < 0.05.

Ý nghĩa: có hiệu quả (RR thấp hơn 1), nhưng không có tác hại lâm sàng, bởi vì tất cả khoảng tin cậy 95% dao động trong khoảng 0.9 đến 1.1.

Ý nghĩa: Có thể có tác hại (vì KTC95% hàm chứa một xác suất nhỏ thuốc có thể có hại. Nhưng rõ ràng là thuốc không có lợi ích lâm sàng.

Ý nghĩa: Có thể thuốc có lợi lâm sàng, nhưng chưa chắc chắn, bởi vì KTC95% bao gồm 1. Có bằng chứng cho thấy thuốc không gây tác hại lâm sàng.

Ý nghĩa: kết quả này cho thấy thuốc có thể đem lại lợi ích đáng kể, nhưng KTC95% quá rộng nên tình trạng bất định còn quá cao.

Ý nghĩa: kết quả này cho thấy thuốc có lợi ích (và có ý nghĩa thống kê), nhưng tác dụng lâm sàng chưa rõ ràng

Ý nghĩa: kết quả này cho thấy thuốc rõ ràng đem lại lợi ích cho bệnh nhân.

Ý nghĩa: chúng ta không thể rút được gì từ kết quả trên!

Kết luận

Tài liệu tham khảo[1] HOPE/HOPE-TOO Study Investigators. Long-term effects of Ramipril on cardiovascular events and diabetes. Results of the HOPE Study Extension. Circulation 2005; 112:1339-1346.[2] Wulff HR, Andersen B, Brandenhoff P, Guttler F. What do doctors know about statistics? Statistics in Medicine 1987; 6:3-10.

[4] Để biết triết lí phản nghiệm trong nghiên cứu lâm sàng, có thể đọc bài của Senn SJ. Falsificationism and clinical trials. Stat Med 1991 Nov;10(11):1679-92.[6] Fisher RA. On the interpretation of ÷2 from contingency tables, and the calculation of P. Journal of the Royal Statistical Society 1922; 85(1):87-94.[6] Fisher RA. Statistical Methods for research workers. Oliver and Boyd, 1954.[7] Neyman J, Pearson E. On the Problem of the Most Efficient Tests of Statistical Hypotheses. Philosophical Transactions of the Royal Society of London. Series A, Containing Papers of a Mathematical or Physical Character 1933; 231: 289-337.[8] Xem thêm chi tiết về những tranh luận liên quan đến kiểm định ý nghĩa thống kê và kiểm định giả thuyết trong sách The Significance Test Controversy, do DE Morrison và RE Henkel biên tập, Nhà xuất bản Aldine, Chicago: 1970. [9] Gigerenzer G, Swijtink Z, Porter T, Daston L, Beatty J, Kruger L. The Empire of Chace: How Probability Changed Science and Everyday Life. Cambridge University Press, 1989. [10] Barnard GA. Must clinical trials be large? The interpretation of P-values and the combination of test results. Stat Med 1990;9(6):601-14. [11] Barnard GA. On alleged gains in power from lower P-values. Stat Med 1989;8(12):1469-77. [12] Rumbold AR, Crowther CA, Haslam RR, Dekker GA, Robinson JS; ACTS Study Group. Vitamins C and E and the risks of preeclampsia and perinatal complications. N Engl J Med 2006;354(17):1796-806.

Link nội dung: https://melodious.edu.vn/dien-giai-a115600.html