|
醫學 研究 中 從未 有 人 考量 過 這 個 問題 。 為 了 檢驗 自己 的 結果 為 肯定 , 敘達維安 的 釣客 只 需 從 水 中 釣起 魚兒 便 可 立即 知道 自己 釣到 什麼 。 診斷 時 對於 陽性 的 檢驗 必須 理性 面對 , 得 藉由 其他 檢驗 和 研究 的 補充 去 查核 結果 。 醫學 研究 中 同樣 需要 此 種 理性 的 處理 方式 , 一 項 研究 也 需 反覆 進行 , 但 這 種 要求 卻 常 面臨 許多 阻礙 。 ◆ 道德 思維 的 要求 : 如果 甲 治療 方法 經 證實 後 確認為 較 佳 時 , 不可 在 第二 階段 研究 中 以 甲 法 治療 某些 病患 , 卻 又 以 乙 法 治療 其他 的 病患 。 試想 您 第一 階段 的 研究 已 證實 了 上述 結果 , 而 您 卻 剝奪 了 用 乙 方法 治療 的 病患 接受 最好 治療 的 機會 。 ◆ 研究 推廣 的 立場 : 針對 曾經 進行 過 的 研究 項目 , 不 願 撥款 支持 雙重 研究 。 ◆ 雜誌 發行人 的 看法 : 我 該 出版 這 研究 結果 嗎 ? 它 有 什麼 新鮮 的 玩意兒 ? 這 我們 早 就 報導 過 了 。 ◆ 自我 虛榮心 的 作祟 : 是否 該 炒作 別人 的 研究 ? 儘管 我 自己 有 足夠 有用 的 想法 , 或 甚至 我 的 研究 應 可 推翻 之前 的 結果 , 也 只 能 得到 別人 說 我 可能 某 部分 做錯 的 評語 。 __UNDEF__ 敘達維安 釣魚 診斷 檢驗 __UNDEF__ 臨床 研究 最初 的 機率 __UNDEF__ 中 有 可 口魚 的 頻率 __UNDEF__ 生病 的 頻率 __UNDEF__ 研究 成果 確實 較 佳 的 機率 錯誤 肯定 的 結果 __UNDEF__ 一 條 臭味魚 上鉤 。 將 一 名 健康 者 視為 病患 。 第一型 錯誤 。 雖 無 差異 , 卻 能 證實 差異 存在 ( 指標 水準 : 犯下 此 種 錯誤 的 機率 ) 。 錯誤 否定 的 結果 __UNDEF__ 無 此 情形 , 因為 所有 可 口魚 皆 上鉤 。 ( 效力 等於 百分之百 ) __UNDEF__ 將 一 名 病患 視為 健康 者 。 第二型 錯誤 。 雖 有 差異 , 卻 不能 證實 差異 存在 ( 效力 : 不會 犯下 此 種 錯誤 的 機率 ) 。 檢驗 一 項 肯定 結果 __UNDEF__ 將 魚 從 水 中 釣起 。 重複 進行 檢驗 及 / 或 後續 檢查 。 反覆 研究 ! ? 沒 人 願意 提供 經費 , 沒 人 有 興趣 出版 研究 結果 , 更何況 還 存在 道德 的 缺失 。 錯誤 肯定 下 的 可能 結論 __UNDEF__ 麵包 取代 魚 。 需 將 臭味魚 處理掉 。 可能 損失 一 個 魚餌 。 __UNDEF__ 病患 需 忍受 後續 檢查 , 這 可能 導致 副作用 。 一 個 經 證實 的 治療 方法 , 由 另 一 個 成效 較 差 者 所 取代 。 帶給 某些 甚至 許多 病患 在 生命 與 健康 上 的 負面 影響 。 表格 52 : 托馬斯 想法 的 一 覽表 。 __UNDEF__ 基本 上 , 醫學 研究 人員 不會 檢查 自己 遇到 何 種 陷阱 。 當 他 獲得 和 插圖 17 一樣 的 結果 及 某 位 統計學家 的 認可 ( p≦ 0.05 ) 時 , 他 會 自然而然 地 認為 自己 會 釣到 的 是 一 條 可口魚 。 於是 一切 不再 礙手礙腳 的 , 未來 他 只 需 以 「 如 證據 所 示 為 較 佳 」 的 方法 治療 病患 。 一如 我們 現在 所 知 但 至今 未 能 回答 的 失誤率 問題 , 醫學家 ( 並非 只有 這 種 人 ) 稱 它 為 p值 又 將 它 視為 失誤率 。 最後 連 教科書 對 p值 的 描述 也 造成 誤導 。 這 種 誤解 使得 p值 在 國際 文獻 中 佔有 一席之地 , 事實 上 它 本身 並 無 任何 價值 。 研究 的 比例 __UNDEF__ 研究 結果 為 肯定 的 比例 __UNDEF__ 研究 結果 為 否定 的 比例 新 治療法 確實 較 佳 ( 有用 的 想法 ) __UNDEF__ 10% __UNDEF__ 10% x 0.80 = 8% __UNDEF__ 10% x 0.20 = 2% 新治療法 確實 並 未 較 佳 ( 無益 的 想法 ) __UNDEF__ 90% __UNDEF__ 90% x 0.025 = 2.25% __UNDEF__ 90% x 0.975 = 87.75% 總計 __UNDEF__ 100% __UNDEF__ 10.25% __UNDEF__ 89.75% 研究 結果 為 肯定 時 , 新治療法 確實 較 佳 的 機率 : __UNDEF__ 8/10.25 = 0.78 或 78% __UNDEF__ 表格 53:一 項 臨床 研究 的 可能 結果 , 考量 每 第二 個 巧合 的 重大 結果 才 是 錯誤 肯定 結果 的 事實 。 假設 : 指標 水準 是 百分之五 , 效力 是 百分之八十 , 而 有用 想法 的 機率 是 百分之十 。 表格 51 中 仍 存在 一 個 思考 上 的 小 缺點 , 它 稍微 誇大 了 這 個 問題 。 假設 所有 研究 的 結果 皆 恰巧 證實 了 一 項 重大 發現 , 即 新 治療法 的 療效 較 佳 。 如果 其中 一半 的 情形 顯示 實 新 治療法 恰巧 較 差 , 這時 當然 就 不會 有 人 認為 新 治療法 比較 好 。 因此 需 將 表格 51 修改成 表格 53 。 整體 而言 , 研究 結果 中 有 百分之十點二五 的 情形 顯示 : 「 新治療法 較 佳 」 , 但 其中 只 有 百分之八 的 情形 確實 如此 , 所以 失誤率 為 百分之二十二 ( 2.25 / 10.25 = 0.22 ) 。 這 機率 雖然 低於 之前 計算出 的 百分之三十六 , 但 儘管 如此 還是 不能 對 這 問題 視若無睹 。 在 表格 54 中 托馬斯 思索 著 , 有用 想法 的 機率 究竟 該 多 高 , 才 能 在 一般 條件 下 ( 指標 水準 是 百分之五 , 效力 是 百分之八十 ) 計算出 差不多 同樣 大 的 真正 失誤率 , 就 像 一般 錯誤 地 以 指標 水準 冒充 失誤率 時 所 計算出 的 結果 。 慈悲 的 研究 人員 認為 有用 想法 的 機率 該 為 百分之四十 , 果真如此 他們 就 能 滿足 上述 的 要求 。 研究 的 比例 __UNDEF__ 研究 結果 為 肯定 的 比例 __UNDEF__ 研究 結果 為 否定 的 比例 新 治療法 確實 較 佳 ( 有用 的 想法 ) __UNDEF__ 40% __UNDEF__ 40% x 0.80 = 32% __UNDEF__ 40% x 0.20 = 8% 新治療法 確實 並 未 較 佳 ( 無益 的 想法 ) __UNDEF__ 60% __UNDEF__ 60% x 0.025 = 1.5% __UNDEF__ 60% x 0.975 = 58.5% 總計 __UNDEF__ 100% __UNDEF__ 33.5% __UNDEF__ 66.5% 研究 結果 為 肯定 時 , 新治療法 確實 較 佳 的 機率 : __UNDEF__ 32 / 33.5 = 0.955 或 95.5% __UNDEF__ 表格 54:一 項 臨床 研究 的 可能 結果 , 考量 每 第二 個 巧合 的 重大 結果 才 是 錯誤 肯定 結果 的 事實 。 假設 : 指標 水準 是 百分之五 , 效力 是 百分之八十 , 而 有用 想法 的 機率 是 百分之四十 。 如果 機率 確實 為 百分之四十 , 那麼 我們 的 好 日子 就 將 降臨 了 。 若 每 位 充滿 夢想 的 研究 人員 引發 的 失誤率 ( 等於 無益 想法 的 機率 ) 為 百分之六十 , 六 位 相同 的 研究 人員 同時 發生 失誤 的 機率 則 為 百分之四點六 , 0.6 x 0.6 x 0.6 x 0.6 x 0.6 x 0.6
|