|
研究 的 結果 皆 恰巧 證實 了 一 項 重大 發現 , 即 新 治療法 的 療效 較 佳 ; 或 其中 一半 的 情形 證實 新 治療法 恰巧 較 差 , 這時 當然 就 不會 有 人 認為 新 治療法 比較 好 。 因此 需 將 表格 四十九 修改成 表格 五十一 。 整體 而言 , 研究 結果 中 有 百分之十二點五 的 情形 顯示 : 「 新治療法 較 佳 」 , 但 其中 只 有 百分之八 的 情形 確實 如此 , 所以 失誤率 為 百分之二十二 ( 2.25 / 10.25 = 0.22 ) 。 這 機率 雖然 低於 之前 計算出 的 百分之三十六 , 但 儘管 如此 還是 不能 對 這 問題 視若無睹 。 在 表格 五十二 中 托馬斯 思索 著 , 有利 想法 的 機率 究竟 該 多 高 , 才 能 在 一般 條件 下 ( 指標 水準 是 百分之五 , 效力 是 百分之八十 ) 計算出 差不多 大小 的 實際 失誤率 , 就 像 一般 受到 指標 水準 操縱 的 情形 相同 。 慈悲 的 研究 人員 認為 有利 想法 的 機率 該 為 百分之四十 , 果真如此 他們 將 能 滿足 上述 的 要求 。 研究 的 比例 研究 結果 為 肯定 的 比例 研究 結果 為 否定 的 比例 新 治療法 確實 較 佳 ( 有利 的 想法 ) 40% 40% x 0.80 = 32% 40% x 0.20 = 8% 新 治療法 確實 並 未 較 佳 ( 無益 的 想法 ) 60% 60% x 0.025 = 1.5% 60% x 0.975 = 58.5% 總計 100% 33.5% 66.5% 研究 結果 為 肯定 時 , 新治療法 確實 較 佳 的 機率 : 32/33.5 = 0.955 或 95.5% 表格 五十二:一 項 臨床 研究 的 可能 結果 , 考量 每 第二 個 重大 結果 才 是 錯誤 肯定 結果 的 事實 。 假設 : 指標 水準 是 百分之五 , 效力 是 百分之八十 , 而 有利 想法 的 機率 是 百分之四十 。 如果 機率 確實 為 百分之四十 , 那麼 我們 的 好 日子 就 將 降臨 了 。 若 每 位 充滿 夢想 的 研究 人員 引發 的 失誤率 ( 等於 無益 想法 的 機率 ) 為 百分之六十 , 六 位 相同 的 研究 人員 同時 發生 失誤 的 機率 則 為 百分之四點六 , 0.6 x 0.6 x 0.6 x 0.6 x 0.6 x 0.6 = 0.046 。 結果 低於 百分之五 。 如果 六 人 皆 一致 認同 某 研究 中 的 甲藥 優於 乙藥 , 結果 即為 重大 的 發現 , 而 不需 再 進行 研究 。 「 如果 那些 專家 真 有 想像 中 的 好 , 研究 和 統計 數據 豈不 就 多餘 了 , 未來 我們 只 需要 湊齊 六 位 學術界 名人 並 詢問 他們 的 意見 即可 。 如果 專家 沒 那麼 好 也 無法 確定 有利 想法 的 機率 , 這時 研究 和 統計 數據 同樣 是 多餘 的 , 因為 失誤率 將 會 大 到 無法 測量 , 若 有 這 種 認知 , 可 省下 一 筆 可觀 的 研究 費用 。 」 在 大多數 的 科學 研究 中 不只 研究 一 個 終點 1, 而是 同時 研究 兩 個 或 更多 個 。 一般 很 少 有 人 會 反對 較 有利 的 認知 , 因為 這麼 做 便 犯 了 第一 類 錯誤 。 2 通常 不 屬於 計劃 的 初步 分析 也 可能 被 發表 , 或者 「 基於 實際 考量 」 根本 未 在 研究 報告 中 加註 , 說明 該 於 何時 、 利用 何 種 方法 評估 哪 個 終點 ( 參傅 博格 與 傅博格 , Furberg und Furberg , 一九九四年 出版 ) , 這時 犯下 第一 類 錯誤 的 機率 大幅 提昇 。 至於 第二 類 錯誤 , 通常 只有 少數 頂尖 的 專業 雜誌 真的 對 它 投 以 關注 , 以 我們 領域 中 的 大多數 研究 為 例 , 其 效力 顯然 低於 百分之五十 。 透過 國際 研究 在 研究 規劃 和 進行 上 慣有 的 增刪 填補 , 實際 的 ( ! ) 失誤率 恐怕 會 更 高 。 表格 五十三 為 實際 的 範例 。 整體 而言 , 研究 結果 中 有 百分之十一點三 的 情形 顯示 : 「 新治 療法 較 佳 」 , 但 其中 只 有 百分之五 的 情形 確實 如此 , 所以 陽性 預測值 ( positiver pradiktiver Wert ) 1 為 百分之四十四 ( 5/11.3 = 0.44 ) , 失誤率 為 百分之五十六 ( 6.3 / 11 .
3 = 0.56 ) 。 也就是說 , 在 百分之五十六 的 情形 下 , 一 項 「 經 科學 證實 為 較 佳 的 治療 方法 」 非但 較 佳 , 它 反而 可能 更 差 。 這 簡直 是 醫學 的 徹底 失敗 , 它 所 造成 的 影響 不但 難以 估計 , 更 無法 以 數據 表達 。 研究 的 結果 研究 的 比例 新 治療法 較 佳 新 治療法 並 未 較 佳 新 治療法 較 佳 10% 10% x 0.5 = 5% 5.0% 新 治療法 並 未 較 佳 90% 90% x 0.14 x 1/2 = 6.3% 83.7% 總計 100% 11.3% 88.7% 失誤率 : 6.3/11.3 = 56% 表格 五十三:一 項 臨床 研究 的 可能 結果 。 假設 : 檢驗 三 個 終點 時 的 實際 指標 水準 是 百分之十四2 , 效力 是 百分之五十 , 而 有利 想法 的 機率 是 百分之十 。 我們 無法 得知 有利 想法 的 機率 , 認為 某 治療法 確實 較 佳 , 因此 無法 在 評估 科學 研究 結果 時 考量 此 狀況 。 科學 中 的 直覺 機率 多 為 主觀 且 為 個人 偏見 所 左右 , 這 就 跟 判斷 中國 大使館 遭 轟擊 的 事件 一樣 。 在 精準 的 科學 領域 中 應該 摒除 這 種 主觀性 。 當今 實踐 的 「 解決 辦法 」 是 , 漠視 這 項 問題 並 推崇 以 p- 值 為 標示 的 統計學 上 的 重大 發現 。 這 樓梯 太 短 了 ! 總 比 沒有 好 ! 插圖 十五 : 阿聰 和 阿明 正在 通往 摘取 智慧 之 花 的 路 上 由於 這 個 問題 並 未 真的 存在 , 所以 也 沒 人 思考 解決 的 辦法 。 1 我們 和 許多 同事 談論 起 這 個 話題 。 所有 了 解 這 狀況 的 人 , 一致 認為 此 問題 無解 。 如果 不能 遵循 特定 方法 ( 依靠 p-值 ) , 勢必 得 找出 另 種 可能性 。 如果 因為 目前 尚未 發現 其他 方法 , 而 完全 漠視 行不通 的 問題 , 就 未免 太 短視 了 。 插圖 十六 : 臨床 研究 的 失誤率 深不可測 , 只好 在 醫學 研究 中 討論 此 問題 。 都納 ( Dietrich Dorner , 德國 Bamberg 大學 心理學 教授 , Leibniz獎 得主 , 同時 也 是 Max Planck 研究 中心 「 認知 人類學 研究 計劃 」 的 主持人 ) 曾 在 自己 的 書 中 「 錯誤 的 決策 思考 」 "Die Logik des Misslingens" ( 聯經 已 於 一九九年 二月 出版 ) 寫道 : 「 如果 直接 漠視 難以 解決 的 問題 , 或 藉由 『 委託 』 取得 表面 的 解決 ; 如果 太 積極 地 想 借助 新 資訊 , 轉移 自己 對 剛 解決 問題 的 注意 ; 如果 只 解決 能 解決 的 問題 , 卻 不 解決 該 解決 的 問題 ; 如果 對 自身 行為 的 反應 和 因 面臨 自身 機能 不全 而 感到 恐懼 , 則
|