|
決斷 的 猶疑 , 最後 錯過 黃金 時間 。 註 一 : 這 兩 個 決策 的 層次 相當於 諾貝爾 經濟學獎 得主 丹尼爾.卡尼曼 ( Daniel Kahneman ) 所 著 《 Thinking , Fast and Slow 》 (2011) 中 區分 的 系統 一 與 系統 二 ( System 1 and System 2 ) 的 思考 反應 機能 。 不 談 錯誤 , 哪來 準確 ? 攸關 生命 的 傳染性 疾病 , 不妨 放寬 偽 陽性 的 錯誤率 , 就算 虛驚一場 , 也 強過 有病 卻 沒 檢查出來 ; 一些 無傷大雅 的 小 毛病 則 可 輕輕 放過 , 偽陰性 雖 高 , 也 省得 疲於奔命 。 就 像 我們 每 天 面臨 二元 判斷 的 十字路口 , 若 能 估算 誤判 後果 , 境界 更 高 。 有 人 開發出 一 台 醫療 診斷 儀器 , 用來 偵檢 一 種 特殊 的 疾病 。 任何 儀器 都 有 誤差 , 臨床 實驗 統計 指出 , 用 這 台 機器 檢驗 一百 個 沒有 患病 的 受測 者 , 有 九○% 的 正確率 , 但是 有 一○% 的 誤差 , 雖然 可以 正確 檢驗出 九十 個 沒 病 的 受測 者 , 卻 會 將 十 個 沒 病 的 受測 者 誤判為 患者 。 假設 你 也 去 接受 這 項 檢驗 , 結果 呈現 陽性 反應 , 請問 : 你 患 這 種 病 的 機率 有 多 大 ? 無所不在 的 兩 種 錯誤 如果 你 的 答案 是 九○% , 那 可 錯得 很 離譜 , 不過 沒關係 , 許多 專業 醫師 也 犯 了 同樣 的 錯誤 。 這 個 問題 的 答案 跟 受 檢驗 的 樣本群 有關 。 如果 樣本群 中 患有 這 種 疾病 的 比率 是 一% , 用 這 台 機器 檢驗 一百 個 樣本 , 假設 它 能 正確 檢驗出 這 一 個 真正 的 患者 , 其餘 九十九 人 雖然 沒 病 , 但是 由於 有 一○% 的 錯誤 , 所以 有 十 個 ( 四捨五入 ) 沒 病 的 人 被 誤判 有病 。 因此 十一 個 呈 陽性 反應 的 受測 者 , 真正 罹病 者 只 有 一 人 , 上述 問題 的 答案 是 九% ( 1/11 ) 。 但 如果 受檢 樣 本群 患有 這 種 疾病 的 比率 高達 二○% , 呈 陽性 反應 的 受測 者 真正 罹病 的 機率 馬上 跳升 到 七二% ( 20/28 ) 。 檢查 有病 與否 是 一 種 二元 的 判斷 , 任何 二元 判斷 都 有 兩 種 可能 的 錯誤 , 第一 種 是 「 誤以為是 」 , 其實 沒 病 的 人 卻 認為 有病 , 也 可 說 是 「 似是而非 」 , 這 是 「 陽性 」 的 錯誤 ( False Positive ) , 或 稱為 「 第一 類 錯誤 」 ( Type I Error ) 。 上面 用到 的 一○% 誤判率 , 便是 「 偽 陽性 」 錯誤 。 前面 的 例子 並 沒有 提到 第二 種 錯誤 , 真正 有病 的 人 卻 被 誤判為 沒 病 , 「 誤以為非 」 , 或者 「 似非而是 」 , 此 乃 「 偽陰性 」 ( False Negative ) 或是 「 第二 類 錯誤 」 ( Type II Error ) 。 運用 科學 技術 做 二元 判斷 , 在 日常 生活 上 的 運用 比比皆是 : 疾病 的 診斷 、 婦女 是否 懷孕 、 超音波 檢驗 胎兒 性別 、 指紋 偵測 、 電腦 病毒 、 垃圾 郵件 、 防盜 警鈴 , 每 一 種 需要 做 「 是 」 與 「 不 是 」 判斷 的 決策 , 都 無法 規避 這 兩 種 錯誤 ── 偽陽性 和 偽陰性 。 提高 準確性 從 技術 下手 前面 的 例子 預測 的 準確性 只有 九% , 第二 種 狀況 準確性 達到 七二% , 很 顯然 第一 種 預測 參考 價值 比 丟銅板 還 低 , 有 九一% 的 機會 僅僅 是 一 場 虛驚 , 當然 沒有 人 可以 接受 這 種 檢驗 結果 。 想要 提高 預測 的 準確性 , 可 有 哪些 對策 ? 最 根本 的 辦法 當然 是 開發 更 進步 的 技術 , 提高 偵測 的 準確度 。 例如 檢查 某 種 疾病 的 時候 , 能夠 找出 某 種 與 疾病 關聯性 最 高 的 癥狀 ( 生化 成分 、 生理 指數 等 ) , 或者 像是 過濾 垃圾 郵件 , 能夠 界定 更 有效 的 判斷 方法 , 正 如 過濾 技術 不斷 升級 , 由 檢視 郵件 的 內容 ( content-based ) , 到 行為 ( behavior-based ) , 進而 到 意圖 ( intent-based ) 。 技術 的 進步 當然 可以 降低 偽 陽性 , 或是 偽陰性 。 譬如 上述 的 例子 中 , 如果 偽 陽性 從 一○% 降低到 二% , 在 前述 兩 種 不同 的 狀況 下 , 預測 的 正確性 很 快 就 能 提高到 三三% 和 九二% 。 第二 種 方法 是 改變 樣本群 內 陽性 的 比例 。 就 像 前面 例子 顯示 的 , 患病 比例 從 一% 提高到 二○% 時 , 預測 準確性 就 會 從 九% 增加 到 七二% 。 這 是 在 疾病 檢驗 時 最 常 使用 的 方法 , 醫生 先 用 「 望聞問切 」 做 初步 的 診斷 , 稍 有 蹊蹺 , 接下來 驗血 驗尿 、 照 X光 、 超音波 , 如果 還 有 需要 , 接下來 再 做 MRI 或 正子 掃描 , 每 一 項 檢驗 有 其 成本 , 卻 可以 增加 樣本群 的 陽性 比率 , 因而 提高 預測 的 準確度 。 許多 新 開發 的 檢驗 方法 , 限定 針對 具有 某些 病癥 的 潛在 病人 , 也 出自 於 同樣 的 考量 。 罕見 疾病 的 檢測 方法 難以 開發 , 除了 市場 規模 小 之外 , 更 困難 的 挑戰 是 需要 更 高 的 技術 , 才 能 達到 極 低 的 偽陽性 、 偽陰性 錯誤 , 檢驗 結果 才 有 預測 價值 。 相反地 , 垃圾 郵件 每 天 擠爆 每 一 個 人 的 郵箱 , 誰 敢 不用 過濾 軟件 ? 雖然 免不了 偽 陽性 、 偽陰性 的 錯誤 , 每 一 個 人 也 很 甘願 地 從 垃圾堆 裡 把 正當 的 郵件 ( False Positive ) 撿回來 。 所以 , 許多 人 創業 選擇 解決 多數 人 頭痛 的 問題 , 不 只是 因為 市場 大 , 也 因為 所 需要 技術 的 精準度 不如 罕見 問題 那麼 高 。 蹺蹺板 般 的 偽陽性 和 偽陰性 就 同 一 種 偵檢 技術 而言 , 偽陽性 和 偽陰性 其實 是 兩 個 此 消 彼 長 的 指數 , 想要 降低 偽 陽性 的 錯誤 , 就 需要 稍微 網開 一 面 , 其 後果 是 漏網之魚 必然 增加 ── 偽陰性 錯誤 提高 。 想要 降低 偽陰性 , 總是 難免 冤枉 無辜 , 沒 病 的 當成 有病 , 偽陽性 自然 提高 。 所以 在 設計 一 項 二元 檢驗 的 時候 , 偽 陽性 與 偽陰性 的 高低 取捨 該 如何 拿捏 呢 ? 這 跟 誤判 後 必須 付出 的 代價 有關 。 以 醫學 檢驗 為 例 , 凡 攸關 生命 , 例如 愛滋病 、 癌症 , 或者 致命 的 傳染性 疾病 , 不妨 放寬 偽 陽性 的 錯誤率 ( 虛驚一場 的 機率 增加 , 心理 衝擊 的 代價 固然 高 ; 有病 卻 沒 檢查出來 , 錯過 醫療 黃金 時間 的 代價 更 高 )
|