|
Displaying extended context for query match # 49,595 in text YL201737692
|
| << Prev |
Next >> |
|
|
|
條 訊息教 電腦 說話 撰寫 一 支 能 解析 人類 語言 微妙 意義 的 演算法 , 並 不 容易 。 人類 能夠 輕易 區分 一 段 話 是 明顯 在 談論 生病 ( 例如 「 發燒 到 三十八 度 C 」 、 「 想 吐 」 、 和 「 癲癇 」 ) , 還是 在 用 生病 做 譬喻 ( 例如 「 小賈斯汀 害 我 全身 發熱 呢 」 、 「 無聊 死 」 、 以及 「 天啊 那 傢伙 的 桃紅 V 領令 我 癲癇 發作 # 潮怪 」 ) 。 我們 依據 各式各樣 的 回饋 訊息 , 學習 適當 使用 修辭 、 比喻 , 或 單純 的 非 字面 語言 。 人類 是 用 一生 去 學習 語意學 ( 研究 語言 的 多重 意義 ) 。 科學家 只 希望 讓 電腦 程式 對 變化多端 的 話語 , 能 多 一些些 了解 , 他們 沒有 那麼多 時間 。 保羅 與 德雷茲 所 擁有 的 , 是 多 到 荒唐 的 巨量 資料 : 他們 花 了 一 年 半 時間 庫存 了 二十億 條 推訊 。 「 一 年 二十億 還 只是 少量 抽樣 。 這 個 資料量 雖然 很 大 , 但 只 算是 小 樣本 , 」 保羅 解釋 。 科學家 才 剛 開始 處理 二十億 條 推訊 , 就 發現 有 其他 的 問題 : 量 太 大 了 ! 不 是 對 程式 而 言 , 而是 對 他們 兩 人 而言 。 要 讓 程式 開始 學習 , 他們 得 先 為 它 設計 課程 , 也 就 是 建立 一 套 規則 , 讓 程式 用來 區分 與 健康 有關 或 無關 的 推訊 。 為了 撰寫 這些 規則 , 他們 必須 大量 刪減 資料 。 下 一 步 是 搞 清楚 哪些 與 疾病 相關 的 話語 最 有 效果 。 「 『 流感 』 之類 的 詞 很 有力 , 可是 真正 對 症 的 藥物 名稱 則 回傳 的 推訊 太少 , 不 值得 納入 。 」 保羅 說 。 他們 檢視 了 二十億 則 推訊 , 看 哪些 與 WebMD 和 WrongDignosis.com 等 網站 的 三萬 個 關鍵字 ( 包括 疾病 ) 有關 。 經過 這 層 篩選 以及 之後 的 分類 , 讓 推訊數 降到 只 剩 一千一百萬 則 , 裡面 包含 「 流感 」 、 「 生病 」 , 以及 其他 多 種 與 疾病 有關 但 經常 被 用於 其他 目的 的 詞彙 ( 例如 「 網頁 設計課 每 次 都 搞 得 我 很 頭痛 」 ) 。 留下 的 一千一百萬 則 推訊 必須 以 人工 分類 或 標注 。 這麼 龐大 的 任務量 不 是 兩 位 語言學家 能 搞定 的 , 但 眾包 ( crowd-sourcing ) 平台 的 出現 , 使得 這 種 大規模 、 重複性 高 的 任務 被 簡化到 能夠 切碎 , 且 透過 亞馬遜 的 「 機器 土耳其人 」 ( Mechanical Turk ) 服務 , 即刻 分給 全 世界 數千 人 的 工作 。 這 一千一百萬 則 推訊 , 每 則 都 被 標示 三 次 , 以防 人為 疏失 。 如果 兩 個 「 機器 土耳其人 」 標示 者 相信 某 則 有點 模稜兩可 的 推訊 是 與 健康 有關 的 , 那麼 該 推訊 與 健康 無關 的 機率 就 很 小 。 這麼 做 的 用意 , 並 不 是 要 讓 程式 免於 自己 學習 , 而是 要 創造 一 批 正確 的 答案 , 讓 程式 自己 檢查 。 在 機器 學習 中 , 這 叫作 訓練集 ( training set ) , 程式 可以 用 它 來 檢查 答案 , 看看 自己 對 不 對 。 機器 學習 的 實際 運用 可 追溯 至 一九五○年代 , 但 只有 最近 , 我們 才 有 足夠 材料 訓練 電腦 模型 解決 幾乎 任何 問題 。 這 個 方法學 的 突破 要 感謝 網際網路 , 使用 者 在 網路 上 自發性 產生 資料 , 取代 了 昂貴 又 費力 的 問卷 調查 。 保羅 與 德雷茲 的 程式 所 做 的 事 , 是 將 健康 與 流感 趨勢 以 更 接近 即時 、 遙測 的 方式 呈現 , 而 不 是 呈現 未來 。 但 記得 , 未來 是 一 種 看法 , 而 流感 爆發 之類 事情 的 看法 是 由 報告 所 塑造 的 。 在 疾管署 官方 數據 公布 前 兩 週 就 預測出 那些 數據 , 就 是 使 原本 被 隱藏 的 某 種 未來 變 得 更 外顯 的 例子 。 現在 讓 我們 回到 本 章 一 開頭 喬許 小朋友 的 故事 。 他 知道 自己 未來 將 會 把 流感 傳給 誰 , 這 裡面 也 包括 針對 人 與 人 之間 直接 傳染 流感 的 精密 估計 , 以 可能性 為 依據 的 行動 智慧 , 被 計算成 機率 分數 。 我們 關心 的 不 是 什麼 大 數據 問題 , 我們 關心 的 是 喬許 ! 數 年 前 , 想 解決 這麼 複雜 的 問題 , 得 找 核子 物理 學位 的 人 來 進行 極 昂貴 又 費事 的 社會 技術 模擬 。 但 那 個 年代 並 沒有 數百萬 人 喜歡 一口氣 公開 他們 的 身體 現況 、 地點 及 計畫 。 用 推特 就 能 即時 察覺 你 朋友 生病 了 繼 保羅 與 德雷茲 的 研究 之後 , 亞當 . 薩迪雷克 ( 第一 章 提 過 他 ) 在 二○一二年 春 發表 了 兩 篇 論文 , 示範 如何 使用 帶有 地理 標籤 的 推訊 , 即時 察覺 你 的 哪 個 朋友 感冒 了 , 並 推論出 他 在 哪裡 得 的 、 並 預測 他 傳染給 你 的 機率 。 他 將 保羅 與 德雷茲 的 程式 ( 就 是 可以 區分 是否 生病 推訊 的 程式 ) , 運用到 真實 世界 中 。 薩迪雷克 查看 了 一千五百萬 則 推訊 , 其中 大約 四百萬 則 有 地理 標籤 。 推訊 則 是 由 紐約 的 六十三萬多 位 推特 用戶 所 提供 。 這些 推訊 裡 大約 有 一半 ( 二百五十萬 則 ) 是 來自 「 每 月 發表 地標 推訊 超過 一百 次 」 的 用戶 — 所謂 的 地標 愛用 者 。 這些 人 大約 只 有 六千 , 但 他們 的 朋友數 共計 三萬一千八百七十四 個 。 這 群 人 裡 , 每 個 人 平均 有 五 個 朋友 。 薩迪雷克 藉由 這 扇 窗 , 看見 這 六千多 個 地標 愛用 者 身處 何處 、 他們 在 那裡 感覺 如何 、 當時 與 誰 見面 、 見面 為時 多久 。 依據 這些 資訊 , 薩迪雷克 就 能 用 演算法 預測出 下 個 月 這 六千 人 當中 , 百分之十八 的 流感 案例 。 這 個 實驗 證明 了 這 個 演算法 的 概念 是 可行 的 。 ( 註 19 ) 如果 他 和 同事 擴大 規模 , 他們 就 能 比 史 上 任何 流病學家 成功 預測出 一 個 月 內 更多 個人 流感 傳染 案例 。 當然 , 這 種 做法 有 其 限制 。 薩迪雷克 承認 , 在 八成 案例 中 , 當 受 試 者 真的 因 流感 生病 時 , 得 病 的 因果 關係 並 不 清楚 。 他 也 坦承 , 他 的 演算法 完全 倚賴 帶原者 在 社群 網站 上 抱怨 身體 不 舒服 並 加上 地標 。 紐約人 發出 生病 推訊 ( 例如 「 分 不清 哪 個 比較 塞 ,
|