Displaying extended context for query match # 22,682 in text YL201502229
<< Prev Next >>
    
 

「 搜尋 」 範圍 將 不 只是 擴大 一 倍 , 而是 擴大 十 倍 , 又 由於 一 個 詞 大約 由 一‧六 個 字 組成 , 使得 實際 的 數量 更加 巨大 , 語料庫 的 資料 積累 亦 須 相應 增加 。 李開復 在 八○年代 中期 做 博士 的 時候 , 就 堅信 語音 識別 研究 必須 擁有 龐大 語料庫 , 現在 仍然 認為 中國 以往 的 研究 之所以 局限於 「 一 個 字 」 , 是 因為 受到 語料庫 太 小 的 約束 。 所以 他 要求 黃昌寧 小組 將 語料庫 迅速 擴大 , 半 年 之中 規模 達到 五十億 字 ( 到 這 年 年底 , 黃昌寧 真的 建立起 世界 上 最 大 的 漢語 語料庫 ) 。 陳正 的 幸運 在於 當 他 開始 從事 這 項 研究 時 , 前人 已經 把 所有 道理 都 弄 明白 了 。 「 我 繼承 了 分割 語言 的 方法 。 」 後來 他 這樣 說 。 但 他 沒有 陷 在 前人 的 經驗 中 , 當 他 深入 這 種 方法 時 , 就 發現 建立 在 自然 語言 基礎 上 的 分割 並 不 自然 , 比如 「 中國 」 一 詞 , 按照 傳統 的 切分 , 應當 寫作 zhong/guo 。 陳正 把 這 組 拼音 寫 在 電腦 螢幕 上 , 左 看 右 看 , 連續 數十 分鐘 目不轉睛 , 似 已 魂飛魄散 , 驀然間 腦子 裡 跳出 一 個 念頭 , 為什麼 不能 這樣 切分 呢 : z/h/o/n/g/g/u/o ? 這一來 讓 他 看到 了 夢想 中 的 美好 情景 。 __UNDEF__ 「 我 要 做 的 是 將 每 一 個 字母 都 分出來 , 具體 到 最 小 的 語言 要素 , 」 他 向 同事 陳述 自己 的 想法 , 「 每 個 字母 都 有 多 種 匹配 的 可能 , 所以 我 要 切分 每 一 個 字母 。 」 他 相信 個人電腦 的 計算 功能 已經 足夠 強大 , 運算 速度 也 已 夠 快速 , 不 怕 在 瞬間 完成 巨大 的 統計 , 只 怕 不 知道 怎麼 做 。 以後 事情 的 發展 證明 這 的確 是 個 聰明 的 想法 , 機器 不僅 大大 地 提高 了 選擇 能力 , 並 開始 產生 一 種 奇妙 的 功效 : 自動 糾正 人為 造成 的 拼寫 錯誤 , 亦即 我們 之前 所 述 的 「 自動 糾錯 模型 」 。 由於 有 了 「 最 小 語音 要素 」 的 概念 , 陳正 有 可能 提出 進一步 的 設想 : 讓 機器 來 糾正 自己 那 滿 口 南方 腔調 造成 的 拼音 錯誤 。 他 向 王堅 請教 , 王堅 讚賞 他 的 想法 , 還給 他 一 本 書 , 書 的 內容 是 專門 分析 英文 拼寫 中 發生 的 各 種 錯誤 , 其 統計 錯誤 機率 的 方法令 陳正茅 塞頓開 。 於是 他 轉而 建築 中文 拼音 拼寫 的 「 錯誤 模型 」 , 將 這 個 模型 分為 「 替代 」 、 「 插入 」 、 「 跳躍 」 、 「 交換 」 四 種 , 又 將 二十六 個 拼音 字母 的 各 種 搭配 分布 於 這 四 種 模型 中 , 列出 下面 一 個 簡單 的 算術式 : 26 × 26 × 4 = 2704 。 這 意味 著 陳正 建立 起來 的 「 電腦 自動 糾錯 模型 」 共計 二七○四 種 。 陳正 完成 了 一 個 劃時代 的 工作 , 卻 給 人 留下 了 意猶未盡 的 印象 。 當 語音 被 分割成 一個個 最 小 因素 時 , 英文 和 中文 之間 似乎 有 了 某 種 共同 的 東西 。 那 一 天 , 李開復 對 他 說 : 「 英文 也 有 自己 的 組詞 規律 , 我們 能不能 讓 機器 識別出來 ? 」 於是 他們 拿出 一 大 堆 「 維斯波 」 的 英文 實驗 資料 , 讓 電腦 去 識別 一 串 字母 是 像 英文 還是 像 中文 。 結果 一 個 更 令 人 驚訝 的 事情 發生 了 : 當 他 使用 Trigram 模型 去 追尋 正確 的 字母 搭配 時 , 機器 居然 能夠 準確 地 分辨 英文 字母 與 中文 拼音 。 當初 王堅 小組 設計 「 無 模式 介面 」 的 研究 計畫 時 , 就 曾 說到 「 中文 和 英文 混合 輸入 而 無須 切換 按扭 」 , 陳正 當時 的 第一 個 反應 是 「 怎麼 可能 ? 」 沒想到 由於 有 了 「 最 小 因素 分割 」 的 想法 , 王堅 小組 提出 取消 「 中英文 切換 」 模式 的 想法 立即 成為 可能 。 工業 時代 的 奧秘 是 「 分工 」 , 資訊 時代 的 奧秘 是 「 融合 」 陳正 的 「 搜尋 引擎 」 基本 框架 一 步 一 步 地 生成 。 與 此 同時 , 邸爍 的 中文 語音 識別 系統 也 有 了 大致 模樣 。 到 了 六月 二十日 , 距離 「 二十一世紀 的 計算 」 大會 還 有 一 週 , 李開復 有些 著急 , 他 問 兩 人 能否 在 一 週 內 「 弄出 一 個 結果 」 。 陳正 胸 有成竹 , 邸爍 也 躍躍欲試 。 一 星期 後 , 他們 果真 拿出 了 階段性 的 報告 , 漢語 語音 識別 系統 的 識別率 達到 七八% 。 又 過 了 六 個 星期 , 識別率 超過 了 九○% 。 現在 陳正 也 能 洋洋 自得 地 說 : 「 我 覺得 拋棄 原來 的 方式 真是 英明 。 」 一向 自信 的 邸爍 , 這 一 回 也 沒想到 自己 身 上 蘊藏 著 如此 大 的 潛力 : 「 這麼 快 就 入 了 門 , 而且 還 能 做出 東西 , 真 沒想到 。 」 不用說 他們 兩 人 沒有 想到 , 就 連 老練 世故 、 閱歷 豐富 的 黃昌寧 也 難以 想像 , 自己 此 生 還 能 身處 這樣 的 環境 中 。 過去 和 現在 的 對比 實在 太 強烈 , 以致 他 在 一 個 私下 場合 講出 一 番 刻骨銘心 的 感受 : 我 一直 直言 不諱 : 我 得 從頭 學 起 。 微軟 有 一 個 很 大 的 不同 : 「 資源 分享 」 。 研究 的 資源 , 也 就 是 軟體 工具 、 原始碼 、 語料 資料 , 所有 的 資源 都 是 共用 。 公司 內部 的 研究 資源 是 無償 使用 , 我 只要 發出 一 封 電子 郵件 , 他 就 很 樂意 送過來 給 你 用 , 但 原創 者 的 功績 並 不會 因此 被 埋沒 。 他 發明 的 東西 被 別人 引用 得 越 多 , 其 業績 也 就 越 好 。 中國 的 學者 對 此 情況 是 夢寐以求 的 , 但 始終 行不通 。 我們 總 說 自己 是 社會主義 「 大 家庭 」 、 「 大 合作 」 , 但 真 到 做 的 時候 又 是 另 一 回 事 。 大家 做 著 同 一 課題 , 不 是 做 一 年 半 年 , 而是 做 十 年 八 年 了 。 但 我 的 成果 你 不能 看 , 你 的 成果 我 不能 看 。 要 看 只 能 在 發表 之後 , 和 全 世界 的 人 一起 看 , 甚至 同 一