|
Displaying extended context for query match # 22,698 in text YL201502229
|
| << Prev |
Next >> |
|
|
|
讓 機器 像 人 一樣 地 和 人 對話 。 他 就是 在 這 期間 , 聽說 了 李開復 的 其 人 其 事 。 「 多元化 」 是 張益肇 迄 今 為止 最 重要 的 人生 經驗 , 他 說 : 「 美國 是 個 多元化 的 社會 , 你 的 興趣 與 信仰 和 大家 完全 不 一致 也 沒有 關係 。 」 但是 他 在 日本 工作 時 , 卻 發現 日本人 對 美國 的 「 多元化 」 持有 強烈 的 批評 態度 , 還 將 美國 經濟 八○年代 的 低潮 , 歸咎於 「 這 個 國家 的 多元化 」 。 當時 的 張益肇 有些 相信 日本人 的 話 , 但 後來 看到 美國 經濟 捲土重來 、 日本 卻 是 每況愈下 , 就 斷定 : 「 多元化 還 是 一 個 好 東西 。 」 現在 , 他 來到 中國 大陸 , 這 是 他 第一 次 來 大陸 , 看到 熙熙攘攘 、 亂亂 哄哄 的 城市 , 他 覺得 「 蠻 親切 的 , 和 台灣 差不多 。 」 他 對 大陸 年輕人 的 「 真是 會 想 事情 」 很 驚訝 , 又 發現 「 中國 學生 做 事情 比 美國人 認真 。 」 不過 他 也 發現 , 在 希格瑪 大廈 裡 是 要 「 百 種 人 做 一樣 事 」 的 。 現在 , 李開復 的 語音 小組 擁有 李明鏡 和 張益肇 兩 位 研究員 了 , 還 有 好幾 位 副研究員 。 當初 拋 硬幣 分開 了 兩 個 初出茅廬 的 小伙子 , 現在 可以 建立 「 語言 模型 」 和 「 聲學 模型 」 這 兩 個 小組 , 他 讓 李明鏡 和 張益肇 分頭 領銜 , 加速 前進 。 七月 時 , 語音 識別 的 模型 還 只 能 識別 「 三百 個 詞彙 組成 的 一百 句 話 」 , 比如 「 北京 的 天氣 很 好 」 , 超過 這 個 範圍 , 機器 便 一籌莫展 , 但 李開復 說 要 在 「 三 個 月 內 使 系統 的 識別 範圍 擴大到 五萬 個 詞彙 」 。 英文 原型 當中 是 沒有 「 第四 聲 」 的 , 但 漢語 有 , 所以 他 要求 「 聲學 模型 」 小組 必須 想出 辦法 , 還 必須 識別 男女 老少 各 種 聲音 及 南腔北調 的 各 種 方言 。 在 設定 了 研究員 的 目標 之後 , 他 又 指示 凌小寧 手下 的 工程師 , 在 兩 個 月 內 做出 一 個 可以 讓 比爾‧蓋茲 看 得 清清楚楚 的 「 演示 模型 」 。 「 聲學 模型 」 的 要點 在於 識別 語音 , 「 語言 模型 」 的 要點 是 識別 語意 , 用 李明鏡 的 話 來 說 , 「 聲學 模型 」 是 識別 「 一 」 , 「 語言 模型 」 是 識別 哪 一 個 「 一 」 。 如此 看來 , 李開復 的 這些 要求 幾乎 包括 了 「 聲學 模型 」 和 「 語言 模型 」 兩 方面 中 最 難解 的 問題 。 他 的 員工 全 都 知道 , 在 如此 短 的 時間 裡 , 只是 解決 其中 一 個 問題 就 已經 夠 嗆 , 現在 他們 卻 要 拿出 一 大 堆 好 的 結果 。 但是 無論 是 「 聲學 模型 」 還 是 「 語言 模型 」 , 「 引擎 」 都 是 其中 最基本 的 部件 , 它 的 作用 是 把 聲音 讀出 , 並 以 文字 方式 顯示出來 。 你 可以 把 「 引擎 」 想像成 汽車 的 發動機 , 也 可以 想像成 一 套 推理 的 邏輯 和 方法 。 不同 的 語言 之間 存在 共同 的 東西 , 所以 才 有 可能 翻譯 。 語言 引擎 在 本質 上 並 無 不同 , 因為 如此 , 希格瑪 大廈 才 能 將 黃學東 小組 現成 的 英文 「 引擎 」 拿過來 使用 , 但 要 讓 它 識別 中文 , 就 必須 給 它 不同 的 資料 模型 , 這 也 正 是 李開復 小組 、 王堅 小組 和 黃昌寧 小組 要 解決 的 問題 。 語音 識別 比 文字 識別 更加 困難 的 地方 , 是 同樣 的 字 在 不同 人 嘴 裡 會 發出 不同 的 聲音 。 但 李開復 的 目標 既然 是 「 不 特定 語 者 」 , 就 要 讓 機器 識別 所有 的 聲音 , 其 具體 的 操作 程式 既 簡單 又 繁雜 , 例如 在 廣東 、 上海 和 北京 三 個 城市 中 抽選 男女 老少 各 五百 人 , 每 人 均 以 地方 方言 和 普通話 兩 種 方式 說話 二百五十 句 , 然後 將 聲音 一一 錄音 整理 。 簡單 地 說 , 就 是 收買 各 種 各 樣 的 中國話 , 來 訓練 和 調整 既成 的 「 聲學 模型 」 。 至於 「 語言 模型 」 小組 的 注意力 , 則 全部 集中 在 糾正 拼音 錯誤 方面 。 李明鏡 在 完成 眼前 任務 的 同時 , 試圖 解決 更加 長遠 的 問題 , 他 給 自己 提出 的 問題 是 : 「 能否 讓 機器 在 不斷 使用 的 過程 中 適應 說話 的 人 , 使用 的 時間 越 長 , 也 就 越 好用 。 」 這 個 概念 在 以往 的 拼音 輸入法 中 稱為 「 自 適應 」 , 現在 李明鏡 要 將 它 應用 在 語音 識別 中 。 說到 「 語料庫 」 , 最 困難 的 地方 是 它 的 數量 。 至今 為止 , 研究院 購買 了 至少 五十億 字 的 中文 語料 , 包括 五十 年 的 《 人民日報 》 、 二十 年 的 《 經濟日報 》 、 網際網路 上 的 大部分 中文 以及 無數 書刊 。 要 在 如此 巨大 的 資料庫 中 找出 詞 與 詞 之間 的 關係 , 可以 想見 其 工作量 之 大 。 到 了 夏季 尾聲 , 研究院 的 「 語音 識別 系統 」 居然 真的 裝進 了 五萬 個 詞 , 就 像 李開復 當初 期望 的 一樣 。 但是 , 現在 還不是 得意洋洋 地 說 「 那 是 我 『 寶貝 』 」 的 時候 , 他們 還 必須 把 研究院 的 成果 變成 可以 看 得見 的 東西 , 並 和 微軟 公司 那 個 包括 英 、 日 、 中 的 語音 識別 大 系統 連接 在一起 , 這 就 要 依靠 軟體 發展部 的 智慧 和 操作 來 完成 。 如果說 研究員 的 作用 相當於 設計師 , 那麼 技術 開發 工程師 的 作用 就 是 提供 設計 工具 以及 把 設計 圖紙 變成 現實 。 如果 一 個 研究員 的 「 圖紙 」 相當於 整 部 機器 上 的 一 個 零件 , 那麼 開發 工程師 的 作用 就 是 把 所有 零件 銜接 在一起 。 具體 說來 , 凌小寧 領導 的 軟體 發展部 之 主要 職責 有 三 : 開發 研究 工具 以 提高 研究員 的 工作 效率 、 把 研究員 的 新 思想 變成 技術 原型 、 在 技術 原型 的 基礎 上 完成 技術 轉移 。 所以 , 希格瑪 大廈 裡 的 「 開發 」 在 某 種 意義 上 又 被 叫做 「 整合 」 或 「 集成 」 。 就 這些 職責 本身 來 說 就是 繼承 了 微軟 公司 的 既成 制度 , 但 凌小寧 的 軟體 發展部 卻 在 其中 創造 了 一
|