Displaying extended context for query match # 22,697 in text YL201502229
<< Prev Next >>
    
 

但 難度 也 最 大 , 也 需要 更 長時間 方 能 見效 , 相形之下 , 中文 拼音 輸入 和 語音 系統 最 有 希望 在 短 時間 裡 取得 突破 。 語音 識別 的 研究 節奏 加快 了 。 李開復 原來 拿 大部分 時間 去 和 各 方面 打交道 , 真正 用來 研究 的 時間 只 有 十分之一 , 現在 他 覺得 不能 再 這樣 下去 , 強迫 自己 至少 將 四分之一 的 精力 放 在 科研 上 。 看來 , 僅僅 依靠 邸爍 和 陳正 不足以 應付 這樣 的 局面 , 他們 的 根基 畢竟 太 淺 , 前進 到 一 個 高度 就 難 能 繼續 , 有時 還 會 犯 一些 低級 錯誤 。 以 目前 的 情形 來 論 , 就算 他 能 容忍 錯誤 , 也 無法 容忍 延誤 時間 。 幸而 這 個 夏天 希格瑪 大廈 人氣 沖天 , 新人 不斷 , 李明鏡 在 七月 間 終於 了結 前緣 , 把 自己 發明 的 全部 「 漢王 技術 」 留在 「 漢王 」 , 隻身 來到 希格瑪 大廈 。 對於 李開復 來 說 這 已 足夠 , 他 要 的 是 這 個 腦袋 。 高劍峰 也 來 了 , 他 是 交通 大學 的 博士 , 然後 進來 的 是 中科院 自動化 所 博士 黃超和 中科院 聲學所 博士 周健來 。 最後 是 張益肇 , 他 是 麻省理工 學院 博士 。 張益肇 有 著 與 李開復 大致 相同 的 經歷 。 出生 在 台灣 , 自幼 赴 美 讀書 , 又 加入 了 美國籍 。 從 外表 看來 , 他 必定 是 屬於 那 種 無論 吃 多少 東西 都 不會 胖 的 人 , 體型 雖 消瘦 , 卻 大腦 發達 , 衣著 隨便 , 待 人 隨和 , 如果 不 是 他 在 使用 中文 表達 思想 時 的 吃力 樣子 , 你 不會 認為 他 有 那麼多 年 的 美國 經歷 。 初 到 美國 , 張益肇 才 剛 小學 畢業 , 當時 他 對照 著 台灣 的 中文 課本 學 英文 , 但 等到 英文 純熟 之後 卻 忘 了 很多 中文 。 他 在 麻省理工 學院 讀完 碩士 課程 , 到 日本 東芝 研究所 工作 一 年 , 又 回到 麻省理工 學院 攻讀 博士 。 那 是 一九九一年 , 從 這時 起 , 他 就 開始 馳騁 於 語音 識別 領域 。 他 研究 如何 把 很多 人 的 聲音 轉換成 一 個 人 的 聲音 , 也 研究 如何 把 一 個 人 的 聲音 轉換成 很多 種 人 的 聲音 , 還 研究 如何 以 類比 影像 建立 自動 駕駛 汽車 的 電腦 神經 系統 。 然後 , 就 像 很多 美國 青年 一樣 , 他 也 投身 矽谷 一 個 很 小 的 軟體 公司 , 在 好奇心 的 驅使 下 , 他 研製出 一 個 聽寫 系統 — — 讓 機器 像 人 一樣 地 和 人 對話 。 他 就是 在 這 期間 , 聽說 了 李開復 的 其 人 其 事 。 「 多元化 」 是 張益肇 迄 今 為止 最 重要 的 人生 經驗 , 他 說 : 「 美國 是 個 多元化 的 社會 , 你 的 興趣 與 信仰 和 大家 完全 不 一致 也 沒有 關係 。 」 但是 他 在 日本 工作 時 , 卻 發現 日本人 對 美國 的 「 多元化 」 持有 強烈 的 批評 態度 , 還 將 美國 經濟 八○年代 的 低潮 , 歸咎於 「 這 個 國家 的 多元化 」 。 當時 的 張益肇 有些 相信 日本人 的 話 , 但 後來 看到 美國 經濟 捲土重來 、 日本 卻 是 每況愈下 , 就 斷定 : 「 多元化 還 是 一 個 好 東西 。 」 現在 , 他 來到 中國 大陸 , 這 是 他 第一 次 來 大陸 , 看到 熙熙攘攘 、 亂亂 哄哄 的 城市 , 他 覺得 「 蠻 親切 的 , 和 台灣 差不多 。 」 他 對 大陸 年輕人 的 「 真是 會 想 事情 」 很 驚訝 , 又 發現 「 中國 學生 做 事情 比 美國人 認真 。 」 不過 他 也 發現 , 在 希格瑪 大廈 裡 是 要 「 百 種 人 做 一樣 事 」 的 。 現在 , 李開復 的 語音 小組 擁有 李明鏡 和 張益肇 兩 位 研究員 了 , 還 有 好幾 位 副研究員 。 當初 拋 硬幣 分開 了 兩 個 初出茅廬 的 小伙子 , 現在 可以 建立 「 語言 模型 」 和 「 聲學 模型 」 這 兩 個 小組 , 他 讓 李明鏡 和 張益肇 分頭 領銜 , 加速 前進 。 七月 時 , 語音 識別 的 模型 還 只 能 識別 「 三百 個 詞彙 組成 的 一百 句 話 」 , 比如 「 北京 的 天氣 很 好 」 , 超過 這 個 範圍 , 機器 便 一籌莫展 , 但 李開復 說 要 在 「 三 個 月 內 使 系統 的 識別 範圍 擴大到 五萬 個 詞彙 」 。 英文 原型 當中 是 沒有 「 第四 聲 」 的 , 但 漢語 有 , 所以 他 要求 「 聲學 模型 」 小組 必須 想出 辦法 , 還 必須 識別 男女 老少 各 種 聲音 及 南腔北調 的 各 種 方言 。 在 設定 了 研究員 的 目標 之後 , 他 又 指示 凌小寧 手下 的 工程師 , 在 兩 個 月 內 做出 一 個 可以 讓 比爾‧蓋茲 看 得 清清楚楚 的 「 演示 模型 」 。 「 聲學 模型 」 的 要點 在於 識別 語音 , 「 語言 模型 」 的 要點 是 識別 語意 , 用 李明鏡 的 話 來 說 , 「 聲學 模型 」 是 識別 「 一 」 , 「 語言 模型 」 是 識別 哪 一 個 「 一 」 。 如此 看來 , 李開復 的 這些 要求 幾乎 包括 了 「 聲學 模型 」 和 「 語言 模型 」 兩 方面 中 最 難解 的 問題 。 他 的 員工 全 都 知道 , 在 如此 短 的 時間 裡 , 只是 解決 其中 一 個 問題 就 已經 夠 嗆 , 現在 他們 卻 要 拿出 一 大 堆 好 的 結果 。 但是 無論 是 「 聲學 模型 」 還 是 「 語言 模型 」 , 「 引擎 」 都 是 其中 最基本 的 部件 , 它 的 作用 是 把 聲音 讀出 , 並 以 文字 方式 顯示出來 。 你 可以 把 「 引擎 」 想像成 汽車 的 發動機 , 也 可以 想像成 一 套 推理 的 邏輯 和 方法 。 不同 的 語言 之間 存在 共同 的 東西 , 所以 才 有 可能 翻譯 。 語言 引擎 在 本質 上 並 無 不同 , 因為 如此 , 希格瑪 大廈 才 能 將 黃學東 小組 現成 的 英文 「 引擎 」 拿過來 使用 , 但 要 讓 它 識別 中文 , 就 必須 給 它 不同 的 資料 模型 , 這 也 正 是 李開復 小組 、 王堅 小組 和 黃昌寧 小組 要 解決 的 問題 。 語音 識別 比 文字 識別 更加 困難 的 地方 , 是 同樣 的 字 在 不同 人 嘴 裡 會 發出 不同 的 聲音 。 但 李開復 的 目標 既然 是 「 不 特定 語 者 」 , 就 要 讓 機器 識別 所有 的 聲音 , 其 具體 的 操作 程式 既 簡單 又 繁雜 , 例如 在 廣東 、 上海 和 北京 三 個 城市