Displaying extended context for query match # 15,586 in text YL201503797
<< Prev Next >>
    
 

可以 從 人工 智慧 想要 解決 但 失敗 的 地方 開始 看 ─ 語言 辨識 、 視覺 和 智慧型 車輛 。  假如 你 曾 在 個人電腦 上 試 過 使用 口語 辨識 軟體 ( 例如 語音 輸入法 ) 來 輸入 文字 的話 , 你 就 知道 它 有 多 蠢 , 像 瑟爾 的 中文室 一樣 , 電腦 完全 不 瞭解 你 在 說 什麼 。 我 只 試 著 用 過 幾 次 就 覺得 非常 挫折 , 假如 房間 裡 有 任何 噪音 , 從 鉛筆 掉到 地 上 到 有 人 對 我 說話 , 螢幕 上 就 會 有 多餘 的 字 跑出來 ; 而且 它 的 錯誤率 很 高 , 通常 這 個 軟體 所 選 的 字 跟 上下文 根本 是 風馬牛不相及 的 , 所以 整 句 也 兜 不 出 個 意義 來 。 例如 , Remember to fell Mary that the bog is ready to be piqued up ( 應該 是 Remember to tell Mary that the book is ready to be picked up ) , 一 個 三 歲 小孩 都 知道 這 是 錯 的 , 但 電腦 不 知道 。 同樣 的 , 所謂 的 自然 語言 介面 是 電腦 科學家 多 年 來 努力 的 目標 , 讓 你 用 簡明 、 清晰 的 語言 告訴 電腦 或 其他 應用 裝置 你 所 要 的 , 然後 讓 電腦 去 執行 。 在 個人 數位 助理 ( personal digital assistant , PDA ) 上 , 你 可以 說 : 「 把 我 女兒 星期天 的 籃球賽 移到 早上 十點 。 」 但是 靠 著 傳統 的 人工 智慧 , 要 做 這樣 的 事 根本 不可能 , 即使 電腦 可以 辨識 每 一 個 你 說出 的 字 , 要 完成 這 項 作業 , 它 必須 知道 你 的 女兒 在 哪裡 上學 、 你 所 指 的 可能 就 是 這 個 即將 到來 的 星期天 以及 籃球賽 是 什麼 , 這 是 因為 原來 的 預定 事項 可能 只 簡短 的 列 著 「 門羅 學校 對 聖約瑟 學校 」 。 或者 你 也許 想要 電腦 聽 一 段 收音機 的 播報 , 看看 有沒有 提到 某 個 產品 , 但是 播音員 描述 了 產品 , 卻 沒 說出 產品 的 名字 , 你我 都 知道 她 在 說 什麼 , 但是 電腦 卻 搞 不 懂 。 像 這些 和 許多 其他 應用 裝置 需要 一 個 能夠 聽懂 口語 的 機器 , 但是 電腦 做 不 來 , 因為 它 不 瞭解 這些 話 , 它 只 能 將 聲音 形態 與 它 所 儲存 的 模式 相 比較 , 並 不能 知道 字 的 意義 。 你 可以 想像 你 學 了 某 種 外語 個別 單字 的 發音 , 但是 不 瞭解 字 的 意思 , 我 現在 請 你 把 某 一 段 那 個 外語 的 談話 邊 聽 邊 打成 文字 。 當 對話 進行 中 , 你 根本 搞 不 清楚 他們 在 談 什麼 , 結果 你 只 能 挑出 一個個 聽得懂 的 單字 , 但是 人 在 說話 時 口語 的 咬字 不 是 很 清楚 , 前後 兩 個 字 有 重疊 的 地方 , 或者 有 音變 等 因素 的 干擾 , 有些 音 因為 噪音 而 聽 不 見 了 。 你 會 發現 把 字 挑出來 並 辨識 它們 是 非常 困難 的 事 , 這些 障礙 正 是 今天 口語 辨識 軟體 所 面臨 的 困難 。 工程師 發現 用字組 轉換 ( word transitions ) 的 機率 , 可以 增進 一些 軟體 的 正確率 , 例如 他們 用 文法 規則 來 規範 同音字 , 這 是 一 個 非常 簡單 的 預測 , 但是 輸入 系統 還是 很 笨 。 今天 的 口語 辨識 只有 在 很 強 的 規範 下 才 會 成功 , 即 在 預設 的 片刻 、 你 所 要 講 的 字 是 有限 的 , 它 才 可以 挑到 正確 的 字 。 然而 , 人類 輕而易舉 就 能 完成 很多 和 語言 有關 的 工作 , 因為 我們 的 皮質 不但 瞭解 字 , 而且 瞭解 句子 以及 字 與 句子 出現 的 文脈 , 我們 能 預期 構想 、 片語 和 字 的 出現 , 我們 皮質 的 世界 模式 很 自動 的 就 這樣 做 了 。 所以 我們 可以 預期 類皮質 的 記憶 系統 也 會 將 模糊 不清 的 口語 辨識 , 轉換成 清楚 的 語言 瞭解 。 高階 層次 的 記憶 系統 不再 用 程式 去 計算 每 一 個 字組 轉換 的 或然率 , 這 個 系統 追蹤 口音 、 字 、 片語 和 構想 , 並用 它們 去 詮釋 剛剛 說 了 些 什麼 。 這 部 智慧 機器 像 人 一樣 , 可以 區分 各 種 說話 的 情境 , 例如 , 你 和 朋友 在 房間 內 的 談話 、 一 通 電話 交談 或是 對 一 本 書 的 編輯 指令 。 要 建造 這 種 機器 不 容易 , 要 充分 瞭解 人類 的 語言 , 這 部 機器 必須 學習 和 體驗 人類 的 行為 , 所以 即使 得 等上 很多 年 , 我們 才 可能 建造出 一 部 瞭解 人類 語言 的 機器 , 不過 在 近期 我們 仍然 可以 用 類皮質 的 記憶 系統 來 改進 現有 的 口語 辨識 系統 。 視覺 是 另 一 個 人工 智慧 失敗 但是 真實 智慧 系統 很 容易 處理 的 領域 。 目前 沒有 任何 一 部 機器 可以 看 著 自然 景觀 ─ 你 面前 的 世界 或是 一 張 風景 照片 ─ 即 能 描述出 它 是 什麼 。 當然 有 幾 個 成功 的 例子 , 不過 那 是 在 非常 有限 的 領域 , 例如 把 電路板 上 的 晶片 安裝 到 正確 的 位置 , 或是 將 某 個 五官 特徵 與 資料庫 做 比對 , 但是 目前 電腦 尚 無法 比較 廣泛 的 去 辨識 各 種 物體 的 差異 , 或 去 分析 一 個 場景 。 你 可以 很 輕鬆 的 環顧 一下 房間 , 然後 找 張 椅子 坐下 , 但是 對 電腦 來 說 卻 很 難 ! 想像 一下 : 你 能 從 監視器 的 螢幕 中 辨識出 一 個 人 究竟 是 拿 著 禮物 去 敲門 , 或是 拿 著 一 根 鐵棍 想 把 門 給 打下來 嗎 ? 你 當然 能 ! 但是 今日 的 軟體 仍 做 不 到 , 所以 我們 必須 雇用 保全 人員 , 眼睛 盯 著 監視器 的 螢幕 , 24 小時 不 敢 放鬆 。 人 很 難 一直 盯 著 螢幕 還 能 保持 警覺 , 但是 這 項 工作 就 可以 交給 智慧 機器 去 做 , 因為 機器 是 不會 疲倦 的 。 許多 情境 下 需要 同時 仰賴 視覺 的 敏銳度 以及 對於 複雜 場景 的 理解 , 這時 智慧 機器 就 是 唯一 的 解決之道 了 。 最後 , 讓 我們 來 看 一下 交通 。 汽車 設計 是 越來越 精密 了 , 現在 車 上 有 全球 定位 系統 來 告訴 你 如何 從 A 走到 B , 有 感應器 來 告訴 你 外面 光線 不 夠 、 要 開 大 燈 了 , 有 速度 感應器 控制 著 安全 氣囊 , 有 倒車 雷達 告訴 你 快要 撞到 東西 了 , 甚至 有 車子 可以 在 專門 的 公路 上 或 理想 的 條件 下 自動 駕駛 ,