|
所 致 — — 能 在 反對 觀點 佔 優勢 的 環境 中 被 接受 。 為 此 , 我們 必須 提出 強而有力 的 證據 , 我 希望 遺傳學 能 對 我們 有所 幫助 。 但是 , 結果 如何 呢 ? 遺傳學 的 貢獻 遺傳學 研究 已經 顯示 , 在 歐洲 的 最 西部 出現 了 不同於 亞洲 及 其 附近 的 人種 。 這 個 想法 已 得到 圓滿 的 解答 , 即 巴斯克人 是 過去 佔據 歐洲 的 現代人 ( 以 克羅馬儂人 為 代表 ) 的 後裔 , 因為 研究 者 在 巴斯克人 中 發現 Rh 陰性 基因 的 頻率 很 高 。 隨後 的 分析 則 進一步 發現 了 其他 的 遺傳 差異 。 在 Rh 陰性 基因 分布 地圖 上 我們 可以 看到 , Rh 陰性 出現 在 東歐 和 亞洲 的 頻率 很 低 , 在 遠離 歐洲 的 地方 , 甚至 降到 零 。 這 顯示 , 新 石器 時代 的 人類 開始 從 中東 緩慢 擴散 時 , 他們 普遍 是 Rh 陽性 的 攜帶 者 , 而 原先 住在 那裡 的 歐洲人 則 剛好 相反 , 大部分 甚至 全 是 Rh 陰性 攜帶 者 。 因此 , 獼猴 基因 ( Rh ) 分布圖 支持 Rh 陽性 血型 是 從 中東 擴展到 歐洲 的 這 一 想法 , 這些 Rh 陽性 血型 人群 一路 上 和 Rh 陰性 血型 的 其他 人群 混合 。 不過 , 單 憑 一 個 基因 不足以 證實 一 個 理論 , 我們 還 需要 其他 更多 確鑿 的 證據 。 人群 遷移 涉及 所有 的 基因 而 不止 是 一 個 , 因此 有 必要 以 儘可能 多 的 基因 來 證實 同 一 見解 。 我 和 二 位 在 史丹福 大學 實驗室 裡 一起 共事 了 幾 年 的 義大利 同事 , 帕爾馬 大學 的 保羅‧梅諾茲 ( Paolo Menozzi ) , 和 都靈 大學 ( Turing University ) 的 艾伯托‧皮亞札 ( Alberto Piazza ) , 開始 將 所有 已 知 的 血型 、 HLA 基因 ( 一般 用來 預測 器官 移植 能否 被 接受 ) , 和 當時 已經 分離出來 並 在 各 人群 進行 過 研究 的 各 種 其他 基因 的 大量 數據 輸入 電腦 。 我們 把 許多 基因 的 分布圖 繪製出來 並 進行 比較 。 一些 基因 遵循 類似 於 Rh 的 模式 , 像 Rh 陽性 那樣 , 在 東部 地區 的 出現 頻率 特別 高 , 在 西部 則 特別 低 。 偶爾 可以 看到 , 在 中東 的 農業 起源 中心 , 有 一 個 絕對 最 高 ( 或 最 低 ) 峰 , 這 意味 著 遺傳 地圖 很 有 可能 能 證實 我們 的 理論 。 不過 , 有 些 基因 的 表現 非常 特異 , 例如 , 在 B型 的 分布圖 上 , 最 高 的 出現 頻率 在 俄羅斯 南部 。 顯然 , 我們 有 必要 研究 大量 的 基因 , 建立 一 種 統一 的 架構 , 及 探索 其他 可能 的 解釋 。 遺傳 地形圖 在 處理 大量 數據 以 得出 普遍 存在 的 族群 行為 時 ( 如同 我們 針對 大量 的 歐洲 族群 的 三十九 個 不同 基因 所 作 的 研究 ) , 統計學 就 能 發揮 效用 了 。 讓 我們 回到 一九三○年代 , 當時 美國 一 位 優秀 的 數學家 哈羅德‧霍特林 ( Harold Hotelling ) 建立 了 一 種 運算 系統 , 能 處理 像 我們 手 中 這 類 大量 的 複雜 數據 。 起初 很少 人 使用 它 , 因為 它 牽涉到 大量 的 複雜 運算 。 假如 要 靠 人工 來 完成 , 我們 需要 一 支 龐大 的 數學家 隊伍 來 計算 , 當時 只有 少數 幾 位 晶體 繞射學家 、 物理學家 和 數學家 , 能夠 有 耐心 、 嚴格 而 認真 地 去 進行 這 項 艱巨 的 工作 。 事實 上 , 在 現代 的 資料 處理 使 運算 變 得 更 簡便 、 迅速 、 準確 以前 , 沒有 一 個 人 敢 採用 霍特林 的 方法 。 在 介紹 主成分 分析 ( principal components analysis ) 程序 之前 , 必須 先 簡單 說明 一下 很多 讀者 都 不 熟悉 的 數學 原理 。 主 成分 分析 使 我們 能 總結 大量 的 數據 , 對 我們 來 說 , 就是 把 每 一 個體 在 遺傳 分布 方面 的 所有 資訊 綜合 起來 , 來 找出 大多數 基因 的 共同 趨勢 和 分布 方式 。 這 個 程序 也 使 我們 得以 分離 和 描述 數據 中 的 潛在 「 結構 」 , 這些 結構 可能 是 取決 於 歷史 或 地理 的 因素 。 在 我們 的 研究 中 , 這些 潛在 結構 可以 表現 在 地理學 方面 , 這 有助於 我們 理解 這些 影響 潛在 結構 的 現象 的 本質 。 個別 的 基因 也 顯示 了 同樣 的 現象 , 但 它們 所 提供 的 情況 既 不 明確 也 不 完全 , 因為 每 個 基因 的 頻率 都 會 受 隨機 波動 的 影響 。 和 所有 的 統計學 方法 一樣 , 這 個 問題 是 透過 計算 大量 觀察值 的 平均值 來 解決 的 ( 在 我們 的 研究 中 , 就 是 自 大量 歐洲 族群 中 蒐集到 的 三十九 個 基因 數據 ) 。 即使 是 不 熟悉 我們 方法 的 數學家 和 物理學家 , 只要 看到 它 的 處理 步驟 後 , 也 能 理解 它 的 本質 : (一) 計算 並 繪製 很多 基因 的 頻率 分布圖 ; (二) 在 一 系列 選定 的 交叉點 上 , 對 所有 基因 頻率值 進行 插值 ; (三) 利用 對應 於 最 大 特徵值 的 特徵 向量 , 繪出 「 合成 的 」 地理 分布 圖 。 每 個 基因 的 頻率 分布 圖 ( 圖 6.9 用 的 是 Rh 陰性 的 例子 ) , 就 是 把 基因 頻率 相同 的 地區 連起來 所 形成 的 等值 曲線 。 求出 了 很多 基因 的 平均值 後 , 接著 就 要 進行 主成分 分析 。 所有 個別 基因 的 結果 , 在 此 地圖 上 就 由 一 個 數字 來 代表 , 以 反映 所 分析 的 全部 基因 。 這 個 數字 就 是 「 合成 」 圖 上 那 一 點 的 主成分值 , 我們 可以 把 它 看作 是 普通 地圖 上 的 「 高度 」 。 結果 就 是 有 「 山 」 、 「 谷 」 分布 的 一 種 「 遺傳 地形 圖 」 。 它 顯示 了 數據 中 潛在 的 結構 。 下 一 步 的 工作 就 是 解釋 這 個 「 等 高線圖 」 的 含義 。 但 這 並 不 表示 主成分 分析 能夠 告訴 我們 一切 。 第一 主成分 , 代表 從 現有 數據 中 所 能 得到 的 最 大 遺傳 變異值 , 剩下 的 就 沒 什麼 解釋力 了 。 事實 上 , 這 張 地圖 只 解釋 了 這 批 基因 頻率 變化 的 某些 變異性 。 例如 , 歐洲 的 第一 主成分 能 解釋 基因 頻率 中 百分之二十八 的 變異 , 剩餘 的 百分之七十二 仍然 不 清楚 。 到 了 這 一 步 以後 , 我們 以 同樣 的 方式 重複 我們 的 操作 , 從 剩餘 的 變異 中 再 得到 第二 主成分 。 第二 主成分 所 提供 的 是 另外 一 張 不同 的 獨立 遺傳
|