免費科普
你血液裡有幾千種分子,科學界能叫出名字的不到一成
每一個峰代表一種分子,帶著它的質量資訊。它們有訊號、有質量、可以被量測、可以在不同人之間比較。
然後你會發現一件令人不安的事:這幾千個峰裡,能夠明確說出「這是什麼分子」的,只有一小部分。
其餘的就掛在那裡。沒有人知道它是什麼。
這批東西在領域內有一個名字:代謝體的「暗物質」。
這個借自天文學的說法很貼切——你抬頭看星空,看得到滿天的光點,但有名字的只有一小部分。差別在於,你血液裡那些沒名字的分子,可能正在決定你的健康。
這是什麼
先講三個詞
代謝體——一個生物體內所有小分子代謝物的總和。基因體是「你的說明書」,蛋白質體是「你造了哪些機器」,代謝體是「你的機器現在正在處理什麼」。
質譜——把分子打成帶電粒子,量測質量與電荷的比值。這是代謝體研究的主力工具。
代謝體暗物質——質譜偵測得到、但無法確認結構的那批分子訊號。
生活場景:一張只有重量的清單
想像你收到一箱東西,但不能打開看。你只拿到一張清單,上面寫著每一件物品的精確重量。
「物品 A:342.1567 公克。」
從重量能推出它是什麼嗎?
有時候可以。 如果你手上有一份目錄,裡面剛好有一件東西是這個重量,而且沒有第二件——那就對上了。
但更多時候不行。 因為很多不同的東西可以有相同的重量。而且如果那個東西根本不在目錄裡,你連比對的對象都沒有。
質譜的處境就是這樣。(實務上還有更多資訊——把分子打碎後看碎片的分布,等於「搖一搖聽聲音」。但即使如此,未知的東西仍然是未知的,因為你沒有它的參考資料。)
這就是問題的本質:質譜的鑑定高度依賴比對資料庫,而資料庫裡只有已知的東西。
機制拆解:生物化學是有文法的
Michael Skinnider 的做法,是一個很優雅的轉向。
先問一個問題:化學上可能存在的小分子,數量大約是多少?
估計值通常落在 10⁶⁰ 這個量級——比可觀測宇宙的原子數還多。
那生物體內實際存在的呢? 數量級小到不能比。
為什麼差這麼多? 因為生物不是隨機組裝分子的。生物用的是有限的建構單元(幾十種胺基酸、幾種醣、幾類脂肪酸)、有限的酵素(每種酵素只做特定的化學轉換)、以及演化出來的路徑(不是隨意的)。
所以生物體內的分子,有一種可辨識的「風格」。
而那正好是語言的結構。
英文字母的排列組合是天文數字,但真正是英文單字的只有一小部分。一個學過英文的人看到 recieve,會知道它不對——不是因為他背過所有單字,是因為他學會了規則。
Skinnider 團隊用的就是這個邏輯:拿一個以「人體內已知小分子結構」訓練的大型語言模型,去尋找相關但未知的代謝物。模型學的不是「有哪些分子」,是「什麼樣的結構看起來像生物會做出來的」。
文法把搜尋空間縮到可以處理的規模。三層巢狀的範圍,由外而內收窄。最外層是化學上可能存在的所有小分子,約 10 的 60 次方量級。中間一層是質量與質譜訊號對得上的分子,仍然很多。最內層是生物化學的文法允許的分子,也就是實際要找的那一小塊。
| 語言 | 真實機制 |
|---|---|
| 字母的所有排列 | 化學上可能的分子(10⁶⁰ 量級) |
| 真正是單字的只有一小部分 | 生物實際會產生的分子 |
| 詞根、詞綴 | 有限的建構單元 |
| 構詞有規則 | 每種酵素只做特定的轉換 |
| 學過英文的人看到錯字會知道 | 模型學會「什麼看起來像代謝物」 |
一句話總結
搜尋空間從 10⁶⁰ 縮到可處理的規模,靠的不是算力,是文法。
為什麼重要
四大組學各自回答不同的問題,而代謝體回答的是最接近「現在」的那一個。
基因體是你一生不變的潛能;轉錄體與蛋白質體以小時到天為單位變化;代謝體以分鐘到小時為單位變化——它會因為你吃了什麼、睡了多久、有沒有生病、吃了什麼藥而快速改變。
這讓它在臨床上特別有價值,也讓它特別難。 而它是四者中被解讀得最少的一個:基因體有參考基因組,蛋白質體有蛋白質資料庫,代謝體有一大片沒有名字的暗區。
這片暗區裡有些什麼?疾病特異的代謝標記、癌症的代謝特徵、藥物在體內的實際產物,以及外來物質——你吃進去的汙染物、塑膠添加劑、環境化學品,多半也在這裡面。
一個關於這條線的旁證:Skinnider 在 2025 到 2026 年間連續拿到 Packard Fellowship、Searle Scholar 與 Pew Scholar。這是美國最競爭的三個青年科學家獎項,評審是各領域的資深研究者。連中三元,代表「這個方向重要」的判斷在同儕之間高度一致。
比喻到此為止
語言的比喻在兩個地方失效,而它們的方向剛好相反:
一、★ 對這件事有利的失效:沒有人能「驗證」一個新單字是不是真的存在,但代謝物可以。
模型生成的候選結構,原則上可以用純化、核磁共振、以及合成標準品去對答案。有真值可以對,AI 才不會自說自話——這是化學相對於許多其他生成式 AI 應用的結構性優勢。
二、★ 對這件事不利的失效:英文的規則是穩定的,生物化學的「文法」不是。
代謝的規則會因物種、組織、疾病狀態而不同。一個在健康人血液上訓練的模型,用在腫瘤組織上未必適用——而腫瘤代謝正是最有價值的應用場景之一。這不是理論上的顧慮,是一個真實的方法學風險。
還沒定案的事
一、生成不等於鑑定。 模型可以生成一個「看起來很像代謝物、而且質量對得上」的結構——但那不等於它就是那個分子。從候選到確認,仍然需要純化、核磁共振、以及合成標準品比對。
二、所以瓶頸可能只是被搬到下一站。 如果 AI 每天生成一千個候選,而驗證一個要三個月,整條管線並沒有變快。「證明候選是對的」才是這個領域現在最缺的一步,而不是更多的模型——這句話對整個 AI 進到科學裡的浪潮都成立,不只這一個題目。
三、我們手上沒有效能數據。 我們知道這個方法怎麼運作,不知道它做得多好。沒有數字的方法描述,不足以支撐判斷,所以這篇講的是想法,不是成績。
四、訓練資料的偏差。 模型只認得「像已知代謝物的東西」,而真正有趣的可能正是不像的那些。這是所有生成式科學方法的共同張力。
延伸閱讀
這篇講的是質譜這一端:看得到很多,但認不出來。
另一端在核磁共振——它認得準,但需要純化過、量夠多的樣品。實務上的流程是:質譜先找出「這裡有一個未知的東西」,分離純化之後,再用核磁共振定出結構。那一端我們寫在另一篇。兩邊都被加速,整條「發現未知小分子」的管線才會真的變快。
如果你想知道這兩條線為什麼被我們分別排在第 6 與第 18 名、以及我們寫下了哪五條「到期就回來對帳」的判定條件——其中一條是這個主題唯一真正重要的門檻——那些在研究筆記〈你血液裡有幾萬種分子。科學界能叫出名字的,不到一成〉裡。
來源
- Princeton CSML,Michael Skinnider: using generative AI to accelerate discovery of small molecules — 連結
- Princeton University(2025-10-15),Michael Skinnider wins 2025 Packard Foundation Fellowship — 連結
- Princeton University(2026-06-23),Michael Skinnider named a Pew Scholar — 連結
- Searle Scholars Program,Michael Skinnider — 連結
- Ludwig Princeton Branch,Michael Skinnider 個人頁 — 連結
- Skinnider Lab — 連結
本文為科學技術之教育性資訊,不構成任何投資建議或醫療建議。