免費科普

你手上那瓶東西是什麼?至今還是有人用鉛筆拼出來的

問題長這樣:你手上有一瓶不知道是什麼的東西,怎麼知道它是什麼?

從一株土壤細菌裡分離出來的新化合物、一個人體內的代謝物、一個天然產物——你可以測出它的化學式(幾個碳、幾個氫、幾個氧),你可以測出它的核磁共振光譜。

然後呢?

然後你把它交給一個做了二十年的博士,他花幾天到幾週,用鉛筆在紙上拼出來。

這件事在 2026 年還是這樣做的。而它之所以還是這樣做,不是因為沒人想自動化——是因為這個問題比它看起來難得多,難的地方也不是大家以為的那個。


這是什麼

先講三個詞

核磁共振(NMR)——把樣品放進強磁場,用無線電波去「敲」它,聽原子核的回應。這是判定小分子結構的基石技術。

結構解析——從光譜資料反推分子的立體結構。也就是「這瓶東西是什麼」。

天然產物——生物體製造出來的分子。抗生素、抗癌藥、免疫抑制劑,歷史上有極大比例來自這個範疇。它們也是最難解的一群。

生活場景:一場合唱的錄音

想像一個合唱團,每個團員站在一個特定位置。

現在你只拿到錄音——看不到人,只有聲音。你要從這段錄音,重建出每個人站在哪裡。

聽起來不可能,但有三條規則讓它變得可能。

規則一:每個人唱的音高,取決於他旁邊站著誰。

這是整件事的核心。每個原子核在磁場裡像一個小磁鐵,會以特定頻率共振——而那個頻率取決於周圍電子雲的屏蔽,也就是它的鄰居是什麼。一個接在氧旁邊的氫,跟一個接在碳旁邊的氫,唱的音高不一樣。化學家管這叫化學位移。

規則二:站得近的人會互相影響,讓對方的音「裂開」。

相鄰的原子核會互相感應,把單一的音分裂成兩個、三個、四個峰。從分裂的模式,可以推出這個核旁邊有幾個鄰居。這是「誰跟誰相鄰」的唯一來源。

規則三:音量告訴你有幾個人在唱同一個音。

峰的面積正比於該環境下的原子核數量。

於是問題變成:給你錄音,重建座位表。

為什麼這件事這麼難

第一個原因人人都想得到:組合爆炸。一個中等大小的天然產物有二三十個碳,把它們接起來的方式是天文數字。

但真正卡住這個問題的是第二個原因,而它很少被講清楚:資訊本身不足以唯一決定答案。

好幾種不同的分子,可以產生幾乎一樣的光譜。化學家管這叫「簡併」。

不同的分子可以產生幾乎相同的光譜。上排是兩個結構明顯不同的分子:左邊是一個環狀骨架,右邊是一條鏈狀骨架。下排把兩者的一維核磁共振光譜疊在同一條基線上,兩組峰的位置與高度幾乎重合。所以反過來從光譜推結構時,同一段光譜對應的不只一個答案。

難的不是算不夠快,是資訊本身不足以唯一決定答案。 專家真正在做的,是排除那些數學上可以、化學上不合理的解。

這改變了整件事的性質。專家真正在做的不是解方程式——方程式有多組解。他在用化學直覺排除那些「數學上可以、但化學上不合理」的答案。而直覺沒辦法寫成規則交給電腦。

過去二十年的電腦輔助結構解析走的是搜尋路線:列舉可能的結構,用規則篩掉不合的,剩下的排序。這條路同時被上面兩件事卡住——列舉列不完,篩完還剩一堆。

換一個問法

普林斯頓的 ChefNMR 換了框架:把結構解析當成生成問題。

它用的是原子擴散模型——跟影像生成模型是同一種邏輯。你給影像模型一段文字,它生成一張符合描述的圖;你給這個模型一段光譜和化學式,它生成一個符合的分子結構。

它不是去「找出」那個分子,是去「畫出」一個符合這段光譜的分子。

訓練資料是實務上最聰明的一步:真實天然物的核磁共振資料太少,不足以訓練,所以團隊模擬了超過 111,000 個天然產物的光譜來訓練。

一句話總結

過去二十年一直在問「哪一個分子符合這段光譜」;換成問「畫一個符合這段光譜的分子」,組合爆炸就繞開了。


為什麼重要

這不是所有化學家的瓶頸,是天然物化學家、代謝體研究者、以及藥物發現前段的瓶頸。

從微生物萃取物裡找新抗生素,你會分離出上百個未知化合物,但只能挑幾個去解結構——其餘的就放著。瓶頸不在「產生候選物」,在「知道候選物是什麼」。

這件事有歷史後果。天然物藥物發現這條線在 1990 年代之後大幅萎縮,原因之一正是「分離出來的東西太多、能解結構的太少」,藥廠因此轉向組合化學與高通量篩選。如果這個瓶頸鬆開,加上抗生素抗藥性的壓力,天然物有可能重新變成一個活躍的來源——但那是五到十年尺度的事,不是明年。

值得一提的是這個團隊的組成:Ellen Zhong 是電腦科學家(她先前的成名作是用機器學習處理冷凍電鏡的構象問題),Mohammad Seyedsayamdost 是化學家,做的是天然物與微生物次級代謝。又一個跨系合作的產物。


比喻到此為止

合唱錄音的比喻在兩個地方失效:

一、錄音是時間序列,核磁共振光譜是頻率域。 你「聽」到的不是聲音隨時間變化,而是不同頻率的訊號強度分布。這個差別在解釋分裂模式時會變得重要。

二、★ 座位表不唯一。

第二點是這個比喻最關鍵的失效,也是整個問題的本質。合唱團的比喻會讓你以為「只要聽得夠仔細、算得夠久,就能重建座位表」——但實際上資訊本身就不足以唯一決定答案。

這也是為什麼這種工具交付的是候選清單,不是答案——而那正好是它能做、也只能做的事。它把化學家從「拼圖」解放到「判斷」:從十個候選裡挑出對的那一個,仍然要靠化學直覺。判斷那一段,機器還沒有能力接手。


還沒定案的事

一、那個「超過 65%」是 top-10,不是 top-1。 論文摘要寫的是「超過 65% 的準確率」,沒有限定條件。翻到正文的結果表,它對應的是最難那個天然物資料集的 top-10(65.74%)——同一個資料集的 top-1 只有 40.15%。

換句話說:它一次就給出正確結構的機率約四成;給你十個候選、其中有一個是對的機率約三分之二。 對一個原本要花幾天到幾週的工作來說,「十選一」已經是巨大的節省——但那跟「六成五的準確率」給人的印象不是同一件事。

看到一個準確率數字,先問它是 top 幾、在哪個資料集上。 同一個模型在較容易的資料集上可以誠實地報出 93%。這個習慣值得帶著離開這篇文章。

二、模擬光譜訓練,真實光譜使用——而這個落差已經被量出來了。 訓練用的是十一萬多個模擬光譜,實務上要處理的卻是真實儀器測出來的光譜(有雜訊、有溶劑峰、有雜質、有基線漂移)。論文有做真實光譜的測試:在一個 238 個分子的教學用資料集上,top-1 是 56%;但在一個 23,457 個分子的大型實驗資料庫上,top-1 掉到 21%。

兩者差 35 個百分點,而分數低的是比較大、比較雜的那一個。在真實而多樣的樣本上,這個工具目前的一次命中率大約是五分之一。

三、只用了一維光譜。 實務上化學家會用二維核磁共振,那是資訊量大得多的實驗。只用一維是一個刻意的困難設定,也意味著它還沒用上化學家實際會用的全部資訊——這既是限制,也是上升空間。

四、立體化學是另一個更難的問題。 分子的鏡像對映體有相同的連接方式、不同的空間排列,而生物體對這個差別極度敏感。這一層從目前的描述看不出來是否處理了。


延伸閱讀

這篇講的是機制,以及為什麼「資訊不足」比「算力不足」更難對付。

同一個瓶頸的另一端在質譜那邊——質譜能一次看到幾千個分子但認不出來,核磁共振認得準但要純化、要量多。

如果你想知道這個工具的可及性為什麼只有 C 級(它開源,所以沒有人能獨佔它的價值)、天然物藥物發現復甦的條件是什麼、以及我們寫下了哪五條「到期就回來對帳」的判定條件——其中一條的到期日只有兩個月,因為那是我們自己的功課——那些在研究筆記〈AlphaFold 解決了蛋白質。小分子這一半,還是靠人一格一格拼〉裡。


來源

  • arXiv:2512.03127(2025-12-02),Xiong, Zhang, Alauddin, Cheng, An, Seyedsayamdost, Zhong,Atomic Diffusion Models for Small Molecule Structure Elucidation from NMR Spectra(ChefNMR,NeurIPS 2025)——文中的 top-1/top-10 與真實光譜數字出自正文結果表 — 摘要|全文 HTML
  • NeurIPS 2025 論文頁 — 連結
  • 官方程式碼與模型權重(MIT 授權) — 連結
  • Princeton University(2025-12-18),Four innovative projects selected for 2025 Schmidt Transformative Technology Fund awards — 連結

本文為科學技術之教育性資訊,不構成任何投資建議。