項目 06評分 3.90C · 僅供追蹤查證 2026-09-02
判定一個未知小分子的結構,至今仍是博士級專家花數天到數週的手工活。普林斯頓的 ChefNMR 把它變成生成問題——給一段核磁共振光譜和化學式,直接生成分子結構。在最難的天然物資料集上 top-10 為 65.74%、top-1 為 40.15%;真實實驗光譜的一次命中率則落在 21% 到 56% 之間。
AlphaFold 解決了蛋白質。小分子這一半,還是靠人一格一格拼
🔧 更正紀錄(2026-08-16)
本篇 v1 只有二手描述,把「超過 65%」寫成一個沒有限定的準確率,並標注定義待查。原文取得後,那個數字的含金量必須修正。
- 原始論文:arXiv:2512.03127,Atomic Diffusion Models for Small Molecule Structure Elucidation from NMR Spectra,NeurIPS 2025,2025-12-02 投遞。作者 Xiong, Zhang, Alauddin, Cheng, An, Seyedsayamdost, Zhong。
- 「超過 65%」是 top-10,不是 top-1。 對應的是最難的 SpectraNP 資料集(111,181 個天然物,最大 274 個原子):top-1 為 40.15%、top-5 為 59.83%、top-10 為 65.74%。
- 較容易的資料集分數高得多:SpectraBase top-1 72.04%/top-10 88.20%;USPTO top-1 81.57%/top-10 93.01%。引用時必須連資料集一起引用,否則同一個方法可以報出 40% 或 93%。
- 論文有做真實實驗光譜的 zero-shot 評測,這回答了 v1 標為未知的 domain gap:SpecTeach(238 個分子)top-1 56%、NMRShiftDB2(23,457 個分子)top-1 21%。落差是真的,而且在大型實驗資料集上相當大。
- 程式碼與模型權重已以 MIT 授權開源(
ml-struct-bio/chefnmr,資料與 checkpoint 置於 Zenodo)。 - 對照基線(SpectraNP top-1):Hu 等人 19%、NMR-DiGress 2%。ChefNMR 的 40% 是這個脈絡下的大幅領先——這一點 v1 完全沒有寫到,是低估。
依 Watch 機制,W2 已判定 met 並附證據(判定日 2026-08-16,判定後不可竄改)。W1 的判定見文末。
我們把更正放在最前面,而不是偷偷改掉。
鉤子
2021 年之後,「AI 解決了蛋白質結構」變成一句常識。AlphaFold 拿了諾貝爾獎,蛋白質資料庫被填滿。
但化學界有一個沒被填的洞,而且它每天都在卡人:
你手上有一瓶不知道是什麼的東西,怎麼知道它是什麼?
從一株土壤細菌裡分離出來的新化合物、一個代謝物、一個天然產物——你可以測出它的化學式(幾個碳、幾個氫、幾個氧),你可以測出它的核磁共振光譜。
然後呢?
然後你把它交給一個做了二十年的博士,他花幾天到幾週,用鉛筆在紙上拼出來。
這件事在 2026 年還是這樣做的。