項目 06評分 3.90C · 僅供追蹤查證 2026-09-02

判定一個未知小分子的結構,至今仍是博士級專家花數天到數週的手工活。普林斯頓的 ChefNMR 把它變成生成問題——給一段核磁共振光譜和化學式,直接生成分子結構。在最難的天然物資料集上 top-10 為 65.74%、top-1 為 40.15%;真實實驗光譜的一次命中率則落在 21% 到 56% 之間。

AlphaFold 解決了蛋白質。小分子這一半,還是靠人一格一格拼

🔧 更正紀錄(2026-08-16)

本篇 v1 只有二手描述,把「超過 65%」寫成一個沒有限定的準確率,並標注定義待查。原文取得後,那個數字的含金量必須修正。

  • 原始論文:arXiv:2512.03127,Atomic Diffusion Models for Small Molecule Structure Elucidation from NMR Spectra,NeurIPS 2025,2025-12-02 投遞。作者 Xiong, Zhang, Alauddin, Cheng, An, Seyedsayamdost, Zhong。
  • 「超過 65%」是 top-10,不是 top-1。 對應的是最難的 SpectraNP 資料集(111,181 個天然物,最大 274 個原子):top-1 為 40.15%、top-5 為 59.83%、top-10 為 65.74%。
  • 較容易的資料集分數高得多:SpectraBase top-1 72.04%/top-10 88.20%;USPTO top-1 81.57%/top-10 93.01%。引用時必須連資料集一起引用,否則同一個方法可以報出 40% 或 93%。
  • 論文有做真實實驗光譜的 zero-shot 評測,這回答了 v1 標為未知的 domain gap:SpecTeach(238 個分子)top-1 56%、NMRShiftDB2(23,457 個分子)top-1 21%。落差是真的,而且在大型實驗資料集上相當大。
  • 程式碼與模型權重已以 MIT 授權開源(ml-struct-bio/chefnmr,資料與 checkpoint 置於 Zenodo)。
  • 對照基線(SpectraNP top-1):Hu 等人 19%、NMR-DiGress 2%。ChefNMR 的 40% 是這個脈絡下的大幅領先——這一點 v1 完全沒有寫到,是低估。

依 Watch 機制,W2 已判定 met 並附證據(判定日 2026-08-16,判定後不可竄改)。W1 的判定見文末。

我們把更正放在最前面,而不是偷偷改掉。


鉤子

2021 年之後,「AI 解決了蛋白質結構」變成一句常識。AlphaFold 拿了諾貝爾獎,蛋白質資料庫被填滿。

但化學界有一個沒被填的洞,而且它每天都在卡人:

你手上有一瓶不知道是什麼的東西,怎麼知道它是什麼?

從一株土壤細菌裡分離出來的新化合物、一個代謝物、一個天然產物——你可以測出它的化學式(幾個碳、幾個氫、幾個氧),你可以測出它的核磁共振光譜。

然後呢?

然後你把它交給一個做了二十年的博士,他花幾天到幾週,用鉛筆在紙上拼出來。

這件事在 2026 年還是這樣做的。


以下為訂閱內容

本篇還有約 24 分鐘的閱讀

剩下的部分包含機制拆解、產業結構、以及我們寫下的觀察條件—— 每條附判定門檻與到期日,三個月後回來對帳。

⚠️ 訂閱尚未開放——目前所有人看到的都是預覽