項目 18評分 3.25C · 僅供追蹤查證 2026-09-02
質譜儀每天在人體樣本裡偵測到數千個分子訊號,而其中絕大多數無法被確認是什麼——這批東西被稱為代謝體的「暗物質」。Skinnider 的做法是用大型語言模型學習生物化學的文法:不是列舉所有化學上可能的分子,而是生成「看起來像生物體會做出來的」分子。
你血液裡有幾萬種分子。科學界能叫出名字的,不到一成
🔧 更正紀錄(2026-09-02)
本篇把 DeepMet 叫做「大型語言模型」。取得原始論文之後,這個說法要修正。
- 原文寫什麼:摘要與「一句話結論」寫「Skinnider 的做法是用大型語言模型學習生物化學的文法」;「這是什麼 ③」寫「他們用一個以『人體內已知小分子結構』訓練的大型語言模型」;文末機制底稿也寫「LLM 以已知人體小分子結構訓練」。
- 正確是什麼:依 Nature 原文,DeepMet 是一個化學語言模型(chemical language model),架構是 LSTM(長短期記憶網路),不是 transformer 型的大型語言模型。規模也跟「大型」相反——微調用的訓練集只有 2,046 個已在人體組織或體液中實驗偵測到的代謝物(來自 HMDB),以 SMILES 字串表示;為了應付這個資料量,團隊先在 ChEMBL 第 28 版的類藥分子上做預訓練,再在這 2,046 個代謝物上微調(不凍結任何層)。
- 這個差別為什麼要緊:本篇整篇的比喻是「模型學會了生物化學的文法」。這個比喻其實更貼近真實的 DeepMet,而不是更遠——正因為訓練集小到只有兩千多個分子,它能運作靠的就不可能是記憶,只能是把 ChEMBL 學到的化學語法遷移過來、再學會代謝物特有的偏好。但「大型語言模型」四個字會讓讀者以為這是一個吃了海量語料的通用模型,那是錯的印象。
- 我們怎麼會寫錯:本篇當時沒有原始論文,引用的是二手介紹,而 C&EN 那篇報導的標題就是「Large language model guides exploration of the dark metabolome」。這是本專案第三次踩同一個坑:二手來源把一個有條件的技術描述壓成一個更有力的詞,而更有力的詞讀起來比較像新聞。
- 依據:Nature, 10.1038/s41586-025-09969-x(全文,PMC12960238)|C&EN 報導標題
我們把更正放在最前面,而不是偷偷改掉。
鉤子
抽一管血,丟進質譜儀,你會得到什麼?
幾千個訊號峰。 每一個峰代表一種分子,帶著它的質量資訊。
然後你會發現一件令人不安的事:這幾千個峰裡,能夠明確說出「這是什麼分子」的,只有一小部分。
其餘的就掛在那裡——有訊號、有質量、可以被量測、可以在不同人之間比較⋯⋯但沒有人知道它是什麼。
這批東西在領域內有一個名字:代謝體的「暗物質」。
這個借用自天文學的說法很貼切。你抬頭看星空,看得到滿天的光點,但有名字的只有一小部分。
差別在於——你血液裡那些沒名字的分子,可能正在決定你的健康。