免費科普
真正在賺錢的 AI,在決定明天哪台卡車走哪條路
先看一個數字:貨運業的營業利益率,經常落在個位數的低段。
這意味著什麼?意味著調度效率改善幾個百分點,就是整年的利潤。
而調度是一個什麼樣的問題?
一家中型貨運公司有幾千台卡車、幾千個司機、每天幾千張訂單。每一個決定——這台車接哪張單、跑完之後空車去哪裡等下一單、這個司機的工時還剩多少、明天哪個區域會缺車——都會影響後面所有的決定。
而且你在做決定的當下,明天的訂單還沒進來。
這不是一個「最佳化」問題。這是一個「在不知道明天會發生什麼的情況下,今天要怎麼決定」的問題。
Warren Powell 在普林斯頓花了四十年做這件事。
這是什麼
先講三個詞
動態規劃——處理「連續做決定,而且每次決定之後會有隨機事件發生」這類問題的數學框架。
維度詛咒——狀態、決策、隨機事件三者的可能組合,隨規模指數爆炸。這是這類問題的根本困難。
決策後狀態——Powell 的關鍵發明。等一下解釋。
生活場景:下棋
想像你在下棋,要決定這一步走哪裡。
標準的做法是往前推演:如果我走這步,對手可能有二十種回應;每種回應之下我又有二十種走法;再下去對手又有二十種⋯⋯
分支數是指數成長的。 推三步是八千種局面,推六步是六千四百萬種。
而貨運調度比下棋更糟。 因為「對手」不是一個人在下棋,是整個市場的隨機性:明天會來多少訂單、從哪裡來、司機會不會請假、路上會不會塞車。
可能性不是二十種,是連續的。
傳統的做法是:對每一個決策,計算所有可能未來的期望值。這在數學上完全正確,在計算上完全不可行——你得對一個高維度的隨機變數做積分。
機制拆解:換一個地方站
Powell 的貢獻不是算得更快,是換一個位置去評估。
先看標準的時序:
現在的狀態 → 我做決定 → 隨機事件發生 → 新的狀態
傳統做法是站在「現在的狀態」,問:如果我做這個決定,把所有可能發生的事都考慮進來,未來的期望價值是多少?要算期望值,要做高維積分,算不動。
Powell 的做法是在中間插一個站點:
現在的狀態 → 我做決定 → 【決策後狀態】 → 隨機事件 → 新的狀態
決策後狀態就是:我已經做完決定、但隨機事件還沒發生時,系統的樣子。
用下棋來說——我已經把棋子放下去了,但對手還沒回應的那個局面。
在決定與隨機事件之間插一個站點。上排是傳統做法:從現在的狀態出發做決定之後,未來扇形展開成許多可能結果,必須對全部求期望值,計算上不可行。下排是加入決策後狀態的做法:狀態、決定、決策後狀態、隨機事件、新狀態依序排列;決策後狀態是決定已經做完、但隨機事件尚未發生的那個位置,它不含隨機性,因此可以直接學習它的價值,不必即時計算期望值。
然後,關鍵的一步:不去計算期望值,而是直接學習「這個局面值多少分」。
為什麼可以這樣做?因為決策後狀態裡還不含隨機性(隨機事件還沒發生),所以對它的評估是一個確定性的函數——你可以拿歷史資料把它學起來。
於是整件事變成:
- 原本:做決定 → 算期望值(高維積分,算不動)
- 現在:做決定 → 查一個學好的價值函數(快)
你把「處理不確定性」這件事,從「每次決策時即時計算」,搬到了「事前從資料中學習」。
一句話總結
Powell 沒有讓電腦算得更快。他換了一個「在哪裡評估」的位置——把不確定性從即時計算搬到事前學習。
為什麼重要:一個沒有突破時刻的四十年
這個案例跟大多數前沿科技的節奏完全不同,而那正是它值得看的原因。
Powell 在普林斯頓的實驗室做了四十年的隨機最佳化。這四十年裡,這個領域沒有一次「突破時刻」——沒有 AlphaFold,沒有 ChatGPT,沒有諾貝爾獎級的新聞。它就是一年一年地把方法磨得更好,應用到更多產業:貨運、能源、金融、醫療排程。
然後在某個時點,三件事同時到位: 方法夠成熟、運算與雲端夠便宜、產業的資料夠數位化。
於是它變成了產品。 這套數學現在裝在一個叫 CORE.ai 的產品裡,客戶是貨運業者——包括幾家具名的大型車隊。它橫跨的決策層級也很寬:從「我們需要幾個司機、該買什麼設備」,到「這週的運力怎麼配」,到「這張單接不接、這台車接哪張」。同一套數學,不同的時間尺度。
還有一個值得記的小細節:這家公司的執行長是 Daniel Powell,而首席分析長是他的父親 Warren Powell。 學術成果商業化最常見的失敗模式是「教授當執行長」——研究者的技能和經營者的技能是兩回事。這個安排把兩者分開了,是判斷學研衍生公司品質的一個實用線索。
比喻到此為止
下棋的比喻在兩個地方失效:
一、棋盤是完全可觀察的,貨運不是。 下棋時你看得到整個棋盤;調度時你不知道明天有多少貨,也不知道競爭對手的運力狀況。這是「部分可觀察」問題,比棋更難。
二、★ 棋有明確的勝負,貨運的「好」是多目標的。
第二點是實務上最麻煩的一環。成本低、準點率高、司機滿意度、設備利用率、客戶關係——這些會互相衝突。要讓價值函數去學什麼,本身就是一個要先決定的事。
而那是一個商業與管理問題,不是數學問題。 數學再優雅,也不會告訴你「準點率比司機留任率重要多少」。而且不同客戶的答案不一樣——這正好是這類產品最難規模化的地方。
還沒定案的事
一、★ 價值難以歸因,這是這類產品最大的銷售障礙。 你告訴客戶「用了我們的系統,你的空駛率下降 3%」——客戶會問「你怎麼知道不是因為今年油價跌了、或貨量變了?」決策型 AI 的價值是統計性的,但客戶的決策是逸事性的。
二、每個客戶都要客製,會傷害可規模化性。 承上:多目標的權重因客戶而異,而客製化正是軟體毛利的殺手。
三、客戶的景氣循環很劇烈。 貨運業的營收與運價高度週期性。下行週期時,被砍的往往是軟體支出——而這跟軟體好不好用無關。
四、最大的客戶可能自己做。 大型業者有自己的內部團隊;而數位貨運平台自帶演算法。有意思的是,這個領域裡同一家公司可以同時是競爭者和客戶——這在企業軟體裡並不罕見,但它讓「市場有多大」變得難算。
五、技術護城河不等於贏。 四十年的數學累積是真的護城河。但企業軟體的勝負常常由銷售與導入決定,不由技術決定——這是很多技術上更好的產品輸掉的原因。
延伸閱讀
這篇講的是機制:為什麼「換一個地方站」能讓算不動的問題變成算得動的。
如果你想知道決策型 AI 與生成式 AI 在「投資報酬率能不能證明」上的結構差異、為什麼貨運科技的導入摩擦特別大、以及我們寫下了哪五條「到期就回來對帳」的判定條件——其中一條刻意把「查不到資訊」和「公司不好」分開寫,因為那是兩件事——那些在研究筆記〈大家都在講會寫詩的 AI〉裡。
來源
- Warren B. Powell,Approximate Dynamic Programming: Lessons from the Field(WSC 2008) — PDF
- Princeton CASTLE Lab — 連結
- FreightWaves,40 years in the making, Optimal Dynamics takes 'high-dimensional AI' mainstream — 連結
- Princeton Innovation(2020),Startup focus: Optimal Dynamics drives logistical decisions with AI — 連結
- DC Velocity(2025-05),Trucking AI vendor Optimal Dynamics raises $40 million——文中「具名的大型車隊客戶」出自此篇 — 連結
本文為科學技術之教育性資訊,不構成任何投資建議。