AI 選型4 min
零售連鎖採購主管評估 AI 補貨預測系統的回測與基準線

零售連鎖導入 AI 補貨預測前的評估清單:該用多長的歷史資料做驗證

補貨預測的準確率數字容易被畫得漂亮。本文整理資料顆粒度的前提盤點、跨季節回測的 POC 設計,以及該問廠商的關鍵問題。

AI 選型零售連鎖AI 補貨預測庫存管理回測POC

一間經營二十多家門市的生活雜貨連鎖品牌,總部的採購主管最近手上有兩份提案。一份來自一家補貨系統廠商,demo 時展示的預測準確率高達九成五;另一份來自現有 ERP 廠商加掛的預測模組,數字沒那麼漂亮,但附了完整的回測報告。採購主管心裡清楚,門市的缺貨跟報廢已經吃掉不少毛利,總部也承受著要「數位轉型」的壓力,但她也隱約覺得,那九成五的準確率,聽起來太乾淨了。

零售連鎖導入 AI 補貨預測,理論上是報酬率最直接的一種 AI 應用——少缺貨、少報廢、庫存周轉變快,數字都看得到。但也正因為效益容易被「畫出來」,這個領域的話術也特別多。上一階段我們談過幾種常見的踩雷模式:模型只在促銷旺季測得漂亮、廠商拿全店平均掩蓋單一品類的慘況、簽約後才發現系統看不懂門市之間的調撥邏輯。這篇要談的是,導入前該怎麼把評估流程做扎實,才不會等到簽約半年後才發現準確率是「demo 用的那組資料特別挑過」。

導入前該先確認的資料前提

AI 補貨預測的準確度,九成建立在資料的完整度跟顆粒度上,而不是模型本身有多先進。導入前,總部至少要先盤點三件事:歷史銷售資料涵蓋的時間長度是否跨過至少一次完整的季節循環與促銷週期、資料是否細到單店單品的每日層級(而不是月彙總或全店加總)、以及缺貨當天的資料是否被正確標記——很多零售系統在缺貨時只記錄「銷量為零」,卻沒有區分這是「賣完了」還是「本來就沒人買」,這會讓模型學到錯誤的需求曲線。

如果品牌有多店型(旗艦店、社區店、outlet 店),資料還得能區分店型與商圈特性,否則模型很容易把大店的熱銷品邏輯,錯誤套用到小店身上。這些盤點工作看起來瑣碎,但決定了後面 POC 測出來的準確率有沒有參考價值。

POC 該怎麼設計才知道準不準

一次性的準確率數字幾乎沒有意義,真正該看的是「跨時間、跨情境」的穩定度。比較務實的做法,是要求廠商用至少涵蓋一個完整年度週期的歷史資料做回測(backtesting),而不是只挑近三個月;並且把資料切成訓練期與測試期,確保模型是在「沒看過答案」的情況下被驗證,而不是拿訓練資料自己驗自己。

驗收指標也不該只看單一個「預測準確率」,至少要拆成三個面向一起看:缺貨率有沒有下降、報廢與效期損耗率有沒有下降、以及庫存周轉天數有沒有改善。同時務必要求廠商拿現行的人工補貨或既有系統的表現當基準線(baseline)做對照,沒有基準線的準確率數字,無從判斷這套系統到底比人工判斷好多少。試用期建議至少抓三個月以上,並且要涵蓋至少一次促銷檔期,因為促銷期間的需求波動,往往是模型最容易失準的地方。

該問廠商的關鍵問題,以及該提高警覺的跡象

下面整理幾個導入前一定要問的問題,以及對照廠商常見的模糊回應方式,可以拿來對照自己正在談的提案:

該問廠商的問題該提高警覺的回答跡象
這個準確率是用多長的歷史資料回測出來的?只給一個總體準確率數字,不願意提供回測區間或方法說明
促銷檔期跟平日的預測邏輯是否分開處理?表示「模型會自動學會」,但講不出具體的季節性或事件標記機制
新品或低銷量長尾品項怎麼處理?迴避問題,或說「這類品項準確率本來就會比較低,可以忽略」
系統能否解釋某一筆補貨建議是怎麼算出來的?強調模型是「黑箱但很準」,無法提供任何可追溯的判斷依據
如果預測明顯失準,店長端可以怎麼調整或覆蓋?系統設計上不允許人工覆蓋,或覆蓋後不會回饋進模型優化
試用期結束後,若效果不如預期,合約如何處理?只談年約優惠,迴避試用期未達標準的退場機制

如果廠商對於「準確率怎麼算出來的」講不清楚,或是不願意提供依產品類別、依店型拆解後的細部數字,這通常代表對方展示的是精心挑選過的最佳案例,而不是這套系統在你們自己資料上真實的表現。反過來說,一家願意老實告訴你「哪些品類目前預測還不夠準」的廠商,往往比一家什麼都保證準的廠商更值得信任。

給零售連鎖決策者的最後提醒

在簽約前,至少確認兩件事:手上的歷史資料是否真的乾淨到能支撐一次有意義的回測,以及廠商是否願意用你們自己的資料、而不是他們準備好的案例,跑一次完整季節週期的試用驗證。補貨預測的價值最終要體現在缺貨跟報廢數字的實際下降,而不是 demo 簡報上的那個百分比。