保險業導入 AI 客戶分級前,該怎麼驗證模型跟業務員的認知一致
AI 分級系統準確率再高,若跟業務員的經驗判斷落差太大也是白費。本文整理盲測比對的 POC 設計,以及該問廠商的分級理由與合規問題。
一間中型保險代理人公司的區部經理最近很頭痛。總公司推了一套 AI 客戶分級系統的試辦方案,說可以根據保單歷史、繳費紀錄、年齡結構等資料,自動把手上幾千位保戶分成「高續保潛力」「高加保潛力」「流失風險」等等級,讓業務員知道該優先聯繫誰。廠商的簡報做得很漂亮,準確率數字也好看,但區部經理心裡有個疑問一直沒問出口:這套系統分出來的名單,跟底下做了十幾年、閉著眼睛都能講出哪個客戶下個月要繳續期保費的資深業務員相比,到底誰比較準?如果兩邊差很多,公司該相信誰?
這個猶豫很合理。保險業的客戶分級從來不是新鮮事,業務員腦中早就有一套經驗法則,真正的問題是:導入 AI 之後,這套模型能不能通過「跟人比」這一關,而不是只通過「跟自己的準確率數字比」這一關。
先確認資料從哪來、分級邏輯建立在什麼前提上
在跟廠商深入談之前,公司內部要先盤點清楚幾件事:目前用來分級的資料來源有哪些,是保單管理系統、CRM,還是業務員自己手抄的 Excel;這些資料的更新頻率如何,有沒有大量空值或錯誤;過去分級主要看哪些變數,是保費規模、繳費穩定度、家庭保單數,還是年齡與職業。如果這些前提沒有先釐清,廠商拿到的訓練資料品質參差不齊,做出來的分級結果再漂亮也只是空中樓閣。
同樣重要的是,要先問清楚模型會不會用到年齡、性別、居住地這類敏感變數。金管會近年持續強調的公平待客原則,對保險業者如何使用客戶資料做差異化對待有明確要求,如果 AI 分級的邏輯不透明,甚至間接複製了某些帶有歧視色彩的判斷模式,後續衍生的合規風險會比模型不準更麻煩。
POC 該怎麼設計才知道準不準
比較務實的做法,是不要直接看廠商提供的整體準確率數字,而是設計一個「盲測比對」的試驗。挑選一個業務員經驗豐富、客戶關係穩定的分公司或通訊處,把過去六到十二個月已經發生的續保、加保、流失結果找出來,同時讓 AI 模型跑一次同期資料的分級預測,再讓資深業務員憑經驗對同一批客戶做主觀分級,三方對照。
驗收的重點不是「AI 有沒有比人厲害」,而是「AI 分級跟實際結果的吻合程度」,以及「AI 分級跟資深業務員的判斷落差有多大、落差出現在哪一類客戶身上」。如果落差集中在某個特定族群,比如年輕保戶或多年沒有互動的沉睡保戶,這通常代表模型在這類樣本數不足或資料特徵不完整,而不是業務員的經驗有問題。試用期建議抓兩到三個月,涵蓋至少一次完整的續期繳費週期,樣本數至少要能涵蓋各分級區間,不要只挑容易分對的客戶做示範。
該問廠商哪些關鍵問題
除了準確率,更該追問的是「為什麼」。同一位客戶為什麼被分到高潛力等級,模型能不能講出具體理由,還是只給一個分數卻說不出所以然。如果業務員質疑某個分級結果不合理,是否有申訴或人工覆核的機制,還是系統的判斷就是最終答案。
下面整理幾個保險業者在評估時該問、以及該提高警覺的跡象:
| 該問廠商的問題 | 該提高警覺的回答跡象 |
|---|---|
| 模型的分級依據能不能拆解成具體理由,而不只是一個分數 | 只強調「AI 很準」,說不清楚模型怎麼做判斷 |
| 訓練資料是否包含本地保單型態,還是套用國外通用模型 | 迴避資料來源問題,或說「這是我們的商業機密不能透露」 |
| 業務員對分級結果有異議時,有沒有申訴或人工覆核流程 | 表示系統判斷不需要也不建議人工干預 |
| POC 期間能不能提供分級理由的完整紀錄供事後檢核 | 只提供試用期的統計摘要,不提供逐筆分級明細 |
| 是否使用了年齡、性別等敏感變數,以及如何處理公平待客的合規疑慮 | 對合規問題輕描淡寫,認為「業界都這樣做」 |
如果廠商能具體回答前面幾個問題,並且願意在 POC 期間開放逐筆分級理由讓公司內部稽核或法遵單位檢視,這通常是比較負責任的廠商;反過來,如果廠商一直用「這是我們的核心演算法」當擋箭牌,拒絕解釋任何判斷邏輯,這類系統即使準確率數字亮眼,長期用起來也會缺乏調整的空間。
最後該確認的一件事
在正式簽約前,不妨把試用期跑出來的分級名單,拿去跟兩三位不同資歷、不同轄區的業務員當面過一次,聽聽他們對哪些客戶的分級「感覺不對」,以及不對在哪裡。這個動作花不了多少時間,但能讓公司在正式導入前,先確認這套系統是真的能幫業務員做出更好的判斷,還是只是把業務員原本就知道的事情,用比較貴的方式再講一次。