AI 踩雷4 min
會計事務所檢查 AI 憑證歸類錯誤與人工覆核流程

會計事務所導入 AI 憑證歸類踩雷:分類錯誤誰來負責

乾淨樣本上的高準確率,不代表能處理手寫收據、外幣單據與客戶各自的歸類慣例。本文解析 AI 憑證分類的錯誤風險與分層導入方式。

AI 踩雷會計事務所憑證歸類OCR財會自動化人工覆核

一間中型會計事務所,服務大約六十家中小企業客戶,每個月要處理的憑證量動輒上萬張。合夥人算過一筆帳:如果能把發票辨識、科目歸類這種重複性工作交給 AI 處理,助理就能把時間省下來做更有價值的稅務規劃與客戶溝通。市面上這類工具的行銷話術也很吸引人——辨識準確率號稱九成五以上,導入後幾週內就能看到效益。事務所評估了兩三家方案,選了一套介接發票 OCR 加上科目分類模型的系統,預計三個月內全面上線。

一開始的測試結果確實不錯。標準格式的三聯式發票、電子發票,辨識率很高,科目歸類也大致合理。合夥人和幾位資深會計師都覺得,這次導入應該會比想像中順利。

為什麼準確率一到真實資料就掉下來

問題是在正式上線、開始處理真實客戶憑證之後才浮現的。測試階段用的是事務所自己整理過、格式相對乾淨的樣本,但實際客戶丟過來的憑證五花八門:手寫收據、跨境採購的外幣單據、餐飲業的複雜統一發票、還有不少客戶習慣拍照上傳而非掃描,畫質參差不齊。AI 模型在這些「非標準」憑證上的判斷開始出錯,尤其是科目歸類——同樣一張辦公用品發票,有的客戶習慣歸在「文具用品」,有的客戶因為產業別不同會歸在「業務推廣費」,AI 學到的是通用邏輯,卻抓不住每個客戶原本的歸類慣例。

更麻煩的是,這些錯誤不是那種一眼就能看穿的離譜錯誤,而是「看起來合理但其實不對」的那種。金額對得上、格式也正確,只是科目歸錯了,或是把應該計入固定資產的採購歸進了當期費用。這種錯誤如果沒有人逐筆覆核,很容易一路帶到申報階段才被發現。

代價:多花的時間,加上信任成本

事務所原本預期 AI 能省下至少三成的初步整理時間,實際上因為每一筆 AI 分類都需要會計師重新核對,前幾個月反而比純人工作業多花了將近一倍的時間——助理要看憑證、還要看 AI 判斷的結果、再去比對客戶的歷史慣例,等於多一道工序。

比時間成本更棘手的是信任問題。有一次因為一批進口設備的憑證被誤歸為費用而非資產,直到客戶的財報出來才被會計師發現,雖然及時更正,沒有真的送出錯誤申報,但客戶得知後對事務所的信任明顯打了折扣,後續有大半年的時間,這位客戶的所有申報件都要求雙重覆核才肯簽字。這種信任成本,比多花的工時更難估算,也更難短時間內補回來。

後來怎麼調整:從全面上線改成分層導入

事務所後來把導入策略整個重新設計。第一步是把 AI 的角色從「自動分類」降級為「初步建議」,所有歸類結果一律標示信心分數,低於一定門檻的憑證直接跳過 AI、進入人工處理佇列,不讓系統硬做它不擅長的判斷。第二步是針對每個大客戶,把過去兩三年的歸類慣例整理成客製化規則庫,讓 AI 判斷時能參考該客戶的歷史邏輯,而不是套用一套通用標準。第三步則是明確劃出責任歸屬:AI 給的是建議,最終簽核與法律責任仍在會計師身上,這件事在事務所內部與客戶端都重新溝通了一次,避免大家誤以為「AI 做的就不用人核」。

調整之後,效率確實回升了,但事務所也承認,那套「AI 全面取代人工初步整理」的樂觀預期並沒有實現——比較實際的定位,是讓 AI 處理標準化程度高的憑證,把人力集中在例外狀況與客製規則需要判斷的部分。

給會計業者的避雷檢查

在評估是否導入憑證歸類 AI 之前,有幾個問題值得先問清楚:這套系統的訓練資料是否涵蓋你們客戶常見的非標準憑證型態,還是只在乾淨樣本上測過;歸類錯誤發生時,責任與更正流程是否清楚,不能等到出包才臨時討論;系統能不能針對個別客戶的歸類慣例做客製,而不是一套邏輯套用所有人。

常見徵兆導入前該做的檢查
廠商只用乾淨測試樣本展示準確率要求用自己客戶的真實憑證(含手寫、跨境、複雜品項)實測
系統沒有信心分數或例外標示機制確認低信心案件會自動轉人工,而非強制輸出結果
沒有明確的人工覆核節點設計導入前先定義哪些憑證類型必須雙重確認
責任歸屬沒有事先講清楚內部與客戶端都要明確:AI 建議、會計師簽核負責

導入 AI 處理憑證歸類這件事本身沒有問題,真正決定成敗的,往往不是模型準不準,而是有沒有把「例外狀況怎麼辦」這件事想清楚,並且在上線前就把責任歸屬談攏。