跳至主內容
返回最新消息
專欄分享

企業如何用三層判斷選擇合適AI代理工具型或教練型

智
智菩科技
2026年9月27日
23 分鐘閱讀

「這家跑分最高、單價最低,先試這家。」選型會議上,採購主管攤開三份 AI Agent 簡報,會議室裡討論的都是模型分數與報價。三個月後試辦結束,代理只能讀不能寫,流程照舊靠人工補位。這正是當前企業在做 AI Agent 選型時最常見的場景:資訊不缺,缺的是判斷順序。當代理產品滿天飛,「企業評估」反而變得更難,因為多數團隊問錯了第一道問題。

AI Agent 選型三層判斷示意圖,說明企業評估從任務出發的完整框架
▲ AI Agent 選型不該從產品清單出發,而要從任務風險與自主性層級反推。

AI Agent 爆量:代理產品滿天飛,企業為何反而更難選?

2024 到 2025 年,代理式 AI 從概念快速走向產品化。軟體與雲端服務商密集推出可自主規劃、呼叫工具、執行多步驟任務的代理功能,市場出現「代理產品爆量」現象。Gartner 將代理式 AI 列為 2025 年首要策略科技趨勢,並預估 2028 年三成以上企業軟體將內建代理能力(Gartner,2024)。

問題是,當每個產品都叫「代理」,名稱本身就不再具備辨識度。行銷詞彙與真實能力之間的落差擴大,企業若以名稱而非能力分級評估,很容易把規則式流程誤認為自主代理,導致期待與交付之間出現巨大裂縫。

2024 至 2025:代理式 AI 從概念走向產品化的三個推力

第一個推力是模型工具呼叫能力成熟,讓代理能實際操作外部系統;第二個推力是雲端平台把代理框架標準化,降低開發門檻;第三個推力是企業對流程自動化的需求從單點走向跨系統。三者疊加,代理產品數量在兩年內快速膨脹。

代理名稱通膨:行銷詞彙與真實能力的落差

國際顧問機構已提出警示,市場存在「代理清洗」現象。採購方需以任務複雜度、工具呼叫能力、記憶與規劃能力等構面拆解,而非以行銷詞彙判斷(Gartner,2025)。只看名稱,等於把選型交給供應商的行銷部門。

市場現況與定價模式的分歧

代理產品的計價方式同樣分歧,席次制、用量制、任務制與成果制並存,企業難以換算總持有成本。在缺乏統一標準下,選型風險明顯升高。建議先理解自身任務屬性,再回頭看產品,順序顛倒往往導致後期成本失控。

產品類型 常見宣稱能力 實際能力邊界 常見計價模式
提示詞包裝型 能理解需求、自動產出 本質為提示範本,無法呼叫系統、無記憶與規劃 席次制
單步自動化型 能自動完成流程 僅能執行單一步驟,例外狀況需人工接手 用量制
多步任務型 能規劃並執行多步驟任務 可串接工具,但中斷後續行與例外處理能力有限 任務制
自主規劃型 能自主拆解目標、動態調整 需高品質資料與權限設計,落地門檻高 成果制

企業評估的第一步,是把產品類型與計價模式對上自己的任務屬性。企業導入AI代理前的治理關鍵問題與決策框架,往往比模型跑分更能決定專案成敗。

採用率高、成熟度低:企業 AI 代理的落地落差從何而來

企業採用 AI 的比例持續攀升,但自認成熟的卻極少。McKinsey(2025)調查顯示,至少一個業務職能已使用 AI 的企業比例達 78%,但自認生成式 AI 部署已達成熟階段的高階主管僅 1%。這條落差線,正是選型要處理的核心問題。

78% 企業已用 AI,僅 1% 自認成熟

使用與成熟之間,隔著流程對齊、權限設計與資料治理三道門檻。多數企業停在「有在用」,卻沒有把代理納入正式流程與責任體系,導致效益無法累積。

95% 試辦專案無法產生可衡量損益的關鍵

MIT Media Lab Project NANDA(2025)研究指出,企業生成式 AI 試辦專案約 95% 未能產生可衡量的損益成果,落差多在流程與人員適配,而非模型本身。換句話說,選型選得再好,流程沒改、人員沒接,效益依然出不來。

台灣企業的三個在地課題:資料治理、權限控管、流程未對齊

台灣製造、金融與零售業者陸續展開概念驗證,普遍面臨資料散落多套系統、欄位定義不一致、權限未細分等問題。代理只能讀不能寫,或寫入後無法追溯,都是對齊斷層的具體症狀。《人工智慧基本法》草案與相關指引仍在成形,企業在缺乏統一標準下,更需要自建評估框架。

數據 數值 來源機構與年度 對選型的意義
企業軟體內建代理能力比例 預估 2028 年達 33%,2024 年不到 1% Gartner(2024) 代理將成為軟體標配,選型要納入長期架構
代理式 AI 專案取消率 2027 年底前逾 40% Gartner(2025) 成本失控與價值不明是主因,驗收要先談
生成式 AI 試辦無損益成果比例 約 95% MIT Media Lab Project NANDA(2025) 流程與人員適配是關鍵,非模型問題
至少一個職能已使用 AI 的企業比例 78% McKinsey(2025) 使用普遍,但成熟度低
已達預期投資報酬的 AI 專案比例 約 25% IBM IBV(2025) 多數專案仍待驗證,驗收機制是重點

這些數字指向同一個結論:AI Agent 選型不是挑最強的模型,而是挑最適合當前流程成熟度的那一層。AI 代理自主行動如何落實最小權限與稽核軌跡?若沒先想清楚,試辦資料再漂亮也難以規模化。

誰該負責選型?企業決策者與 IT 主管的分工

選型失敗常見的原因之一,是責任不清。決策者關心效益與風險,IT 主管關心系統與資料,兩邊若沒在同一張桌上對話,選出來的產品往往只能滿足其中一方。

決策者的三個提問:任務、風險、退出條件

決策者該問的是:這個代理要解決哪個任務?任務失敗的風險由誰承擔?如果三個月後不續約,資料與流程如何退出?這三題確立了選型的邊界,也決定預算的合理上限。

IT 主管的四項技術盤點:系統、資料、權限、軌跡

IT 主管則需盤點代理要接哪些系統、需要哪些資料、取得哪些權限、留下哪些軌跡。這四項若無法在試辦前講清楚,後期的整合成本與資安風險會遠超過授權費。

選型小組的角色配置

建議組成跨部門選型小組,讓業務、IT、資安法遵、財務採購與流程使用者代表各司其職。角色清楚了,評估語言才可能一致。

角色 主要職責 對應產出 常見失誤
業務負責人 定義任務目標與成功標準 任務說明書與效益假設 只看滿意度,未設量化基準
IT 主管 盤點系統、資料、權限與軌跡 整合需求書與權限矩陣 低估整合與維運人力
資安與法遵 檢視資料使用範圍與合規要求 風險評估與合規檢核表 試辦後才發現權限過寬
財務採購 換算總持有成本與合約條件 成本試算表與驗收條款 未載明超量費用與退出條款
流程使用者代表 反映實際操作痛點與例外情境 流程痛點清單與驗收回饋 被排除在選型會議之外

小組成立後,第一個動作不是看簡報,而是把待解決的任務列出來。這也是下一節要談的核心:為什麼選型要從任務出發。

為什麼選型要從任務出發,而不是從產品清單出發

選型會議上最常見的開場,是比較模型跑分與報價。但跑分高不代表任務能完成,單價低不代表總持有成本低。真正的判斷起點,是任務本身的屬性。

四種常見的選型錯誤

第一,以模型分數取代流程指標;第二,以產品名稱推斷能力;第三,忽略權限與軌跡設計;第四,未設對照組就擴大規模。這四種錯誤的共同點,都是跳過了任務盤點這一步。

從任務風險反推可接受的自主性層級

產業界常以類似自動駕駛的分級描述代理自主性,從 L0 人工操作到 L5 完全自主,用以說明代理在感知、規劃、執行與問責上的授權程度。企業可依任務風險對應可接受層級,高風險任務宜停留在 L2 至 L3 的人機協作,低風險重複任務才推進至 L4,並保留人類覆核節點。

三層判斷架構總覽

本文提出的三層判斷是:第一層確認任務屬性屬工具型、教材型或教練型;第二層以可用性、對齊度、可觀測性與成本四軸評估;第三層用小規模對照試辦與合約化驗收把風險鎖住。三層做完,選型就有依據。

傳統做法:「這家跑分最高、單價最低,先試這家。」沒有人問它要接哪些系統、能取得哪些權限、留下哪些軌跡。三個月後試辦結束,代理只能讀不能寫,流程照舊靠人工補位。

新做法:「先問三件事:它要接哪些系統、取得哪些權限、留下哪些軌跡。分數與價格放最後。」選型順序換了,後期的成本失控與責任歸屬問題也跟著少了一半。

自主性層級 感知與規劃範圍 可執行範圍 適合任務風險 必要的人工節點
L0 人工操作 無 無 高風險、高法遵 全程人工
L1 輔助建議 單一資訊來源 提供建議,不執行 中高風險 建議後人工決策
L2 局部自動 限定範圍感知 執行單一步驟 中風險 步驟完成後人工覆核
L3 條件自主 多來源感知與規劃 執行多步驟任務 中低風險 例外與紅燈情境人審
L4 高度自主 動態規劃與調整 跨系統自主執行 低風險、高重複 定期抽查與軌跡稽核
L5 完全自主 全範圍自主 無限制執行 目前不建議企業採用 無

高風險任務宜停在 L2 至 L3,這條線畫出來,選型的範圍自然縮小。接下來要處理的是任務屬性的分類。

第一層判斷:工具型、教材型、教練型怎麼分

任務盤點完成後,第一層判斷是把任務歸類為工具型、教材型或教練型。這三型不是價格帶,而是三種價值深度,對應不同的驗收指標與資料品質要求。

三型的定義與能力邊界

工具型看重任務完成率與週期時間,適合高重複、低風險的流程;教材型看重知識覆蓋率與測驗通過率,適合標準作業與新人訓練;教練型看重決策品質改善幅度與延遲表現,適合需要行為改變的場景。

盲測法:三個問題快速歸類

第一問:這個任務的成果能否用完成率衡量?若是,偏工具型。第二問:這個任務的核心是傳遞知識,還是改變行為?若是前者,偏教材型。第三問:這個任務是否需要價值排序與承諾?若是,偏教練型。

三型對照表

三型的核心差異,在於驗收語言不同。若供應商只用準確率說明價值,通常屬於工具型,不該套用到教練型場景。

類型 核心價值 適用場景 驗收指標 對資料品質的要求
工具型 任務完成與效率提升 高重複、低風險的單一流程 任務完成率、週期時間 流程資料需結構化
教材型 知識傳遞與標準化 新人訓練、標準作業傳承 知識覆蓋率、測驗通過率 知識內容需完整且版本一致
教練型 決策品質與行為改變 需要價值排序與承諾的場景 決策品質改善幅度、延遲表現 情境資料需具備決策脈絡

三型歸類完成後,第二層判斷要處理的是評估軸線。這也是企業評估最容易簡化的一步:只比價格與分數,卻漏掉對齊與可觀測性。

第二層判斷:可用性、對齊程度、可觀測性與總持有成本四軸評估

第二層判斷是本文的核心工具:四軸評估。每一軸都要設定可量化門檻與權重,並要求供應方提供實測資料,而非簡報承諾。

可用性:不只看模型分數,要看流程週期時間

可用性的量化門檻,是流程週期時間縮短比例、人工覆核率下降幅度與錯誤回復成本。這些指標要在試辦前設好基準線,否則事後無法歸因。

對齊程度:資料、權限與責任邊界

對齊程度涵蓋資料是否即時可取、權限是否細分到最小必要、責任邊界是否明確。這一軸若低分,代理只能讀不能寫,或寫入後無法追溯,試辦效益會被人工補位掩蓋。

可觀測性與總持有成本:把黑箱變成可稽核

可觀測性要求日誌、追蹤、回滾與人為覆核機制。總持有成本則要納入授權費、超量費、整合與佈建成本、維運人力、模型更新成本與退出成本。四軸合起來看,才不會買到單價低但總成本高的產品。

評估軸 量化門檻 權重建議 實測資料要求
可用性 流程週期時間縮短 20% 以上 30% 試辦期週期時間與覆核率對照
對齊程度 權限細分至最小必要,資料即時可取 30% 權限矩陣與資料更新頻率證明
可觀測性 可還原決策路徑,具回滾機制 25% 日誌與追蹤紀錄實測
總持有成本 三年總成本可完整試算 15% 計價單位、超量費與退出成本揭露

四軸評分完成後,會得到一個可比較的分數,而不是一堆簡報承諾。接著要處理的是最容易被跳過的一層:試辦與驗收。企業AI代理授權治理如何定義權限邊界與問責機制若沒在這一層寫進合約,四軸分數再高也難以兌現。

第三層判斷:小規模對照試辦與合約化驗收

第三層判斷是把前兩層的結論,放進一個可控的試辦範圍,並用合約把驗收條件鎖住。這一層做實,選型就不再靠感覺。

對照組設計與基準線怎麼設

同一個任務,同時跑現行流程與代理流程,設定基準線與對照組。觀察週期時間、覆核率與錯誤回復成本,而不是只看使用者滿意度。

試辦期要涵蓋一個完整業務週期

若流程週期為月結,試辦就需跨月比較。兩週展示期的亮眼資料,不足以判斷例外處理與錯誤回復成本。多數失敗案例,都是在短展示期看到漂亮數字就擴大規模,結果效益反轉。

驗收條款清單

成果定義、服務水準、超量費用、資料使用範圍、模型更新頻率與退出條款,六項都要寫進合約。寫得越清楚,續約與否就越有客觀依據。

條款項目 應載明內容 驗收方式 未達標的處理
成果定義 完成率、週期時間、覆核率等可量化指標 對照組比較,達門檻才算通過 按比例扣款或延長試辦
服務水準 可用率、回應時間、例外處理時限 每月報表與實測抽查 未達標按日計罰,連續未達得解約
超量費用 計價單位、免費額度、超量單價 用量報表核對 超量前需通知並取得同意
資料使用範圍 可存取資料類別、保存期限、是否用於訓練 稽核紀錄與合規檢核 違反者立即停止並求償
模型更新頻率 更新週期、通知方式、回滾機制 版本紀錄與變更通知 未通知即更新視為違約
退出條款 資料匯出格式、移轉時限、費用 退出演練 未依約移轉得請求損害賠償

傳統做法:「滿意度 4.5 分,看來可以擴大規模了。」沒有人去看流程週期時間、人工覆核率與錯誤回復成本。擴大規模後,效益反轉。

新做法:「滿意度不等於效益。先對照基準線:週期時間縮短多少、覆核率降多少、錯誤回復要花多少成本。」同一套代理,因為看對了指標,續約與否有了客觀依據。

三型 AI 的優缺點、適用場景與驗收方式

三型 AI 各有其優勢與限制,選型時要誠實面對限制,而不是只看優勢。工具型上線快、範圍明確,但價值天花板較低;教材型可規模化傳遞知識,但完成率不等於能力提升;教練型能驅動行為改變,但驗收週期長、對信任度要求高。

工具型:上線快、範圍明確,但價值天花板較低

工具型適合高重複、低風險的流程。限制是流程未改變時效益有限,容易被視為單點自動化,而非真正的能力升級。

教材型:知識傳遞可規模化,但完成率不等於能力提升

教材型透過降低外在負荷、保留內在負荷來促進學習(Sweller 認知負荷理論)。限制是缺乏實作回饋時遺忘率高,成效難以歸因。

教練型:驅動行為改變,但驗收週期長、對信任度要求高

教練型透過即時回饋與間隔重複強化長期記憶與技能遷移,因此驗收須量測延遲表現而非當下表現,否則會高估成效。這種類型的採用落地,需要組織願意開放資料與決策情境。

類型 優勢 限制 適用場景 驗收方式
工具型 上線快、範圍明確、投資報酬較易計算 價值天花板較低,流程未改變時效益有限 高重複低風險任務 任務完成率與週期時間
教材型 降低學習門檻、可規模化傳遞知識 完成率不等於能力提升,遺忘率高 標準作業與新人訓練 知識覆蓋率與測驗通過率
教練型 貼近真實決策情境、長期價值較高 驗收週期長,對信任度與資料開放度要求高 需要行為改變的決策場景 決策品質改善幅度與延遲表現

了解三型的優缺點後,接著要面對的是錢的問題:定價模式怎麼選,才不會讓總持有成本失控。

定價模式怎麼選:席次制、用量制、任務制與成果制

代理產品定價模式分歧,包含席次制、用量計價、任務計價與成果分潤。企業難以換算總持有成本,加上多數合約未定義可驗收的成果指標與退出條款,試辦結束後無法判斷是否續約。

四種計價的適用條件

席次制適合使用者人數穩定、任務範圍明確的場景;用量制適合使用量波動大的情境;任務制適合任務顆粒度清楚、可計算件數的流程;成果制適合成果可歸因、可稽核的專案,但需設分潤上限。

總持有成本試算

試算時要納入授權費、超量費、整合與佈建成本、維運人力、模型更新成本與退出成本。四種計價的負擔差異,往往在超量費與退出成本這兩列才顯現。

合約談判的三個必問

第一問計價單位是什麼;第二問超量如何計算與通知;第三問若三個月後不續約,資料如何匯出。三題問完,成本輪廓大致清楚。

成本項目 席次制 用量制 任務制 成果制
授權費 按人頭計,固定支出 按用量計,變動較大 按任務件數計 前期低,成果分潤
超量費 增購席次 按超量單位計價 超出合約件數加價 分潤比例需設上限
整合與佈建成本 中 中 中高 高
維運人力 低 中 中 高
退出成本 低 中 中高 高,需明訂匯出條款

成本輪廓清楚後,不同規模與產業的選型路徑也會跟著不同。中小企業與中大型企業的起點,往往不在同一個位置。

不同規模與產業的選型路徑

選型沒有標準答案,但有不同的節奏。中小企業資源有限,適合從工具型單點切入;中大型企業治理先行,再談規模化;金融、製造與零售的法遵與稽核要求差異大,起點也不同。

中小企業:從工具型單點切入,先建立資料與權限基礎

挑選高重複、低風險、資料已數位化的單一流程,先建立資料與權限基礎。待流程對齊與稽核機制成熟後,再評估教材型與教練型。

中大型企業:治理先行,再談規模化

中大型企業的挑戰不在工具,而在跨部門共識。建議先完成資料盤點、權限矩陣與稽核軌跡設計,再進入試辦。治理一致之後,規模化才有意義。

金融、製造與零售的差異化重點

金融業法遵要求高,起點宜從 L1 至 L2 的輔助建議開始;製造業任務型態明確,適合從工具型流程自動化切入;零售業資料量大但變動快,適合從教材型與工具型並行。

產業 主要任務型態 建議起點類型 法遵與稽核要求 規模化順序
金融 風險判斷、合規檢核 教練型(輔助決策) 高,需完整稽核軌跡 先治理,再局部自動
製造 排程、品管、報表 工具型(流程自動化) 中,需設備與系統整合紀錄 先單點,再跨線擴散
零售 客服、行銷、庫存 工具型+教材型 中,需資料使用範圍揭露 先試辦,再分店複製
專業服務 知識交付、提案生成 教材型+教練型 中高,需客戶資料隔離 先個人,再團隊

路徑清楚之後,接下來的問題是節奏:從任務盤點到能力內化,該怎麼安排 90 天。

落地五步:從任務盤點到能力內化

落地五步是本文的方法總結:盤點分型、四軸評估、對照試辦、合約驗收、能力內化。五步各有交付文件與檢核點,適合用 90 天節奏推進。

步驟一至五:盤點分型、四軸評估、對照試辦、合約驗收、能力內化

步驟一盤點任務顆粒度、重複性與風險等級;步驟二建立四軸評估表;步驟三進行小規模對照試辦;步驟四把驗收條件寫入合約;步驟五建立內部教練與知識庫沉澱機制,把提示範本、流程規則與例外處理文件化,降低對單一供應商的依賴。

90 天行動節奏

前 30 天完成盤點與評估,第 31 至 60 天進行試辦,第 61 至 90 天完成驗收與內化規劃。節奏固定,決策就不會拖成無限期試辦。

階段 天數區間 關鍵動作 交付文件 檢核點
盤點期 第 1 至 20 天 任務盤點、分型與風險標記 任務清單與自主性層級建議 任務是否可量化驗收
評估期 第 21 至 30 天 四軸評估、權重設定與供應商比對 四軸評分表與成本試算 是否要求實測資料
試辦期 第 31 至 60 天 對照組試辦、基準線量測 試辦報告與對照資料 是否涵蓋完整業務週期
驗收期 第 61 至 80 天 合約化驗收、條款核對 驗收報告與合約附件 六項條款是否齊備
內化期 第 81 至 90 天 知識庫沉澱、內部教練建立 提示範本與流程文件 能力是否留在組織

90 天節奏走完,選型就不再是一次性的採購,而是組織能力的累積。接下來,把實務上最常被問到的五個問題整理成問答。

常見問答:AI Agent 選型與企業評估的實務疑問

工具型 AI 與教練型 AI 該怎麼快速分辨?

看驗收指標。工具型看完成率與週期時間,教材型看知識覆蓋與測驗通過率,教練型看決策品質改善幅度與延遲表現。若供應商只用準確率說明價值,通常屬於工具型。

AI Agent 選型的企業評估指標,第一關該問什麼?

先問能呼叫哪些系統、取得哪些權限、留下哪些軌跡,再問計價單位與超量費用,最後才問模型能力。順序顛倒,往往導致後期成本失控與責任歸屬不清。

AI Agent 選型的試辦要跑多久才看得出成效?

至少涵蓋一個完整業務週期並設對照組。流程週期為月結就需跨月比較,兩週展示期的亮眼資料不足以判斷例外處理與錯誤回復成本。

如何避免買到名稱是代理、實際是腳本的產品,讓採用落地不成空話?

要求實測三件事:多步任務中斷後能否續行、遇到未預期輸入能否求助、執行紀錄能否還原決策路徑。三項皆無法展示者,本質多為規則式自動化。

中小企業資源有限,AI 代理導入評估該從哪一型開始?

從工具型切入,挑高重複、低風險、資料已數位化的單一流程,先建立資料與權限基礎,再評估教材型與教練型,避免一次投入過大而無法驗收。

智菩科技(AIbud)的觀點:選型是治理題,不只是採購題

選型是治理題,不是採購題。企業真正要買的不是一個代理產品,而是一套能把價值排序、決策底線與做事順序沉澱下來的決策系統。

治理、領導、管理三支柱如何套用在選型決策上

以王道經營學三支柱為骨架:治理先定邊界與權責,領導聚共識與方向,管理抓落地與兌現。對應到選型,就是先把任務風險與自主性層級談清楚(治理),再讓跨部門對同一套評估語言有共識(領導),最後用對照試辦與合約化驗收把採用落地做實(管理)。

把供應商能力轉為組織能力

工具型、教材型、教練型不是三種價格帶,而是三種價值深度。挑對層級,AI 才會成為智慧的延伸,而不是另一套閒置軟體。智菩以「智慧引導 AI」為核心,以領導人同心分身為入口,帶動企業 AI 化轉型,讓經營更有效、成果更長久。旗艦產品「領導人同心分身」以 3A(Availability、Alignment、Adoption)為骨架,先把價值排序、決策底線與做事順序沉澱下來,建立組織一致性。

若你正準備啟動 AI 代理的企業評估,建議先把手上待解決的任務列出來,標記重複性與風險等級,再對照本文的三層判斷與四軸評估表。把權限邊界與稽核軌跡一併想清楚,選型就會從感覺變成有依據的決策。

結論:三層判斷做完,選型就不再靠感覺

三層判斷的核心,是把選型從「比產品」變成「比任務適配」。第一層確認任務屬性,第二層以四軸評估,第三層用對照試辦與合約驗收鎖住風險。三層做完,決策語言就一致了。

三個帶得走的判斷原則

第一,先問系統、權限與軌跡,再問分數與價格;第二,驗收看流程指標,不看滿意度;第三,試辦要涵蓋完整業務週期,並設對照組。這三條原則,能避開多數選型陷阱。

下一步:從一個高重複、低風險的流程開始

今天就能做的行動,是挑一個高重複、低風險、資料已數位化的流程,套用四軸評估表打一次分數。分數出來,你就會知道該從工具型、教材型還是教練型開始,採用落地也有節奏可循。

延伸閱讀:

企業如何用三層判斷選擇合適AI代理工具型或教練型 | 智菩科技