當攻擊者也有了 AI Agent,防禦的地基正在鬆動

文/楊建洲 James Yang,Profet AI 執行長特助

AI 正在讓攻防雙方的速度同時失衡,而多數企業還沒意識到這一點。Palo Alto Networks Unit 42《2026 全球事件回應報告》彙整橫跨 50 個以上國家、超過 750 起重大資安事件後指出:最快速的前 25% 攻擊,從取得初始存取權限到完成資料外洩,平均只需 72 分鐘,是前一年的四倍速。同一份報告也發現,漏洞公開後,攻擊者平均只需 15 分鐘就展開自動化掃描。

這樣的速度不是單一報告的孤例。Verizon《2026 年資料外洩調查報告》指出,近三分之一的資料外洩事件源頭是軟體漏洞,已超越帳密遭竊,成為駭客取得初始存取權限最主要的管道;World Economic Forum 與 KPMG《Empowering Defenders》則從防禦端給出對照:具備完整 AI 防禦能力的企業,能將外洩偵測與應對週期縮短約 80 天,平均外洩成本降低最高達 190 萬美元。

七十二分鐘、十五分鐘,這是攻擊者現在的時間表。你的資安團隊,跟得上這個速度嗎?

企業把 AI Agent 推上前線的速度,同樣快得驚人。BCG《2026 AI Radar》顯示,全球 90% 的 CEO 預期 AI Agent 今年創造實質投資回報;Gartner 則預測,2026 年底企業應用系統中將有 40% 整合特定任務的 AI Agent,這個數字在 2025 年初還不到 5%。

這些數字放在一起看,說的是同一件事:AI 沒有選邊站,它同時讓防禦方跟攻擊方都變快了,差別只在誰先意識到遊戲規則已經變了。

過去談「AI 資安與治理」,多數企業關心的是:模型安不安全?資料會不會被用於訓練?隱私政策寫了什麼?這些問題沒有錯,但問的是舊戰場。2026 年真正該警惕的是另一件事:當企業開始把 AI Agent 派上前線,攻擊者也在用同一套技術武裝自己,而且往往更早開始。治理框架本身,已悄悄變成一種競爭力。

傳統資安邏輯完全合理:確認身分、核實權限、範圍內操作即放行,這套邏輯守了企業二十年。但一個擁有合法權限的 AI Agent,身分是真的,權限也合法核發,並沒有闖入任何一扇不該開的門。問題出在,它被授權之後做了什麼。

這是 AI Agent 帶來的挑戰與過去所有資安事件最根本的不同:傳統存取控制管的是「誰可以進門」,但一個能讀資料庫、寄郵件、查工業控制系統的 Agent,只要被誘導做出「權限範圍內、但原本不該做」的動作,這道門檻就完全擋不住它,因為從系統角度看,一切都是合法憑證、正常流程,沒有任何規則被違反。

接下來五種正在發生的威脅,攻擊的都是同一個地方:這些看似合法的操作背後,到底藏著什麼。

這是這個時代最容易被忽略的盲點。傳統問答型 AI 只回應直接輸入的指令,AI Agent 不同:它會主動瀏覽網頁、讀取文件、查詢資料庫,自主蒐集資訊並採取行動。這個特性開創了新的攻擊入口,攻擊者只需在網頁、郵件附件或共享文件裡嵌入對 Agent 下達的隱藏指令。根源在於一個基本技術限制:微軟研究證實,LLM 無法可靠分辨「這段文字只是參考資料」還是「這段文字是要執行的指令」,使用者看不到惡意指令,Agent 卻當成合法請求執行。當 Agent 被賦予讀取外部文件、查詢工業資料庫的權限,並與 MES、ERP 或 OT 控制系統整合,後果會直接升級:2026 年 1 月發表於 MDPI《Information》期刊的研究指出,在工業控制場景中,這類攻擊的潛在影響已超出資料外洩範疇,直接延伸到生產系統操作層面。CIS 2026 年 4 月報告顯示,相關攻擊事件年增幅度達 340%;OWASP GenAI Security Project 將提示注入列為代理 AI 十大威脅第一位。

Agent 能呼叫的每一個工具,都多開一道可能被利用的門。攻擊者可竄改工具的描述或介面,讓 Agent 誤信一個被動過手腳的工具、執行未授權動作,稱為「工具下毒」;也可能讓工具維持乾淨一段時間,待 Agent 建立信任後,再偷換成惡意版本,稱為「Rug pull」。過去發生一起真實案例:史上第一個被發現的惡意 MCP 伺服器,偽裝成合法郵件服務,暗中複製使用者寄出的每一封信。更難察覺的是「工具鏈攻擊」:單獨看,內部 CRM 查詢工具與外部郵件寄送工具都是安全的,但攻擊者可誘導 Agent 將兩者串連,用 CRM 工具撈取客戶資料,再用郵件工具外送。整個過程使用合法憑證、正常程式執行,傳統惡意程式監控完全無法偵測。

除了工具本身被動手腳,Agent 的自動化運作特性同樣可能被拿來利用。人類操作者面對重複性任務會感到疲乏、會停下來確認,但 Agent 不會,只要邏輯上判定「還需要再查一次」,就會不斷觸發下一次呼叫。攻擊者只需要誘導 Agent 陷入迴圈,反覆呼叫成本高昂的外部 API,就可能在極短時間內造成服務中斷,或讓雲端帳單暴增。整個過程由 Agent 自主觸發,不需要人工介入,也不需要真正入侵任何系統,往往要等到帳單或服務告警出現,才會被注意到,屬於典型的「合法功能被過度使用」而非傳統入侵的攻擊型態。

多代理系統常見的失誤是「未限縮的權限繼承」:高權限的「管理者 Agent」委派任務給「工作 Agent」時,未做限縮,直接傳遞完整存取權限。另一種變體是「混淆代理人問題」:權限較低的 Agent 將看似合法的指令轉發給高權限 Agent,後者未驗證原始使用者意圖便直接執行。風險也可能藏在記憶體裡:Agent 若把過往 session 的憑證或金鑰快取下來重複使用,且未做好記憶體區隔,攻擊者就能誘導它調出這些殘留憑證,執行原本用自己權限做不到的操作,形成跨 session 的權限提升。當多個 Agent 之間習慣互相信任、互相委派,這類漏洞會被放大,且往往要事後拼湊時間軸,才能釐清問題出在哪一次委派。

Agentic 系統與傳統軟體的差異,在於它常於執行當下動態組裝能力,載入外部工具、串接不同模型或人格設定,攻擊面因此超出傳統軟體供應鏈分析能處理的範圍。風險分兩層:一層在模型本身,訓練資料或微調過程若遭竄改,後門可撐過整個部署週期。Anthropic 自身研究顯示:僅需 250 份被下毒的訓練文件,就能在 6 億至 130 億參數的模型中植入後門,且即使經過後續安全訓練(含 SFT、RLHF)仍會存在。另一層在工具與框架本身:PyTorch 曾發生依賴混淆攻擊,惡意套件在安裝過程竊取 SSH 金鑰;資安研究人員也在主流平台上發現約一百個惡意 AI 模型,部分一經載入即開啟反向連線。模型的「出身」,也就是訓練資料來源、經手對象,本身就是需要被審視的攻擊面。

Agent 會記錄過去互動以提升可用性,但若未做好隔離,一次成功的注入可污染未來所有 session,讓 Agent 持續替攻擊者執行被植入的錯誤指令。污染的來源不只一種:如果 Agent 仰賴向量資料庫做檢索(RAG),被污染的來源、直接上傳或過度信任的資料管線,都可能讓惡意資料混入資料庫,Agent 之後檢索到這些內容,就會產出錯誤答案或執行被植入的惡意指令。在多租戶環境中,污染還可能透過共享上下文,從一個使用者的 session 滲透到另一個使用者的 session。

這些污染手法都還算是能定位到「一次性事件」,但長期記憶漂移是另一種更難察覺的變體。它不靠單一次成功的注入,而是透過摘要機制或其他 Agent 的回饋,一點一點地、緩慢地扭曲 Agent 儲存的知識或目標權重。因為每一次改變單獨拿出來看,都不像惡意行為,可能只是摘要用詞的些微差異,或權重的小幅調整,傳統的異常偵測很難標記出單一事件。往往要等到 Agent 的行為已經明顯偏離原本設定的範圍,累積的偏差變得肉眼可見,才會被發現,而這時候可能已經持續了相當長一段時間。

看完這五種威脅,容易掉入一種焦慮:是否每出現一種新攻擊手法,就得補一項對應防禦?若照此邏輯,你將永遠追著攻擊者跑,因新手法不斷冒出,永遠補不完。真正該問的是:有沒有一套原則,不管未來出現什麼新招式,只要原則守住,防線就在。

如果一個服務帳號的存取範圍,原本就被限縮到任務所需的最小資料集,即使它被誘導做出異常動作,能觸及的範圍也早已被限制在很小的圈子裡。攻破,發生了;但傷害,被鎖住了。這是一種可以達成的防禦姿態:不是防止攻破,而是讓攻破不再是災難的開始。

下一篇,我們將拆解一套系統化的落地框架:七個能力領域、三層成熟度,看一套真正能接住 Agentic AI 時代的防禦架構,具體長什麼樣子。