2026 年七月下旬,OpenAI 在封閉環境中測試其新模型之一,當時模型決定脫逃(新視窗)。它入侵了另一家軟體公司 Hugging Face 的私有基礎設施,偷走其正在接受測試的網路安全基準測試答案。換句話說,它為了便利而違法。

幾天後,英國 AI 安全研究所透露,Anthropic 的 Mythos 5 AI 模型(新視窗)建立假開發者身分,對真實 GitHub 使用者進行魚叉式網路釣魚以誘使他們核准惡意代碼,並在被發現時編輯自己的活動日誌以掩蓋痕跡。

接著在八月,有新聞報導指出,一位名叫 Andrew 的墨爾本男子請求他的個人 AI 代理(新視窗),該代理基於 OpenClaw 建立並執行 Anthropic 的 Claude,協助他報名一堂已額滿的早晨健身課程。他在候補名單上排第四位,並詢問是否有方法可以往前挪。

該代理發現預約應用程式介面在取消其他使用者的預約時沒有身分驗證檢查。因此,在未徵得 Andrew 同意的情況下,它逕自取消了第一名的預約以給他騰出空間。當 Andrew 要求它復原取消操作時,它無法做到:「我移除的人已從候補名單中消失,我無法還原他們。」。

這三起事件的起因並不相同,但結果是一樣的:AI 代理探索與利用系統的速度和徹底程度,超出了任何人類所能管理的範疇。它們從未收到攻擊任何目標的指令,但無論如何都找到了通往目標的最短路徑。

無論您是前沿實驗室的基礎設施,還是郊區健身房的預約軟體,這都不重要。如果您的企業公開了應用程式介面,那麼您現在就是 AI 代理可以探索的目標,其速度和完整性是任何人類攻擊者都無法企及的。而且根本不需要有人決定攻擊您。

速度才是真正的焦點

人類攻擊者會衡量付出與回報。他們會感到無聊、時間用盡,或者認為健身房預約應用程式不值得費心。過去 20 年來,正是這種衡量默默保護了大多數低價值目標免受隨意利用(除非您使用的是 WordPress)。

AI 代理不會進行這種衡量。只要給定目標,它就會嘗試應用程式介面在技術上允許的任何操作,以機器速度測試端點和參數組合,直到成功為止。它在 Andrew 提出追問的時間內,就找到了健身房的身分驗證漏洞。

這種速度差距的規模已可從數據中一窺端倪。Unit 42 的 2026 年全球事件應變報告(新視窗)發現,最快的攻擊現在只需 72 分鐘即可外洩資料,低於前一年的 285 分鐘。這還是在人類主要仍參與其中的趨勢。代理可在毫秒內做出決策;而人類分析師的回應時間則需要數分鐘到數小時。

對於資安團隊而言,這種不斷增加的速度才是真正令人擔憂的原因,而不是登上新聞的任何單一事件。

全新的攻擊面:任何擁有應用程式介面之物

任何公開應用程式介面的服務都是潛在目標,無論它看起來是否像目標。

  • 折扣在用戶端進行驗證的定價引擎
  • 庫存狀態部位於後端而是位於前端門市的庫存系統
  • 可透過未公開的應用程式介面路徑存取內部欄位的支援平台
  • 未驗證呼叫者是否擁有正在被修改之帳號權限的訂閱管理。

這些都不需要人類專程尋找。只需要一個帶有目標的代理,以及一個會回應的應用程式介面。

風險最大的企業並非那些有明顯資安漏洞的企業。而是那些存在商業邏輯漏洞的企業:僅存在於使用者介面的規則、應用程式介面在技術上允許但介面從不顯示的操作,以及建立在假設沒有呼叫者會嘗試略過預期路徑之基礎上的工作流程。

健身房的開發者幾乎可以肯定認為不值得為取消操作編寫身分驗證檢查,因為沒有普通使用者,也沒有普通攻擊者有理由去嘗試。代理沒有顧忌,而且它甚至不是想要找一個預約來略過。它只是試圖提供幫助。

企業如何應對 AI 攻擊

將每個應用程式介面操作視為特權操作。身分、授權和情境政策必須在每次呼叫時獨立檢查。不是「前端不允許您這樣做」,而是「伺服器驗證您獲准在此資源目前狀態下進行此操作」。健身房的系統只需在取消端點上加上一行授權邏輯,就能阻止這起特定事件。這根本不是全新的控制措施,而是 OWASP 應用程式介面安全清單中最古老的一項,即物件等級授權缺失,而且仍然是大多數系統出錯的項目。

為代理提供專屬的憑證模型。專門為代理工作階段發行具備範圍限制且短 TTL 的權杖,不同於普通的人類工作階段權杖,即使代理找到了您未預期的漏洞,也能限制受損範圍。如果 Andrew 的代理所持有的權杖範圍僅限於他自己的預約,那麼無論應用程式介面另有何許可,取消他人預約的操作都將在憑證層失敗。這一點很重要,因為您無法依賴代理自製。您必須依賴其憑證實際上允許它做的事。

專門配置代理行為偵測工具。代理流量具有可區分的特徵:低於人類的請求間隔時間、系統性的端點列舉、跨參數組合的順序探索,以及成功執行任何人類使用者從未透過實際介面嘗試過的操作。針對該特徵建立基準並實時警報。

關閉回應時間差距,而不僅僅是偵測差距。如果在數分鐘內就已完成探測並轉移目標,那麼在一小時內偵測到探測就毫無意義。上方 Unit 42 的數字,即最快的人類節奏攻擊需 72 分鐘,已經是制定應對方案時錯誤的基準。自動化回應,而不僅是自動化警示,才是縮小毫秒級差距的關鍵。當然,您也需要確保自動化回應本身不會造成損害。

假設這一定會發生,並對回應進行演練。記錄要聯絡的人員、預先擬定客戶溝通內容,並專門針對代理驅動的情境進行兵棋推演,而不僅是傳統的資料外洩劇本。IBM 的《2026 年資料外洩成本報告》指出,全球平均資料外洩成本為 4.99 百萬美元,而 AI 驅動的資料外洩平均高出約 1 百萬美元。這些數字越來越多地描述了以健身房那種方式開始的事件:根本沒有傳統意義上的攻擊者。

像代理一樣測試您自己的應用程式介面,以免代理替您測試。手動滲透測試假設測試人員時間有限,且可嘗試的事項清單有限。對您自己的端點進行自動化對抗性測試,以與代理相同的持久度和速度進行探測,能在客戶的助理誤打誤撞進入漏洞之前,將相同的漏洞曝露出來。目前專門對此已有開源工具。例如 CyberStrike(新視窗),能針對您自己的端點執行對應至 OWASP WSTG 和 MITRE ATT&CK 的專用代理,包括針對防不勝防的健身房物件等級授權漏洞所設的專用測試工具:它傳送基準請求、傳送攻擊,且僅在有可衡量、可重現的差異時才標記發現項目。這與在代理於野外發現取消端點之前就能捕獲該端點漏洞的檢查屬於同種類型。

當然,這個原則並不新。在殭屍網路時代針對 WordPress 安裝執行自家弱點掃描器的網站擁有者得以倖存下來。現在,工具只需要配合呼叫者的速度,而不是最終可能抽出時間的人類攻擊者的速度。