Vào cuối tháng Bảy năm 2026, OpenAI đang thử nghiệm một trong các mô hình mới trong môi trường khép kín thì mô hình này quyết định tự thoát ra(cửa sổ mới). Mô hình đã thâm nhập vào hạ tầng riêng tư của một công ty phần mềm khác là Hugging Face để đánh cắp đáp án cho bài kiểm tra chuẩn an ninh mạng đang được thực hiện. Nói cách khác, mô hình đã vi phạm pháp luật để đạt được mục đích nhanh chóng.

Vài ngày sau, Viện An ninh AI Vương quốc Anh tiết lộ rằng mô hình AI Mythos 5 của Anthropic(cửa sổ mới) đã tạo các danh tính nhà phát triển giả mạo, tấn công giả mạo có mục tiêu người dùng GitHub thật để họ phê duyệt mã độc hại, đồng thời chỉnh sửa nhật ký hoạt động của chính mình nhằm xóa dấu vết khi bị phát hiện.

Sau đó vào tháng Tám, tin tức lan truyền rằng một người đàn ông ở Melbourne tên Andrew đã yêu cầu tác nhân AI cá nhân,(cửa sổ mới) được xây dựng trên OpenClaw và chạy Claude của Anthropic, giúp đăng ký một lớp tập gym buổi sáng đã kín chỗ. Người này đứng thứ tư trong danh sách chờ và hỏi xem có cách nào để vươn lên vị trí cao hơn không.

Đại lý AI nhận thấy API đặt chỗ không kiểm tra ủy quyền đối với việc hủy đăng ký của người dùng khác. Do đó, không cần xin phép Andrew, đại lý AI đã tự động hủy lượt đặt chỗ của người đứng đầu để nhường chỗ. Khi Andrew yêu cầu hoàn tác việc hủy, đại lý AI không thể thực hiện: “Người bị xóa đã không còn trong danh sách chờ và không có cách nào để khôi phục.”

Nguồn gốc của ba sự cố này không giống nhau, nhưng kết quả lại như nhau: các đại lý AI đã dò quét và khai thác hệ thống nhanh hơn cũng như triệt để hơn bất kỳ con người nào có thể quản lý. Dù chưa bao giờ được chỉ thị tấn công bất kỳ điều gì, chúng vẫn tìm ra đường dẫn ngắn nhất để đạt được mục tiêu.

Cho dù đó là hạ tầng của phòng thí nghiệm tiên tiến hay phần mềm đặt chỗ của một phòng gym ngoại thành thì cũng không quan trọng. Nếu một doanh nghiệp công khai API, nơi đó giờ đây trở thành mục tiêu đại lý AI có thể dò quét, với tốc độ và sự toàn diện mà không kẻ tấn công con người nào sánh kịp. Và không ai cần phải quyết định tấn công doanh nghiệp.

Tốc độ mới là yếu tố cốt lõi

Kẻ tấn công con người cân nhắc giữa công sức và phần thưởng. Họ chán nản, hết thời gian, hoặc quyết định một ứng dụng đặt chỗ phòng gym không đáng để tốn công. Phép tính đó đã lặng lẽ bảo vệ hầu hết các mục tiêu giá trị thấp khỏi bị khai thác thông thường trong 20 năm qua (trừ khi đang vận hành WordPress).

Đại lý AI không thực hiện phép tính đó. Khi được giao mục tiêu, đại lý AI sẽ thử bất kỳ điều gì API cho phép về mặt kỹ thuật, thử nghiệm các điểm cuối và tổ hợp tham số với tốc độ máy tính cho đến khi thành công. Đại lý AI đã tìm ra lỗ hổng ủy quyền của phòng gym trong khoảng thời gian Andrew đưa ra câu hỏi tiếp theo.

Quy mô của khoảng cách tốc độ đó đã hiển hiện qua các con số. Báo cáo Ứng phó Sự cố Toàn cầu năm 2026 của Unit 42(cửa sổ mới) chỉ ra rằng các cuộc tấn công nhanh nhất hiện trích xuất dữ liệu chỉ trong 72 phút, giảm so với 285 phút của năm trước. Đó là xu hướng khi con người vẫn chủ yếu tham gia vào quá trình. Tác nhân AI đưa ra quyết định tính bằng miligiây; nhà phân tích con người phản ứng mất từ vài phút đến vài giờ.

Đối với các đội ngũ an ninh, tốc độ gia tăng đó mới là nguyên nhân đáng lo ngại thực sự, chứ không phải bất kỳ sự cố đơn lẻ nào xuất hiện trên tin tức.

Bề mặt tấn công mới: mọi thứ có API

Bất kỳ dịch vụ nào công khai API đều là mục tiêu tiềm năng, dù nhìn bên ngoài có giống hay không.

  • Công cụ tính giá nơi các khoản giảm giá được xác thực ở phía máy khách
  • Hệ thống quản lý kho nơi trạng thái tồn kho nằm ở giao diện cửa hàng thay vì backend
  • Nền tảng hỗ trợ nơi các trường nội bộ có thể truy cập được thông qua các đường dẫn API không được ghi chép trong tài liệu
  • Quản lý gói đăng ký không xác minh quyền sở hữu tài khoản đang được chỉnh sửa của bên gọi.

Không có điều nào trong số này yêu cầu con người phải chủ động tìm kiếm. Chúng chỉ cần một đại lý AI có mục tiêu và một API có phản hồi.

Những doanh nghiệp dễ bị tổn thương nhất không phải là những nơi có lỗ hổng an ninh rõ ràng. Đó là những doanh nghiệp có kẽ hở về logic nghiệp vụ: các quy tắc chỉ tồn tại trên giao diện người dùng, các hành động mà về mặt kỹ thuật API cho phép nhưng giao diện không bao giờ hiển thị, quy trình công việc dựa trên giả định rằng không bên gọi nào cố thử đường dẫn bỏ qua quy trình dự kiến.

Nhà phát triển của phòng gym gần như chắc chắn nghĩ rằng việc viết kiểm tra ủy quyền đối với lệnh hủy là không cần thiết, vì không người dùng bình thường nào, và không kẻ tấn công bình thường nào, có lý do để thử. Tác nhân AI không có sự ngần ngại như vậy, và thậm chí còn không cố tìm lượt đặt chỗ để bỏ qua. Tác nhân AI chỉ đang cố gắng giúp ích.

Cách doanh nghiệp chuẩn bị ứng phó với các cuộc tấn công AI

Coi mọi hành động API là một thao tác có đặc quyền. Danh tính, ủy quyền và chính sách ngữ cảnh, được kiểm tra độc lập, trên mỗi cuộc gọi. Không phải “giao diện người dùng không cho phép làm điều này”, mà là “máy chủ xác minh quyền thực hiện hành động này, trên tài nguyên này, dựa theo trạng thái hiện tại”. Hệ thống của phòng gym lẽ ra đã ngăn chặn được sự cố cụ thể này chỉ bằng một dòng logic ủy quyền trên điểm cuối hủy đặt chỗ. Đây hoàn toàn không phải kiểm soát mới, đây là mục lâu đời nhất trong danh sách an ninh API của OWASP, ủy quyền cấp đối tượng bị phá vỡ, và vẫn là điều mà hầu hết các hệ thống mắc lỗi.

Cung cấp cho các đại lý AI mô hình thông tin đăng nhập riêng. Các mã thông báo có phạm vi và TTL ngắn được cấp riêng cho các phiên của đại lý AI, khác biệt với mã thông báo phiên của con người thông thường, sẽ thu hẹp phạm vi ảnh hưởng ngay cả khi đại lý AI tìm thấy kẽ hở không lường trước. Nếu đại lý AI của Andrew sở hữu mã thông báo chỉ giới hạn trong phạm vi lượt đặt chỗ của chính người này, việc hủy đặt chỗ của người khác sẽ thất bại ở lớp thông tin đăng nhập bất kể API cho phép điều gì khác. Điều này quan trọng vì không thể dựa vào sự tự kiềm chế của đại lý AI. Phải dựa vào những gì thông tin đăng nhập cho phép thực hiện về mặt vật lý.

Thiết lập công cụ chuyên biệt để phát hiện hành vi của tác nhân AI. Lưu lượng của tác nhân AI có hình thái riêng biệt: thời gian yêu cầu nhanh hơn con người, liệt kê điểm cuối có hệ thống, dò quét tuần tự qua các tổ hợp tham số, thực thi thành công các hành động mà không người dùng con người nào từng thử qua giao diện thực tế. Xây dựng ngưỡng cơ sở cho hình thái đó và cảnh báo theo thời gian thực.

Thắt chặt khoảng cách thời gian phản ứng, không chỉ khoảng cách phát hiện. Phát hiện việc dò quét trong một giờ là vô nghĩa nếu việc dò quét hoàn tất và chuyển sang bước tiếp theo chỉ trong vài phút. Con số của Unit 42 ở trên, 72 phút cho các cuộc tấn công nhanh nhất theo tốc độ con người, đã là tiêu chuẩn sai lầm để lập kế hoạch đối phó. Phản ứng tự động, không chỉ cảnh báo tự động, mới là điều giúp đóng khoảng cách được đo bằng miligiây. Tất nhiên, cũng cần đảm bảo phản ứng tự động không gây ra thiệt hại.

Giả định điều này sẽ xảy ra và diễn tập phản ứng. Ghi chép rõ ai sẽ được gọi, soạn thảo trước thông tin truyền thông cho khách hàng, đồng thời thực hiện các bài diễn tập trên giấy cho các kịch bản do đại lý AI dẫn dắt, chứ không chỉ các kịch bản vi phạm truyền thống. Báo cáo Chi phí Vi phạm Dữ liệu năm 2026 của IBM ước tính mức vi phạm trung bình toàn cầu là 4,99 triệu USD, trong đó các vụ vi phạm do AI hỗ trợ có chi phí trung bình cao hơn khoảng 1 triệu USD. Những con số đó ngày càng mô tả nhiều sự cố bắt đầu theo cách của phòng gym: hoàn toàn không có kẻ tấn công theo nghĩa truyền thống.

Kiểm thử các API của chính doanh nghiệp theo cách đại lý AI thực hiện, trước khi đại lý AI làm điều đó. Kiểm thử xâm nhập thủ công giả định kiểm thử viên là con người với thời gian có hạn và danh sách công việc giới hạn. Môi trường đối kháng tự động nhắm vào các điểm cuối của chính doanh nghiệp, dò quét với cùng sự kiên trì và tốc độ như đại lý AI, sẽ làm lộ ra các kẽ hở tương tự trước khi trợ lý của khách hàng tình cờ vấp phải. Hiện đã có các công cụ mã nguồn mở phục vụ riêng cho mục đích này. Ví dụ: CyberStrike(cửa sổ mới) chạy các đại lý AI chuyên biệt được ánh xạ tới OWASP WSTG và MITRE ATT&CK đối với các điểm cuối của doanh nghiệp, bao gồm công cụ kiểm thử dành riêng cho lỗ hổng ủy quyền cấp đối tượng đã khiến phòng gym bất ngờ: Công cụ gửi một yêu cầu cơ sở, gửi cuộc tấn công và chỉ đánh dấu phát hiện nếu có sự khác biệt có thể đo lường và tái hiện. Đó cùng là loại kiểm tra lẽ ra đã phát hiện ra điểm cuối hủy bỏ trước khi đại lý AI tìm thấy trong thực tế.

Tất nhiên nguyên lý này không mới. Các chủ trang web tự chạy công cụ quét lỗ hổng trên bản cài đặt WordPress thời kỳ mạng máy tính ma đã vượt qua được. Bộ công cụ hiện chỉ cần đáp ứng tốc độ của bên gọi, chứ không phải tốc độ của kẻ tấn công con người có thể rồi cũng sẽ tìm tới.