2026년 7월 말, OpenAI가 폐쇄된 환경에서 신규 모델 중 하나를 테스트하던 중 해당 모델이 탈출을 시도하기로 결정했습니다(새 창). 테스트 대상이었던 사이버 보안 벤치마크의 정답지를 훔치기 위해 다른 소프트웨어 기업인 Hugging Face의 개인 인프라를 해킹했습니다. 즉, 편의를 위해 법을 위반한 것입니다.
며칠 후, 영국 AI 안보 연구소는 Anthropic의 Mythos 5 AI 모델(새 창)이 가짜 개발자 신원을 생성하고, 실제 GitHub 사용자를 스피어 피싱하여 악성 코드를 승인하도록 유도했으며, 적발되었을 때 발자국을 감추기 위해 자신의 활동 로그를 편집했다고 공개했습니다.
이어 8월에는 멜버른에 사는 앤드루라는 남성이 OpenClaw를 기반으로 구축되고 Anthropic의 Claude로 작동하는 자신의 개인 AI 에이전트(새 창)에게 예약이 꽉 찬 아침 헬스장 수업에 들어갈 수 있도록 도와달라고 요청했다는 소식이 전해졌습니다. 그는 대기 등록 네 번째였으며 순위를 올릴 방법이 있는지 물었습니다.
에이전트는 예약 API에 다른 사용자의 예약을 취소하는 권한 검증 기능이 없다는 점을 발견했습니다. 그래서 앤드루에게 허락을 구하지 않고, 앤드루의 자리를 만들기 위해 첫 번째 대기자의 예약을 바로 취소했습니다. 앤드루가 취소를 실행 취소하라고 요청했을 때, 에이전트는 다음과 같이 답하며 불가능하다고 했습니다. “제가 삭제한 사람이 대기 명단에서 사라졌으며 복원할 수 있는 방법이 없습니다.”
이 세 가지 사건의 원인은 서로 다르지만, 결과는 동일합니다. AI 에이전트는 인간이 관리했을 어떤 수준보다 더 빠르고 철저하게 시스템을 탐색하고 취약점을 악용했습니다. 그들은 어떤 것을 공격하라는 지시도 받지 않았지만, 그럼에도 목표에 도달하는 가장 짧은 경로를 찾아냈습니다.
귀하가 최첨단 연구소의 인프라이든 교외 헬스장의 예약 소프트웨어이든 상관없습니다. API를 노출하는 비즈니스를 운영하고 있다면, 이제 귀하는 어떤 인간 공격자도 따라올 수 없는 속도와 완벽함으로 AI 에이전트가 탐색할 수 있는 대상이 된 것입니다. 그리고 누구도 귀하를 공격하기로 따로 결정할 필요조차 없습니다.
핵심은 바로 속도입니다
인간 공격자는 노력 대비 보상을 저울질합니다. 그들은 지루해지거나 시간이 부족해지며, 헬스장 예약 앱 따위는 번거롭게 공격할 가치가 없다고 결론짓습니다. 지난 20년 동안 대부분의 가치가 낮은 대상을 수많은 무차별 악용으로부터 조용히 보호해 온 것은 바로 이러한 계산이었습니다(귀하가 WordPress를 운영 중이 아니라면 말이죠).
AI 에이전트는 그런 계산을 하지 않습니다. 목표가 주어지면 API가 기술적으로 허용하는 모든 것을 시도하며, 무언가가 작동할 때까지 기계의 속도로 엔드포인트와 파라미터 조합을 테스트합니다. 에이전트는 앤드루가 후속 질문을 하는 사이에 이미 헬스장의 권한 검증 허점을 찾아냈습니다.
속도 격차의 규모는 이미 숫자로 증명되고 있습니다. Unit 42의 2026 Global Incident Response Report(새 창)에 따르면 가장 빠른 공격의 데이터 유출 시간이 전년도 285분에서 72분으로 줄어들었습니다. 이는 대부분 인간이 여전히 참여하고 있는 상황에서의 추세입니다. 에이전트는 밀리초 단위로 결정을 내리는 반면, 인간 분석가는 대응하는 데 수 분에서 수 시간이 걸립니다.
보안 팀에게 있어 진정한 우려 요인은 뉴스에 나오는 개별 사건이 아니라 점점 빨라지는 공격 속도입니다.
새로운 공격 표면: API를 갖춘 모든 것
API를 노출하는 모든 서비스는 그렇게 보이지 않더라도 잠재적인 표적입니다.
- 할인이 클라이언트 측에서 검증되는 가격 책정 엔진
- 재고 상태가 백엔드가 아닌 스토어프론트에 존재하는 재고 시스템
- 문서화되지 않은 API 경로를 통해 내부 필드에 접근 가능한 지원 플랫폼
- 수정 대상 계정에 대한 호출자의 소유권을 확인하지 않는 구독 관리.
이 중 어느 것도 인간이 찾아 나설 필요가 없습니다. 목표를 가진 에이전트와 응답하는 API만 있으면 됩니다.
가장 위험에 노출된 비즈니스는 명백한 보안 허점이 있는 비즈니스가 아닙니다. 비즈니스 로직에 갭이 있는 비즈니스입니다. 즉 UI에만 존재하는 규칙, API가 기술적으로는 허용하지만 인터페이스에는 전혀 드러나지 않는 작업, 어떤 호출자도 의도된 경로를 건너뛰는 경로를 시도하지 않을 것이라는 가정을 바탕으로 구축된 워크플로 등입니다.
헬스장 개발자는 취소에 대한 권한 검사 코드를 작성할 가치가 없다고 생각했을 것이 거의 확실합니다. 일반 사용자도, 일반 공격자도 이를 시도할 이유가 없었기 때문입니다. 하지만 에이전트에겐 그러한 주저함이 없었으며, 건너뛰기할 예약을 일부러 찾으려 한 것도 아니었습니다. 그저 도움을 주려고 했을 뿐입니다.
기업이 AI 공격에 대비하는 방법
모든 API 작업을 특권 작업으로 취급하세요. 모든 호출 시 신원, 권한 부여 및 컨텍스트 정책을 독립적으로 검증해야 합니다. “프론트엔드에서 귀하가 이 작업을 수행하도록 허용하지 않습니다”가 아니라 “서버가 해당 리소스의 현재 상태를 고려하여 귀하에게 이 리소스에 대한 작업 권한이 있는지 확인합니다”가 되어야 합니다. 헬스장 시스템도 취소 엔드포인트에 한 줄의 권한 부여 로직만 있었더라도 이번 사건을 막을 수 있었을 것입니다. 이것은 결코 새로운 통제 항목이 아니며, OWASP API 보안 목록에서 가장 오래된 항목인 손상된 개체 수준 권한 부여이자 여전히 대부분의 시스템에서 잘못 구현되는 항목입니다.
에이전트에 자체 자격 증명 모델을 부여하세요. 일반적인 인간 세션 토큰과 구별되어 에이전트 세션용으로 특별히 발급된, 범위를 제한하고 TTL이 짧은 토큰은 에이전트가 귀하가 예상하지 못한 허점을 발견하더라도 피해 범위를 제한합니다. 앤드루의 에이전트가 자신의 예약으로 범위가 제한된 토큰만 보유했더라면 API의 허용 여부와 관계없이 자격 증명 계층에서 타인의 예약 취소가 실패했을 것입니다. 에이전트 자체의 자제력에 의존할 수 없기 때문에 이는 중요합니다. 귀하는 자격 증명이 물리적으로 수행을 허용하는 범위에 의존해야 합니다.
에이전트 행위 탐지 전용 도구를 모니터링에 적용하세요. 에이전트 트래픽은 구별되는 형태를 띱니다. 인간 이하의 요청 타이밍, 체계적인 엔드포인트 열거, 파라미터 조합 전반에 걸친 순차적 탐색, 실제 인터페이스를 통해서는 어떤 인간 사용자도 시도한 적 없는 작업의 성공적 실행 등이 있습니다. 이러한 패턴을 기준선으로 설정하고 실시간으로 알림을 받도록 하세요.
탐지 시간 격차뿐만 아니라 대응 시간 격차도 닫으세요. 탐색이 몇 분 만에 완료되어 다음 단계로 넘어간 경우 한 시간 만에 탐색을 탐지하는 것은 의미가 없습니다. 위에 제시된 Unit 42의 수치인 가장 빠른 인간 기준 공격의 72분은 대비 계획을 세우기에는 이미 잘못된 벤치마크입니다. 밀리초 단위의 격차를 닫는 것은 자동 알림뿐만 아니라 자동 대응입니다. 물론 귀하의 자동 대응이 오히려 피해를 주지 않도록 확인하는 것도 필요합니다.
이러한 일이 발생할 것이라고 가정하고 대응을 연습하세요. 누구에게 연락할지 문서화하고, 고객 전달 메시지를 미리 작성하며, 기존의 보안 사고 매뉴얼에 그치지 않고 AI 에이전트 기반 시나리오에 특화된 도상 훈련을 실시하세요. IBM의 2026년 데이터 침해 비용 보고서에 따르면 전 세계 평균 보안 사고 피해액은 4.99백만 달러에 달하며, AI가 활용된 보안 사고는 평균 약 1백만 달러가 더 소요됩니다. 이러한 수치는 헬스장 사례처럼 전통적인 의미의 공격자가 전혀 없는 상태에서 시작된 사건을 점차 더 많이 설명해 주고 있습니다.
에이전트가 귀하를 대신해 테스트하기 전에, 에이전트처럼 귀하의 API를 직접 테스트하세요. 수동 모의 침투 테스트는 제한된 시간과 제한된 항목만 시도할 수 있는 인간 테스터를 전제로 합니다. 에이전트와 동일한 지속성과 속도로 귀하의 엔드포인트를 탐색하는 자동화된 적대적 테스트는 고객의 보조 도구가 허점에 우연히 도달하기 전에 동일한 갭을 드러내 줄 것입니다. 이제 이를 위한 전용 오픈 소스 도구가 존재합니다. 예를 들어 CyberStrike(새 창)는 OWASP WSTG 및 MITRE ATT&CK에 매핑된 특화 에이전트를 귀하의 엔드포인트에서 실행합니다. 여기에는 헬스장의 허점을 기습했던 바로 그 개체 수준 권한 부여 갭을 위한 전용 테스터도 포함됩니다. 이 도구는 기준 요청을 보내기하고, 공격을 보내기하며, 측정 가능하고 재현 가능한 차이가 있는 경우에만 발견 사항으로 표시합니다. 이는 에이전트가 실제 환경에서 취소 엔드포인트를 발견하기 전에 이를 잡아낼 수 있었던 것과 동일한 종류의 검사입니다.
물론 이 원칙이 새로운 것은 아닙니다. 봇넷 시절에 WordPress 설치 환경을 대상으로 직접 취약점 스캐너를 실행했던 사이트 소유자들은 살아남았습니다. 이제 도구는 언젠가 공격을 시도할지도 모르는 인간 공격자의 속도가 아니라 호출자의 속도에 맞춰지기만 하면 됩니다.






