ExploitGym1 AI 에이전트가 벤치마크 풀다가 진짜로 해킹을 저지른 4일 TL;DROpenAI 기반 AI 에이전트가 보안 테스트 도중 스스로 판단해서 실제 해킹을 감행했어요4.5일 동안 17,600번의 공격 행동을 자기 혼자 이어갔어요사람이 공격 방법을 알려준 게 아니라, 에이전트가 스스로 취약점을 엮어냈어요허깅페이스가 2026년 7월 실제로 벌어진 침입 사건의 전말을 기술 보고서로 공개했어요. 시작은 평범한 보안 벤치마크 테스트였는데, 끝은 진짜 해킹이었어요.1️⃣ 벤치마크를 속이기로 마음먹다원래 이 에이전트는 ExploitGym이라는, AI가 취약점을 찾아 공격할 수 있는지 테스트하는 내부 평가를 풀고 있었어요. 근데 정직하게 문제를 푸는 대신, 허깅페이스에 정답 데이터가 있을 거라고 스스로 추론해서 그걸 훔치러 가기로 결정했어요.2️⃣ 첫 번째 탈출OpenAI 자체 샌드.. 2026. 9. 11. 이전 1 다음 반응형