기사 원문 - https://www.tomshardware.com/tech-industry/artificial-intelligence/openai-agent-goes-rogue-and-hacks-popular-ai-community-left-escape-plans-for-future-models-inside-the-companys-infrastructure
 

로이터 통신은 소식통을 인용해 오픈아이얼(OpenAI)의 테스트 환경을 탈출해 허깅페이스(Hugging Face)를 공격한 자율 AI 에이전트가 약 일주일 동안 공격자로 확인되지 않았다고 보도했습니다 . 이 정보가 정확하다면, 이는 오픈아이얼뿐만 아니라 자율 AI 에이전트가 자율적으로 작동하도록 설계된 AI 업계 전반에 걸쳐 오픈아이얼의 첨단 AI 시스템 관리 및 안전 관행에 대한 의문을 제기합니다.

로이터 통신 에 따르면, 이 사건은 7월 9일경 자율 에이전트가 오픈AI의 격리된 테스트 환경에서 탈출을 시도하면서 시작되었습니다 . 이틀 후인 7월 11일, 해당 에이전트는 허깅페이스(Hugging Face)에 침투하기 시작했고, 허깅페이스 공동 설립자인 토마스 울프에 따르면 7월 13일까지 침입이 계속되었습니다. 보고서에 따르면, 오픈AI는 허깅페이스가 7월 16일 자율 AI 에이전트의 공격 사실을 공개하기 전까지 자사 시스템이 공격의 원인임을 인지하지 못했습니다. 7월 18일과 19일 주말 동안 오픈AI 조사관들은 내부 로그에서 에이전트가 테스트 환경에서 탈출했다는 증거를 발견했다고 보고서는 전했습니다. 오픈AI가 허깅페이스에 이 사실을 알렸을 때는 이미 허깅페이스가 FBI에 사건을 신고한 후였습니다. 그리고 7월 21일, 오픈AI는 공식적으로 이 사건을 인정했습니다.

로이터 통신 에 따르면, 오픈AI가 침해 사실을 발견하는 데 일주일 이상 걸린 이유 중 하나는 오픈AI가 일반적으로 여러 고급 모델을 동시에 평가하기 때문이며, 이러한 평가 과정에서 생성되는 엄청난 양의 원격 측정 데이터로 인해 단일 악성 AI 에이전트를 식별하기 어렵기 때문입니다 .

로이터 통신에 따르면, 테스트에 사용된 AI 에이전트는 사이버 보안 작업을 위해 설계되었으며, GPT-5.6 Sol과 더욱 강력한 미공개 OpenAI 모델을 결합한 것이라고 합니다. 이번 침해 사고 이전에도 연구원들은 테스트 과정에서 비정상적인 동작을 관찰한 바 있습니다. 한 사례에서는 에이전트가 향후 버전에서 OpenAI의 내부 제한을 우회하는 방법을 설명하는 지침을 남긴 것으로 알려졌습니다. 또 다른 사례에서는 모니터링 메커니즘을 비활성화하기도 했습니다. 한편, 이러한 이전 사건들이 허깅 페이스 공격을 담당한 에이전트와 직접적인 연관이 있는지는 아직 불분명합니다.

로이터 통신 이 인터뷰한 사이버 보안 전문가들은 이번 사건이 점점 더 자율화되는 AI 시스템의 미해결 문제를 드러낸다고 지적했습니다. 세계윤리데이터재단(WEDF)의 말리 스미스는 오픈AI가 해당 에이전트의 행동을 감지하지 못한 것인지, 아니면 막을 수 없었던 것인지 의문을 제기하며, 두 가지 가능성 모두 우려스럽다고 주장했습니다. 팰리세이드 리서치의 제프리 라디쉬는 이번 사건을 계기로 오픈AI뿐만 아니라, 점점 더 강력한 모델을 배포하는 주요 AI 개발사들이 보안 에 충분한 투자를 할 의향이 있는지에 대한 면밀한 검토가 필요하다고 말했습니다. 그는 또한 궁극적으로 정부의 감독이 필요할 수 있다고 덧붙였지만, 정부가 이처럼 역동적인 산업의 발전을 저해하지 않고 어떻게 감독할 수 있을지에 대해서는 구체적인 방안을 제시하지 않았습니다.