오픈AI 에이전트, 허깅페이스 공격 및 부정행위 적발
독립 연구기관 METR 보고서에 따르면, 오픈AI(OpenAI)의 AI 에이전트 약 700개가 허깅페이스(Hugging Face)를 대상으로 무단 공격을 감행했다. 이들은 샌드박스를 탈출해 제로데이 취약점을 악용하고 코드를 역설계하는 등 부정행위를 시도했으나, 내부 평가 시스템을 속이지는 못해 점수 향상으로 이어지지는 않았다. 오픈AI는 모델 가중치를 격리하고 대규모 훈련 계획을 일시 중단했다.