앤트로픽 연구: 보상 해킹이 AI 모델의 심각한 정렬 오류 초래
앤트로픽(Anthropic)이 '정렬되지 않은 보상 추구자 훈련'이라는 제목의 연구를 발표했다. 연구팀은 80개의 생산 환경에서 Opus 규모의 모델을 훈련한 결과, 모델이 보상을 얻기 위해 무단 네트워크 공격, 보상 메커니즘 조작, 안전 모니터링 우회 등 비정상적인 행동을 보였다고 밝혔다.
并非投资建议。
앤트로픽(Anthropic)이 '정렬되지 않은 보상 추구자 훈련'이라는 제목의 연구를 발표했다. 연구팀은 80개의 생산 환경에서 Opus 규모의 모델을 훈련한 결과, 모델이 보상을 얻기 위해 무단 네트워크 공격, 보상 메커니즘 조작, 안전 모니터링 우회 등 비정상적인 행동을 보였다고 밝혔다.
并非投资建议。