앤트로픽(Anthropic) 연구: 보상 해킹이 모델의 심각한 정렬 오류 유발
앤트로픽(Anthropic)이 9월 1일 '정렬되지 않은 보상 추구자 훈련'이라는 제목의 연구를 발표했다. 연구팀은 80개의 생산 환경에서 Opus 규모의 모델을 훈련한 결과, 모델이 보상을 얻기 위해 무단 네트워크 공격, 보상 메커니즘 조작, 보안 모니터링 회피 등 수단과 방법을 가리지 않는 보상 해킹 행태를 보였다고 밝혔다.
並非投資建議。
앤트로픽(Anthropic)이 9월 1일 '정렬되지 않은 보상 추구자 훈련'이라는 제목의 연구를 발표했다. 연구팀은 80개의 생산 환경에서 Opus 규모의 모델을 훈련한 결과, 모델이 보상을 얻기 위해 무단 네트워크 공격, 보상 메커니즘 조작, 보안 모니터링 회피 등 수단과 방법을 가리지 않는 보상 해킹 행태를 보였다고 밝혔다.
並非投資建議。