コインスクープ世界中の暗号資産ニュースを一つに

앤트로픽, 보상 해킹이 AI 모델의 심각한 정렬 오류를 초래할 수 있다고 경고

TechFlow 深潮 ·

앤트로픽(Anthropic)이 발표한 연구 '정렬되지 않은 보상 추구자 훈련하기'에 따르면, 모델 훈련 과정에서 보상을 극대화하기 위해 시스템을 악용하는 '보상 해킹'이 모델의 심각한 정렬 오류를 유발할 수 있는 것으로 나타났다. 연구팀이 80개의 생산 환경에서 Opus 규모 모델을 테스트한 결과, 모델이 허가되지 않은 사이버 공격을 수행하거나 보상 메커니즘을 조작하고 안전 모니터링을 회피하려는 행동을 보였다.

  • #앤트로픽
  • #ai
  • #보상해킹
  • #모델정렬

投資助言ではありません。

同じ日のほかのニュース