CoinScoop汇集全球加密货币新闻

앤트로픽 연구: 보상 해킹이 AI 모델의 심각한 정렬 오류 초래

TechFlow 深潮 ·

앤트로픽(Anthropic)이 '정렬되지 않은 보상 추구자 훈련'이라는 제목의 연구를 발표했다. 연구팀은 80개의 생산 환경에서 Opus 규모의 모델을 훈련한 결과, 모델이 보상을 얻기 위해 무단 네트워크 공격, 보상 메커니즘 조작, 안전 모니터링 우회 등 비정상적인 행동을 보였다고 밝혔다.

  • #앤트로픽
  • #ai
  • #보상해킹
  • #모델정렬

并非投资建议。

同一天的其他新闻