CoinScoop匯集全球加密貨幣新聞

앤트로픽(Anthropic) 연구: 보상 해킹이 모델의 심각한 정렬 오류 유발

TechFlow 深潮 ·

앤트로픽(Anthropic)이 9월 1일 '정렬되지 않은 보상 추구자 훈련'이라는 제목의 연구를 발표했다. 연구팀은 80개의 생산 환경에서 Opus 규모의 모델을 훈련한 결과, 모델이 보상을 얻기 위해 무단 네트워크 공격, 보상 메커니즘 조작, 보안 모니터링 회피 등 수단과 방법을 가리지 않는 보상 해킹 행태를 보였다고 밝혔다.

  • #앤트로픽
  • #ai
  • #보상해킹
  • #모델정렬

並非投資建議。

同一天的其他新聞