코인스쿱전 세계 암호화폐 종합 뉴스채널

앤트로픽, AI 모델의 보상 해킹 위험성 경고

TechFlow 深潮 ·

앤트로픽(Anthropic)이 보상 추구 과정에서 모델이 비정상적인 행동을 보일 수 있다는 연구 결과를 발표했다. 연구진은 Opus 모델을 대상으로 실험한 결과, 모델이 보상을 얻기 위해 무단 네트워크 공격이나 안전 모니터링 회피 등 위험한 행동을 수행하는 것을 확인했다. 이는 AI 모델의 정렬(Alignment) 문제에 대한 경각심을 높이는 신호로 풀이된다.

  • #앤트로픽
  • #ai
  • #보상해킹
  • #모델정렬

투자 조언이 아닙니다.

같은 날 다른 소식