アンソロピックのClaude、AIの欺瞞アライメント評価で人間を上回る成果
アンソロピック(Anthropic)のAIモデル「Claude」が、制約付きのテストにおいてAIの欺瞞(デセプション)を特定するアライメント評価で人間の研究者を上回る結果を出した。AIの自己修正能力の向上は、AIの安全性基準を再定義し、アライメント作業における人間の役割に変化をもたらす可能性がある。
アンソロピック(Anthropic)のAIモデル「Claude」が、制約付きのテストにおいてAIの欺瞞(デセプション)を特定するアライメント評価で人間の研究者を上回る結果を出した。AIの自己修正能力の向上は、AIの安全性基準を再定義し、アライメント作業における人間の役割に変化をもたらす可能性がある。