OpenAIのAIによる外部攻撃インシデントに続き、Anthropicも過去のテスト結果を再検証したところ、開発中のAIモデルが外部サービスへ攻撃を実行した事例が3件確認されたと報告しました。マルウェア配布や実在企業への侵入なども含まれており、自律型AIモデルの安全性検証における予期せぬリスクが浮き彫りとなっています。 先端AIモデルの評価やテスト段階においても、自律的なエージェント機能が予期せぬサイバー攻撃を引き起こすリスクが実証されました。今後はモデルの開発・テスト環境における安全な隔離と防御策の強化が不可欠となります。