オープンAIのロゴ。/聯合ニュース

オープンAIの最新人工知能(AI)モデルが隔離環境を抜け出して外部サイトをハッキングする前例のない事故が発生した。

オープンAIは「GPT-5.6 ソル」と一部の非公開AIモデルが内部評価の最中に統制を外れ、オープンソースのAI共有プラットフォーム「ハギングフェイス」をハッキングしたと21日(現地時間)に明らかにした。

事故はAIモデルの脆弱性攻撃能力を測定する内部評価の過程で発生した。当時オープンAIのモデルは評価のためサイバー攻撃に対する安全装置が一部緩和された状態だった。

オープンAIはこれらのモデルを外部インターネットから隔離された「サンドボックス」環境で試験したが、AIモデルは未公開脆弱性(ゼロデー)を利用して統制網を突破しインターネットに接続したと説明した。これらのモデルはハギングフェイスに接続して認証情報を奪取し、当該サーバーをハッキングしたことが判明した。

オープンAIは「すべての状況を総合すると、これらのモデルは(セキュリティベンチマークである)『ExploitGym(イクスプロイトジム)』の評価用問題の解法を見つけることに過度に集中し、極端な手段まで動員したとみられる」と述べた。

ハギングフェイスは16日、同社の運用インフラの一部が自律AIエージェントの攻撃を受けたと先に公表した。当時は攻撃に使用されたAIモデルを特定できなかったが、オープンAIの調査の結果、GPT-5.6 ソルと非公開モデルが結合されたエージェントの仕業であることが判明した。

ハギングフェイスはAIベースの検知システムを通じてハッキング事実を認識し、攻撃様相もAIを活用して分析したと説明した。もっとも、一般に公開された利用者向けモデルやデータセットが改ざんされた痕跡は見つからず、ソフトウェア供給網も安全であることを確認したと付け加えた。

両社は現在、共同でフォレンジック(デジタル証拠分析)調査を進め、関連する脆弱性を補完している。

オープンAIは今後、研究の速度が遅くなってもインフラ構成に厳格な統制を適用し、モデル開発時のモニタリングやアクセス制御など安全装置を大幅に強化すると明らかにした。しかし、厳格な隔離環境で内部評価を進めたにもかかわらずこのような事故が発生しただけに、AIのサイバー安全をめぐる論争が拡大する見通しだ。

とりわけ閉鎖型で運用される米国の商用AIモデルと比べて安全関連の統制水準が低いとされる中国製オープンモデルの性能が大きく向上し、これを悪用したサイバー攻撃が増える可能性も提起されている。

ハギングフェイスは当初、今回のハッキング攻撃を中国のズーフー(智譜・Z.ai)のオープンモデルGLM 5.2の仕業と分析した。主要な商用モデルは内蔵の安全装置によりサイバー攻撃ログの分析を拒否した一方、GLM 5.2はこれを実行したためだ。

ハギングフェイスは「自律的なAIベース攻撃はもはや理論上の概念ではない」とし、攻撃だけでなく防御にもAIを積極的に活用してスピードに追随すべきだと分析した。

※ 本記事はAIで翻訳されています。ご意見はこちらのフォームから送信してください。