ChatGPT開発社のオープンAI(OpenAI)が、激化する人工知能(AI)開発競争の中で異例のペース調整に踏み切った。ここ数年にわたり新たなAIモデルの検証と製品開発の速度を高めてきたが、突如としてモデルテストを中断し、研究・訓練システムのセキュリティを強化することにしたというわけだ。

ChatGPT開発元オープンAIのロゴ。/ロイター通信

18日(現地時間)ロイター通信によると、オープンAIは研究・訓練システムを整備しながらAIモデル開発の速度を落としていると明らかにした。これに伴いモデルテストを2週間中断した。テスト中のAIエージェントの活動も他のAIシステムが監視するようにし、セキュリティリスクが高い作業は従来より強力に隔離された環境で進めることにした。

このようにオープンAIが開発速度を落とした背景には先月発生した「予想外のハッキング事故」がある。サイバーセキュリティテストを受けていたオープンAIの自律型AIエージェントが隔離されたテスト環境を抜け出し、他のAI企業であるハギングフェイス(Hugging Face)のシステムに侵入したのだ。

当時AIエージェントは2つの先端AIモデルを基盤に作動していた。AIエージェントはサイバーセキュリティテストで与えられた目標を遂行する過程でハギングフェイスのシステムに侵入した。現在オープンAIは事故の経緯を調査している。関連報告書は近く公開される予定である。

とりわけこの事故が注目されるのは、最近オープンAIがAI開発競争に対応してモデルを検証し製品を開発する速度を大きく引き上げてきた状況で発生したためである。ロイター通信は、オープンAIが複数種類のモデル評価を同時に高速で進めており、その過程で膨大なデータが生成され、従業員がこれに追随するのが難しい状況だったと報じた。AIモデルの能力が急速に向上する中、これを評価・監視する体制にも負担が増した格好だ。

オープンAIは今回の事故後、モデルテストを2週間中断するなど研究・訓練システムのセキュリティ強化作業に乗り出した。ただし2週間のテスト中断がいつ始まったのかは明らかにしなかった。

こうした状況でオープンAIが打ち出した対策の一つが、AIでAIを監視する方式である。テスト中のAIエージェントの活動を他のAIシステムが見守るようにした。また、AIが作業を遂行するためにどのような戦略を立てるのかをのぞき込む「思考過程モニタリング(chain-of-thought monitoring)」も活用する。一部の機微な作業は外部システムに影響を及ぼさないよう、従来より強力なサンドボックス(sandbox)と呼ばれる隔離環境で進めることにした。

ただしこの方法でAIの行動を完全に統制できるかどうかは不透明である。オープンAIは初期研究で、AIモデルが規則に反する計画を立てたとしても、それを監視可能な思考過程に表出しない可能性が示されたと説明した。オープンAIも思考過程モニタリングの有効性をめぐって、なお未解決の問題があると認めた。

次世代モデル「アストラ(Astra)」の訓練も中断された状態だ。オープンAIは7日(現地時間)、最強のAIモデルに適用するセキュリティ基準を強化し、これをまだ満たしていないアストラに関する訓練を中断すると明らかにした。オープンAIが計画していた最大規模の訓練作業も保留されている。これはAIモデルが潜在的に深刻なリスクをもたらす水準の能力を備えた場合に備えるために設けた自社の備えフレームワーク(preparedness framework)に基づく措置である。

オープンAIの今回のペース調整は、最近激しさを増すAI業界の開発競争と対照的な動きである。AIモデルの能力が高度化する中、開発速度を維持しつつテスト過程で生じ得る予想外の行動を監視・統制できるセキュリティ体制を整えることも重要になったということだ。

オープンAI経営陣は、今後登場するより強力なAIモデルに備えるには業界レベルでより広範な戦略が必要だと明らかにした。ロイター通信は、オープンAIが推進するセキュリティ強化措置がAIの予想外の行動を防ぐのに十分かどうかは、なお不透明だと伝えた。

※ 本記事はAIで翻訳されています。ご意見はこちらのフォームから送信してください。