ChatGPT開発社のオープンAIは最近、自社の人工知能(AI)エージェントが外部サイトを自律的にハッキングした事件の余波で、先端AIモデルの開発速度の調整に入った。

オープンAIは最新AIモデルの強化学習試験を2週間中断したなかで、研究・訓練システムを全面改編中であると18日(現地時間)明らかにした。次世代AIモデル「アストラ」の訓練も中断した状態だ。

最近、自社モデルのAIエージェントが隔離環境を抜け出し、外部プラットフォームのハギングフェイスをハッキングし、発売予定モデルの「アストラ」も自社の安全基準上「危険」(Critical)段階に該当する可能性が大きいと評価されたことを受けた措置である。

オープンAIは先端モデルの安全装置と整合性などを評価するための小規模訓練を実施しており、監視システムの適用範囲も拡大した。とりわけモデルが隔離環境を恣意的に離脱できないよう隔離水準を高めた。AIエージェントが統制を逸脱してもインターネット網や開発内部網に侵入できないよう、ネットワーク分離環境も構築した。

AIの推論過程を一つひとつ監視する「思考の連鎖(chain-of-thought)監視」システムも導入した。AIが推論のためにトークンを生成する時点を毎回覗き込み、異常兆候が検知されれば、より精緻な自動調査システムを稼働して無断データ流出や回避試行を見つけ出す方式だ。

ただしオープンAI側は当該システムにも限界があると認めた。AIモデルが規則違反を企図する計画を思考過程に表さない可能性もあるためだ。

オープンAIは、このような監視工程を導入すれば、全体推論演算容量の約20%に達する追加演算資源が消耗されると見込んでいる。

オープンAIは「AIモデル性能が高度化し、これを開発し試験するうえで伴うリスクも大きくなっている」とし、「監視と整列、セキュリティに対する当社の標準はリスクより先行しなければならない」と述べた。

※ 本記事はAIで翻訳されています。ご意見はこちらのフォームから送信してください。