DeepSeek(ディープシーク)ロゴ画像。/聯合ニュース

米国政府はDeepSeek(ディープシーク)やアリババなどの中国の人工知能(AI)企業が、OpenAI・AnthropicなどのAIモデルに迂回接続して回答を大量収集し、これを自社モデルの開発に活用したと公式発表した。中国企業が米国の先端AIを対象に「蒸留」活動を展開し、研究・開発に要する費用と時間を削減したということだ。

米国家安全保障局(NSA)と連邦捜査局(FBI)、サイバーセキュリティ・インフラセキュリティ庁(CISA)は8日(現地時間)に共同報告書を公表し「中国のAI企業が産業規模の攻撃的かつ悪意ある蒸留活動を展開している」と明らかにした。

蒸留は性能が優れた大規模AIを「教師モデル」として、より小型または性能が低い「学生モデル」を訓練する技術である。教師モデルに多数の問題を提示し、そこで得た回答と解法過程を学生モデルの学習データとして用いる方式だ。AIモデルを小型かつ低コストにするため広く活用される技術だが、米政府は中国企業が米国AI企業の許可なく回答を大量収集し自社モデルの学習に利用したと指摘した。

米国政府が名指しした企業はDeepSeek(ディープシーク)とムーンショットAI、アリババ、ミニマックス、ステップファン、Z.AIの6社である。これらは2024年末からOpenAIのGPT、AnthropicのClaude、グーグルのGemini、xAIのGrokなどに数百万回の問い合わせを送り、数十億個のトークンを収集したと調査された。米政府は、これらが収集した回答と問題の解法過程を学習データとして活用し、自社AIモデルの性能を引き上げたと判断した。

とりわけ中国ではOpenAIとAnthropicのモデルを公式には利用できない。米当局は、中国のAI企業がこれを回避するため、いわゆる「転送所(transfer station)」と呼ばれる中継網まで動員したと説明した。中国の利用者がシンガポールなど海外の転送所にリクエストを送ると、現地サーバーと偽アカウントが代わって米国のAIに接続し、回答を受け取って転送する構造だ。これらは複数のアカウントやクラウド事業者に要求を分散し、特定のアカウントが遮断されると別経路に自動切り替えする方式で、実際の利用主体を隠したと調査された。

米国政府は、蒸留が中国AI企業の単なる補助手段ではなく、モデル開発の中核基盤だと主張した。先端AI半導体の輸出統制でコンピューティング資源が不足した中国企業が、多大な費用を投じて開発された米国のAIモデルの出力を活用し、試行錯誤と訓練コストを抑えたということだ。報告書は、こうした活動が中国政府の認知の下で行われた可能性が高いと分析した。

米当局は自国のAI企業に対し、偽アカウントの検知と利用量制限を強化するよう勧告した。悪性の蒸留活動を行っていると疑われるアカウントには、性能の低いモデルの回答を提供したり、応答にノイズを混ぜる案も示した。攻撃者が品質の低いデータを正常な回答と誤認して学習するよう仕向け、蒸留の効果を下げる狙いだ。

※ 本記事はAIで翻訳されています。ご意見はこちらのフォームから送信してください。