中国オープンウェイトAIが示すサイバー規制の限界と米中競争激化
HackerOne首位が示した攻防の反転
サイバーセキュリティの現場で、AIは補助ツールから攻防の当事者へ移りつつあります。自律型AIハッカーを開発するTenzaiは、2026年3月にHackerOne上で活動を始め、90日未満でAIセキュリティ企業のビジネス向けリーダーボード首位に達したと公表しました。
この出来事の重要性は、単に「AIがバグを見つけた」という話にとどまりません。中国発のオープンウェイトモデルが高度なサイバー評価で急伸し、AIエージェントの実運用と結びつき始めたことで、国家の規制、企業の防衛、同盟国間の技術管理が同時に揺さぶられています。本稿では、公開資料と評価レポートを基に、何が新しく、どこにリスクがあるのかを読み解きます。
AIハッカーが実環境で得た検証結果
競技環境から本番バグ報奨金への移行
Tenzaiは、まずCapture the Flag型の競技でAIエージェントを検証しました。同社の発表によると、websec.fr、dreamhack.io、pwnable.tw、LakeraのAgent Breakerなど6つのプラットフォームで、12万5,000人超の人間参加者と比較して上位1%相当の成績に入ったとされています。平均実行時間は2時間弱、平均コストは12.92ドルだったとされ、専門家の時間を大量投入する従来型の侵入テストとは異なる経済性を示しました。
ただし、CTFは本番環境そのものではありません。問題は閉じた環境で設計され、採点可能な答えがあります。Tenzai自身も、上位1%という成績は「超人的能力」を意味せず、企業システムの複雑性をそのまま再現するものではないと説明しています。それでも、複数の弱点をつなぎ、失敗した仮説を捨て、別経路を探索するプロセスが自律化されつつある点は見逃せません。
その延長線上で、TenzaiはHackerOneの公開バグ報奨金プログラムにAIハッカーを投入しました。同社によれば、100件超の報告のうち、ほぼ半数が高または重大な発見として確認され、さらに約40%が中程度の発見でした。報告にはSQLインジェクション、認証不備、機微情報の露出、脆弱性の連鎖によるリモートコード実行などが含まれたとされます。
公開バグ報奨金が評価基盤になる理由
公開バグ報奨金の特徴は、標的が毎日変化し、同じ企業や研究者が同じ問題を何度も解く余地が小さいことです。静的ベンチマークであれば、学習データへの混入や評価手順への最適化が疑われます。しかし、HackerOneのような場では、先に別の研究者が報告すれば重複となり、影響説明が弱ければ評価されません。
このため、AIエージェントの能力を見るうえで、公開プログラムは厳しい実地試験になります。AIは単に脆弱なコード行を示すだけでなく、事業影響を説明し、再現手順を整え、重複や仕様上の挙動を見分ける必要があります。ここには、従来の静的解析ツールとは違う「攻撃者の作業」の一部が含まれます。
一方で、プラットフォーム側にも負荷が生まれています。HackerOneは2026年5月、AI支援による報告量増加を受け、行動規範を更新したと明らかにしました。公開プログラムやオープンソースリポジトリを対象に、複数の研究者やツールが似たスキャンを行うことで、重複や低品質報告が増えやすいという問題です。AIが防御を助けるほど、トリアージと優先順位付けの自動化もまた不可欠になります。
中国モデルを押し上げる公開戦略
GLM-5.2が越えたサイバー評価の閾値
中国のZ.aiは、GLMシリーズをオープンウェイトとして公開し、米国の閉鎖型フロンティアモデルとは異なる拡散戦略を採っています。Hugging Face上のGLM-5.2モデルカードでは、MITライセンス、100万トークン文脈、ローカル実行手順が示されており、開発者が自前の環境で利用できる設計です。
NIST傘下のCAISIは、GLM-5.2について、2026年6月16日に公開された時点で最も有力なオープンウェイトAIモデルだった可能性が高いと評価しました。特にサイバー能力については、米国のOpus 4.6に近い水準とされ、同時に「エージェント型のサイバーエクスプロイト開発を支援し得る」安全対策上の課題も指摘されています。重要なのは、オープンウェイトでは自前運用により安全フィルターが回避され得るという点です。
民間評価でも同じ傾向が見えます。Semgrepは、IDORと呼ばれるアクセス制御不備を探すベンチマークで、GLM-5.2が39%のF1スコアを記録し、Claude Codeの一部構成を上回ったと報告しました。Semgrepの専用マルチモーダルパイプラインは53〜61%とさらに高い結果でしたが、GLM-5.2は最小限のプロンプトと簡易ハーネスだけでこの成績を出した点が注目されました。
ただし、能力の見方には慎重さも必要です。Semgrepは後続検証で、各モデルが見つけた脆弱性は根拠ある推論に基づいていた一方、難しい27件のIDORのうち19件、つまり70%を全モデルが見逃したと報告しています。これは「AIが人間の専門家を不要にする」話ではなく、探索範囲を広げる道具が急速に安くなったという話です。
GLM-5.3で鮮明になったポストトレーニングの効果
Z.aiのGLM-5.3は、この流れをさらに進めました。Hugging Faceのモデルカードによると、GLM-5.3はGLM-5.2と同じ基盤モデルを使い、改善はポストトレーニングによって得られたと説明されています。CyberGymでは84.5、ExploitBenchではGLM-5.2の24.4から54.4へ伸び、ExploitGymでは2時間条件で29件から105件へ増えたとされています。
NVIDIAのNIMリファレンスは、GLM-5.3を7530億パラメータ規模のMixture-of-Expertsモデルと説明し、1トークンあたり約400億パラメータが活性化するとしています。これは、巨大モデルをそのまま全面稼働させるのではなく、必要な専門家部分を選択的に使う設計です。大規模文脈、ツール呼び出し、長期タスクに向けた設計が、サイバー探索にも効いていると考えられます。
CAISIは2026年9月の評価で、GLM-5.3を「これまで公開された中で最もサイバー能力の高いオープンウェイトモデル」と位置づけました。同時に、米国フロンティアモデルとの差はなお存在し、総合指標で約4カ月遅れているとも評価しています。SEC-Bench ProではGLM-5.3が40.4%、米国フロンティア最良が90.2%、ExploitGymでは9.4%対44.4%という差がありました。
この数字は、二つの現実を同時に示します。中国のオープンウェイトモデルは最先端の閉鎖型モデルに完全には追いついていません。しかし、数カ月遅れの能力が、ダウンロード可能で、改変可能で、第三国の開発者にも広がるなら、安全保障上の意味は小さくありません。軍事技術でいえば、最上位機種ではなくとも大量配備される能力が地域の均衡を変えるのに似ています。
オープンウェイトが崩す規制の前提
米国型の自己規制と域外モデルのずれ
米国では2026年9月29日、トランプ大統領が主要AI企業と自主的な安全基準に関する合意を結んだと発表しました。AP通信によれば、合意は内部統制、外部監査、取締役会レベルの監督を含む一方、法的拘束力よりも業界の自己規律に重きを置く内容です。米国政府はAI競争を対中優位の柱と見なし、過度な制約を避ける姿勢を強めています。
しかし、この枠組みは米国企業の閉鎖型モデルを想定した統治に近いものです。API経由で提供されるモデルなら、利用者停止、ログ分析、危険リクエストの拒否、提供地域の制限が可能です。ところが、モデル重みが公開され、自前環境で走る場合、提供者は下流利用の可視性を失います。悪用者が安全層を外し、標的に合わせて微調整しても、元の開発企業やクラウド事業者には検知できません。
この非対称性は輸出管理にも影響します。米国が高性能半導体や一部モデルへのアクセスを絞っても、中国企業が十分に強いオープンウェイトモデルを公開すれば、第三国の開発者はそちらへ流れます。AP通信は、中国モデルが安価で「十分に良い」選択肢として米国利用者にも広がり、オープンなAIの最前線が中国製になりつつあるとの見方を紹介しています。
欧州型のシステミックリスク規制
欧州連合のAI Actは、米国より制度的な網を広くかけています。欧州委員会の解説では、汎用AIモデルの提供者は技術文書、下流事業者向け情報、著作権ポリシー、訓練データ概要などの義務を負います。自由かつオープンソースのライセンスで重みやアーキテクチャ情報を公開するモデルには一部免除がありますが、システミックリスクを持つモデルには免除が適用されません。
同法の考え方は、安全保障の観点から見ると現実的です。問題はモデルが「開いているか閉じているか」だけではなく、どの程度の能力を持ち、どれだけ広く使われ、どのリスク領域で悪用され得るかです。欧州委員会も、先進的な汎用AIをオープン化すれば安全研究や競争に利益がある一方、リスク緩和策が迂回されやすいと認めています。
ただし、欧州型にも限界があります。域外で公開されたモデルがミラーサイトや派生モデルとして拡散すれば、届け出や監査だけで統制することは困難です。さらに、能力評価の速度がモデル更新に追いつかない場合、規制は常に後手に回ります。GLM-5.3のように、同じ基盤モデルでもポストトレーニングだけでサイバー能力が大きく伸びるなら、訓練計算量だけを基準にした分類は不十分になります。
企業防衛を左右するエージェント運用リスク
企業にとって最初の対応は、AIモデルの国籍を問うことではありません。必要なのは、自社がどのモデルをどの権限で、どのデータに接続しているかを把握することです。HackerOneは、自社のAIシステムについて、権限ベースのアクセス制御、必要最小限の一時的コンテキスト、処理後のセッション消去を説明しています。これは、AIエージェント運用の最低線になります。
攻撃側では、AIが偵察、コード読解、報告文作成を高速化します。防御側でも、重複判定、優先順位付け、再現性確認、修正提案が自動化されます。Tenzaiは2026年7月、発見した脆弱性に対してWAFルールや修正ガイダンスを生成し、暫定緩和まで支援する機能を発表しました。発見から修復までの時間を短縮する試みは、AI時代の防御で中心的になります。
一方で、自律型エージェントは権限設計を誤ると、評価環境の外へ出るリスクを持ちます。Axiosは2026年7月、Hugging Faceに対するAI関連の侵害調査で、米国のフロンティアモデルの安全制限に阻まれた後、Hugging FaceがZ.aiのGLM-5.2を分析に使ったと報じました。この事例は、守る側が制限の緩いモデルを必要とする場面があることを示す一方、同じ特性が攻撃側にも利用され得ることを示しています。
したがって、企業は「AI利用を禁じる」よりも、AIエージェントに与える権限を明示し、ログを残し、ネットワーク到達範囲を限定し、外部システムへの操作に人間の承認点を置くべきです。特にソースコード、クラウド管理画面、ID基盤、チケット管理、メールに接続するエージェントは、便利な秘書ではなく特権ユーザーとして扱う必要があります。
日本企業が優先すべき実装と外交感度
今回の論点は、米中AI競争のニュースであると同時に、日本企業の調達問題でもあります。安価で高性能な中国発オープンウェイトモデルは、コスト削減と国内運用の魅力を持ちます。機微データを海外APIに送らず、社内環境で動かせる利点もあります。しかし、サイバー用途に強いモデルほど、誤用時の被害も大きくなります。
読者が注視すべき指標は三つです。第一に、NISTや独立評価機関によるサイバー能力評価です。第二に、モデルカードで示されるライセンス、重み公開範囲、商用利用条件です。第三に、HackerOneのような実運用プラットフォームでAI報告の品質と量がどう変わるかです。ベンチマークの一点突破ではなく、運用上の再現性と安全管理が問われます。
安全保障の観点では、同盟国間での評価共有が欠かせません。欧州のようにシステミックリスクを制度化する道、米国のように企業の自己監査を重視する道、中国のようにオープンウェイトで影響圏を広げる道は、それぞれ異なる力学を持ちます。日本はどれか一つを模倣するのではなく、調達基準、重要インフラのAI利用規程、脆弱性情報共有を組み合わせる必要があります。
AIハッカーの台頭は、防御側にとって脅威であると同時に機会です。重要なのは、モデルの公開形態を過度に単純化せず、能力、権限、監査、責任の四点をそろえて管理することです。中国のオープンウェイトAIが示したのは、技術の拡散速度が規制の速度を上回り始めたという現実です。企業も政府も、その前提で防衛体制を組み直す段階に入っています。
参考資料:
- Tenzai Hits #1 on HackerOne - In Under 90 Days
- Inside the Top 1%: Engineering Tenzai’s AI Hacker to Compete with Elite Humans
- Tenzai’s AI Hacker Can Now Autonomously Mitigate What It Finds
- zai-org/GLM-5.2 - Hugging Face
- zai-org/GLM-5.3 - Hugging Face
- CAISI Assessment of Z.ai’s GLM-5.2
- CAISI’s Assessment of Z.ai’s GLM-5.3 Cyber Capabilities
- We have Mythos at Home: GLM 5.2 beats Claude in our Cyber Benchmarks
- Grounded or Gamed? We Audited Our Own Cyber Benchmark
- GLM-5.2 Risk Evaluation Report
- AI-Driven Report Volume: What We Learned and What We’re Doing About It
- Hacker-Powered Security Report 2025
- General-Purpose AI Models in the AI Act - Questions & Answers
- Cheaper, open and intelligent: Chinese AI models gain ground, as they make inroads in the US
- Trump says top tech firms have signed accord to ‘self-police’ AI development
国際安全保障・欧州情勢
欧州・中東の安全保障問題を中心に、軍事と外交の接点から国際秩序の変動を伝える。
関連記事
WeChatゼロクリック攻撃が示すAI安全保障の新局面と米中協議
米CalifがAI支援で構築したWeChatのゼロクリック実証攻撃は、14億人規模の生活基盤が数日で兵器化され得る現実を示した。Tencentの修正、Anthropic報告、米中AI安全協議の焦点に加え、中国のデジタル統治と責任ある開示の課題、利用者と企業が警戒すべき更新確認とアカウント防御まで解説。
中国AIが米国の安全不安を突くオープン戦略とサイバー覇権競争
Z.aiのGLM-5.3-Flash公開は、OpenAIやHugging Faceのサイバー騒動で揺れる米国AI安全論を突いた。中国勢のオープンモデルは防御現場の検証力、低コスト、国内チップ活用を武器に存在感を増す一方、検閲・供給網・国家依存のリスクも残る。米中AI競争の新局面を安全保障の視点で読み解く。
中国AIがアフリカで急伸、安価モデルが招く米国戦略の最新逆風
DeepSeekやQwenを軸に中国AIがアフリカで浸透しています。Huawei Cloudの南ア展開、AU戦略、世界銀行が示す77%のデータセンター集中、米国のAI輸出政策を比較し、低価格なオープンモデルが開発現場と外交秩序を変える理由、利用者が確認すべき主権リスクと日本企業への示唆まで読み解く。
米AI規制混迷、オープンモデル政策が揺らす米中技術覇権競争の行方
ホワイトハウスのAI行動計画は90以上の政策アクションで革新を促す一方、DeepSeek評価や中国系モデル調査で規制圧力も強めています。オープンウェイトをめぐるNVIDIA、OpenAI、Anthropicの主張を整理し、米中技術覇権と政府調達、輸出管理、日本企業の調達リスクに及ぶ影響を深く読み解く。
DeepSeekとHuaweiが崩すNVIDIA・CUDA支配
DeepSeekがHuawei Ascend向けに6つのソフトウェア群を公開し、NVIDIAのCUDA依存を切り崩す動きが加速しています。V4対応、CANNオープン化、米輸出規制、H20規制、推論需要の拡大、開発者エコシステム、互換性と安定性の壁を整理し、中国AI半導体競争の今後の勝ち筋と限界を読み解く。
最新ニュース
乳がんリスクAI検査が米国拡大、マンモ画像で予防医療は変わるか
米国でClairity Breastが全国展開し、マンモグラフィ画像から5年以内の乳がんリスクをAIで推定できるようになりました。FDAのDe Novo承認、249ドルでの直接提供、1.7%と3.0%のリスク区分、NCCN基準との関係、過大評価や保険適用、医療格差、医師との意思決定の課題まで詳しく解説。
FTCがOpenAI・Anthropic調査、AI安全性の焦点
米FTCがOpenAIとAnthropicなどを調査。AIエージェントの逸脱事案、Hugging Face侵害、子ども向けチャットボット調査、トランプ政権の自主規制路線が交差するなか、既存の消費者保護法で企業責任をどこまで問えるのか。米国政治の力学、安全性投資、国際競争と日本企業への示唆を読み解く。
住宅所有は出生率を救うか、米国住宅政策から読む少子化危機の今
米国で出生数が伸び悩むなか、FHA・VAローンが戦後ベビーブームを後押ししたとの研究が注目されます。2025年の出生数は約360万件、30年固定金利は7%台に再上昇。住宅所有は結婚・第1子の時期にどう影響し、高金利と住宅格差の下で再現可能なのか、移民家庭や低所得層を含む家族形成を支える政策条件を読み解く。
米国債利回り最高水準が映す財政不安とインフレ再燃の新たな市場構図
米10年債利回りが5.34%近辺に上昇し、2002年以来の高水準となりました。イラン戦争に伴う原油高、FRBの利上げ再開、2兆ドル規模の財政赤字、海外投資家の需要変化が重なるなか、住宅ローンや株式評価に波及する長期金利上昇の構造を読み解く。投資家が次に見るべき物価・入札・中銀発言の要点まで整理します。
米国がん標的薬革命が多くの患者に届かない検査遅延と保険格差問題
米国でがん標的薬と腫瘍横断薬の承認が相次ぐ一方、バイオマーカー検査、保険承認、薬剤費、地域差が患者アクセスを阻む。FDA、NCI、CMS、実臨床データを基に、精密医療の成果が診察室へ届かない構造を分析。肺がん研究や医療政策の数字から、技術革新だけでは救えない現場のボトルネックを分かりやすく読み解く。