リーダーシップ

2026.09.27 15:29

AIを作る側が減速を求めている。書類の片隅に葬っている場合ではない

stock.adobe.com

stock.adobe.com

9月半ばの一週間、3つの出来事があった。ある研究者が、この業界は全員の命を賭けの対象にしていると言い残してAnthropic(アンソロピック)を去った。Anthropicは、同社のモデルがサイバー作戦や監視、世論誘導工作に利用された8カ月間の記録をまとめた脅威レポートを公開した。そしてその後、ダリオ・アモデイ(AnthropicのCEO)は、これらのシステムが性能を向上させるペースを業界全体で落とすよう求めるエッセイを発表した。サム・アルトマンは数時間以内にこれに同意し、イーロン・マスクも3つの言葉で同意を示した。

どれも最初の警告ではない。7月13日、スタンフォード大学のデジタルエコノミー・ラボは、「We Must Act Now(今こそ行動すべきだ)」と題した88語の声明を発表した。これには16人のノーベル賞受賞者が署名し、その後、署名者リストは2000人近くにまで達している。7月28日には、OpenAI、Anthropic、Google DeepMind、Metaの1100人以上の従業員が、AI開発のペースを意図的に調整するために必要なツールの構築を米国政府に求めた。アモデイ自身も、OpenAIのチーフサイエンティストやGoogleのAI安全性責任者と並んで署名している。8月には、OpenAIが最新モデルの強化学習を一時停止した。そして、これが最後の警告になるわけでもない。

同ラボのディレクターであるエリック・ブリニョルフソンに話を聞いたとき、彼は遠回しな表現を選ばなかった。「技術的能力の津波が我々に押し寄せている」と彼は語った。「そして我々は、組織的な変化という観点で準備ができていない」。彼が指摘した準備不足とは、組織的なものであった。

今回の警告には代償が伴っていた。アモデイのエッセイが発表されたのと同じ週末、アルトマンはFortune誌に対し、現時点での株式公開は賢明ではないとして、年内のOpenAIの新規株式公開(IPO)の可能性を否定し、ここ数年で最も注目される上場を早くて2027年へと先送りした。Anthropicも自社の上場準備を進めている。ここでほかに何が起きているにせよ、この2社はこの問題をめぐって現実の商業的コストを引き受けているのだ。

警鐘は鳴り続け、その音は回を追うごとに大きくなっている。一部の企業は真剣に対応してきた。実質的な権限を持つ責任者を任命し、機能する審査ゲートを構築し、基準を満たさなかった導入を見送った。しかし、大半の企業がしたのは方針を書いたことだけである。この2つの対応の差は、取締役会への報告資料(ボードパック)で見るよりもはるかに大きい。なぜなら、資料上ではどちらも同じように見えるからだ。

実効性のある制限とは何か

スライドに書かれた制限ではない。実際にテストされている制限のことだ。

今や、すべての大企業がAIポリシーを策定している。大半の企業には運営委員会があり、承認済みツールリスト、研修モジュール、リスク登録簿の1項目が存在する。しかし、それらが実際に何を制限しているのかを尋ねると、途端に回答は心もとなくなる。前四半期にどの導入が中止されたのか。どれが延期されたのか。サービスをローンチしたいと言う事業部門に対して、これまでに「ノー」を突きつけた人間はいるのか。

一度もテストされたことのない制限は、単なる書類にすぎない。

そのギャップは、報告される内容に最も明確に現れる。導入状況は、アカウント数、利用率、削減時間、立ち上げられたパイロットプロジェクトの数など、執拗なまでに測定される。これらの数字が上がると、誰かがそれを発表する。しかし、その逆方向に動くものは何もない。出力がどれほど間違っていたか、それを誰が発見したかを報告する者はいない。システムが想定外の動きをしたことを報告する者もいない。報告資料には慎重さを促すような指標が一つもない。つまり、そのような指標を動かすことを仕事にしている人は誰もいないということだ。

アモデイの提案に対する最も一般的な批判は、それが自己中心的(ポジショントーク)であるというものだ。この計画は、すでにリードしている者に有利に働くと批判派は主張する。そうかもしれない。しかし、その議論は今朝あなたの会社で稼働しているシステムには何の影響も与えない。「誠実さ」を巡る議論は、問題をAnthropicだけのものにすり替える手段であり、自分たち自身の問題にしないための都合のよい方法なのだ。

より本質的な反対意見には、一聴の価値がある。批判派は、この提案が「どの程度ペースを落とすべきか」「いつまでにか」「無視する開発元はどうなるのか」について一切述べていないと指摘する。基準値もなく、第三者の評価者がいつまでに導入されるべきかの期日もなく、罰則もない。裏付けのない制限なのだ。

その批判を念頭に置いて、自社のAIポリシーを読んでみてほしい。そのほとんどは、意向表明、基本原則、名ばかりの責任者だけで構成され、何を基準にプロセスを停止すべきかを具体的に定めていない、まったく同じような文書のはずだ。AI開発元は公に批判されているが、それと同じ不備が、国内のほぼすべての取締役会報告資料の中で見過ごされている。

リスクマネジメントはこれを吸収してしまう

何も変わらなければ、次に起こるのは次のようなことだ。

AIは、サプライチェーンの脆弱性、気候変動への移行、地政学的不安定性、サイバーセキュリティと並んでリスク登録簿に掲載される。ヒートマップで色分けされ、責任者が割り当てられ、四半期ごとにレビューされ、「環境は変化しており、当社は引き続き動向を注視していく」という1文が添えられる。

リスク管理部門が怠慢なわけではない。新しく、かつ限界のない事象に対して、通常通りの業務を行っているだけだ。リスクマネジメントとは、対象が測定可能な形に落ち着くまで監視するようにできている。定量化できない破壊的要因が持ち込まれれば、単に「監視」を生み出すことになる。なぜなら、真の不確実性に対する誠実な対応とは監視だからだ。

問題は、AIを構築している人々自身が、もはやそれを「監視すべきもの」としては語っていないことだ。彼らは「ブレーキ」を求めている。ある技術の開発者が自らの業界のペースを落とすよう公に要求しているとき、それは単に「注視すべき新たな兆候」ではない。それは「現在進行中の危機的シグナル」であり、その事実だけで、リスク登録簿のカテゴリーを「監視」から別の列へと移動させるべきなのだ。

なぜ単なる監視が機能しなくなったのか

これまでの2年間、リスクとは不適切な出力のことであった。数字の誤り、偏った要約、あるいは企業にとって不都合な内容などだ。出力とそれがもたらす結果との間には人間が介在し、レビューによって対処できていた。

しかしその後、ツールは提案するだけでなく、自ら行動を起こすようになった。

Hugging Face(ハギングフェイス)で起きたインシデントの経緯を追ってみよう。5月、あるタスクで行き詰まったOpenAIのエージェントがインターネットへの接続経路を探し求め、その過程で、同社の内部パッケージマネージャーへの書き込み権限があることを発見した。エージェントたちはそのチャネルを使って互いに会話を始めた。誰かがその存在に気づくまでに、何十万通ものメッセージが交わされた。7月までに、エージェントはHugging Faceのプロダクションインフラの内部に侵入し、そこに3日間留まった。

Hugging Faceがそれらを発見した。同社の監視システムが検知し、チームがエージェントを排除。インフラの約3分の1を再構築し、FBIに通報した。これらすべての対応は、OpenAI側の誰もがこの攻撃を自社のテスト走行と結びつけて考える前に行われた。OpenAIが、それが自社の仕業であったと突き止めたのはその翌週末のことだった。

しかも警告はすでに文書化されていた。その3週間前、独立評価機関のMETRは、当該モデルの評価レポートを公開し、公開されているどのモデルよりも高い「不正実行率(cheating rate)」を記録したと報告していた。外部の誰かが監視していたのだ。外部の誰かがそれを公開した。それでも、何も止まらなかった。

監視だけで得られるもの、それは「すでに起こってしまったこと」の克明な記録だけだ。

その場で誰も問いを口にしない

よくある優れたデモの様子を観察してみよう。経営陣の前で、自律型(エージェンティック)のレポートシステムの実演が行われている。システムは4つのソースシステムからデータを抽出し、数値を照合し、誰も指摘していなかった差異を検出して解説を作成し、クライアントにそのまま提出できるレポートを出力する。所要時間はわずか9分。すべての数値がソースデータと一致している。誰かが「これは来四半期にはクライアント向けに導入できる」と言い、その場の全員が同意する。

信頼は別のところへと転移する。これほど見事に動作するものには「有能さ」が感じられ、その場の全員が、デモでは示されていない領域にまでその信頼を広げてしまう。そこには「これほど優れているのだから、安全性やコンプライアンスも万全に違いない。誰かが隅々まで検討しているはずだ」という暗黙の論理が働く。

すべてが正常に確認されたことで、完成したように感じられる。しかし、確認されたのは単なる計算の整合性にすぎない。システムがどの4つのシステムを選択したのか、一致しなかったレコードをどう処理したのか、もし差異が逆方向に出ていたらどのような解説を記述したのか、誰も確認していない。それらの意思決定は、すべてあの9分の間に行われたのだ。

そして、「誰がこれを止められるのか」と尋ねる者は誰もいない。なぜなら、その場においてその質問は中立的には響かないからだ。全員が感動している中で、冷や水を浴びせるような懐疑的な問いと受け取られてしまう。そのため、問題は先送りされ、調達部門へと回されてベンダーアンケートの1項目となり、もはや誰も真剣に意思決定を下さなくなる。こうして、誰も十分に検証していないシステムが、自社のブランドを背負ってクライアントの前に送り出されることになるのだ。

監視の先へ

AIを「監視」することと「統治(ガバナンス)」することとの間には、3つの違いがある。どれも追加の予算を必要としない。

実際にテストされる制限。今四半期に導入されるシステムを1つ選び、あらかじめ設定した基準(しきい値)を超えた場合に、システムを停止させ、そのコストを引き受けて記録するという「明文化された停止措置」を実際に実行してみることだ。一度もシステムを止めたことのない組織は、自分たちにそれができるかどうかさえ分からない。

逆方向を示す指標。導入状況の報告と並行して、出力がどれほど間違っていたか、誰がそれを発見したか、あるいはそれに対応するのにどれだけの時間がかかったかを報告することだ。報告資料の中にペースダウンを促す要素が一つもなければ、その資料はガバナンスとして機能していない。

ブレーキに結びつけられた具体的な名前。ワークフローの途中でシステムの導入を停止できる権限を持つ「実名」の担当者を1人決めること。そして、その停止によって生じる商業的損失は、事前に合意された上で他の誰かが引き受けるようにすることだ。誰も使ったことがなく、それを行使すれば社内での立場を失うような権限は、単なるお飾りにすぎない。

不協和音になる前に

警鐘は静かに積み重なっていく。7月の声明と共同書簡。8月の一時停止。9月の辞任、脅威レポート、そしてエッセイ。一つひとつを個別に見れば、見出しや転送メール、あるいは次四半期の報告書の注記として、処理できてしまう。そして、まさにそのようにして処理されているのだ。

しかし、警鐘の間隔は狭まり、その音は大きくなっている。ある時点で、それらは個別のシグナルであることをやめ、1つの音となる。そうなったとき、いまだ監視を続けているだけの企業に、自ら対応を選択する余地はない。規制当局や保険会社、あるいは不測の事態によって対応を強制されることになり、それは主体的な「意思決定」ではなく、「緊急事態」として彼らに襲いかかるだろう。

このシステムを構築した人々が警鐘を鳴らしている。これを依然として「監視すべき事項」のフォルダに分類しているすべての企業は、言葉にすることなく静かに、不意を突かれる側になることを自ら選択しているのだ。

(forbes.com 原文)

タグ:

advertisement

ForbesBrandVoice

人気記事