エンタープライズテクノロジーの世界で今、最も高くつくアドバイスは、わずか5語に集約される。「まずデータを整えよ」だ。
このフレーズはあらゆる場所で耳にする。世界経済フォーラム(WEF)の報告によれば、企業の72%が今年のAI投資として最も急速に成長させる領域にデータ基盤とパイプラインを優先すると回答している。ガートナーは、2026年までに組織の60%が「AI対応」データに支えられていないAIプロジェクトを放棄すると予測する。Clouderaの最新のグローバル調査では、ITリーダーの96%がAI統合を進めていると回答した一方、約80%がデータアクセスの制約によって取り組みが妨げられているとし、自社のデータが完全にガバナンスされていると答えたのはわずか18%にとどまった。Fivetranが500人超のシニアデータ・テクノロジーリーダーを対象に実施したベンチマーク調査では、1組織あたり年間平均2930万ドル(約46億4000万円)をデータに費やしているにもかかわらず、企業のデータ関連施策の73%が期待を下回っていることが明らかになった。
診断はいつも同じだ。もっとガバナンスを、もっとクレンジングを、もっとパイプラインエンジニアリングを。データの土台を整えてから、AIを導入せよ、というわけだ。
これは賢明に聞こえる。だが、大規模に価値を破壊している。
その論理の表面には、人を引きつける力がある。悪いデータを入れれば、悪い意思決定が出てくる。これに異論を唱える人はいない。しかし多くの企業が導き出している結論、すなわちAIが有用になるには、まずデータをクレンジングし、標準化し、ガバナンスしなければならないという考え方は、価値創造の実際の順序を逆転させている。どの意思決定が重要なのかを問う前に、どのデータが重要なのかを知っているという前提に立っているからだ。そしてAIを、クリーンなデータを消費するものとして扱っている。実際にはAIは、非構造化情報の中から構造を見つけ出すために、これまで作られた中で最も強力なツールであるにもかかわらずだ。
その結果、企業のデータ戦略は、意思決定に関連するシグナルをまったく含まないかもしれないデータセットを磨き上げるために年間数百億ドルを費やす一方で、シグナルに富みながらガバナンスの枠組みに適合しない、雑然とした非構造化ソースを無視している。
最近、OpenAIがSoraを停止した際にも、同じ力学が劇的な形で現れた。Soraは膨大な計算資源を持ちながら、その下に独自のシグナルの堀を持たないプロダクトだった。プロダクトレベルでSoraを終わらせたものは、ポートフォリオレベルで企業のAI施策を終わらせている。データレイク構想のおよそ80%は最終的に失敗し、実務者が率直に「データ沼(データスワンプ)」と呼ぶものへと劣化する。レイクはクリーンだ。だが、シグナルは最初からそこになかった。
こうした支出を始める前に、問うべきより良い問いがある。それは意思決定理論に由来し、「完全情報の期待価値(EVPI)」と呼ばれる。EVPIの枠組みは単純だ。もし完全な情報があったとして、それはこれから下そうとしている意思決定を実質的に変えるだろうか。答えがノーなら、その情報には、どれほどクリーンであっても経済的価値はない。答えがイエスなら、その答えに向かう手がかりを示す雑然とした非構造化の「汚い」データであっても、何も新しいことを教えてくれない完全にガバナンスされたデータセットより価値がある。
この視点を最初に適用する企業、すなわちクレンジングよりシグナルを、インフラより意思決定を優先する企業は、持続的な競争優位を築いている。そうしない企業は、高価な書類棚を作っているにすぎない。
コークの原則:なぜ汚いデータはクリーンなデータより価値があり得るのか
ミネソタ州にあるKoch Industriesのパインベンド製油所は、示唆に富む類推を与えてくれる。事業をめぐって争った一族のメンバーは、同社のカナダ産原料を公然と「ガラクタ原油」と呼んだ。硫黄分を多く含む低品位の素材であり、他の製油所が見送ったものだ。その原油は、硫黄含有量が高いがゆえに極めて安く、処理できる製油所はほとんどなかった。しかしKochは、精製品を供給が逼迫し価格が高い市場で販売した。他社が扱おうとしないものを処理する意志と、扱いの難しい原料からプレミアム価値を引き出す専門能力は、米国産業界で最も持続的な競争優位の一つとなった。
AIにおけるシグナルの原則も、まったく同じように機能する。非構造化の顧客フィードバック、コールセンターの通話記録、衛星画像、センサーテレメトリー、独自の業務ログ。これらはデータ世界における硫黄分の多い原油である。豊富で安く、すでに持っているデータのクレンジングに忙しい組織からはおおむね無視されている。この原料から意思決定に関連するシグナルを抽出する能力を開発する企業は、いまだにマスターデータ管理プログラムを磨いている企業を上回る成果を上げるだろう。
そして、「データ準備」というコンセンサスが完全に見落としている皮肉がここにある。AIこそが製油所なのだ。AIは、非構造化データの中に構造を見つけ、ノイズの中にパターンを浮かび上がらせ、従来の分析では処理できない原料から価値を抽出するために作られたツールである。データがクリーンになるまでAI導入を遅らせるのは、誰かが原油から硫黄を取り除くまで精製をやめろとKochに言うようなものだ。硫黄こそが機会である。製油所こそが能力である。処理の前にクレンジングを順序づけるのではない。処理能力を構築し、それに何をクレンジングする価値があるのかを教えさせるのだ。
シグナルファーストのデータ戦略とは何か
この原則が企業規模で有効であることは、生成AIより何十年も前から証明されている。Verisk Analyticsはデータレイクを構築してから、それで何ができるかを問うたわけではない。同社は、保険業界が下す必要のある意思決定、すなわちリスクの価格設定、不正検知、災害エクスポージャーのモデル化、保険金請求の評価から出発し、それらの意思決定に関連するシグナルを持つあらゆる組織を体系的に買収していった。
AIR Worldwideは、確率論的な災害シグナルをもたらした。大手損害保険会社の保険金請求ワークフローの80%に組み込まれていたXactwareは、詳細な修理費用シグナルをもたらした。Jornayaは、リアルタイムの消費者意図シグナルをもたらした。すなわち、申し込み前に誰が保険を積極的に探しているのかを把握する能力である。各買収は同じ問いに答えていた。どの情報が分かれば、引受担当者、損害査定人、経営幹部の意思決定を実際に変えるのか。これはM&A戦略として適用されたEVPIである。
ネットワーク効果が堀をさらに強化した。参加する保険会社は、集約された業界データセットへのアクセスと引き換えに、自社の損失データをVeriskの統計データベースに提供する。誰もデータそのもののためにデータをクレンジングしているわけではない。より良いシグナルを得るために、シグナルを提供しているのだ。ガバナンスは価値に従う。常にそうだった。
Veriskの時価総額はピーク時に380億ドル(約6兆200億円)超に達した。これは2009年のIPO時の評価額のおよそ13倍である。評価されている資産はデータレイクではない。意思決定に関連するシグナルの蓄積であり、そのシグナルが必要とする人々に届くワークフローである。
最高データ責任者は実際に何をすべきか
この順序の組み替えは、企業がデータリーダーシップをどう考えるべきかに深い示唆をもたらす。最高データ責任者(CDO)の役割は、ほぼ例外なく、ガバナンスとインフラの機能として定義されてきた。データをクレンジングし、データをカタログ化し、パイプラインを構築し、コンプライアンスを管理する。これらは実際に必要な仕事である。だが、二次的な仕事だ。
一次的な仕事はシグナルの特定である。企業が下す必要のある意思決定から逆算し、EVPIの厳密さをもって、どの情報が分かれば実際にその意思決定をどれだけ動かすのかを問うことだ。競争優位はそこに宿る。ガバナンスと品質基準は、シグナルの優先順位に従うべきであり、それに先行すべきではない。
トレーダーはこのことを常に理解してきた。債券デスクは、利回りのシグナルを探す前に、すべてのデータがクリーンかどうかを問うたりしない。何が価格を動かすのかを問う。企業のデータリーダーは、同じ本能を身につけ、単なるデータ衛生ではなく、シグナル発見に報いる組織を築く必要がある。
シグナルを欠いたクリーンなデータは、高価な書類棚にすぎない。



