生成AIエンジン最適化(GEO)について、同時に2つの真実が存在する。1つは、その測定基準があまりにも不確実であるため、今年取締役会に報告される数値のほとんどは統計的な検証に耐えられないということ。もう1つは、より優れた測定方法が登場するのを待ってから参入しようとするブランドは、すぐに始めるブランドに比べて1、2年は遅れをとることになるということだ。
このジレンマは慎重に紐解く価値がある。なぜなら、ほぼ誰も監査できない数値の説得力に基づいて、巨額の資金が動こうとしているからだ。
企業は実際に何を買っているのか?
生成AIエンジン最適化(GEO)、または回答エンジン最適化(AEO)とも呼ばれるこの手法は、顧客がAIアシスタントに質問した際に、自社ブランドが表示されるかどうか、またどのように表示されるかに影響を与えようとする取り組みだ。これに隣接するアプローチである「AI露出度モニタリング」は、その表示頻度を測定しようとするものである。
その捉え方が重要だ。GEOはチャネルではない。影響力の一つのレイヤーであり、ChatGPT内の引用元からのクリックは、そのうちの最も小さく、最も関心の薄い部分にすぎない。本質的な問いは、AIエージェントが「何件の販売を完了させたか」ではなく、AIエージェントが「何件の購買に影響を与えたか」である。これは、エージェント型コマースとエージェント実行型コマースの違い、あるいはソーシャルコマースとアプリ内決済の違いと同じ性質のものだ。
この違いこそが、測定がこれほど困難である理由を解き明かす最初のヒントとなる。
なぜ測定はこれほど不確実なのか?
問題は6つあり、しかもそれらがすべて複雑に絡み合っている。
- AIエンジンは毎回回答を再生成する:同じアシスタントに同じ質問を2回投げかけても、多くの場合、異なるブランドや異なる情報源が返ってくる。6月にarXivで発表された研究では、同一のクエリを繰り返し実行した際に、引用された情報源のセットがどの程度重複するかを測定した。その結果、Geminiでは約30%、SearchGPTでは33〜40%、Perplexityでは約50%にとどまった。この不安定さは、最も重要な局面で顕著になる。Conductorによる1万4000件のAPI呼び出しの分析によると、購買意欲を示すプロンプトは、テストされたクエリタイプの中で最も一貫性が低く、同じプロンプトを2回実行した際に両方に表示されたブランドは10社中わずか4社程度だった。
- 多くの測定ツールは、顧客が使っているものとは異なるプロダクトを測定している:追跡プラットフォームは通常、開発者向けのAPIを呼び出す。これに対し、顧客はメモリ、パーソナライズ、位置情報、モデルのルーティング、そしてWebを検索するタイミングに関する独自のロジックを備えた消費者向けアプリを開く。このギャップは、単一のプロダクト内でも発生する。Semrushがケビン・インディグと共同で実施した分析によると、ChatGPTの高速な「インスタントモード」と、より低速な「思考(Thinking)モード」の間で、引用された情報源の重複はわずか25%であり、同一のプロンプトに対して異なるブランドを推奨することさえあった。また、顧客がどのような属性であるかも影響する。126のソフトウェアカテゴリを対象としたある指標によると、購入者が自らを「フリーランサー」と称するか「エンタープライズ」と称するかによって、あるブランドの回答獲得率が34%から90%へと変動した。
- 追跡されているプロンプトは、実際に実行されているプロンプトではない:AIアシスタントは質問を複数のサブクエリに分解し、それらを並行して実行する。これはGoogleが「クエリのファンアウト」と呼ぶプロセスだ。Googleによると、同社の「Deep Search」機能は、複雑な質問に対して数百のサブクエリを発行することがあるという。特定のフレーズを追跡しているダッシュボードは、エンジンが受けてもいない試験を採点しているようなものだ。
- 引用は情報源ではない:多くのシステムは回答を生成した後に、裏付けとなるリンクを後付けで添付する。研究者はこのエラーモードを「後付けの合理化」と呼んでいる。つまり、引用されたリンクはもっともらしく見えるが、その主張を生み出した根拠そのものではないということだ。このギャップは数値化できる。Position Digitalの分析によると、追跡対象となった95ブランドに関する278の回答において、ChatGPTは本文中でブランド名を552回挙げたものの、そのブランド自体のドメインを引用したのは375回にとどまり、両者が一致したのはわずか185回だった。「引用されること」と「推奨されること」は別個の事象であり、引用レポートはそのうちの一方しか測定していない。
- ノイズの許容範囲が効果を上回っている:前述のarXivの研究では、引用シェアにブートストラップ信頼区間を適用した結果、典型的な区間が3〜7パーセンテージポイントに及ぶことがわかった。その結論は率直だ。一見すると8%から11%へと上昇したように見えても、それはランダムな変動と区別がつかないのである。信頼に足る推計値を得るためには、あるプラットフォームではトピックごとに40〜50個、別のプラットフォームでは150個以上のクエリが必要だった。しかし、ほとんどのブランド向けダッシュボードは、毎週少数のプロンプトを実行するだけで、小数点第1位まで数値を報告している。
- 露出度は成果ではない:言及されることが売上につながるわけではない。AIアシスタントが直接送るリファラルトラフィックはサイト訪問者数全体のわずかな割合にすぎず、実際の影響力は、リファラルログに記録されるものよりはるかに大きいはずだ。まさにそこが問題なのだ。どちらの数値も、最高財務責任者(CFO)に対して「その取り組みが投資に見合うものであったか」を証明することはできない。
一度うまくいったものが、なぜ維持できないのか?
これこそが、企業の経営幹部が最も受け入れがたい部分であり、前提を考え直すべき点である。
従来の検索は、極めて「決定論的(確定的)」である。同じクエリに対しては、誰に対してもほぼ同じ掲載順位のリストが返され、良質な取り組みによって獲得した順位は、アルゴリズムが更新されるまでの約6カ月以上にわたって優位性を保つ持続可能な資産となる。この持続性があるからこそ、SEOは投資価値のあるものだった。
一方、生成AIシステムは「確率論的」だ。回答はリクエストごとに新しく生成される。維持すべきポジションも、防御すべきステータスも存在しない。仮に今日、あるブランドに自社の正確な立ち位置とそれを向上させるための正確な手段を示す「魔法の杖」を与えたとしても、来週には誰も何も触れていないのに、その状況は変化してしまうだろう。なぜなら、モデルが更新され、情報取得(リトリーバル)レイヤーが変わり、競合他社が新たなコンテンツを公開し、あるいは顧客自身の対話履歴が変化するからだ。
GEOは、掲載順位を維持することよりも、継続的な実験を行うことに近い。これを単発のプロジェクトとして予算化するチームは失望することになるだろう。継続的な測定機能として予算を確保するチームは、そうはならない。
特化型エージェントと汎用型エージェントの違いは何か?
GEOに関する議論の多くは、暗黙のうちに1種類のエージェントのみを想定している。しかし、実際には2種類存在する。
汎用型(水平型)エージェント(ChatGPT、Gemini、Claude、Perplexity、Copilotなど)は、公開Web上のデータでトレーニングされており、ユーザーの「発見」に最も近い位置にある。一方、特化型(垂直型)エージェントは、小売業者が所有し、そのカタログデータに縛られている。例えば、Amazonの「Alexa for Shopping(旧Rufus)」、ウォルマートの「Sparky」、その他食料品、医薬品、専門店のアプリに組み込まれたアシスタントなどであり、これらは「購買取引」に最も近い位置にある。「Alexa for Shopping」はAmazonのカタログとPrime会員の行動データでトレーニングされているが、ChatGPTはそうではない。一方での露出度は、他方での露出度をほとんど意味しない。
両方の測定を試みるツールはほぼ皆無だ。モニタリングツールというカテゴリは、外部からプロンプトを送信できる汎用型アシスタントを中心に構築されている。小売業者のエージェントは大規模なクエリ送信ができず、ブランドに対してデータをほとんど返さないからだ。結果として、購買に最も近い接点はほとんどのブランドが測定を試みず、購買から最も遠い接点がすべてのダッシュボードのデータソースになっている。
どのようなデータに基づいて測定されているのか?
根本的に異なる2つの手法が存在するが、その違いが営業用のスライドで説明されることは滅多にない。
「合成プロンプトモニタリング」は、プロンプトのセットを生成し、定期的にエンジンに対して実行し、返ってきた結果をレポートする。再現性があり、検証可能だ。弱点は、顧客が何を尋ねるかを誰かが推測しなければならない点にある。
「リアルプロンプトモニタリング」は、同意を得た消費者パネルを利用し、実際に交わされた会話を観察する。アプリ、ブラウザ、検索、AIアシスタントを網羅するMeasure Protocolのパネルデータによると、2025年にChatGPTでの会話の5回に1回以上が購買意図を示していたという。現在、いくつかのGEOベンダーは、この種のパネルを自社製品に組み込んでいる。パネルデータは、表明された好みではなく、観察された行動にこの分野で最も近づける手段であり、観察された行動データは、常に高い価値を持つ。
どちらか一方だけでは不十分だ。合成テストは、制御された刺激に対してエンジンがどう反応するかを示し、パネルは人々が実際に何を尋ねているかを示す。効果的なプログラムでは、その両方を実行する。
ここで、すべてのベンダーに対して1つの注意点がある。データの収集方法を開示しているベンダーは極めて少ないということだ。どの接点か、どのモデルのビルドか、ログイン状態か、どの地域か、プロンプトごとに何回繰り返したか、ばらつきをどう処理したか。これらの回答を書面で得られない購入者は、測定基準を買っているのではなく、単なる「数値」を買っているにすぎない。
予算が拡大するとどうなるか?
予算が増えれば、それに伴って不正も増加する。このカテゴリーには、すでに根拠のない戦術が含まれている。Ahrefsが13万7000ドメインのサーバーログを分析した結果によると、公開された「llms.txt」ファイルのうち、5月にリクエストを全く受信しなかったものは97%にのぼり、アクセスがあったファイルでも、リクエスト送信者で最も多かったのは、そのファイルの存在を確認するSEO監査ツールだった。Googleはこのファイルは不要であると明言しているが、それでもこの手法は今なお売り込まれている。
支出が増えるにつれて、事態はさらに悪化することが予想される。捏造されたベンチマーク、情報取得を操作するために仕込まれたコンテンツ、そしてそのベンダー独自の評価手法でしか向上させられないような独自のスコアなどだ。変化のペースは、落ち着くどころかさらに加速するだろう。
では、なぜ今からこの取り組みを始めるべきなのか?
なぜなら、2026年における成果物とは「数値」ではなく、「組織の体制」だからだ。
- 経営幹部はすでに自らプロンプトを実行している:先週、CEOがChatGPTに自社のカテゴリを入力して何かを目にし、すでに何らかの結論を下しているかもしれない。もし競合他社が最初に表示されていたなら、その認識はすでに固まりつつある。
- あらゆるベンダーが役員クラスに露出度レポートを送るが、それらの数値はすべて異なる:測定している接点や手法が異なるからだ。社内独自の基準値を持たなければ、企業は「その争いから利益を得ている当事者同士の争い」を仲裁する羽目になる。
- 公表された測定基準に基づく一貫した数値は、誰も共有しない正確な数値に勝る:チームが必要としているのは、議論の余地をなくすための基準ではなく、議論を始めるための「土台」だ。
- チェンジマネジメント(変革管理)こそが最大の制約である:これまでのあらゆる商業のシフトと同様に、MD(マーチャンダイジング)、ブランド、コンテンツ、ITの各部門を一つのテーブルにつかせるには、およそ18カ月を要する。リスクが低いうちに始めるべきだ。
- 土台となる作業のほとんどは、やって損をすることはない:正確で、構造化され、機械可読な製品コンテンツは、オーガニック検索の掲載順位、コンバージョン率、リテールメディアの効率、そして特化型エージェントでのパフォーマンスを向上させる。この価値は、AIショッピングが世間に広く普及するかどうかに左右されるものではなく、他のビジネス領域にも確実にプラスとなる。
その影響力を追い求める価値があることを示す、確かな証拠もある。Similarwebのクリックストリーム調査によると、ChatGPTが推奨したブランドを目にしたユーザーは、7日以内にそのブランドのサイトを訪問する確率が2.5倍高くなり、そのトラフィックの56%は、AIからの直接のリンクではなく、指名検索を経由して流入していた。Similarwebはこの結果について、因果関係ではなく相関関係であるとしており、この調査は米国の3つのバーティカルにおけるデスクトップユーザーを対象としたものだ。これはまるで、看板広告を測定しているかのようである。すなわち、クリック数ではなく「認知の底上げ(リフト)」を測定しているのだ。
ただし、これらすべてに1つの注意書きが必要だ。ここで引用したほぼすべての研究は、賛否を問わず、このカテゴリーのソフトウェアを販売している企業によって作成されたものだ。だからといって結果が誤っているわけではないが、その数値をどの程度信用すべきかについては慎重になる必要がある。最も厳密な研究は学術的なものであり、その中心的な結論は「他のすべての数値には誤差範囲が必要だ」ということである。
今四半期にチームが取り組むべきことは何か?
数値を書き留める前に、測定手法を文書化し、その両方を一緒に公表することだ。ピンポイントな推定値ではなく、範囲(レンジ)で報告する。プロンプトのセットは、ブランドチームが「顧客にこう尋ねてほしい」と望む言葉からではなく、サイト内検索ログ、問い合わせのトランスクリプト、レビューのテキスト、パネルデータなど、実際に観察された顧客の言葉から構築する。特化型エージェントと汎用型エージェントは分けて追跡し、結果が一致しないことを前提とする。露出度とビジネスの成果は別々の列に分けて管理し、インクリメンタリティ(純増効果)は、唯一の有効な手段であるホールドアウト(除外)テストやマッチドマーケット(類似市場)テストを通じて測定する。すべてのベンダーに、データの収集方法を書面で確認する。そして、まずは地味な作業から始めよう。製品データのクレンジング、顧客のリアルな疑問に答えるコンテンツの作成、そしてクローラーを密かにブロックしていないファイアウォールの確認などだ。
測定値は間違っているだろうし、その間違いの理由は列挙できる。だが、それは「役に立つ間違い」である。そこで構築されるケイパビリティ(組織能力)――すなわち、確率論的で、AIエージェントが介在する顧客行動を論理的に分析できるチーム――は、チャットボットでの言及数をはるかに超える重要な意味を持つようになる。
ただし、小数第3位まで表示してはならない。



