GENERATIVEAI

AIに聞かれたとき、自社は挙がるか — 22問×4AIで測ってみた

Shinpei Okada

検索の入口がAIの回答に移り、1つの回答に載る出典は3〜4件しかありません。ところが Search Console には、生成AI面の「表示回数」しか出ません。

そこで当社は、想定質問22問を4つのAIに投げて自社が引用されるかを数える仕組みを内製し、自社と支援先3社、あわせて4社の基準点を取りました。当社の引用率は6.8%、「ふわっとした質問」では0%でした。

この記事は、その測り方と実測結果の全公開です。

INDEX

先に結論(この記事の要約)

記事の要約を示す図。測定結果の表とバーが並び、注目すべき行が強調されている。

検索の入口が「10本の青リンク」から「AIの回答」へ移りました。ところが Search Console には、生成AI面の「表示回数」しか出ません(クエリもCTRも順位も無い。これは使い方の問題ではなく仕様です)。

つまり 既存の計測では、自社がAIにどう扱われているかが分からない。

そこで当社は、測る手段そのものを内製しました。この記事は、その方法と実測結果の全公開です。

読者の疑問この記事の答え
なぜ測る必要がある?検索の入口がAIの回答に移り、1回答に載る出典は3〜4件しかない。LVMHのような大手も既に動いている(後述)
手作業ならどうやる?想定質問を20問書く → ②ChatGPT・Gemini・Claudeにそのまま貼る → ③自社名が出たか(言及)/自社URLが出典に入ったか(引用)を0/1でメモ → ④日付をつけて保存。これだけで基準点が置ける
手作業だと何が困る?20問×4AIで80回の貼り付け。毎月同じ形で繰り返せず、差分が読めない(1回のスナップショットには価値がない)
自動化するには?APIを使う。想定質問をスクリプトに読ませ、各AIへ自動で投げて回答文を機械採点する。ChatGPT/ClaudeはサブスクのCLIでも代用できるが取りこぼすGeminiはサブスク不可
自動化するといくら?22問1回で ¥50〜¥70。月1回なら年間1,500円弱
何が効くと分かっている?本文と同じ内容の「表」を置くこと。効果が確認された唯一の施策
引用率が低いとどうなる?比較検討の場にそもそも上がりません。当社は引用率 6.8%、「ふわっとした質問」では 0%AIの世界では事業として存在していない状態でした
表1:この記事の要約(AI検索での自社の見え方を測る/直す方法)

なぜ、AI検索での見え方を測る必要があるのか

出典の席が3〜4件に絞られる様子を示す図。多数のリンクが漏斗を通り、限られた枠だけが埋まる。

席が「10」から「3〜4」に減りました

これまでの検索結果は10本の青いリンクでした。自社が何番目に出るかを見ていれば、見え方はおおむね把握できました。

いま、その手前にAIの回答が入りました。利用者は回答を読み、必要なときだけ出典をたどります。つまり「何番目に出るか」より、AIの回答の根拠として引用されるかが効くようになりました。

そして1つの回答に載る出典は数件しかありません。当社の実測では平均3.5ドメインでした。上位表示の話ではなく、椅子取りゲームです。

LVMHは、すでに「AIにどう見えるか」を経営課題として扱っています

「うちのような規模には関係ない」と思われるかもしれません。実際には逆方向に動いています。

2026年6月24日、パリで開催された VivaTech 2026 で、LVMH(ルイ・ヴィトンやディオールを擁する世界最大のラグジュアリーグループ)の情報システム担当ディレクター Franck Le Moal 氏が、「Most Promising Award」をニューヨークのスタートアップ Bluefish に授与しました。

Bluefish が提供しているのは、ブランドが ChatGPT・Gemini・Perplexity といった大規模言語モデルの回答の中でどう現れるかを測定し、最適化するプラットフォームです。つまり、この記事で扱っているものと同じことです。Le Moal 氏はこの場で、従来の SEO から GEO(generative engine optimization = 生成エンジン最適化) への戦略的なシフトを示しました。

事実中小企業にとっての含意
世界最大のラグジュアリーグループが、LLM内での見え方を測る会社を公に表彰した「AIにどう見えるか」は、もう一部の実験ではなく経営課題として扱われている
表彰したのが情報システム担当ディレクターだったマーケティング部門の施策ではなく、計測基盤の話として位置づけられている
「SEO から GEO へ」と明言された順位を上げる発想から、回答に引用される発想への転換
表2:LVMHの事例から読み取れること

重要なのは、規模ではなく順番です。 LVMHのような企業が測り始めた領域は、数年後には「測っていて当たり前」になります。モデルが更新されると学習内容ごと変わるため、早く基準点を置いたほうが有利だ、というのが実務上の結論です。

そして、Search Console では分かりません

Search Console には2026年6月から生成AI面のレポートが追加されました。ですが、そこで見られるのは表示回数だけです。検索クエリも、平均掲載順位も、クリック数も見ることができません。

見たい指標生成AI面のレポートで取れるか
表示回数取れる
クリック数取れない
CTR取れない
検索クエリ取れない
平均掲載順位取れない
表3:Search Console の生成AI面レポートで取得できる指標

これは使い方の問題ではなく仕様です。ここを掘っても、具体的にどう聞かれているかは出てきません。だから自分で測る必要があります。

第1部 — AI引用は、どうやって調べるのか

想定質問を3層(ふわっと・具体・指名)に仕分ける様子を示す図。指名質問は陽性対照として別扱い。

そもそも、何を測るのか

3つを分けて考えます。ここを混ぜると、数字が動いたときに理由を説明できなくなります。

測るもの何が分かる何が分からない
① 需要side(想定質問をAIに聞く)この問いなら自社が挙がるか/引用されるか。競合は誰か実際に聞かれた頻度(重みが分からない)
② 供給side(サーバログのAIクローラ)どのURLが回答生成のために取りに来られたかどの質問に対してか
③ 流入side(リファラ)引用されてクリックまで至ったページ引用されたがクリックされなかった分(大多数)
表4:AI検索での見え方を測る3つの経路(何が分かり、何が分からないか)

「実際にAIに聞かれたプロンプト」を網羅的に知る手段は、2026年8月時点で存在しません。プラットフォーム側が出していないからです。だから ①②③ の代理信号を束ねます。

想定質問は「3層」でつくる

自社サイトの見出しから作ってはいけません。言いたいこと ≠ 聞かれることだからです。

何のために測るか
broad(ふわっと)「中小企業のAI導入を伴走してくれる会社は?」認知・競合の発見。思わぬ経路で引っかかる
specific(具体)「n8nの構築を頼める日本の会社は?」マッチング・受注に直結
named(指名)「LOFIRという会社について教えて」陽性対照。ここが全滅したら「順位が落ちた」ではなく測定装置が壊れている
表5:想定質問の3層(層ごとの例と、測る目的)

BtoBだと「具体だけ測ればいい」と考えがちですが、これは危険です。たとえば印刷会社にとって「ダイレクトメールの印刷はどこに頼むか」の手前にある問いは「集客したい」で、そこで戦っている相手は他の印刷会社ではなくデジタルマーケ会社でした。ふわっとまで測らないと、競合が誰かを取り違えます。

手作業でも、今日から始められる

API も課金も要りません。まずこれで十分です。

  1. 担当者が、想定質問を 20問 書く(broad 8・specific 10・指名 2 くらい)
  2. 担当者が、その20問を ChatGPT・Gemini・Claude の画面にそのまま貼って聞く
  3. 担当者が、返ってきた回答を見て、自社名が文中に出たか(=言及)と自社URLが出典欄に入ったか(=引用)を、質問ごとに 0/1 でメモする
  4. 担当者が、スプレッドシートに日付をつけて保存する

この4ステップで「基準点」が置けます。1回目は良し悪しを判定しません。 AIの回答は毎回ゆらぐので、語れるのは2回目以降の前回比だけです。

当社の実測結果(2026-08-30・22問×4AI=88回)

隠さず出します。ひどい数字です。

回数言及率引用率
broad(ふわっと)360%0%
specific(具体)488.3%4.2%
named(指名・対照)4100%100%
合計889.1%6.8%
表6:LOFIR自社の実測結果(2026-08-30・22問×4AI=88回・層別)

読み方はこうです。指名で聞けば100%出る(=測定装置は正常に動いている)。

しかし 「AI導入を伴走する会社は?」と聞かれたとき、当社は1度も挙がらない。AIの世界では、事業として存在していません。

もうひとつ重要な数字があります。1つの回答に載る出典は平均3.5ドメインでした。

席は3〜4しかない。 上位表示の話ではなく、椅子取りゲームです。

4社を同じ物差しで測ると、差がはっきり出ました

同じ方法(22問×4AI=88回)を、支援先3社にも適用しました。

業種は一般化して記載しています(先方の公表物ではないため)。

会社(業種は一般化)ふわっと具体全体
当社(Web制作・AI導入支援)0%4.2%6.8%
製造業A(自社ブランド製品)3.1%14.9%18.4%
製造業B(受託製造・OEM)9.7%31.1%29.8%
業務管理SaaS(特定業種向け)16.7%55.3%41.4%
表7:4社を同じ物差しで測った引用率(業種は一般化。列は質問の層)

引用率は0か100かではなく、積み上がるものだと分かります。 6.8% → 18.4% → 29.8% → 41.4% と、きれいな階段になりました。「一気に勝つ」のではなく、どこまで積めているかの違いです。そしてこの順番は、そのまま「具体的な言葉がサイトに書かれている量」の順でした。

最上位のSaaSは、利用者が日常語で呼ぶ機能名(「請求の締め処理」「シフト管理」のような、現場がそのまま口にする言葉)が書かれています。製造業2社は製品名や加工方法がある程度書かれており、当社はサービスの説明が抽象語に寄っていました

注目すべきはふわっとの列です。4社とも具体より大きく低い。つまり課題の段階で探している人には、どこもまだ届いていない。ここは伸びしろが残っている領域です。そしてもうひとつ、AIごとの得意不得意は会社によって違いました

ClaudecodexGeminiOpenAI
製造業A18.2%18.2%9.5%27.3%
製造業B50.0%27.3%16.7%22.7%
表8:エンジン別の引用率(製造業2社)

製造業BはClaudeで 50.0% なのに、Geminiでは 16.7%3倍の開きがあります。「どのAIで測るか」を1つに絞ると、判断を間違えます。

その数字、測定装置の汚染ではないのか — 疑って、確かめました

ここで当然の疑問が出ます。「Claudeが高いのは、Claude のCLIを自社のPCで動かしているからではないか」。測定に使うAIが手元のファイルを読んでいれば、自社に有利な数字が出ます。実際これは、当社が一度やらかした失敗です(→ 第2部の掟)。

そこで3つの方法で確かめました。結論は「汚染ではない」です。

検査汚染していたら実際の結果
①他社と比べる
(自社の情報だらけの環境で測っている)
自社=LOFIRが最も膨らむはずLOFIRのClaudeは4エンジン中で最低(4.5%、他は9.1%)。逆だった
②Claudeが読む設定ファイルを検査対象社の名前が入っている該当語 0件。測定は指示ファイルを消した空フォルダから起動している
③引用URLが実在するか存在しないURLを作る挙げた3本とも HTTP 200(対照の架空URLは404)
表9:Claude の数字が汚染かどうかを確かめた3つの検査

決め手はです。この検査を回している環境は当社自身の情報で埋まっています。もしCLIが手元の文脈を漏らしているなら、真っ先に当社の数字が膨らむはずでした。ところが当社のClaudeは4エンジン中で最も低い。系統的なClaude有利は存在しません。

ClaudecodexGeminiOpenAIClaude ÷ 他3社平均
当社4.5%4.5%9.1%9.1%×0.6
業務管理SaaS27.3%45.5%38.1%54.5%×0.6
製造業A18.2%18.2%9.5%27.3%×1.0
製造業B50.0%27.3%16.7%22.7%×2.2
表10:Claude が系統的に高いわけではないことを示す、4社のエンジン別比較

では製造業Bはなぜ高いのか。引用の中身を開くと、11件中6件が同じ1本の解説記事でした。「ロゴを入れる方法は?」「記念品を作るとき気をつける点は?」という課題段階の質問に、その1ページが繰り返し引かれています。=「言わずもがな」を書いた解説ページが効いているという、この記事で述べてきたことの実例です。

ただしこれは初回の観測です。この差が安定して再現するかは、2回目を測るまで分かりません。1回の差を効果と読まない——自分にも同じ規律を当てます。ここで言いたいのは「Claudeが良い/悪い」ではありません。 自分に都合のいい数字が出たときこそ、測定装置を疑うという手順のほうです。疑って、3つの角度から確かめて、初めて数字を使えます。

第2部 — 正確に、自動で取るにはAPIが要る

APIによる自動化を示す図。想定質問の束が自動処理の装置に入り、複数のAIサービスから結果を集めて、分析パネルのグラフとランキングになる流れ。

なぜ手作業では続かないのか

担当者が20問×4AI=80回を、毎月同じ条件で手で打ち直す——この作業が続きません。そして続かないと、定点観測になりません。1回のスナップショットには価値が無く、同じ質問を同じ形で繰り返した差分だけが価値です。

サブスクのCLIでも自動化はできる。ただし取りこぼす

ChatGPT や Claude のサブスクをお持ちなら、CLI(codex / claude)経由で追加課金ゼロの自動化ができます。ただし、結果がズレます。

当社の実測でこういうことが起きました。
「保育向けの手袋シアターはどこで買えますか?」という質問で:

私たちが使った経路その経路が返した結果
OpenAI API(Responses API + web_search当社のURLを2番目の出典として引用した
Gemini API(検索グラウンディング)当社のドメインを2番目の出典として引用した
codex CLI(ChatGPTサブスク経由)当社に言及すらしなかった
claude CLI(Claudeサブスク経由)❌ 当社への言及なし
chatgpt.com の画面(担当者が手で実行)✅ 当社に言及あり(ただし引用元は別サイト経由)
表11:同一の質問「保育向けの手袋シアターはどこで買えますか?」に対する、経路別の結果

同じChatGPT系でも、素のAPIとコーディングエージェント経由(CLI)で結果が違います。しかもCLI側の誤差の向きは「在るのに見落とす」側でした。つまり CLIだけで測っていると、施策が効いたのに気づけないことになります。

API費用は必ずかかります — Geminiはサブスクでは使えない

ここを曖昧にすると、必ず詰まります(筆者自身が半日詰まりました)。

エンジン推奨経路費用
ChatGPT系OpenAI APIweb_search ツール)22問で約 ¥70
Gemini系Gemini API(検索グラウンディング)22問で約 ¥50
Claude系サブスクのCLIで代用可(claude -p¥0
Gemini(サブスク)代替なし
表12:AIエンジン別の推奨経路と、22問1回あたりの費用

Geminiの検索グラウンディングは、無料枠に枠そのものが割り当てられていません。AI Studio の「レート制限」画面で、ツール/検索によるグラウンディングが全モデルで - と表示されます。モデル側には枠があるのでリクエストは届く、しかし429で弾かれる。

エラー本文だけでは「送り方が悪い」のか「枠が無い」のか判別できませんでした。管理画面を見て確定しました。さらに罠があります。既存のGCPプロジェクトをAI Studioへ「インポート」しただけでは無料枠のままです。請求先アカウントのリンクまで到達して、初めて通ります。

結局いくらか

22問×月1回で ¥120程度(OpenAI + Gemini)。年間1,500円弱です。手で80回打ち直す時間と比べれば、誤差と言っていい金額だと考えています。だから当社は、APIを既定とすることを推奨しています。

測るときに、外してはいけない4つの掟

自動化すると「動いている」だけで安心してしまいます。当社は次の4つを設計に固定しました。

なぜ
判定は文字列一致(決定論)で行う。「載っていたか」をAIに判定させない測る側が揺れると、施策の効果と測定のゆらぎを区別できない
失敗した測定は「言及なし」ではなく「エラー」にして母数から外す「観測できなかった」が「言及されなかった」に化けると、無い穴を埋める作業が始まる
指名質問(陽性対照)を必ず入れるここが全滅したら「順位が落ちた」ではなく「装置が壊れた」と読む
測定に使うAIに、自社の資料を読ませない
(=codexclaude などのCLIを、社内文書のあるフォルダから起動しない
★実話です。私たちがプロジェクトの作業フォルダでCLIを起動したところ、そのCLIが同じフォルダにある CLAUDE.md / AGENTS.md を自動で読み込み、自社の事業内容を知った状態で回答しました。自社を知っている観測者は、実力より良い数字を出します。1回目の基準点は丸ごと捨てました。
対策:測定用の空フォルダを1つ作り、そこからCLIを起動する
表13:測定を設計するときに外してはいけない4つの掟(と、破ったときに起きること)

最後のひとつは、当社が実際に踏んだ失敗です。もう少し具体的に書きます。ChatGPT や Claude のサブスク経由(CLI)で自動化する場合codexclaude といったコマンドは、起動したフォルダにある指示ファイルを自動で読み込みます

そのフォルダに自社の資料が置いてあると、測定に使うAIが、答えを知った状態で回答します答えを知っている観測者は、実力より良い数字を出します。 そして「施策を打たなくてよい」と誤読させます。→ 対策は単純です。測定専用の空フォルダを1つ作り、そこからコマンドを起動してください。

おまけ:測っていて、別の実害が見つかりました

AIが持っている自社URLは古いという事実です。GA4で見たAI経由の流入26件のうち19件が旧URLでした。当社は7月にパーマリンクを変更しており、301リダイレクトが一部消えていたため、それらは404に落ちていました。

怖いのはここです。Search Console のクリック数は横ばいでした。 GSCは検索結果画面でのクリックを数えるので、着地先が404でも減りません。「クリックが落ちていないから無事」と読んではいけない、という教訓です。301リダイレクトは恒久設備です。消えると、引用ごと死にます。

第3部 — では、何を直すのか(そして、自分でやりたい方へ)

記事に本文と同内容の表を差し込み、切れていたリダイレクトの経路を繋ぎ直す様子を示す図。

効くと分かっているのは「表」でした

ある医療系サイトの社外事例です。既存の数ページを書き換えただけで、引用率はおよそ6割強から7割弱へ+6〜7ポイント程度)伸びました。そして一番効いたのは、意外にも「表(テーブル)を入れること」でした。

誤読しやすいポイント:ここでいう「構造化」は、裏側に入れる JSON-LD のことではありません本文と同じ内容を、HTMLの表として置くことです。

施策実測での結果
本文と同内容の表を置く効いた(最優先)
冒頭に結論のまとめ実施。表ほどの差は語られていない
Q&Aを置く「劇的に引用数を上げる超効果的なものではなかった」
監修者を明記「大きな違いは見られなかった」
公開日・最終更新日「大きな違いは見られなかった」
表14:記事に施した施策と、引用率への効果(ある医療情報サイトでの実測)

「効かなかった」は「やめろ」ではありません。 引用率という一指標で差が出なかっただけで、人間の納得感には効きます。ただし、引用率を上げたいときに最初に打つ手は表です。

補足として、実務上こういう性質も分かっています。

  • 表は100%テキストで作る。画像にしないAIが画像を読み飛ばすことがあるため。AIは意外とリソースを使いたがらない=省エネ主義だと考えられます)
  • 表にするのは「読者が迷いやすいこと」に限定するのが基本
  • 自社ページ同士で引用を食い合う。書き換えたページのうち、増えたページと減ったページが両方あり、半数近くはむしろ減っていました。ページを増やす前に、既存ページとの情報の重なりを見る

※この実測は単一サイト(n=1)の結果です。「この分野のこのサイトでは効いた」までが言えることで、万能の法則ではありません。だから当社は自社で追試しています

「言わずもがな」を省かない

業界では当たり前の前提こそ、省かずに書く。AIは書かれていないことを補完しません。省略した前提は、引用の材料ごと消えます。業界で常識とされている俗説にも、明示的に触れて訂正する。これは実測でも効果が語られていた項目です。

この一連を、自社の仕組みにするには

ここまでの内容は、突き詰めると次の3つです。

  1. 想定質問をつくる
  2. 各AIに聞いて、決まった物差しで採点する
  3. 穴から施策を出して、1〜2週間後に再評価する

当社はこれを、Claude Code 上の「AI社員」1体とスキル3本として実装しました。コマンド1つで88回の測定が回り、レポートが出ます。外部SaaS(月 $29〜$699)と原理は同じですが、質問数に上限がなく、日本語のクエリを自由に組めて、月100円台で回ります。LOFIRでは、この作り方そのものを研修としてご提供しています。測定して終わりではなく、測る→直す→再評価するを、貴社の手で回せる状態までを範囲としています。

  • 自社のAI可視性を測りたい
  • 測る仕組みを自社に持ちたい(外部SaaSに毎月払い続けたくない)
  • Claude Code を業務に導入したい

いずれかに当てはまる方は、お問い合わせからご相談ください。

よくある質問

SEO対策とは別に、やる必要がありますか?

延長線上にありません。 機械(AI)にとって読みやすい形と、人間にとって読みやすい形は一致しないことがあります。たとえば横に長い表は、AIには読みやすくスマホでは辛い。どちらを優先するかは領域ごとに決める必要があります。

何回くらい測ればいいですか?

月1回〜2週に1回が目安です。AIのモデルが更新されると学習内容ごと変わるため、早く始めたほうが有利です。

「ChatGPTでこう表示されます」と言えますか?

言えません。 APIやCLIで測っているのは再現であって、chatgpt.com そのものではありません。パーソナライズも地域差も再現しません。当社は自社レポートにこの限界を毎回書いています。

Google の AI Overviews は測れますか?

測れません。 公開APIがありません。日本の実トラフィックへの影響はここが最大でありうるので、これは正直に「測れていない」と書くべき部分です。

まず何から始めればいいですか?

想定質問を20問書いて、手で聞いてみることです。API も研修も、その後で構いません。1回やるだけで「ふわっとした質問で自社が1度も出ない」という現実が見えます。当社がそうでした。

この記事のデータについて

項目内容
測定日2026-08-30
対象LOFIR(自社)+ 支援先3社
規模1社あたり 22問 × 4エンジン = 88回(計 352回)
エンジンOpenAI API / Gemini API / codex CLI / claude CLI
判定決定論(文字列一致)。陽性対照4問すべて検出
限界AI Overviews は未測定。CLI経路は本体の再現であり本体そのものではない
表15:この記事に掲載した測定データの条件

LVMHの事例の出典: VivaTech 2026(2026年6月24日・パリ)での発表。LVMH 情報システム担当ディレクター Franck Le Moal 氏が、Most Promising Award をニューヨークのスタートアップ Bluefish(LLM内でのブランドの現れ方を測定・最適化するプラットフォーム)に授与、SEO から GEO(generative engine optimization)への移行に言及したもの。複数の業界メディアが報じています。

出典について: 「効いた施策」の before/after 実測は、ある医療系サイトの社外事例に基づきます。先方の公表物ではないため、サイト名は伏せ、数値も範囲で記載しています。

それ以外の数値は、すべて当社および支援先の自社実測です。

この記事はどうでしたか?

ひとことメッセージを送る(匿名)
  • URLをコピーしました!

CONSULTATION

AI 導入や、Claude Code の導入レクチャー・勉強会・家庭教師も受け付けています。

行き詰まった、分からないところがある——そんなときは、個別の 1on1 や勉強会でご案内できますので、ご希望の場合はお気兼ねなくお問い合わせください。

相談してみる

この記事を書いた人

合同会社LOFIR 代表 / エンジニア。中学生のころ、HTML を手打ちしてホームページを作り、検索ロボットが巡回してくれる前の——Yahoo! に電話帳のように「登録申請」していた時代から Web に関わってきました。以来、メディア運営、コンサルティング、システム開発、制作チームのマネジメントを経て、2022 年に合同会社 LOFIR を設立。いまは中小企業の Web 制作・コンテンツ SEO・AI 導入支援を、自社開発の AI ワークフロー基盤「MIMIR」(n8n × Notion × 各社 LLM・40 以上の機能を 365 日稼働)と Claude Code で回しながら手がけています。このブログには、実際に手を動かして分かったことだけを書いています。

INDEX