aaam
SEO・AIO

AIクローラーを止めるべきか|Google-Extendedで止まるもの、止まらないもの

AIクローラーを止めるべきか|Google-Extendedで止まるもの、止まらないもの

アーム代表の伊藤です。
Google-Extendedをrobots.txtでブロックしても、Google検索のAIによる概要やAIモードでの利用は止まりません(Google公式ドキュメント、2026年9月17日確認)。止まるのはGeminiアプリとVertex AIでの学習とグラウンディングだけです。

「タダで使われるのが気持ち悪い」という直感と、「止めて何を失うか分からない」という不安は、別の問題です。運営元8つの公式仕様と文化庁の資料をもとに、この2つを切り分けて整理します。

最初の一覧表で「止めると何を失うか」を確かめ、3つの問いで止めるべきかを決められる構成にしています。

AIクローラーを止めるべきかは、「失うものを言えるか」で決まる

  • 8社公式ドキュメントを2026年8月12日確認
  • Perplexity遮断は学習を1件も減らさない
  • AI概要はGoogle-Extendedの対象外

AIクローラーを止めるべきかの判断は、機能の有無ではなく「学習されて失うものを説明できるか」で決まります。説明できないなら、止めない。これが基本線です。

AIクローラーの一覧は多くの記事にありますが、判断に要るのは「止めると何を失うか」の列です。運営元8つの公式ドキュメントを、この軸だけで並べ直しました。すべて2026年8月12日に各社の公式ドキュメントで確認した内容です。

「タダで使われるのが嫌だ」という感覚も、判断の材料になる

ここまでは主に、事業でサイトを運営している方に向けた話です。ただ、公開されている相談を見ると、無料のホームページ作成サービスで個人のサイトを持っている方から「生成AIの学習の対象になるのを拒否する設定はあるか」という質問も出ています。事業の損得というより、自分が書いたものが対価なく誰かの答えの材料にされる感覚への抵抗です。

この感覚を否定する必要はありません。ただしrobots.txtで止められる範囲は、事業でも個人でも同じです。次の一覧表と3つの問いは、そのまま個人のサイトにも当てはめて読んでください。

自社に来ているクローラーの正体、まず一覧で確認

クローラー

運営元

役割

Googlebot

Google

Google検索のインデックス

Google-Extended

Google

Gemini学習+グラウンディング

GPTBot

OpenAI

基盤モデルの学習

OAI-SearchBot

OpenAI

ChatGPT検索の表示

ChatGPT-User

OpenAI

ユーザー起点の取得

OAI-AdsBot

OpenAI

ChatGPTの広告の検証

ClaudeBot

Anthropic

生成AIモデルの改善のための収集

Claude-SearchBot / Claude-User

Anthropic

検索品質の改善 / ユーザー起点

PerplexityBot

Perplexity

Perplexity検索の表示

Perplexity-User

Perplexity

ユーザー起点の取得

CCBot

Common Crawl

オープンなWebアーカイブ

Applebot-Extended

Apple

Apple基盤モデルの学習

Meta-ExternalAgent

Meta

基盤モデルの学習+インデックス

Bing(NOCACHE / NOARCHIVEメタタグ)

Microsoft

メタタグで学習と回答利用を制御

止めたら何が消え、何が残るのかの対応表

クローラー

失うもの

学習は止まるか

Googlebot

Google検索・AIによる概要・AIモードの全部

検索ごと消える

Google-Extended

Geminiアプリ・Vertex AIでの利用

Gemini系のみ止まる

GPTBot

今後の学習への利用

止まる

OAI-SearchBot

ChatGPT検索の回答での表示

もともと学習用ではない

ChatGPT-User

ユーザーの求めに応じた個別アクセス

対象外

OAI-AdsBot

ChatGPTへ出稿した広告の審査と、関連性の判定

もともと学習に使われない

ClaudeBot

今後の収集への利用

止まる

後半7種の対応も、同じ基準でまとめます。

クローラー

失うもの

学習は止まるか

Claude-SearchBot / Claude-User

検索品質向上・回答時のアクセス

もともと学習用ではない

PerplexityBot

回答でのリンク表示のみ

減らない

Perplexity-User

ユーザー起点の取得

対象外

CCBot

今後の収集が止まる

今後の収集分のみ

Applebot-Extended

学習への利用のみ

止まる

Meta-ExternalAgent

Metaの学習と製品での利用

止まる

Bing(NOCACHE / NOARCHIVEメタタグ)

NOARCHIVEで回答・学習から除外

タグの種類による

  • Googlebot:事実上の退場
  • Google-Extended:検索とAIによる概要はそのまま
  • GPTBot:ChatGPT検索の露出は別トークンなので残る
  • OAI-SearchBot:ナビゲーショナルリンクは残りうる
  • ChatGPT-User:robots.txtが適用されないことがある
  • PerplexityBot:学習はもともとしていない
  • Perplexity-User:robots.txtを一般に無視すると公式が明記
  • CCBot:過去に収集済みのアーカイブが消えるとは公式に書かれていない
  • Applebot-Extended:検索結果には引き続き掲載されうる(そもそもクロールしないトークン)
  • Meta-ExternalAgent:robots.txt反映は最大24時間
  • Bing(NOCACHE / NOARCHIVEメタタグ):どちらのタグでも通常のBing検索には表示され続ける

同じ遮断でも、失うものの中身は違う

この表から、判断を左右する事実を3つだけ抜き出します。

  • PerplexityBotのブロックは、学習を1件も減らさない純粋な機会損失
  • OAI-SearchBotのブロックはChatGPT検索の露出を消す。学習は止まらない
  • Google-Extendedのブロックは、Google検索のAIによる概要には及ばない

Google-Extendedを止めても、検索の露出は消えない

  • Gemini学習とグラウンディングのみ停止
  • 検索のAI概要・AIモードは対象外
  • 検索順位のシグナルには使われない

Google-Extendedで止まるのは、GeminiアプリとVertex AIでの学習およびグラウンディングだけです。Google検索のAIによる概要とAIモードには及びません。

止まるのはGeminiアプリの学習とグラウンディングだけ

Google-Extendedとは、自社サイトのコンテンツをGoogleのAI学習から外すための、独立した製品トークンです。

robots.txtに数行書くだけで設定できます(※robots.txt…サイトのルート直下に置く、クローラーへのアクセス可否を伝えるテキストファイル)。

ただし、このスイッチで止まる範囲は多くの人の期待より狭いので、先に「止まるもの」と「止まらないもの」を分けます。

Googleの公式ドキュメント「Google's common crawlers」(2026年7月14日更新)によると、Google-Extendedが管理するのは次の2つです。

  • 将来のGeminiモデルの学習に、自社サイトのコンテンツを使わせるかどうか
  • GeminiアプリとVertex AIでのグラウンディングに使わせるかどうか(※グラウンディング…回答の正確さを上げるため、回答生成の瞬間にGoogle検索インデックスの内容をAIへ渡す仕組み)

つまりGoogle-Extendedのブロックが及ぶ範囲は、GeminiアプリとVertex AIというGoogleの「AI製品」側に限られます。

同じドキュメントには「Google-Extended does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search.」(Google-ExtendedはGoogle検索への掲載に影響せず、ランキングシグナルとしても使われない)と明記されています。安心材料であると同時に、次の見出しの伏線でもあります。

AIによる概要とAIモードは、止めても消えない

Google検索の検索結果に出るAIによる概要(AI Overviews)とAIモードは、Google-Extendedの管轄外です。

解説記事のなかには「Google-ExtendedをブロックすればAIによる概要から消える」と書いているものがありますが、公式仕様はそうなっていません。

Googleの公式ドキュメント「AI features and your website」(2025年12月10日更新)は、AIは検索に組み込まれた機能の一部であり、その制御はGooglebot向けのrobots.txtディレクティブで行う、と説明しています。

そして同じページで、Google-Extendedは「Googleのその他のシステムでの学習とグラウンディングを制限する」ための道具だと位置づけています。

検索内のAI機能はGooglebotの管轄、Gemini製品はGoogle-Extendedの管轄、という縦割りです。

家の分電盤にたとえると、Appleの分電盤には部屋ごとのブレーカーが並んでいるのに、Googleの分電盤には「検索内のAI機能」という部屋のブレーカーがありません。

あるのは家全体の主幹ブレーカー(Googlebot)と、離れの小屋のブレーカー(Google-Extended)だけです。

AIによる概要だけを外す方法は、公式仕様に存在しない

それではAIによる概要だけを外したい場合はどうするのか。Googleが公式に挙げる手段は、nosnippet、data-nosnippet、max-snippet、noindexの4つだけです(前掲「AI features and your website」)。

問題は、この4つがいずれもAI専用のスイッチではないことです。nosnippet系を使えば通常の検索結果のスニペット(説明文)も同時に消え、noindexを使えば検索結果そのものから消えます。

AIによる概要だけをピンポイントで外して、通常の検索の見え方は維持する、という手段は2026年9月17日時点の公式仕様に存在しません。ここが、AIクローラーの制御を考えるときの最初の分岐点になります。

AIクローラーは3種類ある。まとめて止めてはいけない理由

  • 分類は学習用・検索回答用・ユーザー起点の3つ
  • Applebotは巡回せず検索結果は残る
  • Perplexityは学習に不使用と公式明言

AIクローラーと一括りに呼ばれるものは、役割で3種類に分かれます。

同じ会社のクローラーでもトークンごとに役割が違うため、「OpenAIをブロック」「Googleを許可」のような会社単位の判断をすると、止めたいものが止まらず、失いたくないものだけを失います。

なお、LLMOやAIOといった用語の整理は別記事にまとめているので、本記事では繰り返しません。

学習用

GPTBot、ClaudeBot、Google-Extendedなど

AIの基盤モデルの学習素材を集めるクローラーです。

該当するのは、この6つです。

  • GPTBot(OpenAI)
  • ClaudeBot(Anthropic)
  • Google-Extended(Google)
  • CCBot(Common Crawl)
  • Applebot-Extended(Apple)
  • Meta-ExternalAgent(Meta)

ブロックすれば、今後の学習への利用をオプトアウトする意思表示になります。

Applebot-Extended

内容

補足

Apple公式の定義

学習からのオプトアウト用トークン

「検索用クローラー」とする解説記事とは食い違う

ページの巡回

行わない

クロールするクローラーではない

ブロック後の検索結果

掲載は続く

学習・AI回答・検索が別スイッチの設計

なお、Applebot-Extendedを「検索用クローラー」として分類している解説記事がありますが、Apple公式の定義は「Apple基盤モデルの学習からのオプトアウト用トークン」です。

Applebot-Extended自体はページをクロールせず、ブロックしても検索結果には掲載され続けます。

Appleは「学習」「AI回答の材料」「検索インデックス」を別々のスイッチとして分けている、いちばん設計の綺麗なプラットフォームです。

検索・回答用

OAI-SearchBot、PerplexityBotなど

AI検索の回答に自社サイトを表示するためのクローラーです。該当するのは3つです。

  • OAI-SearchBot(ChatGPT検索)
  • PerplexityBot(Perplexity)
  • Claude-SearchBot(Anthropic)

OpenAIの公式ドキュメントには、OAI-SearchBotをオプトアウトしたサイトはChatGPT検索の回答に表示されなくなる(ただしナビゲーショナルリンクとしては表示されうる)と明記されています。ブロックの対価は、学習の停止ではなくAI検索からの露出です。

止めるトークン

起きること

起きないこと

OAI-SearchBot

ChatGPT検索の回答に出なくなる

学習の停止(対価は露出のほう)

PerplexityBot

回答へのリンク表示の機会が減る

学習量の削減(基盤モデルに不使用と公式が明言)

一括遮断の危うさを1行で証明する事実があります。

Perplexityの公式ドキュメント「Perplexity Bots」は、PerplexityBotについて「It is not used to crawl content for AI foundation models.」(AI基盤モデルのためのコンテンツ収集には使われない)と明記しています。

つまりPerplexityBotをブロックしても、学習に使われる量は1件も減りません。減るのは、Perplexityの回答に自社サイトへのリンクが表示される機会だけです。

学習対策のつもりでブロックすると、防犯のつもりで店の看板を下ろすことになります。泥棒は止まらず、お客様だけが止まります。

ユーザー起点

ChatGPT-User、Perplexity-Userなど

ユーザーがAIに質問した瞬間に、AIが代わりにページを見に行くタイプです。該当するのは3つです。

  • ChatGPT-User(OpenAI)
  • Perplexity-User(Perplexity)
  • Claude-User(Anthropic)

ユーザーの指示による取得なので、robots.txtのルールが適用されないことがある、と各社が公式に述べています。

項目

内容

補足

動き方

ユーザーの指示でAIが代わりにページを取得

自動巡回ではない

robots.txtの扱い

適用されないことがある

各社が公式に説明している

Perplexity-User

ルールを一般に無視

公式ドキュメントがそう書いている

Perplexityの公式ドキュメントは、Perplexity-Userについて「ユーザーが取得を要求したため、robots.txtのルールを一般に無視する」とまで明記しています。

robots.txtという道具の限界が、公式仕様の側に書いてある領域です。

例外

3分類に当てはまらないOAI-AdsBot

もう1つ、この3分類のどれにも当てはまらないトークンがあります。OpenAIのOAI-AdsBotです。

項目

内容

補足

役割

ChatGPT広告のページ検証と、関連性・タイミングの判定

広告向けの専用トークン

学習への利用

使われない

公式のクローラー一覧に書かれている

事業への影響

ほぼなし

ChatGPTに広告を出す予定がなければ

ChatGPTへ出稿された広告のページが安全かを検証し、広告を出す関連性とタイミングを判定するためのもので、OpenAIは公式のクローラー一覧で「このボットから得たデータは生成AIモデルの学習には使わない」と明記しています。

ChatGPTに広告を出す予定がなければ、止めても通しても事業への影響はほぼありません。判断の優先度はいちばん低い枠として扱ってください。

AIクローラーを止めるべきかを決める、3つの問い

  • 問いは失うもの・ライセンス・流入数の3つ
  • 生成AIパフォーマンスレポートは2026年6月開始
  • 流入×問い合わせ率×粗利で手放す額を試算

ここまでで、何が止まって何が止まらないかは出揃いました。残るのは「では止めるべきか」です。AI学習の遮断は、コストゼロの防御策ではありません。止めた瞬間に失うのはAI検索経由の露出と指名想起で、それは半年後の商談の入口です。

判断すべきは「守るか否か」ではなく、そのコンテンツは学習の養分にされる損より、推薦されない損のほうが大きいか。次の3つの問いで決められます。

問い1

学習されて失うものを、言葉にできるかどうか

最初の問いがいちばん重要です。学習されると事業のどの数字が毀損されるのかを言葉にできるか。「なんとなく気持ち悪い」だけでは判断できません。ほとんどの事業会社のサイトは、サービス紹介と事例と問い合わせフォームでできています。

この構成のコンテンツは、学習されて失うものを言語化しにくい一方、AIの回答に載らなくなる機会損失は問い合わせ件数という実数で表れます。説明できないなら、止めない。これが基本線です。

問い2

そのコンテンツを、別途ライセンス販売できるかどうか

有償で販売しうる独自データベース、独自調査、会員限定資料を持っている場合だけ、話が変わります。

対象

遮断の法的な意味

取るべき動き

有償販売しうる独自データベース・調査・会員資料

生じうる

該当部分だけ技術的措置+法律の専門家に相談

サイト全体

一括遮断の理由にはならない

この場合でも対象は絞る

文化庁の資料の整理のとおり、技術的措置とデータベース販売(の予定)が組み合わさると、robots.txtのブロックに法的な意味が生じうるからです。

該当するなら、その部分だけを対象に技術的措置を講じ、あわせて法律の専門家に相談する価値があります。サイト全体を一括で遮断する理由には、この場合でもなりません。

問い3

AI検索経由の流入は、いまの件数を先に数える

止める・通すの判断は、感情ではなく自社の実数でやります。見る場所は2つです。Googleの「生成AIパフォーマンスレポート(検索)」(2026年6月3日提供開始)と、GA4の参照元に出るAIサービスのドメイン。

見る場所

わかること

限界

生成AIパフォーマンスレポート(検索)

AIによる概要・AIモードの表示回数

クリック数・順位は取れない

GA4の参照元

AIサービスのドメイン経由の流入

実測の公開例は本文のリンク先を参照

  • 「生成AIパフォーマンスレポート(検索)」で取れる指標は表示回数・ページ・国・デバイス・日付のみで、クリック数と掲載順位は取れない。

前者はAIによる概要とAIモードでの表示回数を見られますが、指標は表示回数・ページ・国・デバイス・日付のみで、クリック数や掲載順位は取得できません。

公式ヘルプによれば、2026年8月31日に全プロパティへの展開が完了しています(2026年9月17日確認)。

小さいうちに方針を決めておくのが安上がりです。数字が小さいことは、無視してよい理由にはなりません。アームの自社サイトでの流入の実測は「TOFU・MOFU・BOFUとは?意味と違い、見込み客がどの段で止まるかの見つけ方」で公開しています。

そして、その数字を止める判断の値札に変換します。掛け算は単純です。AI検索経由で来ている月あたりのセッション数に、サイト全体の問い合わせ率と、問い合わせ1件あたりの粗利を掛ける。

これが、遮断を選んだときに毎月手放す金額の見積もりになります。精度の高い数字にはなりませんが、役員会の議題としては「AIに学習されるのが気持ち悪い」よりはるかに扱いやすい形です。

そして学習される側の損は、多くの事業会社でこの式の右辺に置ける数字が1つも出てきません。出てこないという事実そのものが、答えになります。

この3つの問いに答えて、役員会に出す一枚(止める・通すの判断表)まで作りたい場合は、現状の数字から一緒に作ります。役員会に出す判断材料づくりから相談する

robots.txtの書き方は、止めると決めたトークンを並べるだけ

  • 設定は2行、User-agentとDisallow
  • Metaは反映に最大24時間と案内
  • 確認はルート直下のrobots.txtを開く

止めるものを決めたあとのrobots.txtの書き方は、2行で終わります。

User-agent: GPTBot
Disallow: /

止めたいAIクローラーが複数あるなら、このセットをトークンごとに繰り返します。一部だけを対象にする場合は、Disallowの値を「/archive/」のようにパスで指定します。

許可を明示したいときは、Allowを使う

逆に「このディレクトリだけは通す」と書きたいときはAllowを使いますが、何も書かなければ通るのが既定の挙動なので、Allowを並べる必要は本来ありません。書くとすれば、意思を明示して自分と後任が読み返せるようにするためです。

置き場所はサイトのルート直下です。書き換えたら、ブラウザで「https://自社ドメイン/robots.txt」を開き、公開されている内容が意図どおりかを確認してください。Metaのように、robots.txtの変更の反映へ最大24時間かかると案内している運営元もあります。

通すと決めたら、次にやることがある

通す判断をした場合の次の一歩は、制作の工程でAI検索向けの作り込みをすることです。詳しくはこちらに整理しています。

この記事の一覧表を自社サイトに当てはめて、どれを止めてどれを通すかを決めかねている場合は、現状の流入データから一緒に見ます。まだ何も設定していない状態からで構いません。AIクローラーを止めるべきか、現状の流入から相談する

robots.txtに「AI学習禁止」と書けば、法的に守られるのか

  • 意思表示だけでは著作権法30条の4に届かない
  • 技術的措置+販売予定で初めて法的意味を持つ
  • 実例にNYTやGuardianが挙がる

「AI学習禁止」という意思表示だけでは、著作権法30条の4ただし書に該当しない。これが文化審議会著作権分科会法制度小委員会「AIと著作権に関する考え方について」(令和6年3月15日)の整理です。

ただし、技術的な措置を講じること自体は自由で、データベースとして販売する予定がある場合は話が変わります。

「学習禁止」の意思表示だけでは、著作権法30条の4ただし書に該当しない

著作権法第30条の4は、情報解析(AI学習を含む)のための著作物利用を原則として認める規定で、「著作権者の利益を不当に害することとなる場合は、この限りでない」というただし書が付いています(条文はe-Gov法令検索の著作権法で確認できます。2026年8月時点)。

では「学習禁止」と書くことは、このただし書に該当するのか。文化庁の「考え方」は次のように述べています。

著作権者が反対の意思を示していることそれ自体をもって、権利制限規定の対象から除外されると解釈することは困難である。そのため、こうした意思表示があることのみをもって、法第30条の4ただし書に該当するとは考えられない。

意思表示だけでは、法的な効力は生じないという整理です。「AI学習禁止」というテキストをサイトに書いても、利用規約に書いても、それだけでは30条の4の適用を外せない、というのが2024年3月時点の公的な整理です。

ただし、技術的な措置を講じること自体は自由にできる

同じ資料は、robots.txtのような技術的措置を講じること自体は自由だと明言しています。

AI学習のための著作物の複製等を防止するための、機械可読な方法による技術的な措置としては、現時点において既に広く行われているものが見受けられる。

こうした措置をとることについては、著作権法上、特段の制限は設けられておらず、権利者やウェブサイトの管理者の判断によって自由に行うことが可能である。

そして具体例の筆頭に「ウェブサイト内のファイル"robots.txt"への記述によって、AI学習のための複製を行うクローラによるウェブサイト内へのアクセスを制限する措置」が挙がっています。

robots.txtでのブロックは、法的効力の有無とは別に、国の資料が例示する標準的な技術的措置だということです。

データベースとして販売する予定がある場合は、話が変わる

ここからが、この資料でいちばん実務に直結する部分です。技術的措置に「データベースの著作物として販売される予定」が組み合わさると、ただし書に該当しうると整理されています。

AI学習のための著作物の複製等を防止する技術的な措置が講じられており、かつ、このような措置が講じられていることや、過去の実績(情報解析に活用できる形で整理したデータベースの著作物の作成実績や、そのライセンス取引に関する実績等)といった事実から、当該ウェブサイト内のデータを含み、情報解析に活用できる形で整理したデータベースの著作物が将来販売される予定があることが推認される場合には、この措置を回避して、クローラにより当該ウェブサイト内に掲載されている多数のデータを収集することにより、AI学習のために当該データベースの著作物の複製等をする行為は、当該データベースの著作物の将来における潜在的販路を阻害する行為として、当該データベースの著作物との関係で、本ただし書に該当し、法第30条の4による権利制限の対象とはならないことが考えられる

資料の脚注30には、実例としてThe New York Times、Financial Times、The Guardian、Axel Springerが挙がっています。

いずれもrobots.txtでAI学習用クローラーをブロックしたうえで、テキスト・データマイニング用のライセンスやAPIを別途提供している事例です。

同じ枠組みは、部分的なブロックにも及びます。

脚注31は、あらゆるAI学習用クローラーをブロックしていなくても「主要なAI学習用クローラが複数ブロックされているといった場合であれば」将来販売される予定を推認させる一要素になる、と述べています。全部止めなければ意味がない、という話ではありません。

逆向きの記述もあります。

脚注28は、robots.txtでクローラーのアクセスが制限されていない場合、それは「(大量の情報を容易に情報解析に活用できる形で整理したデータベースの著作物が)販売されている場合」に該当しないことを推認させる要素になると述べています。

ただし同じ脚注には、この事情は複製を行う者の過失を否定する要素にとどまるという別の意見も併記されています。ブロックするかどうかは法的な文脈でも中立な行為ではない、という程度に受け取るのが正確です。

国も「AI学習用クローラーだけを全て止める技術はない」と認めている

同資料の脚注31には、技術的な限界の自認があります。

現状ではrobots.txtにおいて、あらゆる種類のクローラをブロックする措置は取り得ても、AI学習用クローラに限ってこれらを全てブロックするという措置は取ることができないという技術的限界がある

robots.txtは、クローラーが名乗りを上げて従うことを前提にした紳士協定です。名乗らないクローラー、従わないクローラーは止められません。

この限界は国の審議会資料にも書かれている公知の事実であり、「robots.txtに書けば完全に守られる」と説明する記事があれば、その説明のほうが公的な整理から外れています。

法律の解釈について

アームは弁護士ではありません。この章の引用は文化庁の審議会がまとめた「考え方」という文書の記載を引用したもので、法律そのものではありません。個別の案件がどう判断されるかは法律の専門家に確認してください。

アームが言えるのは、robots.txtが何を止めて何を止めないかという技術的な事実と、この資料に何が書かれているかまでです。

AIクローラーを遮断するとき、陥りやすい4つの失敗

  • エックスサーバーは1月に21種遮断機能追加
  • anthropic-aiは現行の公式名にない
  • 非公開化はID・パスワード認証が必要

AIクローラーの遮断は、設定自体は数分で終わります。だからこそ、判断を挟まずに実行してしまう失敗が起きやすい領域です。実際に起きやすい4つを挙げます。

失敗1

レンタルサーバーの一括遮断トグルを、意味を確認せずONにする

エックスサーバーは2026年1月7日に、全プランへ「AIクローラー遮断設定」を追加しました(エックスサーバー公式マニュアル、2026年8月12日確認)。

項目

内容

補足

提供開始

2026年1月7日に全プランへ追加

初期状態はOFF

遮断の範囲

21種類をまとめて遮断

学習用と検索・回答用を区別しない

ONにした結果

検索AIの回答から消える

学習を止めるつもりが露出まで手放す

  • エックスサーバーの遮断設定は、遮断対象が随時追加されうる。ONにするとChatGPT検索やPerplexityの回答から自社サイトへのリンクが消えていく。

ドメインごとのトグルで、GPTBot、Google-Extended、ClaudeBotに加えて、OAI-SearchBotやPerplexityBotといった検索・回答用のクローラーまで、21種類をまとめて遮断できます(対象は随時追加される可能性があると公式マニュアルに記載)。初期状態はOFFです。

機能そのものは正当です。「対策が遅れている」と思われたくない一心でONにする判断は、珍しくありません。問題は、このトグルが「学習用」と「検索・回答用」を区別せずにまとめて遮断することの意味を、押す側が知らないまま押せる点にあります。

ONにした瞬間、ChatGPT検索とPerplexityの回答から自社サイトへのリンクが消えていきます。学習を止めたかっただけの会社が、AI検索の露出まで同時に手放す設計です。押す前に、この記事の3つの問いに答えてからにしてください。

失敗2

古い記事の一覧をコピーして、現行にないUser-agentで設定する

AIクローラーの名前は数年で入れ替わっています。

User-agent

現行の公式ヘルプでは

扱い

anthropic-ai/Claude-Web

記載がない

古い解説記事に残る名前(2026年8月12日確認)

ClaudeBot/Claude-User/Claude-SearchBot

現行の3つ

設定はここから名前を取る

たとえばanthropic-aiやClaude-Webという名前を載せている解説記事がありますが、Anthropicの現行の公式ヘルプに記載されているのはClaudeBot、Claude-User、Claude-SearchBotの3つで、この2つの記載はありません(2026年8月12日確認)。

古い一覧をコピーしたrobots.txtは、存在しない相手に指示を出し、現行のクローラーを素通りさせます。設定するときは、各社の公式ドキュメントの現行の一覧から名前を取ってください。

失敗3

robots.txtで止めればページが非公開になると思っている

robots.txtはアクセス制御であって、非公開化の仕組みではありません。

手段

できること

非公開にできるか

robots.txt

クローラーへのアクセス制御

できない(締め出す仕組みではない)

ID・パスワード認証

見られては困る情報を守る

アクセス自体を制限できる

Googleの公式ドキュメント「Introduction to robots.txt」(2025年12月10日更新)も、robots.txtについて「it is not a mechanism for keeping a web page out of Google」(Googleからページを締め出すための仕組みではない)と明記しています。

見られては困る情報は、robots.txtではなくID・パスワード認証で守ります。文化庁の資料でも、認証によるアクセス制限はrobots.txtと並ぶ技術的措置の例として挙げられています。

失敗4

llms.txtを置けば学習を防げると思っている

llms.txtはAIへの案内ファイルであって、アクセスを制限する仕組みではありません。学習のオプトアウトとは役割がまったく別です。llms.txtの実測データと位置づけは別記事に譲ります。

アームはAIクローラーを、ほとんど許可している理由

  • アームは主要クローラーを個別に許可
  • 自社にも古い名前anthropic-aiが残存
  • 引用を止めても推薦は増えない

最後に、アームがこのテーマをどう扱っているかを開示します。判断の参考というより、判断の実例として読んでください。

遮断は守りではなく、選択的な機会放棄として設計する

アームの自社サイト(aaam.jp)のrobots.txtは、GPTBot、OAI-SearchBot、ChatGPT-User、ClaudeBot、PerplexityBot、Google-Extended、CCBotを、1つずつ名前を書いて明示的に許可しています。

止めているのは全クローラー共通の/api/だけです(2026年8月12日時点の現物)。理由は、この記事の問い1に自分で答えた結果です。アームのコラムやサービス紹介は、学習されて具体的に失うものを説明できません。

一方でAI検索経由の接点は、これから増やしたい側の数字です。だから通しています。

自社のrobots.txtにも、消し忘れが残っていた

ついでに、格好のつかない話も書いておきます。アームのrobots.txtには、いまもanthropic-aiとClaude-Webという2行が残っています。

この記事の「よくある失敗」で「現行にない名前を書くな」と指摘した、まさにその名前です。Allowなので実害は出ていませんが、書いた当時の一覧をそのまま置き続けた結果であることに変わりはありません。

robots.txtは、各社の公式ドキュメントが更新されるたびに読み直す対象だという、自分への戒めとして残しておきます。

同じ判断が、どのお客様にも当てはまるとは限らない

同じ判断がどのお客様にも当てはまるとは限りません。大事なのは、遮断を「守り」と呼ばず、「AI検索経由の機会を選択的に放棄する行為」として損得を見積もることです。自社の現状の流入がどうなっているかから見立てたい場合は、AI検索時代の流入診断で現状把握からやっています。AI検索経由の成果をどう測るかは、こちらの実測記事でも扱っています。

守るべきは独自データであって、サイト全体ではない

守る価値の設計は、サイト単位ではなくコンテンツ単位でやります。有償販売しうる独自データや会員限定資料があるなら、その領域だけを認証で守り、必要ならrobots.txtの措置とライセンス設計を重ねる。

集客のために書いたコンテンツは通す。文化庁の資料が示した「技術的措置+販売の予定」という枠組みも、データベースという単位で語られています。全か無かの二択にしないことが、機会損失を最小にします。

引用を止めても、推薦は増えない

SEOの専門家である住太陽氏は「AI引用とAI推薦の違い」(ボーディー有限会社、2026年7月21日更新)で、AIに引用されることは回答生成の養分にすぎず、ビジネス上のメリットはほとんどない、と整理しています。

この整理を遮断の文脈に当てはめると、話は逆向きに転がります。養分にされたくないなら止めればよい。ただし止めても推薦は増えません。AIが自社を推薦する材料は第三者のクチコミやレビューであって、そもそも自社サイトの外にあるからです。

推薦の材料は、そもそもサイトの外にある

つまりAIクローラーの遮断は、攻めにも守りにもならない中立の行為です。引用が消えるだけで、推薦の獲得競争には何の影響もありません。判断の重心は、推薦される材料を外の世界にどれだけ作れているか、に置くべきだと考えています。AIが自社をどう見ているかを実際に確かめた記録は、こちらです。

よくある質問

Google-Extendedをブロックすると検索順位は下がりますか?

下がりません。Google公式ドキュメントが、Google-ExtendedはGoogle検索への掲載に影響せず、ランキングシグナルとしても使われないと明記しています(2026年9月17日確認)。検索順位を理由に許可し続ける必要も、ブロックをためらう必要もありません。

AIによる概要に自社サイトが出ないようにできますか?

AIによる概要だけを外す公式の手段は存在しません(2026年9月17日確認)。公式が挙げるのはnosnippet系のタグとnoindexのみで、いずれも通常の検索結果の表示も同時に削ります。スニペットや検索掲載ごと手放してよいかで判断してください。

robots.txtを無視するAIクローラーはどうすればいいですか?

robots.txtは従うクローラーしか止められず、この技術的限界は文化庁の資料にも明記されています。従わない相手まで止めたい場合はサーバー側でのアクセス制御が必要になるので、サーバー会社や制作会社に相談してください。

なおユーザー起点の取得(Perplexity-Userなど)は、公式仕様としてrobots.txtに従わないものなので、不正な無視とは区別して考えます。

一度学習されたコンテンツは削除してもらえますか?

robots.txtで止められるのは今後のクロールで、過去に収集されたデータを遡って消す仕組みではありません。収集済みデータの削除手順は、各社の公式ドキュメントに明記されていません(2026年8月12日時点)。だからこそ、方針は学習される前に決めておく価値があります。

画像やPDFも学習の対象になりますか?

ファイル形式ごとの扱いを明記した公式ドキュメントは確認できていません(2026年8月時点)。

制御の側から言えば、robots.txtの指定はURL単位なので、画像やPDFを置いたディレクトリをDisallowに指定すれば取得自体を制限できます。

AppleのようにHTTPヘッダー(X-Robots-Tag)での指定を案内しているプラットフォームもあります。

制作会社から「AI対策」として遮断設定を提案されました。妥当ですか?

提案書に「何を失うか」の説明があるかで見分けてください。遮断設定そのものは数分で終わる作業で、単体で値札が付くものではありません。学習用と検索・回答用の区別、遮断で失う露出、止める理由の3点が説明されていない提案は、この記事の一覧表を持って根拠を聞くことをおすすめします。

AIクローラーを止めるべきかは、失うものと露出の見積もりで決まる

Google-Extendedが止めるのはGeminiアプリとVertex AIでの学習とグラウンディングだけで、Google検索のAIによる概要とAIモードには及びません。

そしてAIクローラーを止めるべきかの判断は、「学習されて失うものを説明できるか」「止めて失う露出をいくらと見積もるか」で決まります。

では、何から確かめればいいのか

まずは自社サーバーの設定画面とrobots.txtの現状、AI検索経由の流入の実数を確認するところから始めてみてください。

アームは、AI検索を含めた流入の設計を、現状の数字の把握から一緒にやるデザインスタジオです。どのAIクローラーを止め、どれを通すかの判断からで構いません。よければお問い合わせフォームからご相談ください。

アームの取り組みはAI検索に選ばれるサイトでも紹介しています。

関連するお悩み

関連するコラム