監修:黒岩俊児(株式会社セルフプラス 代表・Shopify Plus Partner)
公開日:2026年10月6日|本記事は各社の公式発表・一次情報にもとづき、EC構築の実務者が内容を確認しています。
「AIに学習されたくないからrobots.txtで拒否した」つもりが、実はChatGPT検索やPerplexityの回答にも表示されなくなっていた——という相談が増えています。原因は単純で、「モデルの学習に使うクローラー」と「検索結果・AI回答を作るために参照するクローラー」は別物なのに、まとめて一つのルールで拒否してしまっているケースがほとんどです。本記事の結論は、両者を区別したうえで、robots.txt以外の場所(WAF・セキュリティプラグイン・Cloudflareのbot対策・IP制限)でも同じクローラーが弾かれていないかまで確認して初めて「設定した」と言える、というものです。数字や仕様はすべて各社の公式ドキュメントで確認できたものだけを書いています。
目次
Shopifyやその他ECの制作・運用・保守について、お気軽にご相談ください。
連絡は問い合わせ・無料相談・無料お見積りよりどうぞ。
「学習用クローラー」と「検索用クローラー」は別物

主要なAI企業は、目的の異なる複数のクローラーをそれぞれ別のUser-Agent名で公開しています。学習用(モデルの訓練データ収集)、検索・引用用(AI検索の回答に表示するための取得)、エージェント用(ユーザーが個別に指示した際の取得)の3種類があり、同じ会社の中でも役割によって拒否すべきかどうかの判断が変わります。各社の公式ドキュメントで確認できる内容を整理すると、次のとおりです。
| クローラー名 | 運営元 | 役割 | 種別 | Disallowした場合に起きること |
|---|---|---|---|---|
| GPTBot | OpenAI | AI基盤モデルの学習データ収集 | 学習 | 今後のコンテンツをモデル学習に使わせない意思表示になる |
| OAI-SearchBot | OpenAI | ChatGPT検索の結果に表示するための取得 | 検索・引用 | ChatGPT検索の回答に表示されなくなる(ナビゲーショナルリンクは残る場合あり) |
| ChatGPT-User | OpenAI | Custom GPT・GPT Actions等、ユーザー操作に応じた個別取得 | エージェント | OpenAIは「ユーザー指示による取得のためrobots.txtが適用されない場合がある」と説明。拒否の効果は限定的 |
| ClaudeBot | Anthropic | AI基盤モデルの学習データ収集 | 学習 | 今後のコンテンツをAnthropicのAI学習データセットから除外する意思表示になる |
| Claude-SearchBot | Anthropic | Claudeの検索結果の品質向上のための取得 | 検索・引用 | Claudeの検索インデックスから外れ、検索回答での可視性・精度が下がる |
| Claude-User | Anthropic | ユーザーの質問に応じた個別ページ取得 | エージェント | その質問に対する個別取得ができなくなる |
| PerplexityBot | Perplexity | Perplexity検索の結果に表示するための取得 | 検索・引用 | Perplexityの検索結果に表示されなくなる可能性がある |
| Perplexity-User | Perplexity | ユーザーの質問に応じた個別ページ取得 | エージェント | Perplexity公式が「ユーザー起点のため原則robots.txtを見ない」と説明。拒否での制御は基本的にできない |
| Google-Extended | Gemini等の学習・グラウンディング利用可否のコントロール | 学習(利用制御トークン) | Gemini等への学習利用は止まるが、Google検索の掲載・順位には影響しないとGoogle公式が明記 | |
| Applebot-Extended | Apple | Apple Intelligence等の基盤モデル学習の利用可否コントロール | 学習(利用制御トークン) | 学習利用は止まるが、Siri・Spotlight・Safariの検索結果やランキングには影響しない |
| Bytespider | ByteDance(TikTok運営元) | 検索・レコメンド向上のための収集(公式説明なし) | 不明(透明性が低い) | 公式なrobots.txt遵守表明がなく、拒否しても遵守されない可能性がある |
| CCBot | Common Crawl(非営利団体) | オープンなWebアーカイブデータセットの構築 | 学習データセット収集 | データセットから外れる。複数のAI企業が同データセットを学習に利用するため影響範囲が広い |
とくに誤解されやすいのはGoogle-ExtendedとApplebot-Extendedです。この2つは独自にページを取得しに来る「クローラー」ではなく、既存のGooglebot・Applebotが取得したデータを生成AIの学習に使ってよいかを指定する「利用制御トークン」です(Google Search Central、Apple公式サポート・2026年9月時点)。Googleは「Google-Extendedはサイトの検索への掲載やランキング信号には影響しない」と明記し、Appleも「Applebot-Extendedを拒否してもSiri・Spotlight・Safariの検索結果には影響しない」としています。拒否しても検索側の露出を犠牲にしない、数少ない「純粋な学習オプトアウト」です。
一方でBytespiderは、Web上の複数の独立した検証で「robots.txtを取得しているのに、Disallowの指示に従わずクロールしている」という報告が繰り返し出ており、運営元のByteDanceからrobots.txt遵守を明言した公式ドキュメントも見当たりません。学習・検索・エージェントの区別だけでなく、「そもそも指示に従う相手かどうか」も企業ごとに前提が異なる点は押さえておく必要があります。
Shopifyやその他ECの制作・運用・保守について、お気軽にご相談ください。
連絡は問い合わせ・無料相談・無料お見積りよりどうぞ。
robots.txtの具体的な書き方

方針が決まったら、robots.txtに具体的な記述を追加します。ここでは「全面的に許可する場合」と「学習用クローラーだけを拒否する場合」の2パターンを示します。いずれも既存のrobots.txtを丸ごと置き換えるのではなく、これらのブロックを追記する形にしてください。User-Agent名や仕様は各社が更新することがあるため、設定前に必ずOpenAI・Anthropic・Perplexity・Google・Appleそれぞれの公式ドキュメントで最新のUser-Agent名を確認してください。
パターン1: AIクローラーを全面的に許可する場合
AI検索での引用も、モデルの学習利用も、どちらも許容する場合の記述です。
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: Applebot-Extended
Allow: /
User-agent: Bytespider
Allow: /
User-agent: CCBot
Allow: /
パターン2: 学習用クローラーだけを拒否する場合
「AI検索での引用・流入は歓迎したいが、無断でのモデル学習データとしての利用は避けたい」という場合の記述です。学習系(GPTBot・ClaudeBot・Google-Extended・Applebot-Extended・Bytespider・CCBot)をDisallowにし、検索・引用系とエージェント系はAllowのまま残します。
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: CCBot
Disallow: /
コピーしてそのまま使うのではなく、自社が何を許可し何を拒否したいのかを先に決め、必要な行だけを反映してください。User-agent: * (すべてのクローラーが対象の既定ルール)でDisallow: /を書くと、ここに挙げたクローラーもすべて遮断されるため注意が必要です。
Shopifyやその他ECの制作・運用・保守について、お気軽にご相談ください。
連絡は問い合わせ・無料相談・無料お見積りよりどうぞ。
拒否すると何を失うのか

AIクローラーの許可・拒否は、どちらが正解というものではありません。ただし拒否には失うものがあることを正直に書きます。
- 検索・引用系クローラー(OAI-SearchBot・Claude-SearchBot・PerplexityBot)を拒否すると、その分だけAI検索の回答に載る機会を失います。 自社名や商品が言及される、出典リンクとして表示される、といった機会がそのまま無くなります
- 「学習だけ拒否」のつもりが、範囲を間違えて検索系まで巻き込むミスが起きやすい。 User-agent: * へのDisallow: /や、GPTBotとOAI-SearchBotの混同がその典型です
- 拒否したからといって、必ずしも実害があるとは限らないケースもある。 Google-ExtendedとApplebot-Extendedは、拒否してもGoogle検索やSiri・Spotlight・Safariの検索結果表示には影響しないと各社が明記しています
- 一度学習に使われたデータは、後からrobots.txtを直しても遡って取り除かれるわけではありません。 Anthropicも「拒否は将来のコンテンツの除外を意味する」としており、過去分への遡及効果は説明されていません
結局のところ、AI検索からの流入や引用を事業として重視するなら検索・引用系は開けておく、学習データとしての無断利用そのものを避けたいなら学習系だけ閉じる、という目的ベースの判断が必要になります。「なんとなく全部拒否」も「なんとなく全部許可」も、どちらも意図しない結果を招きやすい選択です。
Shopifyやその他ECの制作・運用・保守について、お気軽にご相談ください。
連絡は問い合わせ・無料相談・無料お見積りよりどうぞ。
robots.txt以外で弾いてしまっている経路

robots.txtはあくまで「お願いベース」の自主規制であり、法的な強制力はありません。逆に言えば、robots.txtで許可していても、それより手前の層でアクセス自体がブロックされていれば、AIクローラーはサイトに到達できません。見落とされがちな経路を整理します。
- CDN・WAFのbot対策。 CloudflareはBot Fight Mode・Bot Managementといった機能で、User-Agentやアクセスパターン、bot判定スコアをもとにアクセスを遮断できます。Cloudflare公式は、これらが「robots.txtの許可設定とは独立して動作する」こと、WAFのカスタムルールは「ネットワークの入り口でクローラーを止める(サーバーまで到達させない)」ことを明記しています
- セキュリティプラグイン。 ファイアウォール機能を持つプラグインも、User-Agent判定やアクセス頻度、IPレピュテーションをもとに遮断する設定を持つことがあります。robots.txtとは別の場所で効くため、robots.txtを直しただけでは解決しません
- IPアドレスによるアクセス制限。 特定の国・地域からのアクセス制限や、データセンター由来のIPレンジを一律でブロックする設定が入っていると、AIクローラーのIPも巻き込まれて弾かれることがあります
これらは互いに独立した仕組みなので、「robots.txtは正しく書いた」だけでは、実際にAIクローラーがサイトへ到達できているかどうかは分かりません。次の章で、実際にアクセスできているかを確認する方法を説明します。
Shopifyやその他ECの制作・運用・保守について、お気軽にご相談ください。
連絡は問い合わせ・無料相談・無料お見積りよりどうぞ。
設定したあとの確認方法

サーバーログでUser-Agentを確認する
もっとも確実なのは、実際のアクセスログを見ることです。レンタルサーバーやホスティングの管理画面、またはサーバーのアクセスログ(Apache・Nginxのaccess log)から、”GPTBot” “OAI-SearchBot” “ClaudeBot” “PerplexityBot” といった文字列で絞り込み、該当のアクセスにどのステータスコードが返っているかを確認します。200であれば到達・取得できており、403・406・451などが返っていれば、robots.txt以前にサーバー側かCDN側で遮断されている可能性が高くなります。
curl -A で実際にアクセスしてみる
手元の端末からも、各社が公式ドキュメントで公開しているUser-Agent文字列を指定してcurlでアクセスすれば、同じことを能動的に確認できます。
curl -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot" -I https://example.com/
curl -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot)" -I https://example.com/
ここで200が返れば、そのUser-Agentでのアクセス自体は通っていることが分かります。403・406などが返れば、WAFやセキュリティプラグインがUser-Agentベースで遮断している可能性が高いというサインです。ただしcurlはrobots.txtの内容を自動では読みに行きません。 この確認方法はあくまで「ネットワーク・サーバー層でブロックされていないか」を調べるものであり、「robots.txtの指示を各社が実際に守っているか」を検証するものではない点は区別しておく必要があります。robots.txtを実際にどう解釈するかはクローラー側の実装次第です。
Shopifyやその他ECの制作・運用・保守について、お気軽にご相談ください。
連絡は問い合わせ・無料相談・無料お見積りよりどうぞ。
Shopify・WordPressでのrobots.txt編集方法

Shopify: robots.txt.liquidを使う
Shopify管理画面の「オンラインストア」→対象テーマの「コードを編集」→「テンプレート」で新規テンプレートを追加し、種別として「robots」を選択するとrobots.txt.liquidが作成されます。Shopify公式ドキュメントは、既定のルールセットに含まれていないクローラーは「ルールを手動で追加できる」としており、既定のLiquid出力はそのまま残し、その下に前章のUser-Agentブロックをプレーンテキストで追記する形を案内しています。全文を独自のプレーンテキストに丸ごと置き換えるのは避けてください。 Shopify公式はrobots.txt.liquidの編集を「サポート対象外のカスタマイズ」と位置づけ、誤った使い方をするとサイトへの流入をすべて失う可能性があると注意を促しています。Liquidを維持したまま追記すれば、Shopify側の既定ルール更新の恩恵も受け続けられます。
WordPress: SEOプラグインまたは物理ファイルで編集する
WordPressは、サイトのルートに物理的なrobots.txtファイルが存在しない場合、コア機能のdo_robots()が仮想的にrobots.txtを生成して返す仕組みになっています(WordPress公式開発者リファレンス)。編集方法は主に2通りです。
- SEOプラグインの機能を使う。 Yoast SEOなら「SEO」→「ツール」→「ファイルエディター」、Rank Mathなら一般設定内のrobots.txt編集画面から、仮想ファイルの内容をサーバーに直接触れずに編集できます
- 物理ファイルとして設置する。 FTPやホスティングのファイルマネージャーで、wp-config.phpと同じ階層(サイトのルート)にrobots.txtというテキストファイルを設置します。物理ファイルが存在すると、WordPressの仮想ファイルより優先して配信されます
いずれの方法でも、編集後は実際にhttps://example.com/robots.txtにブラウザでアクセスして、意図した内容が反映されているかを確認してください。
Shopifyやその他ECの制作・運用・保守について、お気軽にご相談ください。
連絡は問い合わせ・無料相談・無料お見積りよりどうぞ。
よくある質問(FAQ)
GPTBotだけをrobots.txtで拒否すれば、AI検索から自社サイトが消えますか?
いいえ。GPTBotはOpenAIのモデル学習用クローラーで、ChatGPT検索の検索結果生成に使われるのはOAI-SearchBotという別のクローラーです。GPTBotをDisallowにしても、OAI-SearchBotをAllowのままにしておけば、ChatGPT検索の回答への表示は影響を受けません(OpenAI公式ドキュメント)。この2つを混同してまとめて拒否すると、学習は防げてもAI検索での露出機会も同時に失うことになります。
robots.txtでAIクローラーを拒否すれば、確実にデータ収集を止められますか?
確実とは言えません。GPTBot・ClaudeBot・PerplexityBot・CCBotなど主要各社は公式に「robots.txtを尊重する」と明言していますが、ByteDanceのBytespiderには公式な遵守表明がなく、指示に従わずクロールしているという独立した検証報告があります。またChatGPT-UserやPerplexity-Userのようにユーザーの指示で個別ページを取得するクローラーは、OpenAIとPerplexityがそれぞれ「ユーザー起点のためrobots.txtの適用対象外となる場合がある」と公式に説明しています。
robots.txtで許可しているのに、AIクローラーのアクセスが実際には来ません。なぜですか?
robots.txt以外の場所で遮断されている可能性があります。CloudflareなどのCDN・WAFはUser-Agentやアクセスパターンをもとにbotを遮断でき、これはrobots.txtの許可設定とは独立して動作します。セキュリティプラグインやIPアクセス制限も同様です。robots.txtを直しただけで対応済みと判断せず、サーバーログの確認やcurl -Aでの実測まで行う必要があります。
robots.txtの設定変更は、すぐにAI検索の表示に反映されますか?
反映には時間がかかります。OpenAIとPerplexityは、robots.txtの変更が自社システムに反映されるまで最大24時間程度かかる場合があると公式に説明しています。設定直後に検索結果を確認して変わっていないと判断するのは早計です。
ShopifyのrobotsファイルはAIクローラーの設定のために全文書き換えてよいですか?
推奨されません。Shopify公式は、robots.txt.liquidの既定ルールをLiquidオブジェクト経由で維持したまま、必要なUser-Agentのルールだけを追記する方法を案内しており、全文をプレーンテキストで置き換える行為は「サポート対象外のカスタマイズ」であり、誤った使い方をするとサイトへの流入をすべて失う可能性があると注意を促しています。
Shopifyやその他ECの制作・運用・保守について、お気軽にご相談ください。
連絡は問い合わせ・無料相談・無料お見積りよりどうぞ。
まとめ|「学習」と「検索」を分けてから設定する

AIクローラーのrobots.txt設定は、まず学習用と検索・引用用を分けて考え、そのうえでrobots.txtの外側(WAF・セキュリティプラグイン・Cloudflareのbot対策・IP制限)まで含めて実際に通っているかを確認する、という2段構えで初めて完結します。robots.txtの記述だけを直して満足してしまうと、意図せずAI検索での露出機会を失ったり、逆に拒否したつもりが素通りしていたりします。設定後は必ずサーバーログやcurl -Aで実測してください。AI検索対策の全体像はAIコマースとは?エージェンティックコマースの仕組み・主要プロトコル・EC事業者の対策に、robots.txt以外に取り組むべき10の施策はECサイトのGEO対策|AI検索に選ばれる10施策に、AIへの要約提供という別の切り口はllms.txtとは?AI検索対応チェックリストにまとめています。自社の設定が実際にどう見えているか判断がつかない場合は、AIO無料診断で確認することもできます。
Shopify制作のお見積もり・ご相談
また、初めてのお取組みで不安のある方などもご不明点などはお気軽にご連絡ください。














に相談する