メインコンテンツへスキップ
テクニカルGEO公開: 2026-09-07読了目安 9分

主要AIクローラー一覧とrobots.txtの正しい設定方針|学習禁止と検索引用(GEO)を両立させる制御術

「AIにコンテンツを無断学習されるのは防ぎたいが、AI検索からの流入・引用は逃したくない」。GPTBotやGoogle-Extended、PerplexityBotの仕様詳細と、robots.txtでの高度な制御方法、設定コード例を徹底解説します。

GEORank 編集部GEO・生成AI検索リサーチチーム
#robots.txt#AIクローラー#GPTBot
自社サイトのAI対応度は万全ですか? 登録不要・30秒でAIクローラー許可や構造化データを無料診断できます。

1. AIクローラーの2大区分:「基盤モデル学習用」と「リアルタイム検索用」

多くのWebマスター、セキュリティ担当者、オウンドメディア責任者が直面している深刻なジレンマがあります:

**「自社の独自記事やソースコードが、OpenAIやGoogleの大規模言語モデル(LLM)の学習データとして無断で吸収されるのは防ぎたい。しかし、ChatGPT SearchやGoogle AI Overviews、Perplexityからの検索アクセス流入や引用推薦は絶対に逃したくない…」**

この問題を解決するために不可欠なのが、AIクローラーには「モデル学習用(Training Crawler)」と「リアルタイム検索用(Search Crawler)」の2種類が存在するという技術的知識です。

多くの企業が、全AIボットを一括で遮断(Disallow)してしまった結果、「AI検索エンジンからのユーザー流入が完全にゼロになり、競合他社だけが独占的に推薦される」という致命的な機会損失を招いています。

`robots.txt`のディレクティブを正しく書き分ければ、「学習は拒否しつつ、検索と引用は許可する」という高度なハイブリッド制御が可能です。


2. 主要AIクローラー10種完全一覧表と役割・影響度

主要なAI企業が運用している代表的クローラーの仕様一覧です。

提供元クローラー名 (User-Agent)クローラーの主な役割遮断した場合のビジネスへの影響
OpenAI`GPTBot`GPTモデル(GPT-4/5等)の事前学習学習データから自社サイトが除外される
OpenAI`OAI-SearchBot`ChatGPT Search(検索機能)のインデックスChatGPTの検索回答で引用・推薦されなくなる
Google`Google-Extended`Gemini等の生成AIモデル学習用一部AIモデルの学習対象外となる
Google`Googlebot`Google検索全般およびAI Overviews検索結果・AI Overviews両方から完全に消失
Perplexity`PerplexityBot`Perplexityの検索インデックス・引用Perplexityの回答で自社が引用されなくなる
Anthropic`ClaudeBot`Claudeモデルの学習・検索Claudeの回答に反映されなくなる
Common Crawl`CCBot`オープンなWebスクレイピングデータセット多数のオープンソースLLMの学習除外
ByteDance`Bytespider`TikTok・AIモデルのデータ収集ByteDance系AIの学習除外
Apple`Applebot-Extended`Apple Intelligenceの学習用Siri・Apple AIの学習除外
Meta`FacebookBot`Llama等のモデル学習Meta系AIの学習除外

3. 間違えると検索流入が激減するrobots.txtの典型的な失敗例3選

Webサイトのリニューアルやセキュリティ見直しの際に多発している危険な設定例です。

失敗例①: 全ボットに対して一括で拒否を設定してしまう ```txt # ❌ 最悪の例:Google検索からもAI Overviewsからも自社が消滅する User-agent: * Disallow: / ``` 開発環境(Staging)の`robots.txt`を誤って本番環境にデプロイしてしまい、オーガニック流入もAI露出も一夜にして消失するトラブルが後を絶ちません。

失敗例②: OAI-SearchBotやPerplexityBotまでブロックしてしまう ```txt # ❌ 失敗例:AI検索からのアクセス流入を自ら放棄している User-agent: GPTBot Disallow: / User-agent: OAI-SearchBot Disallow: / User-agent: PerplexityBot Disallow: / ``` `GPTBot`(学習用)だけでなく、ユーザーが実際に検索している`OAI-SearchBot`や`PerplexityBot`まで遮断しているため、見込み客がChatGPTに「おすすめのツール」を質問した際に自社が一切表示されなくなります。

失敗例③: Googlebotを拒否してGoogle-Extendedだけ許可する GoogleのAI Overviewsは、`Googlebot`が収集した検索インデックスを基盤として動作しています。`Googlebot`を拒否すれば、AI Overviewsにも当然表示されません。


4. 用途別おすすめ設定コード(完全開放・ハイブリッド・完全遮断)

企業のポリシーに合わせて選択できる、そのままコピペして使える`robots.txt`テンプレートです。

パターンA: 【推奨】学習拒否 + AI検索流入最大化(ハイブリッド型) 自社コンテンツの無断学習はブロックしつつ、ChatGPT Search、Google AI Overviews、Perplexityからの集客は最大化する、現在最もバランスの取れた標準設定です。

# 通常の検索エンジンクローラーは許可
User-agent: Googlebot
Allow: /

User-agent: Bingbot Allow: /

# AI検索用クローラー(リアルタイム検索・引用)は許可 User-agent: OAI-SearchBot Allow: /

User-agent: PerplexityBot Allow: /

# AIモデル事前学習用クローラーは拒否 User-agent: GPTBot Disallow: /

User-agent: ClaudeBot Disallow: /

User-agent: CCBot Disallow: /

User-agent: Bytespider Disallow: /

User-agent: Applebot-Extended Disallow: /

# サイトマップとllms.txtの所在を明記 Sitemap: https://example.com/sitemap.xml ```

パターンB: 全AIへの露出を最優先する完全開放型 スタートアップや新興SaaSなど、「知名度獲得と言及シェア最大化が最優先」の企業向けです。

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml ```


5. robots.txtの配置場所・キャッシュ更新頻度・検証手順

`robots.txt`は、Webサーバーのルート直下(`https://yourdomain.com/robots.txt`)に配置する必要があります。

検証チェックリスト 1. **ステータスコードの確認**: ブラウザまたは`curl`でアクセスし、`200 OK`でプレーンテキスト(`text/plain`)が返るか。 2. **Google Search Consoleでのテスト**: 「robots.txt レポート」ツールで最新バージョンが認識されているか確認。 3. **GEORank 無料サイト構造診断**: 自社URLを入力すると、主要AIクローラーに対する`robots.txt`の許可・遮断状態を一覧で即時検証できます。


6. よくある疑問(FAQ):AIクローラー遮断の法的是非と影響

Q1. robots.txtのDisallowには法的な強制力がありますか? `robots.txt`はWeb標準のプロトコル(紳士協定)であり、法的な強制力を持つわけではありません。しかし、OpenAI、Google、Anthropic、Perplexityなどの主要AI企業は、公式に`robots.txt`のディレクティブを遵守することを明言しています。

Q2. 設定を変更してからAI検索に反映されるまでどれくらいかかりますか? 各社のクローラーキャッシュによって異なりますが、通常は**数日〜2週間程度**で最新の`robots.txt`が反映され、クローリングの挙動が変化します。

自社の現在地を確認するクレカ登録不要・月額1,980円〜

自社サービスは主要AI検索で推薦されていますか?

GEORank(ジオランク)なら、Google Gemini (AI Overviews)、ChatGPT、Perplexityにおける自社言及シェアと、AIが参照する引用元メディアを毎日自動追跡。自社URLのAI構造診断も無制限で実行できます。

※ 有料プランも国内最安の月額1,980円から。自動課金はありません。