GPTBot

OpenAI
AI Training / Web Ingestion

Large-scale ingestion for model pre-training. Scans robots.txt and sitemaps.

robots.txt Token: User-agent: GPTBot
Known IP Ranges: 7 CIDR blocks published
Documentation: Official Spec →

OAI-SearchBot

OpenAI
Live Search Indexing

Live web indexing for ChatGPT Search features. Honors robots.txt separately from training.

robots.txt Token: User-agent: OAI-SearchBot
Known IP Ranges: 3 CIDR blocks published
Documentation: Official Spec →

ChatGPT-User

OpenAI
User-Directed Retrieval

Fetched on-demand when a ChatGPT user provides a URL or search query.

robots.txt Token: User-agent: ChatGPT-User
Known IP Ranges: 2 CIDR blocks published
Documentation: Official Spec →

ClaudeBot

Anthropic
AI Training / Web Ingestion

Large-scale crawler for Claude model training. Follows standard links & robots.txt.

robots.txt Token: User-agent: ClaudeBot
Known IP Ranges: 2 CIDR blocks published
Documentation: Official Spec →

PerplexityBot

Perplexity AI
Search & Model Grounding

Perplexity search crawler for indexing web content and summarizing citations.

robots.txt Token: User-agent: PerplexityBot
Known IP Ranges: 3 CIDR blocks published
Documentation: Official Spec →

Perplexity-User

Perplexity AI
User-Directed Retrieval

Live on-demand web fetches triggered directly by user prompts in Perplexity.

robots.txt Token: User-agent: Perplexity-User
Known IP Ranges: 1 CIDR blocks published
Documentation: Official Spec →

Googlebot

Google
General Search Engine

Primary Google search indexer. Renders HTML and executes JS when queue permits.

robots.txt Token: User-agent: Googlebot
Known IP Ranges: 3 CIDR blocks published
Documentation: Official Spec →

Google-Extended

Google
AI Training Scraper

Used to manage Gemini and Vertex AI training access without affecting Google Search.

robots.txt Token: User-agent: Google-Extended
Known IP Ranges: 1 CIDR blocks published
Documentation: Official Spec →

Bingbot

Microsoft
Search & Copilot Grounding

Microsoft search indexer powering Bing and Microsoft Copilot index data.

robots.txt Token: User-agent: Bingbot
Known IP Ranges: 4 CIDR blocks published
Documentation: Official Spec →

Bytespider

ByteDance
Search & Doubao AI Training

High-frequency crawler used for TikTok search and Doubao LLM ingestion.

robots.txt Token: User-agent: Bytespider
Known IP Ranges: 3 CIDR blocks published
Documentation: Official Spec →

CCBot

Common Crawl
Public Research Crawl Archive

Monthly open web archive used by hundreds of open source AI models (Llama, etc.).

robots.txt Token: User-agent: CCBot
Known IP Ranges: 2 CIDR blocks published
Documentation: Official Spec →

Meta-ExternalAgent

Meta
AI Training & Ingestion

Meta crawler for AI model development and link previews.

robots.txt Token: User-agent: Meta-ExternalAgent
Known IP Ranges: 3 CIDR blocks published
Documentation: Official Spec →

Amazonbot

Amazon
Search & Alexa AI Training

Amazon web crawler for Alexa answer generation and search features.

robots.txt Token: User-agent: Amazonbot
Known IP Ranges: 2 CIDR blocks published
Documentation: Official Spec →

Applebot

Apple
Search & Apple Intelligence

Apple search indexer and Apple Intelligence web dataset ingestion.

robots.txt Token: User-agent: Applebot
Known IP Ranges: 1 CIDR blocks published
Documentation: Official Spec →

Cohere-AI

Cohere
AI Training Crawler

Crawler gathering web text for Cohere Command and Embed models.

robots.txt Token: User-agent: cohere-ai
Known IP Ranges: No published IP ranges
Documentation: Official Spec →

Automated Scraper / Script

Autonomous / Developer
Headless / HTTP Automation

Custom script, automated library, or headless browser session.

robots.txt Token: User-agent: *
Known IP Ranges: No published IP ranges
Documentation: Official Spec →