· Análisis GEO · Técnico · 6 min read
GPTBot, ClaudeBot, PerplexityBot: qué son y cómo configurar tu robots.txt para ellos
Cada motor de IA generativa rastrea la web con sus propios bots y para fines distintos. Esta guía explica quién es quién y cómo evitar bloquear sin querer tu visibilidad en GEO.
Cada motor de IA generativa tiene, como mínimo, un bot que rastrea la web. Algunos tienen tres, cada uno con un propósito distinto. Y el error más habitual no es no saber que existen: es bloquearlos todos a la vez con una regla genérica, sin darse cuenta de que dentro de ese bloqueo hay decisiones muy diferentes.
Esta guía explica quién es cada bot, qué hace con lo que rastrea y cómo escribir un robots.txt que refleje realmente lo que quieres permitir.
Por qué esto no es lo mismo que bloquear un crawler de SEO
Un buscador tradicional tiene, en esencia, un objetivo: indexar tu página para poder mostrarla en resultados de búsqueda. Bloquear su crawler tiene una consecuencia clara y única.
Con los motores de IA generativa hay más matices, porque un mismo proveedor puede usar bots distintos para fines distintos:
- Recolectar datos para entrenar un modelo. Ocurre una vez (o de forma periódica) y no está ligado a una pregunta concreta de un usuario.
- Indexar contenido para poder citarlo en respuestas. Es más parecido a lo que hace un buscador: construye un índice que luego se usa para responder preguntas.
- Acceder a una página en el momento en que un usuario la menciona o pregunta por ella. Es una petición en tiempo real, disparada por una persona usando ChatGPT, Claude o Perplexity.
Permitir uno no implica permitir los otros. Puedes decidir que tu contenido no entrene modelos de terceros pero sí quieres que aparezca citado cuando alguien pregunte por él. O al revés. Por eso cada proveedor documenta sus bots por separado.
Quién es cada bot
OpenAI
| Bot | Función |
|---|---|
GPTBot | Rastrea contenido que puede usarse para entrenar modelos de OpenAI. |
OAI-SearchBot | Indexa contenido para las citas de ChatGPT Search. |
ChatGPT-User | Accede a una URL cuando una persona le pide a ChatGPT que la lea o consulte en el momento. |
Anthropic (Claude)
| Bot | Función |
|---|---|
ClaudeBot | Recolecta datos para entrenar los modelos de Claude. |
Claude-SearchBot | Rastrea contenido para mejorar la calidad de las respuestas de búsqueda de Claude. |
Claude-User | Accede a una página cuando un usuario le pide a Claude que la consulte. |
| Bot | Función |
|---|---|
Google-Extended | Controla si tu contenido puede usarse para entrenar los modelos generativos de Google (Gemini), de forma independiente al rastreo que ya hace Googlebot para el buscador. |
Perplexity
| Bot | Función |
|---|---|
PerplexityBot | Rastrea y actualiza el índice que Perplexity usa para construir sus respuestas. |
Perplexity-User | Accede a una página en tiempo real cuando un usuario pregunta por ella directamente. |
Otros bots que conviene conocer
CCBot: el crawler de Common Crawl. No pertenece a ningún proveedor de IA, pero su conjunto de datos alimenta el entrenamiento de numerosos modelos, propios y de terceros. Bloquearlo no controla directamente ningún motor de IA generativa concreto, pero sí reduce tu presencia en uno de los datasets de origen más usados del sector.Applebot-Extended: regula el uso de tu contenido en las funciones de IA de Apple, de forma independiente alApplebotque usa Siri y Spotlight.Bytespiderymeta-externalagent: crawlers de ByteDance (TikTok) y Meta, respectivamente, con el mismo objetivo de recolección de datos para IA.
Cómo escribir las reglas en robots.txt
La sintaxis es la misma que ya conoces de SEO: un bloque User-agent seguido de Allow o Disallow. La diferencia está en tratar cada bot por separado en vez de agrupar por proveedor.
Ejemplo: permitir que Claude cite tu contenido y responda preguntas de usuarios sobre él, pero no usarlo para entrenar el modelo.
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
El mismo criterio se aplica a OpenAI y a Perplexity, sustituyendo los nombres de los bots. Google-Extended funciona con la misma lógica: se declara aparte de Googlebot, así que bloquearlo no afecta a tu presencia en la búsqueda tradicional de Google.
Una regla como esta, en cambio, bloquea indiscriminadamente cualquier bot cuyo nombre contenga “bot”, incluyendo los de indexación y respuesta que probablemente sí quieras permitir:
User-agent: *bot*
Disallow: /
Antes de escribir cualquier regla, decide primero qué quieres permitir y qué no; el robots.txt es solo la forma de expresarlo, no la decisión en sí. No hay una configuración correcta universal: depende de si tu prioridad es la visibilidad en respuestas de IA, evitar que tu contenido entrene modelos de terceros, o ambas cosas a la vez de forma distinta según el bot.
Errores frecuentes
- Bloquear con una regla genérica sin revisar qué bots incluye. Muchas plantillas de
robots.txtpara “bloquear IA” que circulan por foros mezclan bots de entrenamiento con bots de indexación y respuesta, con el efecto de reducir visibilidad sin que esa fuera la intención. - Asumir que bloquear el crawler de entrenamiento también bloquea las citas. Son bots distintos con directivas distintas; hay que comprobar cada uno.
- No revisar el
robots.txtdespués de una migración o un cambio de CMS. Es habitual que una plantilla nueva reintroduzca un bloqueo genérico de bots que ya se había resuelto. - Confiar solo en el nombre del user-agent sin verificar el origen. Algunos scrapers no respetan
robots.txty además falsifican el user-agent de bots legítimos.robots.txtes una directiva que los rastreadores respetuosos cumplen voluntariamente, no un mecanismo de bloqueo técnico: frente a tráfico que falsifica el user-agent hacen falta medidas adicionales (verificación de IP, WAF), que quedan fuera del alcance de este artículo.
Qué tiene que ver esto con la visibilidad en IA
Si ClaudeBot, GPTBot o PerplexityBot no pueden rastrear tu web, esos motores no pueden citarla ni recomendarla, por buena que sea la información que contiene. Es una condición previa, no una garantía: permitir el acceso no asegura que te citen, pero bloquearlo sí garantiza que no puedan hacerlo.
Comprobar esto es parte de lo que analiza Análisis GEO en el diagnóstico técnico de un informe: qué bots pueden acceder realmente a una web y qué reglas de robots.txt podrían estar limitando su visibilidad en motores de IA generativa sin que el propietario lo sepa.
Relacionado: si además quieres ofrecer a los modelos una versión resumida y estructurada de tu contenido más allá de lo que ya rastrean estos bots, puede interesarte qué es llms.txt y si merece la pena implementarlo. Y si quieres revisar de forma más amplia qué otros errores técnicos pueden estar limitando tu visibilidad, esta checklist de 15 errores frecuentes es un buen punto de partida.