Si un bot no puede leer tu página, no la indexa ni la cita. Con Google lo notas en Search Console. Con ChatGPT o Perplexity, simplemente dejas de aparecer como fuente y nadie te avisa.

Casi siempre la culpa es de una de estas cuatro cosas.

1. El robots.txt

Es lo primero que lee cualquier bot serio. Un Disallow: / en el grupo de User-agent: * deja fuera a todos los que no tengan un grupo propio. Pasa mucho después de una migración, cuando se sube a producción el robots.txt del entorno de pruebas.

Un detalle que poca gente conoce: si el robots.txt devuelve un error 5xx, Google deja de rastrear la web hasta que vuelva a responder. Si devuelve un 404, en cambio, entiende que puede rastrearlo todo.

2. El firewall o el CDN

Cloudflare, Akamai, DataDome y compañía bloquean bots por user-agent, por IP o por comportamiento. Cloudflare, por ejemplo, trae un modo anti-bots y una opción para bloquear crawlers de IA que hay webs que tienen activados sin saberlo.

La herramienta compara lo que recibe un navegador normal con lo que recibe cada bot. Si el navegador ve la página y el bot se lleva un 403 o un reto, algo los está tratando distinto.

3. El noindex

El bot entra, pero le dices que no indexe. Puede venir en una etiqueta <meta name="robots"> o en la cabecera X-Robots-Tag, y puede ir dirigido a un bot concreto (googlebot: noindex).

4. Contenido distinto para bots

Algunas webs sirven a los bots una página vacía, una versión sin renderizar o un aviso de cookies que tapa todo. Si un bot recibe mucho menos contenido que el navegador, la herramienta te lo marca para que lo revises.

Buscadores de IA: qué bots dejar pasar

OpenAI, Anthropic y Perplexity separan sus bots por función:

  • Búsqueda (OAI-SearchBot, Claude-SearchBot, PerplexityBot): indexan tu web para citarla en sus respuestas.
  • Usuario (ChatGPT-User, Claude-User, Perplexity-User): entran cuando alguien les pide que abran tu página.
  • Entrenamiento (GPTBot, ClaudeBot, CCBot…): recogen contenido para entrenar modelos.

Si quieres aparecer en ChatGPT, Claude o Perplexity, deja pasar al menos a los de búsqueda y usuario. Bloquear los de entrenamiento es una decisión de negocio y no afecta a que te citen.

Con Google es diferente: Google-Extended controla si tu contenido se usa para entrenar Gemini, pero AI Overviews y AI Mode usan el mismo Googlebot que el buscador. Si bloqueas Googlebot, desapareces de todo.

Límites de la herramienta

Las peticiones salen de Cloudflare con el user-agent de cada bot. Las webs que verifican los bots por IP pueden bloquearte aquí y dejar pasar al bot real, y alguna incluso le sirve un robots.txt distinto. Por eso un bloqueo por HTTP te dice dónde mirar, pero confírmalo en los logs o en la inspección de URLs de Search Console.