BigIdeas Connect LogoBigIdeas Connect

¿Tu sitio web es invisible para ChatGPT?

BigIdeas Connect Team
Share

Buscar solía significar una sola cosa: posicionarse en Google. Ahora, cada vez más personas le hacen una pregunta a ChatGPT, Claude o Perplexity en lugar de escribirla en un cuadro de búsqueda: "encuéntrame un techador cerca de mí", "cuál es un buen quiropráctico en [ciudad]", "dónde debería comer esta noche". Si un asistente de IA no puede leer tu sitio, no puede recomendarte. Eso es la Optimización para Motores de Respuesta (AEO, por sus siglas en inglés), y silenciosamente se ha vuelto tan importante como el SEO tradicional.

Aquí viene la parte incómoda: tu sitio puede estar haciéndolo todo bien —rápido, bien estructurado, técnicamente sólido— y aun así ser invisible para los asistentes de IA, por culpa de un archivo que casi nadie revisa: robots.txt.

Lo que encontramos al auditar nuestra propia plataforma

Construimos cada página para que cargue al instante (números reales: el contenido completo de la página se entrega en una cuarta parte de un segundo, sin necesidad de JavaScript para verlo) y ya habíamos escrito un archivo robots.txt que daba la bienvenida explícitamente a los rastreadores que importan para la visibilidad en IA: ClaudeBot de Anthropic, GPTBot de OpenAI, el rastreador de IA de Google y el rastreador de Perplexity.

Pero cuando comprobamos qué se estaba sirviendo realmente, encontramos una contradicción: la propia función de gestión de bots de nuestro proveedor de alojamiento estaba anulando silenciosamente nuestra política, bloqueando de forma tajante justo a los rastreadores que habíamos intentado permitir explícitamente. ClaudeBot de Anthropic ya había intentado acceder a nuestro sitio 13 veces, y había sido rechazado cada vez, de forma invisible, sin que nada en nuestro propio código se lo indicara.

Este es un error genuinamente fácil de cometer, porque no aparece como un error. Tu sitio carga bien para los humanos. Search Console se ve normal. La única manera de detectarlo es comprobar de verdad qué se está sirviendo específicamente a los rastreadores de IA, no solo lo que tu propio código dice que está sirviendo.

Hicieron falta dos correcciones, no una

Nuestro primer movimiento fue recorrer la lista de rastreadores de Cloudflare uno por uno y desactivar "Bloquear rastreador" para cada bot que importa para la visibilidad en IA; no solo los tres obvios (ChatGPT, Claude, Perplexity), sino una lista mucho más larga que la mayoría de la gente no sabe que existe: el rastreador de IA de Google, el de Apple, el de Meta (tanto el rastreador de entrenamiento como el que se activa cuando alguien le pide a Meta AI que obtenga una página específica en vivo), el del asistente de IA de DuckDuckGo, el de Mistral, y los propios rastreadores de búsqueda en tiempo real de OpenAI y Anthropic, distintos de los de propósito general.

Eso hicimos. Cada interruptor, revisado y corregido. Volvimos a verificar el archivo robots.txt en vivo para confirmarlo, y exactamente el mismo bloqueo conflictivo seguía ahí. Desbloquear un rastreador y lograr que deje de ser rechazado en el borde de la red es una corrección real y necesaria. No es lo mismo que el que el propio archivo robots.txt deje de contradecir tu propia política: resultó que esas eran dos configuraciones completamente independientes detrás de dos interruptores diferentes, y arreglar una no toca la otra.

La segunda configuración real era un interruptor maestro etiquetado como "robots.txt gestionado", ubicado una pantalla más arriba de la lista de rastreadores, con una descripción que —en retrospectiva— decía exactamente lo que estaba haciendo: escribir contenido automáticamente en nuestro archivo robots.txt en nuestro nombre. Desactivar eso fue lo que finalmente lo resolvió.

La lección aquí no es realmente sobre Cloudflare en concreto. Es que las plataformas modernas de alojamiento/CDN tienen cada vez más varias capas independientes de política de bots apiladas unas sobre otras, y "revisé una configuración" no es lo mismo que "verifiqué el archivo real que se está sirviendo". Vuelve a descargar siempre el archivo en vivo después de cada cambio y confirma que coincide con tu intención; no confíes en que un interruptor del panel hizo lo que la descripción del interruptor vecino daba a entender.

Por qué esto importa más para los negocios locales

Si eres una marca nacional de SaaS, que un asistente de IA te cite es algo agradable de tener. Si eres un techador, un quiropráctico o un restaurante, es la forma en que la gente cada vez más encuentra negocios "cerca de mí"; y depende de algo aún más fundamental que el acceso de los rastreadores: si tu sitio les dice a los sistemas de IA los datos básicos (tu dirección, número de teléfono, horario) de una manera estructurada que realmente puedan usar. Esa es una pieza aparte, pero relacionada, que estamos integrando directamente en nuestra plataforma, para que cada sitio de negocio construido sobre ella obtenga esto de forma predeterminada, no como algo que tengas que acordarte de configurar.

La lista de verificación de rastreadores de IA

Si quieres comprobar tu propio sitio, esto es exactamente lo que hicimos, en orden:

  1. Confirma que tu propio robots.txt (el que genera tu propio código/CMS) dice explícitamente Allow: / para los rastreadores que impulsan las respuestas de IA; consulta la tabla de abajo para la lista completa.
  2. Si estás en Cloudflare: ve a AI Crawl Control → Overview y desactiva "robots.txt gestionado". Toda su función es escribir contenido automáticamente en tu archivo, que normalmente no es el contenido que realmente quieres.
  3. Ve a la lista de rastreadores (marca "Mostrar rastreadores inactivos" si faltan algunos) y desactiva "Bloquear rastreador" para cada bot de motor de respuestas de IA, uno a la vez. No asumas que una configuración masiva de "permitir todo" lo cubre; revisa cada uno.
  4. Vuelve a descargar tu robots.txt en vivo —no el de tu código base, sino el que realmente se está sirviendo (curl https://tusitio.com/robots.txt)— y confirma que no haya ninguna regla duplicada o contradictoria para ningún rastreador que te importe.
  5. Revisa las "Solicitudes fallidas" por rastreador en tu panel. Un número alto en un bot que quieres permitir es una señal de alarma de que algo sigue rechazándolo, incluso después de que la política parezca correcta.
  6. Repite toda esta comprobación cada vez que cambies de proveedor de alojamiento/CDN, rediseñes tu sitio o lances un nuevo dominio; nada de esto se transfiere automáticamente.

La lista de referencia de rastreadores

"Los tres grandes" en los que todo el mundo piensa no son el panorama completo. Aquí está la lista más completa que realmente repasamos:

RastreadorPropietarioVeredicto
GPTBot, OAI-SearchBot, ChatGPT-UserOpenAIPermitir
ClaudeBot, Claude-User, Claude-SearchBotAnthropicPermitir
Google-Extended, Google-CloudVertexBotGooglePermitir
GooglebotGooglePermitir siempre: búsqueda normal, no específica de IA
PerplexityBot, Perplexity-UserPerplexityPermitir
Meta-ExternalAgent, Meta-ExternalFetcher, FacebookBotMetaPermitir
Applebot-ExtendedApplePermitir (Apple Intelligence/Siri)
DuckAssistBotDuckDuckGoPermitir
MistralAI-UserMistralPermitir
Bytespider, TikTok SpiderByteDanceBloquear: agresivo, sin beneficio recíproco
CCBotCommon CrawlBloquear: conjunto de datos de entrenamiento amplio, no un motor de respuestas
Amazonbot, Anchor Browser, Manus Bot, Novellum, ProRataInc, PetalBot, Terracotta Bot, TimpibotVariosBloquear: sin beneficio claro de AEO para la mayoría de los sitios

La conclusión

El AEO no es una preocupación del futuro: ya está determinando quién es encontrado hoy. Y no basta con escribir la política correcta; tienes que verificar que sea realmente lo que se está sirviendo, en cada capa, porque las capas entre tu código e internet (CDNs, funciones de gestión de bots, configuraciones predeterminadas) pueden anular silenciosamente tu intención sin arrojar jamás un error.