Saltar al contenido principal

Cómo comprobar tú mismo qué ve un rastreador de IA en tu web (sin instalar nada)

Cuatro comprobaciones con el navegador que ya tienes: el texto que llega sin JavaScript, los metadatos, los datos estructurados y el robots.txt. Y lo que cada una NO demuestra, que es donde se equivoca casi todo el mundo.

Por

Founder & SEO Lead

Un pequeño robot blanco observa una ventana de navegador cuya barra de direcciones dice «view-source:»; una lupa de cristal amplía el código HTML y resalta en teal la etiqueta «<title>»; arriba a la izquierda, el logo de Autoridad Digital sobre fondo azul oscuro
Ver el código fuente es lo más parecido que tienes, sin instalar nada, a leer tu web como la lee un rastreador de IA que no ejecuta JavaScript.

Resumen ejecutivo

  • La mayoría de los rastreadores de IA no ejecutan JavaScript. Vercel y MERJ lo midieron en los de OpenAI, Anthropic, Meta, ByteDance y Perplexity: descargan los archivos JS, pero no los ejecutan. Gemini sí renderiza, porque usa la infraestructura de Googlebot.
  • Por eso la prueba básica es ver el código fuente, no «Inspeccionar». El código fuente es lo que entrega tu servidor; «Inspeccionar» enseña la página después de ejecutar JavaScript.
  • Con el navegador que ya tienes puedes comprobar cuatro cosas: el texto que llega sin JavaScript, los metadatos, los datos estructurados y el robots.txt.
  • Cada comprobación tiene un punto ciego. El más traicionero: la prueba de resultados enriquecidos de Google ejecuta JavaScript, así que puede enseñarte un JSON-LD que los bots de IA nunca verán.
  • Y el robots.txt no lo es todo: tu CDN puede bloquear a los bots aunque el robots.txt les dé paso.
  • En nuestro estudio de 584 webs de empresas, una de cada tres portadas enseñaba poco o nada sin JavaScript y la mitad no publicaba ningún dato estructurado. Son justo las dos cosas que aquí aprenderás a comprobar.

Por qué no basta con abrir tu web

Cuando abres tu web en el navegador, ves el resultado final: el HTML que manda tu servidor, más todo lo que JavaScript añade, cambia o carga después. Es lo que ve una persona. No es lo que ve la mayoría de los rastreadores de IA.

En diciembre de 2024, Vercel y MERJ publicaron el análisis más citado sobre el tema. Estudiaron el tráfico real de los rastreadores y concluyeron que los de OpenAI, Anthropic, Meta, ByteDance y Perplexity no renderizan JavaScript. Descargan archivos JS (ChatGPT en el 11,5 % de sus peticiones, Claude en el 23,8 %), pero no los ejecutan. Las excepciones son Gemini, que usa la infraestructura de Googlebot, y AppleBot, que rastrea con un navegador. Su recomendación final es la de siempre: servir desde el servidor el contenido que importa.

Hemos revisado la documentación actual de OpenAI, Anthropic y Perplexity sobre sus rastreadores y ninguna dice lo contrario. Tampoco lo confirma: simplemente no hablan de JavaScript. Mientras nadie publique otra cosa, lo prudente es suponer lo peor, que tu web tiene que entenderse sin ejecutar nada.

Esto tiene una consecuencia práctica: si tu web está hecha con un constructor o un framework que pinta el contenido desde el navegador, puedes tener una página preciosa para las personas y vacía para los bots. En el análisis de tres webs de medios encontramos una con cero palabras en el HTML inicial.

Vamos con las cuatro comprobaciones. Solo necesitas el navegador y cinco minutos.

1. El texto: lo que llega sin JavaScript

Abre el código fuente (no «Inspeccionar»)

La forma más sencilla en Chrome, Edge y Firefox: clic derecho sobre la página → «Ver código fuente de la página». Se abre una pestaña con el HTML en bruto.

Si prefieres el teclado, depende del navegador y del sistema, y aquí es donde falla casi todo el mundo:

NavegadorWindowsMac
ChromeCtrl + UCmd + Option + U
EdgeCtrl + U—
FirefoxCtrl + UCmd + U
Safari—Primero activa el menú Desarrollo (abajo)

Fuentes: ayuda de Chrome, de Edge y de Firefox.

Cmd + U solo funciona en Firefox. En Chrome para Mac el atajo lleva también Option. Lo sabemos porque nosotros mismos lo escribimos mal en los primeros correos en los que proponíamos esta comprobación, y a quien lo probara en Chrome no le funcionaba.

En Safari, el código fuente está escondido hasta que activas las herramientas de desarrollo: menú Safari → Ajustes → pestaña Avanzado → marca «Mostrar funciones para desarrolladores web» (ayuda de Apple). Después aparece el menú Desarrollo, con la opción de mostrar el código fuente de la página.

En el móvil: en Chrome para Android puedes escribir view-source: delante de la dirección en la barra (por ejemplo, view-source:https://tuempresa.com). En el iPhone no hay forma práctica, ni en Safari ni en Chrome. Hazlo desde un ordenador.

Y no uses «Inspeccionar». Abre las herramientas para desarrolladores en el panel Elements, que enseña el DOM, es decir, la página después de ejecutar JavaScript. La documentación de Chrome lo dice claramente: cuando JavaScript añade, quita o edita nodos, el DOM deja de coincidir con el HTML. Una web vacía para los bots se ve perfecta en «Inspeccionar».

Busca una frase de lo que vendes

Con el código fuente abierto, pulsa Ctrl + F (Cmd + F en Mac) y busca una frase literal de tu página, algo que diga qué haces: «instalación de paneles solares en Málaga», «despacho de abogados mercantiles», lo que sea.

  • Si aparece, ese texto llega en el HTML y un rastreador sin JavaScript puede leerlo.
  • Si no aparece, pero la ves en pantalla, la está pintando JavaScript. Para GPTBot, ClaudeBot o PerplexityBot, esa frase no existe.

Repite la búsqueda con dos o tres frases de distintas partes de la página: el titular, la descripción de un servicio, el texto del pie. Es común que el titular llegue en el HTML y el resto se cargue después.

La versión visual: apaga JavaScript

Si el código fuente te resulta ilegible, hay una forma más intuitiva de ver lo mismo. En Chrome: clic en el icono que hay a la izquierda de la dirección → configuración del sitio → cambia el permiso de JavaScript para que no se permita. Recarga la página (ayuda de Chrome).

Lo que quede en pantalla es, aproximadamente, lo que lee un rastreador que no ejecuta JavaScript. Si ves una página en blanco o un icono de carga que no termina, ya tienes el diagnóstico. Acuérdate de volver a permitirlo después.

Lo que esta comprobación NO demuestra:

  • Que tu contenido merezca ser citado. Solo demuestra que se puede leer. Una página de relleno perfectamente servida es legible e irrelevante, y lo explicamos con una que saca 100/100 en cómo puntúa nuestro escáner.
  • Que el bot reciba lo mismo que tú. Chrome, al ver el código fuente, puede enseñarte la copia que guardó al cargar la página en vez de volver a pedirla. Y tu servidor o tu CDN pueden responder distinto a un bot que a tu navegador. Esto último se ve en el paso 4.

2. Los metadatos: lo que la IA lee antes que tu texto

En el mismo código fuente, busca con Ctrl + F estas etiquetas. Todas deberían estar en el HTML, no añadidas por JavaScript:

BuscaQué debes encontrarSi falta o está mal
<titleUn título que diga qué es la página y de quiénLos motores tienen que adivinarlo
name="description"Un resumen de una o dos frasesEn nuestro estudio, faltaba en el 39,9 % de las webs
<h1Un único titular principalFaltaba en el 38,7 %
rel="canonical"La URL oficial de la páginaPueden quedarse con otra versión de la misma página
noindexNada: no debería aparecerSi aparece, le estás pidiendo a los buscadores que no indexen la página

La última es la más grave y la más fácil de pasar por alto: un noindex que alguien dejó puesto al lanzar la web, o que un plugin añade a ciertas páginas. Si la búsqueda de noindex devuelve algo en una página que quieres que aparezca, empieza por ahí.

Lo que esta comprobación NO demuestra: que los metadatos sean buenos. Un título genérico («Inicio») cumple la comprobación y no ayuda a nadie. Lo que sí sabrás es si existen y si llegan sin JavaScript.

3. Los datos estructurados: quién eres para una máquina

Aquí está la trampa de verdad, y la razón de que este artículo exista.

Los datos estructurados (normalmente en formato JSON-LD) son el bloque de código en el que le dices a las máquinas, sin ambigüedad, quién es tu empresa: nombre, logo, dirección, teléfono, perfiles oficiales. Son la base del entity SEO. En el estudio de las 584 webs, el 51,9 % no publicaba ninguno y el 60,3 % no le decía a la IA quién era la empresa.

Para comprobarlo tienes dos herramientas gratuitas de Google:

  • La prueba de resultados enriquecidos, en search.google.com/test/rich-results. Pegas tu URL y te dice qué datos estructurados detecta. Solo reconoce los tipos que Google usa para resultados enriquecidos, pero Organization está entre ellos, que es el que importa aquí (ayuda de Google).
  • El validador de schema.org, en validator.schema.org. Enseña todos los tipos de schema.org, no solo los que usa Google.

Y ahora la trampa. Las dos herramientas ejecutan JavaScript. La ayuda de Google dice que la prueba de resultados enriquecidos usa el código renderizado, y la documentación del validador dice que extrae los datos estructurados que inserta JavaScript. Es decir: te enseñan lo que ve Googlebot, no lo que ve GPTBot.

Por eso la comprobación correcta tiene dos pasos:

  1. Pasa tu URL por la prueba de resultados enriquecidos. Si no detecta nada, no tienes datos estructurados, o están rotos. Ojo: ver el código fuente no te sirve para esto, porque la ausencia no se ve si no sabes qué buscar. Este también fue un error nuestro: en los primeros correos de prospección proponíamos comprobar la falta de datos estructurados mirando el código fuente, y quien lo hacía veía sus servicios escritos en la página y pensaba que el correo mentía.
  2. Si la prueba sí detecta datos estructurados, confirma que están en el HTML. Abre el código fuente y busca application/ld+json. Si aparece, los datos llegan sin JavaScript. Si la prueba los encuentra pero el código fuente no, los está insertando JavaScript: habitualmente, Google Tag Manager o un plugin. Google los verá; la mayoría de los bots de IA, no.

Lo que esta comprobación NO demuestra: que tener datos estructurados haga que la IA te cite. Google dice por escrito que no hace falta ningún marcado especial para aparecer en sus funciones de IA, y los estudios que han intentado medir el efecto no lo encuentran. La evidencia completa está en este artículo. Donde sí ayudan es en que las máquinas no te confundan con otra empresa de nombre parecido.

4. El acceso: quién puede entrar

La última comprobación es la más rápida. Escribe en el navegador tu dominio seguido de /robots.txt, por ejemplo https://tuempresa.com/robots.txt. Es un archivo de texto con instrucciones para los rastreadores.

Busca los nombres de los bots de IA. Los principales, según la documentación de cada empresa:

EmpresaBotPara qué
OpenAIOAI-SearchBotAparecer en la búsqueda de ChatGPT
OpenAIGPTBotEntrenar modelos
AnthropicClaude-SearchBotBúsqueda de Claude
AnthropicClaudeBotEntrenar modelos
PerplexityPerplexityBotBúsqueda de Perplexity

Fuentes: OpenAI, Anthropic y Perplexity.

Lo que tienes que mirar:

  • Si un bot aparece con Disallow: /, lo estás bloqueando en todo el sitio. Bloquear GPTBot solo te saca del entrenamiento; bloquear OAI-SearchBot te saca de la búsqueda de ChatGPT. OpenAI documenta que son ajustes independientes.
  • Si un bot tiene su propio bloque, ese bloque sustituye al general (User-agent: *) para ese bot; no se suman. Lo dice el estándar (RFC 9309) y es la fuente de muchos bloqueos accidentales: alguien añade un bloque para GPTBot con una sola regla y, sin querer, le quita todas las restricciones generales, o al revés. Lo explicamos a fondo en la auditoría técnica del robots.txt.
  • Si no hay ningún bloque para bots de IA, se aplica el general. Con un User-agent: * sin restricciones, todos pueden entrar.

Lo que esta comprobación NO demuestra, y es lo más importante de esta sección: que los bots puedan entrar de verdad. El robots.txt es una instrucción, no una barrera. El bloqueo real lo hacen el cortafuegos o la CDN, y pueden bloquear a un bot aunque tu robots.txt le dé paso.

El caso más común es Cloudflare. Desde julio de 2025 bloquea por defecto a los rastreadores de IA que no tienen permiso, y el 15 de septiembre de 2026 cambió sus valores por defecto para los dominios nuevos: bloquea las categorías de entrenamiento y de agentes en las páginas con anuncios, y deja pasar la de búsqueda. Su control de rastreadores funciona con reglas del cortafuegos que responden con un error. Perplexity, en su documentación, avisa de que con un cortafuegos quizá tengas que autorizar sus bots de forma explícita.

Si tu web pasa por Cloudflare o un servicio parecido, entra en su panel y busca la sección de control de bots o de rastreadores de IA. Ahí está la respuesta que el robots.txt no te da.

Por qué no te recomendamos «hacerte pasar» por un bot

En internet encontrarás el truco de pedir tu web con una herramienta de línea de comandos cambiando la identificación del navegador por la de un bot (el user agent). No lo recomendamos como prueba, porque engaña en las dos direcciones. Los servicios como Cloudflare identifican a los bots reales por su origen y su firma, no solo por cómo se presentan. Tu petición falsa puede ser bloqueada por falsa aunque el bot real pase, o pasar aunque el bot real esté bloqueado. El único dato fiable es el del panel de tu CDN o los registros de tu servidor.

Las cuatro comprobaciones, en una tabla

Quieres saber…CómoLo que NO demuestra
Si tu texto llega sin JavaScriptCódigo fuente + buscar una frase, o apagar JavaScriptQue el contenido merezca ser citado
Si tienes título, descripción, H1, canonicalCódigo fuente + buscar cada etiquetaQue sean buenos
Si declaras quién eres (JSON-LD)Prueba de resultados enriquecidos, y luego buscar application/ld+json en el código fuenteQue eso te haga citar
Si los bots pueden entrar/robots.txt y el panel de tu CDNQue te vayan a visitar

Y la advertencia que vale para las cuatro: todo esto mide si la IA puede leerte, no si te cita. Que te citen depende de tu autoridad, de lo que se dice de ti en otras fuentes y de la calidad de lo que publicas. Pero si falla algo de lo anterior, lo demás no llega a importar: lo que un bot no puede leer, no lo puede citar.

O hazlo todo de golpe

Si no te apetece abrir código fuente, el escáner GEO hace estas comprobaciones por ti. Lee tu HTML sin ejecutar JavaScript, revisa tu robots.txt para 8 bots de IA, detecta los datos estructurados que llegan en el HTML y te devuelve una nota con lo que falla, por orden de prioridad. Lo que no puede ver es tu CDN desde dentro: esa parte sigue siendo cosa tuya.

Herramienta gratuita

¿Qué ve un bot de IA en tu web?

Las comprobaciones de este artículo, automáticas y en 20 segundos: texto sin JavaScript, metadatos, datos estructurados y acceso para 8 bots de IA. El informe sale aquí mismo.

El informe se muestra al momento en esta página. Usaremos tu email solo para contactarte sobre el resultado.

Preguntas frecuentes

Lo más parecido, sin instalar nada, es ver el código fuente de la página: clic derecho sobre la página y «Ver código fuente de la página», o Ctrl+U en Chrome, Edge y Firefox para Windows. En Mac, Chrome usa Cmd+Option+U y Firefox Cmd+U. El código fuente es el HTML que entrega tu servidor, antes de ejecutar JavaScript, y según el estudio de Vercel y MERJ los rastreadores de OpenAI, Anthropic y Perplexity no ejecutan JavaScript. Si el texto de tus servicios no aparece ahí, esos rastreadores no lo ven.

Porque depende del navegador. En Firefox para Mac, Cmd+U sí abre el código fuente. En Chrome para Mac el atajo es Cmd+Option+U. En Safari primero hay que activar las funciones para desarrolladores web en Ajustes, pestaña Avanzado, y después usar la opción de mostrar el código fuente del menú Desarrollo. En Chrome, Edge y Firefox también funciona el clic derecho sobre la página.

No. «Inspeccionar» abre el panel Elements de las herramientas para desarrolladores, que enseña el DOM después de que JavaScript lo haya modificado. Una web que solo tiene contenido gracias a JavaScript se ve completa en «Inspeccionar» y vacía en «Ver código fuente». Para saber qué ve un rastreador que no ejecuta JavaScript, usa el código fuente.

No necesariamente. La prueba de resultados enriquecidos renderiza la página, es decir, ejecuta JavaScript, y el validador de schema.org también extrae el marcado que inserta JavaScript. Si tu JSON-LD aparece en esas herramientas pero no en el código fuente, lo está insertando JavaScript, por ejemplo desde Google Tag Manager o un plugin, y los rastreadores de IA que no ejecutan JavaScript no lo verán.

No. El robots.txt es una instrucción, no una barrera: el bloqueo real lo hacen el cortafuegos o la CDN. Cloudflare, por ejemplo, bloquea por defecto ciertas categorías de rastreadores de IA en los dominios nuevos, y su bloqueo funciona con reglas del cortafuegos que responden con un error aunque tu robots.txt diga lo contrario. Si usas Cloudflare o un servicio parecido, revisa su panel de control de bots además del robots.txt.

¿Prefieres que lo compruebe una máquina?

El escáner GEO hace estas comprobaciones de golpe: lee tu HTML sin ejecutar JavaScript, revisa tu robots.txt para 8 bots de IA y te dice qué datos estructurados declaras. Gratis y en 20 segundos.

Escanear mi web
Sobre el autor

FOUNDER & SEO LEAD

Founder de Autoridad Digital. Especialista en SEO, Generative Engine Optimization, Topical Authority y Authority Stacking, PR Digital. Todos los artículos del blog están firmados por él.

¿Te resulta útil este contenido? Añádenos como fuente preferida en Google.

Activa las cookies de terceros (Google) para ver este botón.

¿Quieres aplicar estas estrategias a tu negocio?

Solicita una auditoría y descubriremos juntos cómo dominar tu nicho.

Solicitar Auditoría