MOTOR v2.0

Cómo puntúa el escáner GEO

El escáner reparte 100 puntos entre cinco áreas. Publicamos cada comprobación, lo que vale y cómo se mide, para que puedas verificar el resultado y reproducirlo. Si cambiamos un peso, cambia la versión del motor, que sale en cada informe.

Resumen: 100 puntos en cinco áreas

Nota: A desde 85 (bien preparado para la era de la ia); B desde 65 (base sólida con mejoras pendientes); C desde 40 (visibilidad limitada en motores de ia); D por debajo (prácticamente invisible para la ia).

Acceso para motores de IA — 30 puntos

Si un motor no puede entrar en tu web, nada de lo demás importa. Esta categoría mide si los rastreadores tienen permiso y si, en la práctica, tu servidor los deja pasar.

robots.txt legible

2 pts

Pedimos /robots.txt en la raíz del dominio. Cuenta si responde 200 con texto (no con la portada en HTML, como hacen muchas SPA).

Permisos de 15 rastreadores

14 pts

Evaluamos cada user-agent con la semántica de Google: gana el grupo más específico, y dentro de él la regla más larga. Los bots pesan según su función: los de búsqueda y respuesta (Googlebot, Bingbot, OAI-SearchBot, Claude-SearchBot, PerplexityBot, DuckAssistBot) ×3; los que visitan por encargo del usuario (ChatGPT-User, Claude-User, Perplexity-User) ×2; los de entrenamiento (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, Meta-ExternalAgent, CCBot) ×1. Bloquear uno de búsqueda es crítico; bloquear solo los de entrenamiento es un aviso, porque es una decisión legítima.

Prueba de acceso real

6 pts

Pedimos tu página tres veces más, identificándonos como GPTBot, ClaudeBot y PerplexityBot (con nuestra firma al final del user-agent). Si el servidor responde 4xx, sirve una página de desafío del CDN o devuelve menos del 30% del texto que nos dio a nosotros, lo marcamos. Si la prueba no se puede completar, damos la mitad de los puntos y lo decimos. Si tu servidor rechaza incluso al escáner, reintentamos una vez presentándonos como navegador para poder analizar la web, y lo señalamos como aviso.

llms.txt

4 pts

Mitad de los puntos por publicarlo en texto plano; la otra mitad si sigue la propuesta: empieza por un título Markdown y tiene al menos 3 enlaces.

Sitemap XML

4 pts

El declarado en robots.txt o, si no hay, /sitemap.xml y /sitemap_index.xml. Cuenta si contiene <urlset> o <sitemapindex>.

Los 15 rastreadores evaluados
User-agentPlataformaTipoPeso
GooglebotGoogle Search, AI Overviews y AI ModeBúsqueda y respuestas×3
BingbotBing y Microsoft CopilotBúsqueda y respuestas×3
OAI-SearchBotChatGPT SearchBúsqueda y respuestas×3
Claude-SearchBotClaude (búsqueda)Búsqueda y respuestas×3
PerplexityBotPerplexityBúsqueda y respuestas×3
DuckAssistBotDuckDuckGo (DuckAssist)Búsqueda y respuestas×3
ChatGPT-UserChatGPT (visitas a petición del usuario)Visitas por encargo×2
Claude-UserClaude (visitas a petición del usuario)Visitas por encargo×2
Perplexity-UserPerplexity (visitas a petición del usuario)Visitas por encargo×2
GPTBotOpenAI (entrenamiento de modelos)Entrenamiento×1
ClaudeBotAnthropic (entrenamiento de modelos)Entrenamiento×1
Google-ExtendedGemini (entrenamiento y respuestas de Gemini; no afecta a AI Overviews)Entrenamiento×1
Applebot-ExtendedApple Intelligence (entrenamiento)Entrenamiento×1
Meta-ExternalAgentMeta AI (entrenamiento)Entrenamiento×1
CCBotCommon Crawl (datasets con los que se entrenan muchos modelos)Entrenamiento×1

Datos estructurados — 20 puntos

Los datos estructurados (schema.org en JSON-LD) le dicen a buscadores y modelos quién eres y qué es cada página, sin tener que deducirlo del texto.

JSON-LD válido

6 pts

Al menos un bloque application/ld+json que sea JSON válido. Un bloque malformado es crítico: los motores lo descartan entero.

Entidad de marca

4 pts

Un tipo que identifique quién está detrás: Organization, LocalBusiness, ProfessionalService, Person y similares.

Ficha de entidad completa

4 pts

Un punto por cada dato de la entidad: name, url (o @id), logo (o image) y al menos un sameAs hacia perfiles externos.

Schema de contenido

6 pts

Un tipo que describa la página: WebSite, WebPage, Article, BlogPosting, FAQPage, Service, Product, BreadcrumbList, HowTo, entre otros.

Metadatos e indexación — 20 puntos

Metadatos e indexación deciden si la página puede aparecer y cómo se presenta. Un noindex o un nosnippet anulan todo lo demás.

<title>

3 pts

Entre 10 y 70 caracteres: puntos completos. Fuera de rango: 1 punto. Sin título: crítico.

Meta description

3 pts

Entre 50 y 170 caracteres: puntos completos. Fuera de rango: 1 punto.

Canonical

2 pts

Declarado y apuntando al mismo sitio. Un canonical a otro dominio cede la autoría y se marca.

Open Graph

2 pts

og:title, og:description y og:image presentes.

Idioma

1 pts

Atributo lang en la etiqueta <html>.

Un único H1

2 pts

Exactamente un H1 fuera de scripts y plantillas.

Indexable

4 pts

Sin noindex ni en la meta robots/googlebot ni en la cabecera HTTP X-Robots-Tag (general o dirigida a Googlebot o a un bot de IA).

Se puede citar

3 pts

Sin nosnippet ni max-snippet:0 (crítico: te pueden encontrar pero no citar). max-snippet por debajo de 50 caracteres deja 1 punto; bloques con data-nosnippet, 2.

Contenido citable — 20 puntos

La mayoría de rastreadores de IA no ejecutan JavaScript y citan fragmentos concretos. Esta categoría mide si tu contenido está en el HTML y en un formato fácil de extraer.

Texto sin JavaScript

8 pts

Palabras visibles en el HTML inicial, fuera de scripts, estilos y <head>. 300 o más: puntos completos; entre 150 y 299: la mitad; menos: crítico.

Subtítulos

3 pts

Al menos dos H2/H3.

Subtítulos-pregunta

2 pts

Al menos un H2/H3/H4 formulado como pregunta (¿…?, «cómo», «qué», «cuánto»…): el formato que mejor encaja con cómo se pregunta a un asistente.

Listas o tablas

2 pts

Al menos una lista (2+ elementos) o tabla (2+ filas) fuera de menús, cabecera y pie.

Señales de confianza (E-E-A-T)

3 pts

En páginas normales: enlace a «sobre nosotros» (2 puntos) y a contacto (1). En artículos (Article/BlogPosting u og:type article): autor declarado, una fecha de los últimos 18 meses y enlace a «sobre nosotros» o contacto, un punto cada uno.

HTTPS

2 pts

La URL final, tras redirecciones, se sirve por https.

Resto del sitio — 10 puntos

Una portada impecable no sirve si el resto de la web no se puede leer. Revisamos una muestra para ver si los problemas se repiten.

Muestra de hasta 4 páginas

10 pts

Elegimos URLs del sitemap y de los enlaces de la página, una por sección (/servicios, /blog, /contacto…). En cada una comprobamos 5 cosas: que responda, que sea indexable, que tenga título, JSON-LD y al menos 150 palabras sin JavaScript. La nota es la proporción de comprobaciones superadas. Si no hay forma de descubrir otras páginas, damos la mitad y lo avisamos.

Cómo se ordenan las prioridades

Cada problema lleva los puntos que recuperarías al arreglarlo y un esfuerzo orientativo (bajo, medio o alto). El resumen ejecutivo del informe elige los tres con más retorno: puntos recuperables, ×1,5 si es crítico, divididos por el esfuerzo (×1; ×1,6; ×2,6). La «puntuación estimada» suma esos tres arreglos a tu nota actual.

Lo que el escáner no mide

  • Si ChatGPT, Perplexity o Gemini te citan hoy, ni en qué preguntas.
  • Tu autoridad temática y tus menciones en las fuentes que consultan los modelos.
  • La calidad o la veracidad de tu contenido: solo su formato y su accesibilidad.
  • El rendimiento (Core Web Vitals) ni la experiencia de usuario.

Eso es lo que cubre la auditoría GEO. Sobre la versión anterior del motor, lee cómo puntuaba la v1 y qué no medía.

Preguntas frecuentes

¿Por qué el escáner pesa distinto a los bots de búsqueda y a los de entrenamiento?

Porque bloquearlos tiene consecuencias distintas. Si bloqueas OAI-SearchBot, PerplexityBot o Googlebot, esas plataformas no pueden leer tu web cuando alguien les pregunta y no pueden citarte. Si bloqueas GPTBot o CCBot, tu contenido no entra en el entrenamiento de los modelos: pierdes algo de presencia en lo que «saben», pero sigues pudiendo aparecer en sus respuestas con búsqueda. Por eso los primeros pesan el triple y su bloqueo es crítico, y el de los segundos es un aviso.

¿Google-Extended controla si aparezco en AI Overviews?

No. Según la documentación de Google, Google-Extended solo decide si tu contenido se usa para entrenar Gemini y para sus respuestas en las apps de Gemini. AI Overviews y AI Mode forman parte de la Búsqueda y dependen de Googlebot. Por eso el escáner evalúa los dos por separado.

¿Por qué la prueba de acceso real puede dar un falso positivo?

Porque pedimos tu página con el user-agent de GPTBot, ClaudeBot y PerplexityBot desde nuestros servidores, no desde los de OpenAI, Anthropic o Perplexity. Si tu firewall verifica los bots por su dirección IP, puede bloquearnos a nosotros y dejar pasar a los reales. Lo avisamos en el propio informe: si sale este hallazgo, compruébalo en el panel de tu CDN.

¿Por qué el escáner no mide si la IA ya me cita?

Porque eso no se puede medir bien con una sola consulta automática: las respuestas cambian según la pregunta, el país, el historial y el modelo. El escáner mide las barreras técnicas, que son deterministas. Medir las citas reales requiere decenas de preguntas repetidas en varios modelos a lo largo del tiempo, y eso es parte de la auditoría GEO.