1/6Rastreo e indexación: cómo Googlebot lee tu web
  1. 1Rastreo e indexación: cómo Googlebot lee tu web
  2. 2Renderizado y SEO: SSR, CSR y SSG
  3. 3Arquitectura de la información y enlazado
  4. 4Rendimiento y Core Web Vitals
  5. 5Datos estructurados y entidades
  6. 6Auditoría de logs y automatización

Rastreo e indexación: cómo Googlebot lee tu web

SEO técnico · Lección 1

Antes de pelear por una palabra clave, tu página tiene que existir para Google. Aquí ves las cuatro fases por las que pasa toda URL, y dónde se atasca la mayoría.

  • 8 min de lectura
  • Nivel intermedio
  • Con examen al final
Lo que te llevas
  • Googlebot es un Chrome sin ojos ni paciencia: si tu servidor tarda, rastrea menos.
  • Una URL pasa por cuatro fases: descubrir, rastrear, renderizar e indexar. No es instantáneo.
  • El crawl budget importa en sitios grandes: cada redirección y cada error lo gastan.
  • Si tu contenido solo aparece tras ejecutar JavaScript, Google lo verá días más tarde.
El cliente

Googlebot no es magia: es un programa

Para trabajar el SEO técnico conviene quitarle el misterio a Google. Cuando entra en tu web lo hace Googlebot, que no es más que una versión automatizada de Chrome: descarga tu HTML, lo interpreta y lo guarda en su índice. Piensa en él como un visitante con tres limitaciones.

No tiene ojos. Solo lee el código (el DOM), no la pantalla. Lo que se pinta con una imagen de fondo o aparece solo al pasar el ratón, para él no existe. No tiene paciencia. Si tu servidor tarda en responder, corta y se va a otra URL. No inicia sesión. No rellena formularios ni pulsa botones: lo que está detrás de un clic, no lo ve.

La consecuencia práctica es simple: todo lo que quieras que posicione tiene que estar en el HTML que entregas, servido rápido y accesible sin interacción.

Compruébalo tú
En Search Console, abre Inspección de URL y mira la pestaña "HTML renderizado". Lo que no aparezca ahí es lo que Google no está viendo de tu página.
El ciclo

El viaje de una URL, de enlace a resultado

Indexar no es un solo paso, es una cadena. Entenderla es lo que te permite diagnosticar por qué una página nueva tarda en aparecer aunque "esté bien hecha".

Las cuatro fases

Entre rastrear e indexar hay una cola de render. Si tu contenido ya viaja en el HTML, la saltas y entras antes.

Cada vez que Googlebot pide una URL recibe un código de estado, y actúa según cuál sea. Pruébalos:

InteractivoQué hace Googlebot con cada respuesta

Pulsa un código de estado y mira su reacción.

200 · OK

Descarga el HTML y lo pasa a la cola de indexación. Es el único estado que quieres en las URLs que deben posicionar.

Presupuesto

Crawl budget: cuánto te rastrea Google

Google no rastrea tu web entera cada día: le asigna un presupuesto. Sale de dos cosas: la demanda (cómo de popular y enlazado es tu contenido) y la oferta (cómo de rápido responde tu servidor).

En una web de pocas páginas esto casi no importa: Google llega a todo. Empieza a pesar a partir de miles de URLs, cuando lo que gastas en basura técnica es contenido nuevo que se queda sin rastrear.

Umbrales que no conviene cruzar
< 200 msRespuesta del servidor (TTFB)por encima, Google baja el ritmo de rastreo
0Saltos de redireccióncada 301 intermedio es una petición que se gasta de más
0Errores 5xxun 500 repetido frena el rastreo de todo el dominio
66.249.66.1  Googlebot  GET /guia-completa/     200  18443
66.249.66.1  Googlebot  GET /guia-completa       301  0
66.249.66.1  Googlebot  GET /buscar?orden=precio 200  0     (soft 404)
66.249.66.1  Googlebot  GET /api/legacy/         500  0

En los registros de tu servidor ves exactamente qué rastrea Google y qué respuesta recibe. Es la fuente de verdad, no una estimación de una herramienta.

Renderizado

Por qué el JavaScript retrasa la indexación

Aquí está el punto que más páginas rompe sin que nadie se entere. Si tu web entrega el contenido ya escrito en el HTML (renderizado en servidor, SSR), Google lo lee de una pasada. Si el contenido solo aparece después de que el navegador ejecute tu JavaScript (renderizado en cliente, CSR), Google recibe una página casi vacía y tiene que volver más tarde a "renderizarla".

Ese "más tarde" es una cola aparte, y puede tardar días. En una tienda significa que un producto nuevo no aparece a tiempo; en un medio, que pierdes la ventana de frescura de una noticia.

Míralo: la misma web servida en HTML frente a otra que depende de JavaScript.

InteractivoLa carrera del renderizado

Dos páginas, la misma web. Lanza el rastreo y mira cuál se indexa antes.

HTML (SSR)En espera
JavaScript (CSR)En espera
El HTML se indexa en la primera pasada. El que depende de JavaScript espera en la cola de render.
HTML servido frente a JavaScript en cliente
HTML (SSR)JavaScript (CSR)
Qué recibe GoogleEl contenido, ya listoUna página casi vacía
Cuándo se indexaEn la primera pasadaTras la cola de render, días después
Coste para GoogleBajoAlto: ejecuta tu JavaScript
RiesgoNingunoQue no llegue a renderizarse a tiempo

No es una cruzada contra JavaScript: es a favor de que el contenido viaje ya en el HTML. Next.js con SSR o generación estática te lo da sin renunciar a la interactividad.

El contraste
Lo que se dice
Con Google todo acaba indexándose igual, tarde o temprano.
Lo comprobable
Una página que depende de JavaScript entra en una cola de render aparte y puede tardar días. En contenido que compite por frescura, esos días son el partido entero.

Regla m8d Si tu página necesita ejecutar JavaScript para mostrar su contenido, cuenta con que Google la verá más tarde. Ábrela sin JavaScript: lo que desaparece es justo lo que Google puede tardar en ver.

Examen

Comprueba lo aprendido

Cinco preguntas. Acierta las cinco para dar la lección por superada.

Pregunta 1 de 5

¿Qué es, en la práctica, Googlebot?

Comentarios

Sé el primero

Sin registro: solo un nombre. Todos los comentarios se revisan antes de publicarse.