Rastreo e indexación: cómo Googlebot lee tu web
Antes de pelear por una palabra clave, tu página tiene que existir para Google. Aquí ves las cuatro fases por las que pasa toda URL, y dónde se atasca la mayoría.
- 8 min de lectura
- Nivel intermedio
- Con examen al final
- Googlebot es un Chrome sin ojos ni paciencia: si tu servidor tarda, rastrea menos.
- Una URL pasa por cuatro fases: descubrir, rastrear, renderizar e indexar. No es instantáneo.
- El crawl budget importa en sitios grandes: cada redirección y cada error lo gastan.
- Si tu contenido solo aparece tras ejecutar JavaScript, Google lo verá días más tarde.
Googlebot no es magia: es un programa
Para trabajar el SEO técnico conviene quitarle el misterio a Google. Cuando entra en tu web lo hace Googlebot, que no es más que una versión automatizada de Chrome: descarga tu HTML, lo interpreta y lo guarda en su índice. Piensa en él como un visitante con tres limitaciones.
No tiene ojos. Solo lee el código (el DOM), no la pantalla. Lo que se pinta con una imagen de fondo o aparece solo al pasar el ratón, para él no existe. No tiene paciencia. Si tu servidor tarda en responder, corta y se va a otra URL. No inicia sesión. No rellena formularios ni pulsa botones: lo que está detrás de un clic, no lo ve.
La consecuencia práctica es simple: todo lo que quieras que posicione tiene que estar en el HTML que entregas, servido rápido y accesible sin interacción.
El viaje de una URL, de enlace a resultado
Indexar no es un solo paso, es una cadena. Entenderla es lo que te permite diagnosticar por qué una página nueva tarda en aparecer aunque "esté bien hecha".
- 1Descubrirpor sitemap o un enlace
- 2Rastreardescarga el HTML
- 3Renderizarejecuta el JS si hace falta
- 4Indexarguarda el contenido
Entre rastrear e indexar hay una cola de render. Si tu contenido ya viaja en el HTML, la saltas y entras antes.
Cada vez que Googlebot pide una URL recibe un código de estado, y actúa según cuál sea. Pruébalos:
Pulsa un código de estado y mira su reacción.
Descarga el HTML y lo pasa a la cola de indexación. Es el único estado que quieres en las URLs que deben posicionar.
Crawl budget: cuánto te rastrea Google
Google no rastrea tu web entera cada día: le asigna un presupuesto. Sale de dos cosas: la demanda (cómo de popular y enlazado es tu contenido) y la oferta (cómo de rápido responde tu servidor).
En una web de pocas páginas esto casi no importa: Google llega a todo. Empieza a pesar a partir de miles de URLs, cuando lo que gastas en basura técnica es contenido nuevo que se queda sin rastrear.
66.249.66.1 Googlebot GET /guia-completa/ 200 18443
66.249.66.1 Googlebot GET /guia-completa 301 0
66.249.66.1 Googlebot GET /buscar?orden=precio 200 0 (soft 404)
66.249.66.1 Googlebot GET /api/legacy/ 500 0
En los registros de tu servidor ves exactamente qué rastrea Google y qué respuesta recibe. Es la fuente de verdad, no una estimación de una herramienta.
Por qué el JavaScript retrasa la indexación
Aquí está el punto que más páginas rompe sin que nadie se entere. Si tu web entrega el contenido ya escrito en el HTML (renderizado en servidor, SSR), Google lo lee de una pasada. Si el contenido solo aparece después de que el navegador ejecute tu JavaScript (renderizado en cliente, CSR), Google recibe una página casi vacía y tiene que volver más tarde a "renderizarla".
Ese "más tarde" es una cola aparte, y puede tardar días. En una tienda significa que un producto nuevo no aparece a tiempo; en un medio, que pierdes la ventana de frescura de una noticia.
Míralo: la misma web servida en HTML frente a otra que depende de JavaScript.
Dos páginas, la misma web. Lanza el rastreo y mira cuál se indexa antes.
No es una cruzada contra JavaScript: es a favor de que el contenido viaje ya en el HTML. Next.js con SSR o generación estática te lo da sin renunciar a la interactividad.
Regla m8d Si tu página necesita ejecutar JavaScript para mostrar su contenido, cuenta con que Google la verá más tarde. Ábrela sin JavaScript: lo que desaparece es justo lo que Google puede tardar en ver.
Comprueba lo aprendido
Cinco preguntas. Acierta las cinco para dar la lección por superada.
Pregunta 1 de 5
¿Qué es, en la práctica, Googlebot?
Comentarios
Sé el primeroSin registro: solo un nombre. Todos los comentarios se revisan antes de publicarse.