Los buscadores, van a cambiar su funcionamiento con la introducción de los motores conversacionales (IA) … ¿Qué webs e información utilizarán para mostrar resultados? ¿Cómo podemos añadir nuestros contenidos?.

Google y Microsoft, han confirmado que utilizan múltiples fuentes, incluyendo webs, foros, redes sociales, recursos wiki y muchos más. También han confirmado que los sistemas de rastreo web actuales, se mantienen con algunos ajustes, en este artículo vamos a estudiar ese tipo de rastreo web.

Debemos saber que, primero, Google rastrea internet para encontrar nuevas páginas.Posteriormente, indexa estas páginas para entender de qué se trata y las clasifica de acuerdo con los datos recuperados. El rastreo y la indexación son dos procesos diferentes, aún así, ambos son realizados por un rastreador.

¿Qué es el rastreador de Google?

Google crawler (también searchbot, spider) es un software que Google y otros motores de búsqueda utilizan para escanear la Web. En pocas palabras, sondea internet de página en página, buscando contenido nuevo, o actualizado, que Google aún no tiene en sus bases de datos.

Cualquier motor de búsqueda tiene su propio conjunto de rastreadores. En cuanto a Google, hay más de 15 tipos diferentes de rastreadores, el principal de Google se llama Googlebot, y realiza tanto rastreo como indexación.

¿Cómo funciona el rastreador de Google?

Google (cualquier motor de búsqueda en realidad) no tiene un registro central de URLs, que se actualice automáticamente cada vez que se crea una nueva página. Esto significa que Google no es «alertado» sobre las nuevas páginas automáticamente, sino que tiene que encontrarlas. Googlebot se desplaza constantemente por Internet y busca nuevas páginas, añadiéndolas a la base de datos de páginas existentes de Google.

Una vez que Googlebot descubre una nueva página, renderiza (visualiza) la página en un navegador (Chromium), cargando todo el HTML, el código de terceros, JavaScript y CSS. Esta información se almacena en la base de datos del motor de búsqueda y luego se utiliza para indexar y clasificar la página. Si una página ha sido indexada, se añade al índice de Google.

¿Cómo ve las páginas el rastreador de Google?

El rastreador de Google renderiza cada página con la última versión del navegador Chromium. En el mejor de los casos, Google crawler «ve» una página de la forma en que se diseñó, pero en un escenario realista, las cosas son más complicadas.

Representación móvil y de escritorio

Googlebot puede «ver» tu página con dos subtipos de rastreadores: Googlebot Desktop y Googlebot Smartphone.

Hace algunos años, Google utilizaba un rastreador de escritorio para visitar y renderizar la mayoría de las páginas. Pero las cosas han cambiado con la introducción del concepto MOBILE FIRST. Google comenzó a usar Googlebot Smartphone para rastrear, indexar y clasificar la versión móvil de los sitios web para SERP móviles y de escritorio.

Googlebot Mobile y Googlebot Desktop visitarán tu sitio web. Por lo tanto, es importante cuidar ambas versiones de tu sitio web y pensar en usar un diseño adaptativo.

¿Cómo saber si Google rastrea e indexa tu sitio web con el concepto mobile first? Recibirás una notificación especial en Google Search Console.

Si el código de tu página está desordenado, es posible que el rastreador no pueda renderizarlo correctamente y considere tu página vacía.

En cuanto a la representación de JavaScript, debes recordar que JavaScript es un lenguaje que evoluciona rápidamente, y Googlebot a veces puede no ser compatible con las últimas versiones. Asegúrate de que tu JS sea compatible con Googlebot, o tu página puede ser renderizada incorrectamente.

Ten en cuenta tu tiempo de carga de JavaScript. Si un script necesita más de 5 segundos para cargarse, Googlebot no renderizará ni indexará el contenido generado por ese script.

¿Qué influye en el comportamiento del rastreador?

El comportamiento de Googlebot no es caótico, está determinado por algoritmos sofisticados, que ayudan al rastreador a navegar por la web y establecer las reglas de procesamiento de la información. Echemos un vistazo a lo que influye en el comportamiento del rastreador y cómo puedes optimizar el rastreo de tus páginas.

Enlaces internos y backlinks

Si Google ya conoce tu sitio web, Googlebot revisará tus páginas principales en busca de actualizaciones de vez en cuando. Es por eso que es crucial colocar los enlaces a las nuevas páginas en las páginas de más valor, y ya censadas, de tu sitio web. Lo ideal es en la página de inicio.

Por ejemplo, puedes enriquecer tu página de inicio con un bloque que incluya las últimas noticias o publicaciones. Esto permitiría a Googlebot encontrar tus nuevas páginas mucho más rápido.

En términos de rastreo, los backlinks funcionan igual: Google encontrará tu página más rápido si está vinculada con alguna página externa creíble y popular. Así que si añades una nueva página, no te olvides de la promoción externa (No te olvides de las redes sociales).

Aunque Google ha declarado recientemente que los enlaces nofollow, también podrían usarse como pistas para rastrear e indexar, todavía recomendamos usar dofollow.

Profundidad de clic

La profundidad de clic muestra qué tan lejos está una página de la página de inicio, indicando así cuántos «pasos» necesitará Googlebot para llegar a una página. Idealmente, se debería llegar a cualquier página de un sitio web en 3 clics. Una mayor profundidad de clic ralentiza el rastreo y apenas beneficia la experiencia del usuario.

Si ves que algunas páginas importantes están demasiado lejos de la página de inicio, reconsidera la disposición de la estructura de tu sitio web. Una buena estructura debe ser simple y escalable, para que puedas agregar tantas páginas nuevas como necesites sin afectar negativamente a la profundidad de clic y evitar que el rastreador de Google llegue con éxito a las páginas.

Estructura de sitio web simple y escalable. Mapa del sitio

Un mapa del sitio, es un documento que contiene la lista completa de páginas que quieres que aparezcan en Google. Puedes enviar un mapa del sitio de tu web a Google a través de Google Search Console (Índice> Sitemaps) para que Googlebot sepa qué páginas visitar y rastrear. Un mapa del sitio también le dice a Google si hay alguna actualización en tus páginas.

El mapa del sitio no garantiza que Googlebot lo use al rastrear tu web. El rastreador puede ignorar tu mapa del sitio y seguir rastreando el sitio web de la forma en que decida.

Algunos CMS incluso generan automáticamente un mapa del sitio, lo actualizan y lo envían a Google para que su proceso SEO sea más rápido y fácil.

Instrucciones de indexación

Al rastrear e indexar tus páginas, Google sigue ciertas instrucciones, como robots.txt, noindex tag, robots meta tag y X-Robots-Tag.

Robots.txt es un archivo, situado en el directorio raíz, que restringe algunas páginas o elementos, para que sean ignorados por Google. Una vez que Googlebot descubre tu página, lee el archivo robots.txt. Si robots.txt restringe el rastreo de la página descubierta, Googlebot deja de rastrear y cargar cualquier contenido y script de esa página. Esta página no aparecerá en la búsqueda (aunque hay excepciones).

La etiqueta Noindex, la metaetiqueta de robots y la etiqueta X-Robots son las etiquetas utilizadas para restringir a los rastreadores de rastrear e indexar una página.

Una etiqueta noindex restringe la indexación de la página para todo tipo de rastreadores. Esto significa que puedes evitar que algunos tipos de rastreadores visiten la página y mantenerla abierta a otros. Si no se especifica el tipo de robot, las instrucciones serán válidas para todos los tipos de rastreadores de Google.

El archivo Robots.txt no garantiza que la página esté excluida de la indexación. Googlebot trata este documento más como una recomendación que como una orden. Esto significa que Google puede ignorar robots.txt e indexar una página para la búsqueda. Si quieres asegurarte de que la página no se indexe, usa una etiqueta noindex.

Algunas páginas pueden no estar disponibles para ser rastreadas e indexadas por Google …

  • Páginas protegidas por contraseña. Googlebot simula el comportamiento de un usuario anónimo que no tiene ninguna credencial para visitar páginas protegidas. Por lo tanto, si una página está protegida con una contraseña, no se rastreará, ya que Googlebot no podrá acceder a ella.
  • Páginas excluidas por instrucciones de indexación. Estas son las páginas ocultas a Google por las instrucciones de robots.txt, páginas con una etiqueta noindex, metaetiqueta de robots y X-Robots-Tag.
  • Páginas huérfanas. Son las páginas a las que no se enlazan desde ninguna otra página del sitio web. Googlebot es un robot araña, lo que significa que descubre nuevas páginas siguiendo todos los enlaces que encuentra. Si no hay enlaces que apunten a una página, entonces la página no se rastreará y no aparecerá en la búsqueda.

Algunas de las páginas pueden estar restringidas a rastreo e indexación a propósito. Suelen ser las que no están destinadas a aparecer en la búsqueda: páginas con datos personales, políticas, términos de uso, versiones de prueba de páginas, páginas de archivo, páginas de resultados de búsqueda internas, etc.

Pero si quieres que tus páginas estén disponibles para los rastreadores de Google y atraer tráfico, comprueba cuidadosamente las instrucciones de indexación.

¿Cuándo aparecerá mi sitio web en la búsqueda?

Está claro que tus páginas no aparecerán en las búsquedas inmediatamente después de que publiques tu web. Si tu sitio web es absolutamente nuevo, Googlebot necesitará algo de tiempo para encontrarlo (puede tardar hasta 6 meses en algunos casos).

Si Google ya conoce tu sitio web, y has realizado algunas actualizaciones o añadido nuevas páginas, entonces la velocidad de aparición de los cambios depende del “presupuesto de rastreo”.

El presupuesto de rastreo es la cantidad de recursos que Google gasta en rastrear tu web. Cuantos más recursos necesite Googlebot para rastrear tu sitio web, más lento aparecerá en la búsquedas.

La asignación del presupuesto de rastreo depende de los siguientes factores:

  • Popularidad del sitio web. Cuanto más popular sea un sitio web, más puntos de rastreo está dispuesto a gastar Google en tu rastreo.
  • Tasa de actualización. Cuanto más a menudo actualices tus páginas, más recursos de rastreo obtendrá tu sitio web.
  • Número de páginas. Cuantas más páginas tengas, mayor será tu presupuesto.
  • Capacidad del servidor para manejar el rastreo. Tu servidor de alojamiento, tiene que ser capaz de responder a las solicitudes de los rastreadores a tiempo.

El presupuesto de rastreo no se gasta por igual en cada página, ya que algunas agotan más recursos (debido a la cantidad de JavaScript y CSS o por disponer un HTML desordenado). Por lo tanto, el presupuesto de rastreo asignado puede no ser suficiente para rastrear todas tus páginas, al menos, tan rápido como esperas.

Además de los problemas de código, algunas de las causas más comunes, que provocan malgastar los presupuestos de rastreo, son los problemas de contenidos duplicados y URLs mal estructuradas.

Problemas de contenido duplicado

Esto puede suceder por muchas razones, como:

  • Llegar a la página de diferentes maneras: con o sin www, a través de http o https;
  • URL dinámicas: cuando muchas URL diferentes conducen a la misma página
  • Pruebas A/B de las versiones de las páginas.

El contenido duplicado, gasta el presupuesto de rastreo y reduce las posiciones de tus páginas en búsquedas, si Google decide que la calidad general de tu web es baja.

Puedes evitar problemas de contenido duplicado configurando URLs cánónicas. Una etiqueta canónica indica qué página debe considerarse «la principal», por lo que Google no indexará el resto de las URLs duplicadas. También puedes restringir que los robots de rastreo visiten URL dinámicas con la ayuda del archivo robots.txt.

Problemas de estructura de URL

Las URL fáciles de usar son apreciadas tanto por los humanos como por los algoritmos. Googlebot no es una excepción. Googlebot puede confundirse cuando intenta entender URL largas y ricas en parámetros. Cuanto más «confundido» esté Googlebot, más recursos de rastreo empleará en una sola página.

Las URL amigables para el usuario (y Googlebot) son claras, siguen una estructura lógica, tienen la puntuación adecuada y no incluyen parámetros complicados.

El rastreador principal de Google, Googlebot, funciona bajo algoritmos sofisticados, pero puedes «utilizar» su comportamiento para que sea beneficioso para tu web.

¿Quieres contratar los servicios de nuestra agencia?