Google no desea incluir el mismo contenido en los resultados de búsqueda para una sola consulta, por lo que realizan una gran cantidad de detección de duplicaciones para juntar las URL y el contenido, de modo que no muestren un conjunto desordenado de resultados de búsqueda. Uno podría suponer que Google primero necesita rastrear las páginas para ver el contenido y la metainformación antes de plegar y consolidar esas señales en una sola página. Pero no, John Mueller de Google dijo que a menudo pueden hacer esto incluso antes de que rastreen el sitio.

John Mueller de Google dijo en un hangout de webmaster esta mañana en la marca de 24 segundos que «también hacemos eso esencialmente antes de gatear». Es decir, Google también puede doblar contenido antes incluso de rastrear el sitio. «Donde observamos las URL que vemos y basándonos en la información que tenemos del pasado creemos que probablemente estas URL podrían terminar siendo las mismas y luego las juntaremos», agregó John Mueller.
Dijo que pueden hacer eso «cuando podemos reconocer patrones claros». «Especialmente dentro de un sitio web donde podemos ver bien que todo en este subdirectorio aquí es lo mismo que en este subdominio debido a la forma en que se configura el hosting, así que podemos asumir ciegamente que estas URL son las mismas sin realmente mirándolos «, agregó.
Supongo que parte de esto se basa en canónicos, redirecciones y estructuras básicas de CMS que muestran patrones claros y señales que Google puede captar más rápido que el rastreo de todo el sitio.