Comprendre le SEO

Comment Google découvre votre site ?

Avant de pouvoir afficher une page dans ses résultats, Google doit d’abord savoir qu’elle existe. Pour cela, ses robots parcourent continuellement le web à la recherche de nouvelles pages et de nouveaux liens. Ce processus s’appelle le crawl.

🤖 Googlebot 🔗 Liens 🗺️ Sitemap 🔎 Crawl
La réponse en 30 secondes

Google utilise des programmes automatisés appelés robots d’exploration, dont Googlebot. Ils parcourent le web, visitent des pages déjà connues et suivent les liens qu’ils rencontrent.

Lorsqu’un lien mène vers une nouvelle page, Google peut ainsi découvrir son URL, la visiter puis décider de l’analyser pour éventuellement l’ajouter à son index.

Comprendre le crawl de Google en 2 minutes

Pour visualiser le fonctionnement, imaginez Googlebot comme un petit explorateur qui se déplace de page en page grâce aux liens présents sur Internet.

Voici l’explication en vidéo :

Vidéo SEO Minute
Étape n°1

Google parcourt le web avec Googlebot

Google ne dispose pas d’une liste magique contenant toutes les pages existantes sur Internet.

Il doit donc les découvrir progressivement. Pour cela, Google utilise notamment un robot d’exploration appelé Googlebot.

Son travail consiste à visiter des pages connues, lire leur contenu et repérer les liens permettant d’accéder à d’autres URLs.

1

Google connaît une première page

Googlebot commence par visiter une URL déjà connue de Google.

2

Il analyse les liens

Sur cette page, le robot rencontre des liens vers d’autres contenus.

3

Il découvre une nouvelle URL

Un lien peut conduire Googlebot vers une page qu’il n’avait encore jamais rencontrée.

4

Il poursuit son exploration

La nouvelle page peut à son tour contenir d’autres liens que Google pourra suivre.

Étape n°2

Les liens sont les chemins utilisés par Google

On peut comparer Internet à une immense carte. Les pages sont les destinations et les liens sont les routes qui permettent de passer de l’une à l’autre.

Lorsqu’une page de votre site contient un lien vers une autre page, vous facilitez donc sa découverte par Google.

C’est l’une des raisons pour lesquelles le maillage interne est important en SEO : il aide les visiteurs à naviguer sur votre site, mais également les moteurs de recherche à comprendre et parcourir sa structure.

Illustration montrant comment Google découvre les pages d'un site en suivant les liens entre plusieurs pages web
Googlebot découvre de nouvelles pages en suivant les liens présents sur le site.
💡

Une page sans lien est beaucoup plus difficile à découvrir

Une page qui n’est reliée à aucune autre partie de votre site est parfois appelée page orpheline.

Même si cette page existe techniquement, Google dispose de moins de chemins pour la découvrir et comprendre sa place dans votre site.

Étape n°3

Le sitemap aide également Google à trouver vos pages

Les liens ne sont pas le seul moyen utilisé par Google pour découvrir les URLs d’un site.

Vous pouvez également lui fournir un sitemap XML.

Il s’agit simplement d’un fichier qui liste les URLs importantes de votre site afin d’aider les moteurs de recherche à les découvrir.

🔗

Les liens

Googlebot suit les liens présents sur les pages qu’il connaît déjà pour découvrir de nouvelles URLs.

🗺️

Le sitemap

Le sitemap fournit à Google une liste d’URLs que vous souhaitez l’aider à découvrir et explorer.

!

Un sitemap ne garantit pas l’indexation

Ajouter une page dans votre sitemap permet d’aider Google à la découvrir. Cela ne signifie pas automatiquement qu’elle sera indexée, et encore moins qu’elle apparaîtra bien positionnée dans les résultats de recherche.

Google explique lui-même le fonctionnement et les bonnes pratiques concernant les sitemaps dans sa documentation Search Central sur les sitemaps.

À retenir

Crawl, indexation et classement : ce n’est pas la même chose

C’est probablement la distinction la plus importante à comprendre lorsque l’on débute en SEO.

🔎
1. Découverte & crawl
Google trouve et visite la page.
🗂️
2. Indexation
Google analyse la page et peut l’ajouter à son index.
🏆
3. Classement
Google détermine si la page mérite d’apparaître pour une recherche.

Une page peut donc être crawlée sans être indexée. Et une page indexée peut parfaitement se trouver très loin dans les résultats de recherche.

Le crawl n’est que la première étape.

En pratique

Comment aider Google à découvrir vos pages ?

Sur un site classique, vous n’avez pas besoin de chercher à « appeler Googlebot ». Une structure propre permet déjà de lui faciliter considérablement le travail.

  • Reliez vos nouvelles pages à d’autres pages du site. Évitez autant que possible les pages totalement isolées.
  • Construisez un maillage interne logique. Les catégories, menus et liens contextuels doivent permettre de circuler facilement entre vos contenus.
  • Maintenez un sitemap XML propre. Il doit contenir en priorité les URLs que vous souhaitez réellement voir explorées et indexées.
  • Vérifiez que vous ne bloquez pas Google par erreur. Certaines directives techniques peuvent empêcher Googlebot d’accéder à une partie du site.
  • Utilisez Google Search Console. L’outil d’inspection d’URL permet notamment de vérifier si Google connaît une page et d’observer certaines informations liées à son exploration et son indexation.
Un peu de technique

Et le fichier robots.txt dans tout ça ?

Lorsqu’il arrive sur un site, Googlebot doit également respecter certaines règles d’exploration.

Le fichier robots.txt permet notamment d’indiquer aux robots quelles parties du site ils peuvent ou ne peuvent pas explorer.

Attention : bloquer le crawl n’est pas la même chose que bloquer l’indexation

Le fichier robots.txt sert principalement à contrôler l’exploration. Si votre objectif est d’empêcher une page d’apparaître dans Google, d’autres directives comme noindex sont utilisées.

C’est une distinction assez technique, mais importante : Google doit généralement pouvoir accéder à une page pour lire certaines directives qui lui demandent de ne pas l’indexer.

Résumé

Comment Google découvre-t-il votre site ?

Google utilise des robots comme Googlebot pour parcourir continuellement le web.

Ces robots visitent des pages connues, suivent les liens qu’ils rencontrent et découvrent ainsi de nouvelles URLs.

Un sitemap XML peut également aider Google à identifier les pages importantes de votre site.

Mais découvrir et crawler une URL n’est que le début : Google doit ensuite analyser son contenu, décider éventuellement de l’indexer, puis déterminer pour quelles recherches elle pourrait être pertinente.

🤖
Googlebot
explore le web
🔗
Les liens
lui indiquent de nouveaux chemins
🗺️
Le sitemap
l’aide à identifier vos URLs
Questions fréquentes

FAQ sur le crawl de Google

Qu’est-ce que le crawl en SEO ?

Le crawl correspond à l’exploration des pages web par les robots des moteurs de recherche. Google utilise notamment Googlebot pour visiter les URLs et récupérer les informations nécessaires à leur analyse.

Qu’est-ce que Googlebot ?

Googlebot est le nom générique du robot d’exploration utilisé par Google Search. Il visite automatiquement les pages du web et suit notamment les liens qu’il rencontre.

Comment Google trouve-t-il une nouvelle page ?

Google peut notamment découvrir une nouvelle URL grâce à un lien présent sur une page déjà connue ou grâce à un sitemap contenant cette URL.

Un sitemap suffit-il pour être indexé sur Google ?

Non. Un sitemap facilite la découverte des URLs mais ne garantit ni leur crawl, ni leur indexation, ni leur positionnement dans les résultats de recherche.

Quelle est la différence entre crawl et indexation ?

Le crawl correspond à la visite d’une page par Googlebot. L’indexation intervient ensuite : Google analyse la page et décide éventuellement de conserver ses informations dans son index.

Étape suivante

Google a trouvé votre page. Que se passe-t-il ensuite ?

La découverte n’est que la première étape du fonctionnement d’un moteur de recherche. Google doit ensuite comprendre la page, l’indexer et déterminer sa pertinence avant de pouvoir la proposer dans ses résultats.

Continuer à apprendre le SEO →

À propos de l’auteur

Théo Lacourt consultant SEO SEA

Théo Lacourt

Consultant SEO & SEA indépendant

10 ans d’expérience en acquisition, dont +1M€ de budget Google Ads géré côté annonceur. J’accompagne des TPE, PME et e-commerces partout en France pour développer leur visibilité sur Google — SEO et SEA.

Laisser un commentaire