Comment fonctionne un moteur de recherche comme Google ?
La réponse
En savoir plus
Un moteur de recherche comme Google doit résoudre un problème en deux temps : connaître une partie du contenu disponible sur le web, puis identifier rapidement les pages susceptibles de répondre à une requête. Pour y parvenir, il s’appuie sur une chaîne de traitement composée principalement de l’exploration des pages, de leur indexation et du classement des résultats. La réponse affichée après une recherche dépend donc d’un travail effectué en amont, avant même que l’utilisateur ne saisisse sa demande.
Explorer les pages du web
La première étape est le crawl, aussi appelé exploration. Des programmes automatisés, notamment les robots d’exploration, parcourent le web en découvrant des adresses de pages et en consultant leur contenu. Ils peuvent suivre les liens présents sur des pages déjà connues et utiliser d’autres indications fournies par les sites, comme les plans de site. Le fichier robots.txt permet à l’administrateur d’un site d’indiquer aux robots quelles parties il souhaite voir explorer ou non ; il s’agit d’une consigne destinée aux robots coopératifs, et non d’un dispositif de sécurité. L’exploration n’est pas une copie instantanée de l’ensemble d’Internet : certaines pages sont difficiles à découvrir, peuvent être inaccessibles ou ne sont pas retenues dans l’index du moteur.
Analyser et indexer les contenus
Après leur découverte, les pages sont analysées afin d’enregistrer dans l’index les informations utiles à leur compréhension et à leur recherche. Le moteur peut notamment examiner le texte, la structure de la page, la langue, les liens et d’autres éléments associés au contenu. Il construit ainsi une représentation organisée des pages plutôt que de parcourir tout le web à chaque requête. L’index est une vaste base de données conçue pour retrouver rapidement les documents correspondant à certains termes ou à certaines notions. Une page explorée n’est toutefois pas nécessairement indexée, et son indexation ne signifie pas qu’elle apparaîtra en bonne position dans les résultats.
Classer les réponses possibles
Lorsqu’une personne effectue une recherche, le moteur interprète les termes employés et consulte son index pour sélectionner des pages candidates. Il les classe ensuite à l’aide d’algorithmes qui combinent de nombreux signaux. Ceux-ci cherchent notamment à mesurer la pertinence du contenu par rapport à la requête, sa qualité et la fiabilité que lui accordent certains éléments du web. Les liens provenant d’autres pages peuvent contribuer à évaluer la popularité ou l’autorité relative d’un document, mais ils ne constituent pas l’unique critère. Le classement vise donc à placer en tête les résultats jugés les plus utiles pour la recherche donnée, et non à reproduire simplement l’ordre chronologique de publication des pages.
Afficher une réponse adaptée à la requête
Le résultat visible par l’utilisateur est l’aboutissement de cette sélection. Le moteur présente généralement une liste de liens accompagnés d’un titre et d’un extrait destiné à aider à comprendre le contenu de chaque page. Selon la recherche, il peut aussi proposer d’autres formats, comme des images, des vidéos, des cartes ou des informations directement mises en évidence. La rapidité de l’affichage repose sur des systèmes informatiques capables d’interroger l’index et de traiter de nombreuses demandes. Malgré cette organisation, aucun moteur ne connaît toutes les pages du web et aucun classement n’est parfait : la qualité de la réponse dépend à la fois des contenus disponibles, de leur indexation et de l’adéquation entre la requête et les résultats proposés.
