Google, Yahoo et Microsoft se livraient une concurrence féroce au milieu des années 2000, chacun cherchant à indexer le web plus vite et plus précisément que les autres. Alors pourquoi ces trois rivaux ont-ils accepté de s’asseoir à la même table pour créer ensemble un format technique commun ? La réponse tient à un problème que la concurrence seule ne pouvait pas résoudre : la fragmentation.
Retour sur la genèse du protocole sitemap XML, un cas assez rare de coopération entre concurrents directs, et sur ce que cette histoire explique du format que tout développeur WordPress manipule aujourd’hui sans y penser.
2005 : Google lance seul son propre protocole
En juin 2005, Google publie le « Google Sitemap Protocol », un format XML permettant aux propriétaires de sites de lister leurs URL et de fournir des métadonnées comme la date de dernière modification ou la fréquence de mise à jour estimée. L’objectif : aider le robot d’indexation à découvrir des pages qu’il n’aurait pas trouvées par simple exploration de liens, notamment sur les sites avec une architecture profonde ou peu de liens entrants.
Le format fonctionne, mais il ne concerne que Google. Un webmaster souhaitant faciliter l’exploration par Yahoo ou par MSN Search devait alors se plier à d’autres exigences, ou se contenter d’un fichier qui n’était lu que par un seul moteur sur trois.
2006 : la fragmentation pousse à la coopération

C’est cette fragmentation qui a motivé le rapprochement. En novembre 2006, Yahoo et Microsoft rejoignent Google pour publier une version commune du protocole sous un nom neutre, « sitemaps.org », détaché de la marque d’un moteur en particulier. Le format technique reste très proche du protocole initial de Google, mais il devient un standard ouvert, avec une spécification publique et une gouvernance partagée.
Pour les propriétaires de sites, le changement est immédiat : un seul fichier sitemap.xml, respectant une seule spécification, suffit désormais à informer les trois moteurs principaux. Cette simplification a largement contribué à l’adoption massive du format dans les années qui ont suivi, bien au-delà des trois moteurs fondateurs.
Ce que le format a conservé de cette genèse
- Une structure XML simple, avec des balises
<urlset>,<url>,<loc>et<lastmod> - Une limite de 50 000 URL et 50 Mo par fichier, héritée des contraintes de traitement de l’époque
- Une gouvernance neutre, sitemaps.org n’appartenant à aucun des trois moteurs fondateurs
Un extrait du format d’origine, toujours valide aujourd’hui
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://exemple.fr/article-fondateur/</loc>
<lastmod>2006-11-16</lastmod>
</url>
</urlset>
Cette structure de 2006 est restée quasiment inchangée depuis. C’est elle que WordPress reprend fidèlement dans son propre système de sitemap natif, apparu bien plus tard.
Pourquoi cette coopération n’a pas duré sur tous les sujets
La leçon retenue en agence : les standards ouverts naissent souvent d’un problème que la concurrence seule ne peut pas résoudre, rarement d’une bonne volonté générale entre rivaux.
Cette coopération autour des sitemaps est restée assez isolée : sur d’autres sujets, comme les critères de classement ou les formats de données structurées, chaque moteur a continué à avancer séparément, parfois en s’inspirant du travail des autres sans concertation formelle. Le format sitemap reste un cas particulier, né d’un besoin commun trop coûteux à résoudre chacun de son côté.
En résumé
Le format sitemap XML que l’on génère aujourd’hui sans y penser est né d’un problème de fragmentation que la concurrence entre moteurs ne pouvait pas résoudre seule. Cette histoire explique pourquoi la spécification reste sobre, ouverte et peu évolutive : elle a été conçue comme un socle commun minimal, pas comme un outil marketing propre à un moteur. Quatorze ans plus tard, cette sobriété reste sa plus grande qualité.