Vérification du sitemap

Entrez un site et nous cherchons son sitemap comme le fait un robot d’exploration, le lisons, puis listons les entrées qu’un moteur de recherche écarterait. Si vous savez déjà où se trouve le sitemap, entrez son adresse pour tester directement ce fichier.

Un domaine seul lance la recherche à partir de robots.txt. Une adresse avec un chemin est lue comme le sitemap lui-même ; les fichiers .xml.gz conviennent.

Ou essayez wordpress.org, www.gov.uk

Un sitemap est une liste, pas un ordre

Un moteur de recherche trouve les pages en suivant des liens. Un sitemap lui évite cette peine. C’est un fichier unique où vous écrivez l’adresse de chaque page à explorer, si bien que rien ne dépend de la découverte d’un lien. Le format est petit. Un <urlset> contient des entrées <url> et chaque entrée n’a besoin que d’un <loc> avec l’adresse complète :

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://www.example.com/pricing</loc>
    <lastmod>2026-03-14</lastmod>
  </url>
</urlset>

Un fichier peut contenir 50 000 adresses et peser 50 Mo avant compression. Les sites plus gros répartissent la liste en plusieurs fichiers et publient un <sitemapindex>, c’est-à-dire un sitemap dont les entrées sont d’autres sitemaps. Un index ne peut pas pointer vers un autre index.

Lister une page demande seulement une visite. Que la page soit ensuite indexée ou non dépend de la page.

Ce que signifie chaque résultat

VérificationPourquoi un robot s’y intéresse
État, Content-Type, tailleLe fichier doit répondre 200. Une redirection est suivie, mais elle change l’adresse par rapport à laquelle les entrées sont jugées. Une réponse HTML signifie généralement que le fichier est absent et que le site a envoyé sa page « introuvable » avec le statut 200.
XML bien formé, espace de nomsUn analyseur XML s’arrête à la première erreur de syntaxe : un seul mauvais caractère cache donc toutes les entrées qui suivent. La valeur de xmlns doit être exactement http://www.sitemaps.org/schemas/sitemap/0.9.
URL absolues, même hôte et même schémaUn sitemap ne peut lister que des pages de l’hôte qui le sert, avec le même schéma. example.com et www.example.com sont deux hôtes.
Règle du dossierUn sitemap rangé dans /blog/ ne peut lister que des adresses sous /blog/. Déclarer le fichier dans robots.txt lève cette limite et la vérification l’ignore alors.
Doublons, URL longues ou non encodéesLe fichier fonctionne quand même, mais chacun de ces défauts montre que le générateur ne liste pas les adresses canoniques.
lastmodDoit être une date W3C : 2026-03-14 ou 2026-03-14T09:30:00+00:00. Les dates dans le futur sont signalées, tout comme la même date sur chaque entrée d’un fichier de dix entrées ou plus.
Échantillon en directUne 404 signifie que la liste est périmée. Une 301 ou une 302 signifie que la liste donne une adresse qui n’est pas l’adresse finale.

<priority> et <changefreq> sont indiqués à titre d’information seulement. Google a dit qu’il ignore les deux.

Réparations des défauts habituels

L’analyseur s’arrête au milieu du fichier
Cherchez un & brut dans une adresse. En XML, il s’écrit &amp; : ?a=1&b=2 devient donc ?a=1&amp;b=2. Une ligne vide ou un avertissement PHP affiché avant <?xml casse le fichier dès son tout premier octet.
Des adresses sur le mauvais hôte ou en http://
Le générateur construit les adresses à partir de l’adresse du site dans ses réglages. Réglez-la sur la forme où les visiteurs aboutissent après les redirections, puis régénérez.
Tous les lastmod sont identiques
Le générateur inscrit l’heure de son exécution. Configurez-le pour qu’il utilise la date de la dernière modification de chaque page, ou omettez la balise. Une mauvaise date est pire que pas de date : dès que les moteurs de recherche voient qu’elle ne correspond pas aux vrais changements, ils cessent de se fier à la balise pour tout le site.
Des pages mortes ou redirigées dans l’échantillon
Régénérez le sitemap après avoir supprimé ou déplacé des pages et ne listez que des adresses qui répondent 200 et se déclarent elles-mêmes canoniques. Pour les liens à l’intérieur de vos pages, il y a le détecteur de liens morts.
Non déclaré dans robots.txt
Ajoutez une ligne avec l’adresse complète n’importe où dans le fichier : Sitemap: https://www.example.com/sitemap.xml.

Ce que cette vérification ne peut pas vous dire

Elle lit au plus 5 Mo par fichier et cinq enfants d’un index : sur un très gros site, les totaux décrivent donc la partie lue. Les doublons sont cherchés à l’intérieur de chaque fichier, pas entre les fichiers. Les extensions image, vidéo, actualités et hreflang sont comptées mais pas validées.

Cinq pages, c’est un échantillon. Elles peuvent toutes répondre 200 pendant que des centaines d’autres ne le font pas et une page qui répond 200 peut quand même porter une balise noindex ou un canonical qui pointe ailleurs. Le relevé SEO de la page montre les deux pour une page donnée et les consoles de recherche les signalent pour tout le sitemap une fois que vous l’avez soumis.

Questions fréquentes

Où se trouve le sitemap d’un site web ?

Ouvrez /robots.txt sur le site et cherchez une ligne qui commence par Sitemap:. S’il n’y en a pas, essayez /sitemap.xml, puis /sitemap_index.xml (Yoast et Rank Math sur WordPress) et /wp-sitemap.xml (WordPress lui-même depuis la version 5.5). Cette vérification suit ces étapes à votre place.

Un petit site a-t-il besoin d’un sitemap ?

Pas strictement. Si chaque page est accessible depuis le menu en quelques clics, les robots les trouveront toutes. Un sitemap aide quand le site est neuf et que peu d’autres sites pointent vers lui, quand il est gros, ou quand certaines pages ne sont accessibles que par un formulaire de recherche.

Combien d’URL un sitemap peut-il contenir ?

50 000 par fichier et 50 Mo une fois décompressé. Au-delà de l’une ou l’autre limite, répartissez la liste en plusieurs fichiers et listez-les dans un index de sitemaps, qui peut lui-même nommer jusqu’à 50 000 sitemaps.

Google utilise-t-il priority et changefreq ?

Non. Google ignore les deux et ne lit que <loc> et, une fois qu’il s’est montré fiable sur le site, <lastmod>. Bing privilégie aussi lastmod. Laisser les deux autres balises ne fait aucun mal.

Quel format de date lastmod exige-t-il ?

Le profil W3C de l’ISO 8601. Un jour seul suffit : 2026-03-14. Avec une heure, placez un T entre la date et l’heure et terminez par un fuseau horaire : 2026-03-14T09:30:00+00:00 ou 2026-03-14T09:30:00Z.

Mon sitemap est valide. Pourquoi les pages ne sont-elles pas indexées ?

Un sitemap dit seulement aux moteurs de recherche que les pages existent. Ils peuvent quand même décider de ne pas indexer une page pauvre, dupliquée, bloquée par robots.txt, marquée noindex, ou dont la balise canonical désigne une autre adresse. Vérifiez quelques-unes des pages manquantes une par une.