Détecteur de liens brisés
Donnez-nous une adresse de départ. Notre robot parcourt le site page par page, essaie chaque lien et chaque image qu’il rencontre et rapporte ceux qui échouent avec les pages où ils se trouvent.
Les liens se cassent sans que personne y touche
Quand vous ajoutez un lien, vous comptez sur le serveur de quelqu’un d’autre, ou sur un fichier que vous renommerez peut-être l’an prochain. Votre page ne garde que l’adresse. La cible déménage, un domaine n’est pas renouvelé, une image est supprimée de la médiathèque et votre page a toujours exactement la même allure dans votre éditeur. La seule personne qui s’en aperçoit est celle qui clique.
Cette lente dégradation s’appelle la pourriture des liens (link rot) et elle ne s’arrête jamais. Une étude du Pew Research Center de 2024 a trouvé que 38 % des pages web qui existaient en 2013 n’étaient plus accessibles dix ans plus tard. Pour savoir où en est votre site, quelqu’un doit essayer chaque lien. C’est un travail pénible pour une personne et facile pour un programme.
Comment se déroule l’exploration
- Nous récupérons la page de départ et lisons
robots.txt. Les chemins qu’il interdit sont laissés de côté. - Chaque
<a href>et chaque<img src>est collecté, y compris les images à chargement différé dansdata-src. Les liensmailto:,tel:etjavascript:sont ignorés et le#fragmentest supprimé. - Les liens vers des pages du même hôte vont dans la file pour être lus à tour de rôle.
example.cometwww.example.comcomptent comme un seul site. Les autres sous-domaines, non. - Tout le reste (autres sites, PDF, images, téléchargements) est seulement testé. Nous commençons par une requête
HEAD, qui demande le statut sans le corps, puis nous retombons sur unGETnormal si le serveur refuseHEAD. - Les redirections sont suivies à la main, jusqu’à cinq sauts. Un sixième saut, ou une adresse qui se redirige vers elle-même, est signalé comme une boucle.
L’exploration s’arrête après 100 pages lues ou 600 requêtes. Elle ouvre au plus quatre connexions à la fois vers un hôte, attend six secondes une réponse et teste chaque adresse une seule fois, peu importe combien de fois elle est liée. Quand un chemin apparaît avec plus de cinq chaînes de requête différentes, les variantes en trop sont ignorées. Sinon, un calendrier ou une page de filtres mangerait tout le budget.
Lire les quatre listes
- Liens brisés
- La cible a répondu par une erreur, ou n’a pas répondu.
404et410signifient que la page a disparu.500à504indiquent un serveur défaillant et peuvent être temporaires. « Nom de domaine introuvable » veut souvent dire que tout le site a fermé. « Certificat SSL invalide » veut dire que les navigateurs affichent un avertissement avant la page. - Images brisées
- Mêmes causes, mais ce que le visiteur voit est un cadre vide ou une icône d’image cassée.
- Redirections internes
- Des liens vers vos propres pages qui ne fonctionnent que par une redirection. Rien n’est cassé, mais chaque clic coûte un aller-retour de plus et quelqu’un pourrait un jour retirer la redirection.
- À vérifier à la main
- La cible a répondu
401,403,429ou999, donc elle refuse les robots ou demande une connexion. LinkedIn, Facebook et beaucoup de sites derrière une protection anti-robots font cela. Vous devrez ouvrir le lien vous-même pour trancher.
Chaque ligne liste jusqu’à cinq pages où l’adresse apparaît et les échecs les plus répétés viennent en premier. Un lien mort dans un pied de page apparaît sur chaque page et vous le corrigez à un seul endroit.
Réparer ce que l’exploration trouve
- Votre propre page a déménagé. Corrigez le lien, puis ajoutez une redirection permanente pour les gens qui arrivent d’ailleurs. Apache :
Redirect 301 /old-page/ /new-page/. nginx :location = /old-page/ { return 301 /new-page/; }. - Un autre site a déplacé sa page. Cherchez la nouvelle adresse sur ce site. Si le contenu a disparu, pointez vers une copie sur la Wayback Machine (
web.archive.org) ou retirez le lien. - Image manquante. Téléversez-la de nouveau sous le même nom, ou modifiez la page.
- Redirection interne. Remplacez l’adresse du lien par l’adresse finale indiquée dans le rapport.
Nous ne voyons que les liens présents dans le HTML envoyé par le serveur. Les menus construits par JavaScript, les images d’arrière-plan CSS, les variantes srcset, les vidéos et les scripts ne sont pas testés, pas plus que les pages derrière une connexion. Les ancres ne sont pas vérifiées non plus, donc un lien vers /page#prices passe si /page existe. Et un site qui répond 200 pour des pages manquantes cache ses liens morts à tous les robots d’exploration. Le test de soft 404 détecte ce cas.
Questions fréquentes
Les liens brisés nuisent-ils au SEO ?
Quelques liens morts n’abaisseront pas le classement d’un site. Ce qu’ils vous coûtent est autre chose. Un lien interne brisé empêche les robots d’atteindre la page qui se trouve derrière, la valeur que ce lien transmettait est perdue et les visiteurs qui tombent sur une erreur ont tendance à partir.
Pourquoi un lien est-il signalé comme brisé alors qu’il s’ouvre dans mon navigateur ?
La cible ne traite pas notre robot comme elle vous traite. Elle peut bloquer les requêtes automatisées, répondre trop lentement pour la limite de six secondes, servir un certificat pour lequel votre navigateur a déjà une exception, ou exiger un cookie que vous possédez. Ouvrez le lien dans une fenêtre privée pour comparer.
Le robot respecte-t-il robots.txt et comment le bloquer ?
Oui. Il se présente sous le nom MissWrenchBot et suit le groupe écrit pour ce nom, ou le groupe * s’il n’y en a pas. Pour l’écarter, ajoutez User-agent: MissWrenchBot suivi de Disallow: /. Vous en saurez plus sur la page du robot.
Mon site a plus de 100 pages. Que puis-je faire ?
L’exploration lit les pages dans l’ordre où elle les découvre, à partir de l’adresse que vous donnez. Lancez-la plusieurs fois depuis différents points d’entrée, par exemple l’index du blog puis le catalogue de produits, pour couvrir différentes parties du site.
Combien de temps les résultats sont-ils conservés ?
24 heures. Pendant qu’une exploration s’exécute, l’adresse dans la barre de votre navigateur devient un lien vers cette exploration. Vous pouvez la mettre en favori ou l’envoyer à un collègue jusqu’à son expiration.
Quelle est la différence entre un 404 et un 410 ?
404 Not Found dit que rien n’existe à cette adresse pour le moment. 410 Gone dit que la page a été retirée volontairement et ne reviendra pas. Pour un lien sur votre site, la réparation est la même.