Verificación de sitemap

Escribe un sitio y buscamos su sitemap como lo haría un rastreador, lo leemos y enumeramos las entradas que un buscador descartaría. Si ya sabes dónde está el sitemap, escribe su dirección para probar ese archivo directamente.

Un dominio solo inicia la búsqueda en robots.txt. Una dirección con ruta se lee como el propio sitemap; los archivos .xml.gz sirven.

O prueba wordpress.org, www.gov.uk

Un sitemap es una lista, no una orden

Un buscador encuentra páginas siguiendo enlaces. Un sitemap le ahorra el trabajo. Es un archivo donde escribes la dirección de cada página que quieres que se rastree, para que nada dependa de que alguien encuentre un enlace. El formato es pequeño. Un <urlset> contiene entradas <url>, y cada entrada solo necesita un <loc> con la dirección completa:

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://www.example.com/pricing</loc>
    <lastmod>2026-03-14</lastmod>
  </url>
</urlset>

Un archivo puede contener 50.000 direcciones y pesar 50 MB sin comprimir. Los sitios más grandes dividen la lista en varios archivos y publican un <sitemapindex>, que es un sitemap cuyas entradas son otros sitemaps. Un índice no puede apuntar a otro índice.

Incluir una página en la lista solo pide una visita. Que la página se indexe después depende de la propia página.

Qué significa cada resultado

ComprobaciónPor qué le importa a un rastreador
Estado, Content-Type, tamañoEl archivo debe responder 200. Una redirección se sigue, pero cambia la dirección con la que se juzgan las entradas. Una respuesta HTML suele significar que falta el archivo y el sitio envió su página de “no encontrado” con estado 200.
XML bien formado, espacio de nombresUn analizador XML se detiene en el primer error de sintaxis, así que un solo carácter erróneo oculta todas las entradas que lo siguen. El valor de xmlns debe ser exactamente http://www.sitemaps.org/schemas/sitemap/0.9.
URL absolutas, mismo host y esquemaUn sitemap solo puede listar páginas del host desde el que se sirve, con el mismo esquema. example.com y www.example.com son dos hosts.
Regla de carpetaUn sitemap guardado en /blog/ solo puede listar direcciones bajo /blog/. Declarar el archivo en robots.txt levanta ese límite, y entonces la verificación lo omite.
Duplicados, URL largas o sin codificarEl archivo sigue funcionando, pero cada una es señal de que el generador no lista las direcciones canónicas.
lastmodDebe ser una fecha W3C: 2026-03-14 o 2026-03-14T09:30:00+00:00. Se señalan las fechas futuras, y también la misma fecha en todas las entradas de un archivo con diez o más.
Muestra en vivoUn 404 significa que la lista está obsoleta. Un 301 o 302 significa que la lista da una dirección que no es la final.

<priority> y <changefreq> se informan solo a título informativo. Google ha dicho que ignora ambos.

Arreglos para los fallos habituales

El analizador se detiene a mitad del archivo
Busca un & sin escapar en una dirección. Dentro de XML se escribe &amp;, así que ?a=1&b=2 pasa a ser ?a=1&amp;b=2. Una línea en blanco o un aviso de PHP impreso antes de <?xml rompe el archivo desde su primer byte.
Direcciones en el host equivocado o en http://
El generador construye las direcciones a partir de la dirección del sitio que figura en sus ajustes. Pon ahí la forma en la que acaban los visitantes tras las redirecciones y vuelve a generar.
Todos los lastmod son idénticos
El generador está estampando la hora a la que se ejecutó. Configúralo para que use la fecha de la última edición de cada página, o deja la etiqueta fuera. Una fecha falsa es peor que ninguna: cuando los buscadores ven que no coincide con los cambios reales, dejan de fiarse de la etiqueta en todo el sitio.
Páginas muertas o redirigidas en la muestra
Vuelve a generar el sitemap tras borrar o mover páginas, y lista solo direcciones que respondan 200 y se nombren a sí mismas como canónicas. Para los enlaces dentro de tus páginas, tienes el buscador de enlaces rotos.
No declarado en robots.txt
Añade una línea con la dirección completa en cualquier parte del archivo: Sitemap: https://www.example.com/sitemap.xml.

Lo que esta verificación no puede decirte

Lee como máximo 5 MB por archivo y cinco hijos de un índice, así que en un sitio muy grande los recuentos describen la parte que se leyó. Los duplicados se buscan dentro de cada archivo, no entre archivos. Las extensiones de imagen, vídeo, noticias y hreflang se cuentan pero no se validan.

Cinco páginas son una muestra. Pueden responder todas 200 mientras cientos de otras no lo hacen, y una página que responde 200 aún puede llevar una etiqueta noindex o un canonical que apunta a otra parte. La lectura de SEO en la página muestra ambas cosas para una página concreta, y las consolas de búsqueda las informan para todo el sitemap una vez que lo has enviado.

Preguntas frecuentes

¿Dónde está el sitemap de un sitio web?

Abre /robots.txt en el sitio y busca una línea que empiece por Sitemap:. Si no hay ninguna, prueba /sitemap.xml, luego /sitemap_index.xml (Yoast y Rank Math en WordPress) y /wp-sitemap.xml (WordPress mismo desde la versión 5.5). Esta verificación sigue esos pasos por ti.

¿Un sitio pequeño necesita un sitemap?

No estrictamente. Si se puede llegar a todas las páginas desde el menú en pocos clics, los rastreadores las encontrarán todas. Un sitemap ayuda cuando el sitio es nuevo y pocos sitios lo enlazan, cuando es grande, o cuando a algunas páginas solo se llega a través de un formulario de búsqueda.

¿Cuántas URL puede contener un sitemap?

50.000 por archivo, y 50 MB sin comprimir. Si se supera cualquiera de los dos límites, divide la lista en varios archivos y enuméralos en un índice de sitemaps, que a su vez puede nombrar hasta 50.000 sitemaps.

¿Google usa priority y changefreq?

No. Google ignora ambos y lee solo <loc> y, cuando ha demostrado ser fiable en el sitio, <lastmod>. Bing también favorece lastmod. Dejar las otras dos etiquetas no hace ningún daño.

¿Qué formato de fecha necesita lastmod?

El perfil W3C de ISO 8601. Basta con un día: 2026-03-14. Con hora, pon una T entre fecha y hora y termina con una zona horaria: 2026-03-14T09:30:00+00:00 o 2026-03-14T09:30:00Z.

Mi sitemap es válido. ¿Por qué no se indexan las páginas?

Un sitemap solo les dice a los buscadores que las páginas existen. Aun así pueden decidir no indexar una página que es pobre, duplicada, bloqueada por robots.txt, marcada noindex o cuya etiqueta canonical nombra otra dirección. Revisa una por una algunas de las páginas que faltan.