VeryAppı
SEO y visibilidad

Sitemap y robots.txt explicados de forma sencilla

Publicado el 10 de noviembre de 2025·8 min de lectura

El sitemap XML es una lista de las páginas de un sitio que se envía a Google para facilitar su descubrimiento. El archivo robots.txt indica a los robots de los motores de búsqueda qué partes del sitio pueden explorar. Ambos son archivos técnicos sencillos, generalmente generados de forma automática por un CMS moderno, pero una mala configuración de cualquiera de los dos puede impedir que páginas enteras aparezcan en Google.

El problema: dos archivos invisibles que pueden bloquear todo un sitio

El sitemap y el robots.txt nunca se muestran a un visitante. Viven en direcciones técnicas (/sitemap.xml y /robots.txt) que nadie consulta a diario. Precisamente eso es lo que los hace peligrosos: un error de configuración —un robots.txt que bloquea todo el sitio por accidente tras una migración, un sitemap que apunta a URL obsoletas— puede pasar desapercibido durante meses mientras el tráfico orgánico cae en picado, sin que ningún mensaje de error visible alerte al propietario del sitio.

Son dos archivos distintos con funciones diferentes, a menudo confundidos entre sí. Entender la diferencia evita los errores de configuración más habituales.

El sitemap XML: el mapa del sitio para los motores de búsqueda

El sitemap es un archivo en formato XML que enumera las URL del sitio, a veces con información adicional (fecha de última modificación, frecuencia de actualización). No garantiza la indexación de una página, pero facilita su descubrimiento, en particular para:

  • sitios con muchas páginas (e-commerce, blogs activos);
  • páginas profundas, poco enlazadas por enlaces internos;
  • sitios recientes, cuya estructura Google aún no ha cartografiado por completo.

Un CMS moderno (WordPress con un plugin SEO, Shopify, la mayoría de las soluciones a medida) genera el sitemap automáticamente en la dirección susitio.com/sitemap.xml. Se actualiza solo con cada nueva página publicada. El trabajo humano consiste sobre todo en comprobar que existe, que está actualizado y que se ha enviado correctamente a Google Search Console.

El archivo robots.txt: las reglas de exploración

Robots.txt es un archivo de texto en la raíz del sitio (susitio.com/robots.txt) que da instrucciones a los robots de los motores de búsqueda: qué secciones explorar, cuáles evitar. Sirve principalmente para:

  • evitar que los robots pierdan tiempo de rastreo en páginas sin interés SEO (carrito, cuenta de usuario, páginas de búsqueda interna);
  • señalar la ubicación del sitemap (línea Sitemap: al final del archivo);
  • en casos poco frecuentes, bloquear por completo la exploración de un sitio en desarrollo.

Un punto que suele malinterpretarse: robots.txt bloquea el rastreo, no la indexación. Una página con la exploración prohibida puede aun así aparecer en los resultados de Google, sin título ni descripción, si está enlazada desde otra página de la web. Para retirar de verdad una página de los resultados de búsqueda, el método correcto es la etiqueta <meta name="robots" content="noindex"> colocada directamente en el código de la página, no un bloqueo en robots.txt.

Los errores más frecuentes

Un robots.txt que bloquea todo el sitio por accidente

Es el error más costoso. Suele producirse tras una migración: el sitio de desarrollo tenía la línea Disallow: / para impedir que Google indexara una versión de prueba, y esa línea no se retiró al pasar a producción. Resultado: todo el sitio va desapareciendo progresivamente de los resultados de búsqueda, a menudo sin que nadie note la causa de inmediato.

Un sitemap nunca enviado a Google Search Console

El archivo existe, es correcto, pero nadie lo ha señalado a Google. Sin un envío explícito, Google acaba generalmente por descubrirlo por sí solo, pero con un retraso adicional evitable con unos pocos clics.

Un sitemap que contiene URL obsoletas o con error

Tras un rediseño o una eliminación de páginas, el sitemap a veces sigue listando URL que devuelven un error 404. Esto no daña directamente el posicionamiento de las demás páginas, pero complica el trabajo de Google y puede retrasar la indexación de las páginas nuevas.

Confundir noindex con disallow

Bloquear una página mediante robots.txt pensando en retirarla de los resultados de búsqueda no funciona de forma fiable, por la razón explicada más arriba. Es una confusión técnica clásica que deja páginas no deseadas visibles en Google.

Caso particular: sitios multilingües y sitios de e-commerce

En un sitio disponible en varios idiomas, cada versión lingüística debería aparecer en el sitemap con las etiquetas hreflang asociadas, para que Google entienda qué versión mostrar según el idioma y el país del visitante. Un sitemap que solo lista un idioma, o que omite estas etiquetas, puede llevar a Google a mostrar la versión lingüística equivocada en los resultados, o a ignorar algunas páginas traducidas por no haberlas identificado claramente como distintas.

En un sitio de e-commerce, el volumen de páginas (fichas de producto, variantes, categorías, páginas de filtro) plantea un reto diferente: un sitemap único se vuelve rápidamente demasiado voluminoso y difícil de mantener actualizado manualmente. La práctica habitual consiste en generar varios sitemaps segmentados (productos, categorías, contenido editorial) enlazados entre sí mediante un archivo "índice de sitemaps", que la mayoría de las plataformas de e-commerce (Shopify, WooCommerce, soluciones a medida) generan de forma automática.

Cómo corregir un error rápidamente una vez identificado

Una vez identificado un problema de robots.txt o de sitemap en Search Console, la corrección en sí suele ser rápida:

  • para un robots.txt que bloquea demasiado contenido, basta con retirar o ajustar la línea Disallow en cuestión, y luego comprobarlo con la herramienta de prueba de robots.txt integrada en Search Console;
  • para un sitemap con URL en error, hay que identificar su origen (páginas eliminadas, redirecciones mal configuradas) y regenerar el archivo, algo que ocurre automáticamente en la mayoría de los CMS en cuanto se corrige el contenido de origen;
  • tras cualquier corrección, vuelva a solicitar una exploración en Search Console en lugar de esperar el paso natural de los robots, lo que reduce el tiempo de reconocimiento de unos días a unas horas en la mayoría de los casos.

Lista de verificación rápida

VerificaciónCómo hacerloResultado esperado
El sitemap existeAbrir susitio.com/sitemap.xml en un navegadorAparece una lista de URL en formato XML
El sitemap está enviadoGoogle Search Console > SitemapsEstado "Correcto", páginas descubiertas mostradas
Robots.txt no bloquea el sitioAbrir susitio.com/robots.txtSin línea Disallow: / para todo el sitio
Robots.txt referencia el sitemapLeer el final del archivo robots.txtUna línea Sitemap: https://susitio.com/sitemap.xml
Sin URL en error en el sitemapGoogle Search Console > Sitemaps, o herramienta de rastreoNinguna URL 404 listada

Lo que hay que recordar

  • El sitemap facilita que Google descubra las páginas; el robots.txt regula la exploración del sitio.
  • Robots.txt no retira una página de los resultados de búsqueda: esa es la función de la etiqueta noindex.
  • El error más costoso es un robots.txt que bloquea todo el sitio tras una migración mal finalizada.
  • Un CMS moderno genera ambos archivos automáticamente; el trabajo consiste sobre todo en comprobar su contenido, no en escribirlos a mano.
  • Google Search Console permite comprobar en pocos minutos si estos archivos se tienen en cuenta correctamente.

Preguntas frecuentes

¿Un sitio sin sitemap puede aun así ser indexado por Google? Sí, Google puede descubrir páginas siguiendo los enlaces internos, sin sitemap. Pero en un sitio con varias decenas de páginas o una arquitectura poco enlazada, el sitemap acelera y hace más fiable ese descubrimiento. Se vuelve casi imprescindible para el e-commerce o los sitios con contenido frecuente.

¿Hay que bloquear las páginas inútiles con robots.txt? Robots.txt impide el rastreo, no la indexación: una página bloqueada puede aun así aparecer en Google sin descripción si está enlazada desde otro sitio. Para retirar una página de los resultados, es mejor usar la etiqueta meta noindex directamente en la página.

¿Cómo saber si mi sitemap está bien tenido en cuenta por Google? En Google Search Console, sección Sitemaps, añada la URL de su sitemap y consulte el estado. Google indica el número de páginas descubiertas y, por separado, el número realmente indexadas: las dos cifras no siempre coinciden.

¿El sitemap debe contener obligatoriamente todas las páginas del sitio? No, solo las páginas que quiere ver indexadas: páginas de contenido, productos, categorías. Las páginas técnicas (inicio de sesión, carrito, avisos legales genéricos) no tienen lugar en el sitemap.

En resumen

El sitemap y el robots.txt son archivos técnicos aparentemente menores, pero un error de configuración puede bloquear la indexación de un sitio entero sin la menor señal visible. Una comprobación rápida en Google Search Console basta para descartar el riesgo. En VeryAppi, cada sitio web entregado por suscripción incluye un sitemap generado automáticamente y un robots.txt correctamente configurado desde el momento de su puesta en línea.

Preguntas frecuentes

¿Un sitio sin sitemap puede aun asi ser indexado por Google?

Sí, Google puede descubrir páginas siguiendo los enlaces internos, sin sitemap. Pero en un sitio con varias decenas de páginas o una arquitectura poco enlazada, el sitemap acelera y hace más fiable ese descubrimiento. Se vuelve casi imprescindible para el e-commerce o los sitios con contenido frecuente.

¿Hay que bloquear las páginas inútiles con robots.txt?

Robots.txt impide el rastreo, no la indexación: una página bloqueada puede aun así aparecer en Google sin descripción si está enlazada desde otro sitio. Para retirar una página de los resultados, es mejor usar la etiqueta meta noindex directamente en la página.

¿Cómo saber si mi sitemap está bien tenido en cuenta por Google?

En Google Search Console, sección Sitemaps, añada la URL de su sitemap y consulte el estado. Google indica el número de páginas descubiertas y, por separado, el número realmente indexadas: las dos cifras no siempre coinciden.

¿El sitemap debe contener obligatoriamente todas las páginas del sitio?

No, solo las páginas que quiere ver indexadas: páginas de contenido, productos, categorías. Las páginas técnicas (inicio de sesión, carrito, avisos legales genéricos) no tienen lugar en el sitemap.

Artículos relacionados

← Volver al blog