SEO Técnico
13 de agosto de 2026 10 min

Guía de robots.txt y Sitemap.xml: Configuración Correcta y Errores Comunes

Guía de robots.txt y Sitemap.xml: Configuración Correcta y Errores Comunes

Resumir con IA

Deja que la IA lea este artículo y resuma los puntos clave.

A veces basta una sola línea para que un sitio desaparezca por completo de la búsqueda:

User-agent: *
Disallow: /

Estas dos líneas son correctas en un entorno de desarrollo; si se trasladan por error a producción, eliminan el sitio de Google. Es uno de los errores técnicos más comunes y más costosos tras un lanzamiento.

robots.txt y sitemap.xml son los dos canales básicos de comunicación que estableces con el motor de búsqueda. En esta guía explicamos qué hace cada uno, cómo escribirlos correctamente y dónde suelen cometerse errores.

¿Qué Es robots.txt y Qué Hace?

Es un archivo de texto plano que se encuentra en el directorio raíz de tu sitio (tusitio.com/robots.txt). Le indica a los bots de los motores de búsqueda qué direcciones no deben rastrear.

Distinción crítica: robots.txt bloquea el rastreo, no la indexación.

Estas dos cosas se confunden con frecuencia. Si bloqueas una página con robots.txt, Google no puede leerla — pero si otros sitios enlazan a ella, puede indexarla sin ver su contenido. El resultado es un registro extraño en los resultados de búsqueda, sin descripción.

ObjetivoHerramienta correctaPor qué
Que la página no aparezca en los resultados de búsquedaMeta etiqueta noindexGoogle lee la página y aprende a no indexarla
Que el bot no sobrecargue el servidorDisallow en robots.txtEl rastreo no se realiza en absoluto
Que la página ni se rastree ni aparezcaPrimero noindex, y una vez fuera del índice, disallowEl noindex de una página bloqueada no puede leerse

La última fila es importante: la etiqueta noindex de una página bloqueada por robots.txt no puede ser vista por Google. Si quieres sacar una página del índice, aplica primero noindex y bloquéala solo después de confirmar que salió.

¿Cómo Se Escribe un robots.txt Correcto?

Para la mayoría de los sitios, el archivo necesario es así de simple:

User-agent: *
Disallow: /wp-admin/
Disallow: /carrito
Disallow: /pago
Disallow: /buscar
Allow: /wp-admin/admin-ajax.php

Sitemap: https://tusitio.com/sitemap.xml

Reglas:

  • User-agent indica a qué bot te diriges; * significa todos.
  • Disallow indica la ruta que no se rastreará. Si se deja vacío (Disallow:), significa que todo está permitido.
  • Allow abre una excepción dentro de un Disallow.
  • La línea Sitemap indica la dirección completa de tu sitemap; puede haber varias.
  • El archivo debe estar en UTF-8 y ubicarse en el directorio raíz. Un robots.txt en una subcarpeta no es válido.

Tiene sentido bloquear: paneles de administración, los pasos de carrito y pago, las páginas de resultados de búsqueda interna, las combinaciones infinitas de filtros y las áreas con datos personales.

Lo que nunca debe bloquearse: los archivos CSS y JavaScript. Google los necesita para renderizar la página tal como la ve el usuario; si se bloquean, la página se ve rota y la evaluación de compatibilidad móvil se ve afectada negativamente.

¿Qué Es Sitemap.xml?

El sitemap es la lista de las direcciones importantes de tu sitio. Es la forma más directa de decirle a Google «quiero que rastrees estas».

Estructura básica:

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://tusitio.com/</loc>
    <lastmod>2026-08-13</lastmod>
  </url>
  <url>
    <loc>https://tusitio.com/servicios</loc>
    <lastmod>2026-07-02</lastmod>
  </url>
</urlset>

Límites: como máximo 50.000 URLs y 50 MB (sin comprimir) por archivo. En sitios más grandes se usa un índice de sitemaps:

<sitemapindex xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <sitemap><loc>https://tusitio.com/sitemap-productos.xml</loc></sitemap>
  <sitemap><loc>https://tusitio.com/sitemap-blog.xml</loc></sitemap>
</sitemapindex>

La ventaja oculta de dividirlo así: en Search Console cada sitemap se reporta por separado, así que ves directamente qué sección no se está indexando. Si el 90% de tus productos está indexado pero solo el 30% del blog, localizas el problema de un vistazo.

Seis Errores Comunes en el Sitemap

1. Incluir URLs que no deberían indexarse. Las direcciones con noindex, con un canonical que apunta a otra página, o que devuelven 301, no deben estar en el sitemap. El sitemap dice «esto es importante»; el canonical dice «esta no es la versión original». Cuando entran en conflicto, Google puede ignorar tu etiqueta canonical.

2. Actualizar el campo lastmod todos los días. Renovar la fecha sin que el contenido haya cambiado hace perder credibilidad; con el tiempo Google deja de prestarle atención a este campo. Actualízalo solo cuando el contenido realmente cambie.

3. Darle importancia a los campos priority y changefreq. Google prácticamente ignora estos dos campos. No vale la pena dedicarles tiempo.

4. Mezclar protocolos o subdominios distintos. Las direcciones dentro del sitemap deben coincidir con el dominio donde se encuentra el sitemap y con la versión canónica.

5. Dejar direcciones que devuelven 404. Las páginas eliminadas también deben quitarse del sitemap; de lo contrario, desperdicias presupuesto de rastreo.

6. No enviar nunca el sitemap. Es común crear el archivo y olvidar añadirlo a Search Console. Añadir la línea Sitemap: en robots.txt también es útil.

Relación con el Presupuesto de Rastreo

Para los sitios pequeños, el presupuesto de rastreo (crawl budget) no es un problema. Pero en sitios que generan decenas de miles de URLs se forma este ciclo: Google rastrea un número limitado de páginas; si esas páginas están llenas de combinaciones de filtros, nunca le llega el turno a tus páginas de producto reales.

En este caso, robots.txt se convierte en una palanca real:

  • Bloquea las combinaciones infinitas de filtros (Disallow: /*?color=)
  • Bloquea los resultados de búsqueda interna
  • Bloquea las páginas infinitas basadas en calendario o fechas

Pero atención: los enlaces internos que apuntan a las páginas que bloqueas quedan ahora en un punto ciego. Antes de bloquear, revisa la estructura de enlaces internos que lleva a esas páginas.

Verificación Tras la Configuración

  1. Abre tusitio.com/robots.txt en el navegador. Debe devolver 200 y el contenido debe ser legible.
  2. En Search Console → Configuración → informe de robots.txt, confirma que el archivo fue recibido y que no hay errores.
  3. Con la herramienta de Inspección de URLs, prueba varias páginas importantes; la fila «¿Se permite el rastreo?» debe decir .
  4. Envía el sitemap a Search Console y, unos días después, compara el número de «URLs detectadas» con el de «Indexadas».
  5. Si la diferencia es grande, revisa los motivos de exclusión en el informe Páginas.

Todos estos pasos están explicados pantalla por pantalla en nuestra guía de Search Console.

Checklist para el Lanzamiento

Los dos puntos que más se olvidan al lanzar un sitio nuevo son:

  • ¿Se eliminó la línea Disallow: / del entorno de desarrollo?
  • ¿Se desactivó la opción «Bloquear motores de búsqueda» en la configuración del tema o plantilla?

Ambos son errores que se corrigen con un solo clic, pero que pueden tardar semanas en notarse. Lo primero que hay que hacer el día del lanzamiento es abrir el robots.txt y revisarlo. Para una verificación más amplia, consulta nuestro checklist de SEO técnico.

Preguntas Frecuentes

¿Se penaliza a un sitio que no tiene robots.txt?

No. Si el archivo no existe, Google asume que todo es rastreable. Aun así, es útil crearlo porque puede incluir la línea del sitemap.

¿Debería bloquear los bots de IA?

La decisión es tuya. User-agents como GPTBot, ClaudeBot o PerplexityBot se pueden bloquear con robots.txt. Pero si quieres que tu contenido sea citado en las respuestas de la IA, bloquearlos te hace perder visibilidad — analizamos este equilibrio en nuestra guía de GEO.

¿Con qué frecuencia debo actualizar el sitemap?

Genéralo de forma automática. Si tu gestor de contenidos no actualiza el sitemap al añadir una página nueva, mantenerlo a mano no es sostenible.

¿Por qué la página que bloqueé sigue apareciendo en Google?

robots.txt bloquea el rastreo, no la indexación. Para sacar una página del índice se necesita noindex — y para que el noindex pueda leerse, la página debe ser rastreable.


Artículos Relacionados:

Compartir Esta Publicación: