SEO Técnico
13 de agosto de 2026 10 min

Guia de robots.txt e Sitemap.xml: Configuração Correta e Erros Comuns

Guia de robots.txt e Sitemap.xml: Configuração Correta e Erros Comuns

Resumir com IA

Deixe a IA ler este artigo e resumir os pontos-chave.

Às vezes basta uma linha para um site desaparecer completamente da busca:

User-agent: *
Disallow: /

Essas duas linhas estão corretas em ambiente de desenvolvimento; se forem levadas para produção por engano, apagam o site do Google. É um dos erros técnicos mais comuns — e mais caros — logo após o lançamento.

robots.txt e sitemap.xml são os dois canais básicos de comunicação com o mecanismo de busca. Neste guia explicamos o que cada um faz, como escrevê-los corretamente e onde costumam dar errado.

O Que É e Para Que Serve o robots.txt?

É um arquivo de texto simples que fica na raiz do seu site (seusite.com/robots.txt). Ele diz aos bots dos mecanismos de busca quais endereços eles não devem rastrear.

Distinção crítica: o robots.txt bloqueia o rastreamento, não a indexação.

Essas duas coisas são muito confundidas. Se você bloquear uma página com robots.txt, o Google não consegue lê-la — mas, se outros sites linkarem para ela, ele pode indexá-la sem nunca ver o conteúdo. O resultado é um registro estranho nos resultados de busca, sem descrição.

ObjetivoFerramenta corretaPor quê
A página não deve aparecer na buscaMeta tag noindexO Google lê a página e aprende a não indexá-la
O bot não deve sobrecarregar o servidorrobots.txt disallowO rastreamento simplesmente não acontece
A página não deve ser rastreada nem aparecerPrimeiro noindex, depois disallow após sair do índiceA tag noindex numa página bloqueada não pode ser lida

A última linha é importante: a tag noindex de uma página bloqueada pelo robots.txt não pode ser vista pelo Google. Se você quer remover uma página do índice, primeiro use noindex, confirme que ela saiu, e só depois bloqueie.

Como Escrever um robots.txt Correto?

Para a maioria dos sites, o arquivo necessário é bem simples:

User-agent: *
Disallow: /wp-admin/
Disallow: /carrinho
Disallow: /checkout
Disallow: /busca
Allow: /wp-admin/admin-ajax.php

Sitemap: https://seusite.com/sitemap.xml

Regras:

  • User-agent define para qual bot você está falando; * significa todos.
  • Disallow indica o caminho que não deve ser rastreado. Se deixado vazio (Disallow:), significa que tudo é permitido.
  • Allow abre uma exceção dentro de um Disallow.
  • Sitemap indica o endereço completo do seu sitemap; pode haver mais de um.
  • O arquivo deve estar em UTF-8 e ficar na raiz do domínio. Um robots.txt em uma subpasta é inválido.

Faz sentido bloquear: painéis administrativos, carrinho e etapas de checkout, páginas de resultado de busca interna, combinações infinitas de filtros, áreas com dados pessoais.

Nunca bloqueie: arquivos CSS e JavaScript. O Google precisa deles para renderizar a página como o usuário a vê; se forem bloqueados, a página aparece quebrada e a avaliação de compatibilidade mobile é prejudicada.

O Que É o Sitemap.xml?

O sitemap é uma lista dos endereços importantes do seu site. É a forma mais direta de dizer ao Google "eu quero que você rastreie estas páginas".

Estrutura básica:

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://seusite.com/</loc>
    <lastmod>2026-08-13</lastmod>
  </url>
  <url>
    <loc>https://seusite.com/servicos</loc>
    <lastmod>2026-07-02</lastmod>
  </url>
</urlset>

Limites: no máximo 50.000 URLs e 50 MB (sem compressão) por arquivo. Em sites maiores, usa-se um sitemap index:

<sitemapindex xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <sitemap><loc>https://seusite.com/sitemap-produtos.xml</loc></sitemap>
  <sitemap><loc>https://seusite.com/sitemap-blog.xml</loc></sitemap>
</sitemapindex>

Dividir o sitemap traz um benefício escondido: no Search Console, cada sitemap é reportado separadamente, então você vê diretamente qual seção não está sendo indexada. Se 90% dos produtos estão no índice mas apenas 30% do blog está, você encontra o problema em segundos.

Seis Erros Comuns no Sitemap

1. Listar URLs que não deveriam ser indexadas. Endereços com noindex, que apontam via canonical para outra página, ou que retornam 301, não devem estar no sitemap. O sitemap diz "isso é importante"; o canonical diz "esta não é a versão original". Quando os dois entram em conflito, o Google pode ignorar seu canonical.

2. Atualizar o campo lastmod todos os dias. Renovar a data sem o conteúdo ter mudado gera perda de confiança; depois de um tempo o Google para de considerar esse campo. Atualize apenas quando o conteúdo realmente mudar.

3. Dar importância aos campos priority e changefreq. O Google ignora praticamente esses dois campos. Não vale a pena investir tempo neles.

4. Misturar protocolos ou subdomínios diferentes. Os endereços dentro do sitemap devem usar o mesmo domínio do sitemap e coincidir com a versão canônica.

5. Deixar endereços que retornam 404. Páginas excluídas também precisam sair do sitemap; caso contrário, seu orçamento de rastreamento é desperdiçado.

6. Nunca enviar o sitemap. É comum criar o arquivo e esquecer de cadastrá-lo no Search Console. Adicionar a linha Sitemap: no robots.txt também ajuda.

Relação com o Orçamento de Rastreamento

Para sites pequenos, o orçamento de rastreamento (crawl budget) não é um problema. Mas em sites com dezenas de milhares de URLs, se estabelece este ciclo: o Google rastreia um número limitado de páginas; se essas páginas estiverem cheias de combinações de filtros, suas páginas de produto de verdade nunca chegam a ser rastreadas.

Nesse cenário, o robots.txt se torna uma alavanca real:

  • Bloqueie combinações infinitas de filtros (Disallow: /*?cor=)
  • Bloqueie páginas de resultado de busca interna
  • Bloqueie páginas infinitas baseadas em calendário/data

Mas atenção: os links internos que apontam para as páginas bloqueadas passam a ir para um ponto cego. Antes de bloquear, revise a estrutura de links internos que aponta para essas páginas.

Verificação Pós-Configuração

  1. Abra seusite.com/robots.txt no navegador. Deve retornar 200 e o conteúdo deve ser legível.
  2. No Search Console → Configurações → relatório de robots.txt, confirme que o arquivo foi lido sem erros.
  3. Use a ferramenta de Inspeção de URL para testar algumas páginas importantes; a linha "Rastreamento permitido?" deve dizer Sim.
  4. Envie o sitemap no Search Console e, alguns dias depois, compare o número de "URLs descobertas" com o de "Indexadas".
  5. Se a diferença for grande, verifique os motivos de exclusão no relatório de Páginas.

Todos esses passos estão detalhados, tela a tela, no nosso guia do Search Console.

Checklist para o Lançamento

Os dois itens mais esquecidos ao lançar um site novo:

  • A linha Disallow: / do ambiente de desenvolvimento foi removida?
  • A opção "Bloquear mecanismos de busca" do tema/CMS foi desativada?

Ambos são erros fáceis de corrigir, mas podem levar semanas para serem notados. No dia do lançamento, a primeira coisa a fazer é abrir o robots.txt e conferir. Para uma verificação mais ampla, veja nosso checklist de SEO técnico.

Perguntas Frequentes

Um site sem robots.txt é penalizado?

Não. Se o arquivo não existir, o Google considera tudo rastreável. Ainda assim, vale criar um, nem que seja para incluir a linha do sitemap.

Devo bloquear bots de inteligência artificial?

A decisão é sua. User-agents como GPTBot, ClaudeBot e PerplexityBot podem ser bloqueados via robots.txt. Mas, se você quer que seu conteúdo seja citado como fonte em respostas de IA, bloquear reduz essa visibilidade — discutimos esse equilíbrio no nosso guia de GEO.

Com que frequência devo atualizar o sitemap?

Gere automaticamente. Se o seu CMS não atualiza o sitemap quando uma página nova é adicionada, a manutenção manual não é sustentável.

A página que bloqueei ainda aparece no Google, por quê?

O robots.txt bloqueia o rastreamento, não a indexação. Para remover a página do índice é preciso usar noindex — e, para que o noindex seja lido, a página precisa ser rastreável.


Artigos Relacionados:

Compartilhe Este Post: