Robots.txt: o que é, como criar e erros que custam tráfego

O arquivo robots.txt é a primeira porta de entrada do Google no seu site — e um erro de sintaxe pode bloquear páginas críticas sem que você perceba. Este guia explica o que é robots.txt, como criar o arquivo seguindo as diretrizes oficiais de 2025-2026 e lista os erros mais caros que derrubam o rastreamento e prejudicam o SEO técnico.

5 min de leitura
 Robots.txt: o que é, como criar e erros que custam tráfego

O robots.txt é o primeiro arquivo que o Googlebot procura quando chega ao seu site. Uma linha errada nele pode tirar seções inteiras do Google; uma linha bem pensada poupa o servidor e organiza o rastreamento. Este guia mostra como o Google lê o arquivo, com base na documentação oficial, e o que fazer com os robôs de IA.

O que é robots.txt?

Robots.txt é um arquivo de texto, na raiz do domínio, que diz aos robôs de busca quais partes do site eles podem ou não rastrear. Ele segue o Robots Exclusion Protocol, padronizado na RFC 9309. O arquivo controla rastreamento, não indexação, e não funciona como barreira de segurança.

O endereço é sempre o mesmo: https://seusite.com.br/robots.txt. Um robots.txt numa subpasta é ignorado.

Para que serve o robots.txt?

Serve para tirar do caminho do robô o que não precisa ser rastreado. Os casos mais comuns em sites B2B são estes.

  • Resultados de busca interna e URLs com filtros e parâmetros.

  • Áreas de login, carrinho e painéis.

  • Ambientes de teste publicados por engano.

  • Arquivos gerados em massa que não têm valor para a busca.

O arquivo também aponta onde está o sitemap, o que acelera a descoberta de páginas novas.

Como o Google lê o robots.txt?

O Google baixa o arquivo antes de rastrear e guarda uma cópia em cache por até 24 horas. Algumas regras do comportamento oficial pesam na prática.

Situação

O que o Google faz

Arquivo responde 200

Aplica as regras

Arquivo responde 404 ou outro 4xx (exceto 429)

Entende que não há restrição e rastreia tudo

Servidor responde 5xx

Para de rastrear o site por 12 horas; depois usa a última versão válida por até 30 dias

Arquivo acima de 500 KiB

Ignora o conteúdo depois do limite

Regras conflitantes

Vale a regra mais específica; no empate, a menos restritiva

O robots.txt vale só para o host, protocolo e porta onde está. O arquivo de www.seusite.com.br não cobre blog.seusite.com.br.

Quais comandos o robots.txt aceita?

O Google aceita quatro campos: user-agent, allow, disallow e sitemap. Outros, como crawl-delay, são ignorados pelo Google.

  • user-agent indica a qual robô o grupo de regras se aplica. * vale para todos.

  • disallow bloqueia um caminho.

  • allow libera um caminho dentro de uma área bloqueada.

  • sitemap informa a URL completa do sitemap.

Os nomes dos campos não diferenciam maiúsculas, mas os caminhos sim: /Blog e /blog são regras diferentes. O asterisco representa qualquer sequência de caracteres e o cifrão marca o fim da URL.

User-agent: *
Disallow: /busca
Disallow: /*?filtro=
Disallow: /*.pdf$

Sitemap: https://seusite.com.br/sitemap.xml

Como criar um robots.txt?

O processo leva poucos minutos.

  1. Liste as áreas que não precisam aparecer na busca.

  2. Escreva as regras num arquivo de texto simples, em UTF-8, com o nome robots.txt.

  3. Publique o arquivo na raiz do domínio.

  4. Abra o endereço no navegador e confirme que ele carrega.

  5. Repita para cada subdomínio que tiver conteúdo próprio.

Para não escrever à mão, use o Gerador de robots.txt e llms.txt da MarkSaint.

Como testar o robots.txt no Search Console?

O antigo testador de robots.txt saiu do ar. Hoje o Search Console tem um relatório de robots.txt, em Configurações, que mostra qual versão o Google baixou, quando e se encontrou erros. Para checar uma URL específica, use a Inspeção de URL: ela informa se a página está bloqueada pelo arquivo.

Depois de mudar o arquivo, peça um novo rastreamento pelo próprio relatório. Sem isso, o Google pode levar até um dia para ver a versão nova.

Robots.txt ou meta robots: qual usar?

Use robots.txt para controlar o que o robô visita. Use a meta tag noindex para controlar o que aparece no Google. A confusão entre os dois é a origem de muitos problemas.

Uma página bloqueada no robots.txt ainda pode aparecer no Google, sem descrição, se outros sites linkarem para ela. E se você bloquear a página e colocar noindex nela, o Google nunca lê o noindex, porque não pode rastrear a página. Para tirar algo do índice, libere o rastreamento e use noindex.

Como tratar robôs de IA no robots.txt?

Cada empresa de IA declara seus próprios robôs, como GPTBot (OpenAI), ClaudeBot (Anthropic) e PerplexityBot. Bloquear um deles impede que aquele robô use o site, mas também reduz a chance de a marca ser citada naquela ferramenta.

O caso do Google pede atenção. O token Google-Extended controla o uso do conteúdo para treinar e embasar o Gemini, mas não afeta a busca nem tira o site dos AI Overviews ou do AI Mode. Esses recursos dependem do Googlebot comum, e o controle sobre eles passa por nosnippet, max-snippet ou noindex.

User-agent: Google-Extended
Disallow: /

Para empresas B2B que querem ser citadas por IAs, a recomendação padrão é liberar os robôs de busca e decidir caso a caso sobre os de treinamento. Mais contexto em SEO para LLMs e em llms.txt funciona?.

Quais erros no robots.txt derrubam o tráfego?

Cinco erros aparecem com frequência nas auditorias da MarkSaint.

  1. Disallow: / esquecido depois de sair do ambiente de teste.

  2. Bloqueio de CSS e JavaScript, que impede o Google de renderizar a página.

  3. Uso do robots.txt para esconder páginas do índice, no lugar do noindex.

  4. Servidor devolvendo erro 5xx no arquivo, o que pausa o rastreamento do site inteiro.

  5. Caminhos com maiúsculas e minúsculas trocadas, que não bloqueiam nada.

O robots.txt é um arquivo pequeno, mas mexe em tudo o que o Google consegue ver. Se você quer saber se o seu está bloqueando páginas que vendem, peça uma análise técnica avançada de SEO ou comece pela auditoria gratuita.

Fontes

MarkSaint

MARKSAINT · SISTEMA EM SINCRONIA

Preparando a experiência MarkSaint…