O robots.txt é o primeiro arquivo que o Googlebot procura quando chega ao seu site. Uma linha errada nele pode tirar seções inteiras do Google; uma linha bem pensada poupa o servidor e organiza o rastreamento. Este guia mostra como o Google lê o arquivo, com base na documentação oficial, e o que fazer com os robôs de IA.
O que é robots.txt?
Robots.txt é um arquivo de texto, na raiz do domínio, que diz aos robôs de busca quais partes do site eles podem ou não rastrear. Ele segue o Robots Exclusion Protocol, padronizado na RFC 9309. O arquivo controla rastreamento, não indexação, e não funciona como barreira de segurança.
O endereço é sempre o mesmo: https://seusite.com.br/robots.txt. Um robots.txt numa subpasta é ignorado.
Para que serve o robots.txt?
Serve para tirar do caminho do robô o que não precisa ser rastreado. Os casos mais comuns em sites B2B são estes.
Resultados de busca interna e URLs com filtros e parâmetros.
Áreas de login, carrinho e painéis.
Ambientes de teste publicados por engano.
Arquivos gerados em massa que não têm valor para a busca.
O arquivo também aponta onde está o sitemap, o que acelera a descoberta de páginas novas.
Como o Google lê o robots.txt?
O Google baixa o arquivo antes de rastrear e guarda uma cópia em cache por até 24 horas. Algumas regras do comportamento oficial pesam na prática.
Situação | O que o Google faz |
|---|---|
Arquivo responde 200 | Aplica as regras |
Arquivo responde 404 ou outro 4xx (exceto 429) | Entende que não há restrição e rastreia tudo |
Servidor responde 5xx | Para de rastrear o site por 12 horas; depois usa a última versão válida por até 30 dias |
Arquivo acima de 500 KiB | Ignora o conteúdo depois do limite |
Regras conflitantes | Vale a regra mais específica; no empate, a menos restritiva |
O robots.txt vale só para o host, protocolo e porta onde está. O arquivo de www.seusite.com.br não cobre blog.seusite.com.br.
Quais comandos o robots.txt aceita?
O Google aceita quatro campos: user-agent, allow, disallow e sitemap. Outros, como crawl-delay, são ignorados pelo Google.
user-agent indica a qual robô o grupo de regras se aplica.
*vale para todos.disallow bloqueia um caminho.
allow libera um caminho dentro de uma área bloqueada.
sitemap informa a URL completa do sitemap.
Os nomes dos campos não diferenciam maiúsculas, mas os caminhos sim: /Blog e /blog são regras diferentes. O asterisco representa qualquer sequência de caracteres e o cifrão marca o fim da URL.
User-agent: *
Disallow: /busca
Disallow: /*?filtro=
Disallow: /*.pdf$
Sitemap: https://seusite.com.br/sitemap.xmlComo criar um robots.txt?
O processo leva poucos minutos.
Liste as áreas que não precisam aparecer na busca.
Escreva as regras num arquivo de texto simples, em UTF-8, com o nome
robots.txt.Publique o arquivo na raiz do domínio.
Abra o endereço no navegador e confirme que ele carrega.
Repita para cada subdomínio que tiver conteúdo próprio.
Para não escrever à mão, use o Gerador de robots.txt e llms.txt da MarkSaint.
Como testar o robots.txt no Search Console?
O antigo testador de robots.txt saiu do ar. Hoje o Search Console tem um relatório de robots.txt, em Configurações, que mostra qual versão o Google baixou, quando e se encontrou erros. Para checar uma URL específica, use a Inspeção de URL: ela informa se a página está bloqueada pelo arquivo.
Depois de mudar o arquivo, peça um novo rastreamento pelo próprio relatório. Sem isso, o Google pode levar até um dia para ver a versão nova.
Robots.txt ou meta robots: qual usar?
Use robots.txt para controlar o que o robô visita. Use a meta tag noindex para controlar o que aparece no Google. A confusão entre os dois é a origem de muitos problemas.
Uma página bloqueada no robots.txt ainda pode aparecer no Google, sem descrição, se outros sites linkarem para ela. E se você bloquear a página e colocar noindex nela, o Google nunca lê o noindex, porque não pode rastrear a página. Para tirar algo do índice, libere o rastreamento e use noindex.
Como tratar robôs de IA no robots.txt?
Cada empresa de IA declara seus próprios robôs, como GPTBot (OpenAI), ClaudeBot (Anthropic) e PerplexityBot. Bloquear um deles impede que aquele robô use o site, mas também reduz a chance de a marca ser citada naquela ferramenta.
O caso do Google pede atenção. O token Google-Extended controla o uso do conteúdo para treinar e embasar o Gemini, mas não afeta a busca nem tira o site dos AI Overviews ou do AI Mode. Esses recursos dependem do Googlebot comum, e o controle sobre eles passa por nosnippet, max-snippet ou noindex.
User-agent: Google-Extended
Disallow: /Para empresas B2B que querem ser citadas por IAs, a recomendação padrão é liberar os robôs de busca e decidir caso a caso sobre os de treinamento. Mais contexto em SEO para LLMs e em llms.txt funciona?.
Quais erros no robots.txt derrubam o tráfego?
Cinco erros aparecem com frequência nas auditorias da MarkSaint.
Disallow: /esquecido depois de sair do ambiente de teste.Bloqueio de CSS e JavaScript, que impede o Google de renderizar a página.
Uso do robots.txt para esconder páginas do índice, no lugar do
noindex.Servidor devolvendo erro 5xx no arquivo, o que pausa o rastreamento do site inteiro.
Caminhos com maiúsculas e minúsculas trocadas, que não bloqueiam nada.
O robots.txt é um arquivo pequeno, mas mexe em tudo o que o Google consegue ver. Se você quer saber se o seu está bloqueando páginas que vendem, peça uma análise técnica avançada de SEO ou comece pela auditoria gratuita.
Fontes
