O que é robots.txt?
Robots.txt, também chamado de arquivo robots, é o arquivo de texto que fica na raiz do site e diz aos robôs dos buscadores quais áreas eles podem rastrear e quais devem evitar. O robots.txt funciona como uma placa de sinalização na entrada do site: o Googlebot e outros crawlers o consultam antes de percorrer as páginas.
O arquivo fica sempre no mesmo endereço, seusite.com.br/robots.txt, e qualquer pessoa pode visualizá-lo. Ele usa uma sintaxe simples de regras por robô, e sua manutenção faz parte da rotina de SEO técnico.
Um detalhe importante: o robots.txt controla rastreamento, e não indexação. Uma página bloqueada no arquivo ainda pode aparecer na busca se outros sites apontarem links para ela, só que sem descrição, porque o Google não conseguiu ler o conteúdo.
Como funciona na prática?
O arquivo é composto por blocos de regras. Cada bloco começa identificando o robô e depois lista permissões e bloqueios:
User-agent: *
Disallow: /carrinho/
Disallow: /busca-interna/
Allow: /
Sitemap: https://www.seusite.com.br/sitemap.xml
O significado de cada diretiva:
- User-agent define a qual robô as regras se aplicam. O asterisco vale para todos.
- Disallow bloqueia o rastreamento de um caminho.
Disallow: /carrinho/impede o acesso a tudo que começa com esse diretório. - Allow libera um caminho específico dentro de uma área bloqueada.
- Sitemap informa o endereço do sitemap XML, ajudando o buscador a descobrir as páginas importantes.
Depois de publicar ou alterar o arquivo, você pode conferir se o Google o leu corretamente no relatório de robots.txt do Google Search Console, que mostra a versão processada e eventuais erros de sintaxe.
Robots.txt vs meta robots: qual a diferença?
| Critério | Robots.txt | Meta robots |
|---|---|---|
| Onde fica | Arquivo na raiz do site | Tag no HTML de cada página |
| O que controla | Rastreamento (acesso do robô) | Indexação e comportamento por página |
| Alcance | Diretórios e padrões de URL inteiros | Uma página por vez |
| Impede aparecer na busca? | Não garante | Sim, com a diretiva noindex |
Veredito: o robots.txt decide onde o robô pode entrar, e a meta robots decide o que ele pode fazer com a página depois de entrar.
Exemplos de uso
- E-commerce: uma loja virtual bloqueia
/carrinho/e/checkout/para que o Googlebot não gaste tempo rastreando páginas transacionais sem valor para a busca orgânica. - Busca interna: um portal de notícias bloqueia
/busca?q=, evitando que milhares de combinações de pesquisa interna consumam o orçamento de rastreamento. - Ambiente de testes: uma agência bloqueia o diretório
/homolog/do site do cliente enquanto a nova versão está em construção, embora a proteção por senha seja o método mais seguro nesse caso.
Erros comuns
- Usar
Disallow: /sem perceber, bloqueando o site inteiro e derrubando o tráfego orgânico. - Bloquear arquivos CSS e JavaScript, impedindo o Google de renderizar a página como o usuário a vê.
- Usar o robots.txt para esconder páginas sensíveis: o arquivo é público e lista exatamente o que você quis ocultar.
- Tentar remover uma página do índice apenas com Disallow, quando o correto seria a diretiva noindex na própria página.
- Esquecer de atualizar o arquivo após migrações, mantendo bloqueios de estruturas antigas.
Perguntas frequentes sobre robots.txt
Onde fica o arquivo robots.txt do meu site?
O robots.txt fica sempre na raiz do domínio, no endereço seusite.com.br/robots.txt. Você pode digitar essa URL em qualquer navegador para ver o arquivo atual. Se o endereço retornar erro 404, o site não tem robots.txt, e os buscadores assumem permissão para rastrear tudo o que encontrarem.
Robots.txt tira uma página do Google?
Não de forma confiável. O robots.txt impede o rastreamento, mas a página pode continuar indexada se receber links de outros sites. Para remover uma página da busca, o caminho correto é permitir o rastreamento e aplicar a diretiva noindex, ou usar a ferramenta de remoções do Google Search Console para casos urgentes.
Todo site precisa de robots.txt?
Sites pequenos funcionam sem o arquivo, porque a ausência equivale a liberar todo o rastreamento. O robots.txt se torna importante em sites maiores, com áreas transacionais, filtros e busca interna, nos quais orientar o robô economiza orçamento de rastreamento e concentra a atenção do buscador nas páginas que geram resultado.