Robots.txt para sites com IA: o que permitir e bloquear em 2026
Em 2026, o robots.txt deixou de ser apenas instrução para o Googlebot. Você decide nele se quer ou não aparecer em ChatGPT, Claude, Perplexity, Gemini e dezenas de outros agentes de IA. Bloquear errado custa visibilidade; abrir tudo sem critério gera consumo desnecessário de banda. Veja o equilíbrio certo.
Os crawlers que importam em 2026
GPTBot (OpenAI/ChatGPT)
ChatGPT-User (browsing em tempo real)
PerplexityBot e Perplexity-User
ClaudeBot (Anthropic)
Google-Extended (Gemini)
CCBot (Common Crawl, usado por muitos LLMs)
Bloquear ou permitir?
Permita todos os bots éticos se sua estratégia inclui aparecer em respostas de IA. Bloqueie apenas rotas sensíveis (admin, checkout, áreas logadas). Sites que bloqueiam GPTBot somem progressivamente das respostas do ChatGPT — uma decisão que deve ser comercial, não inercial.
Exemplo de robots.txt moderno
User-agent: * | Allow: /
Disallow: /admin/
Disallow: /checkout/
Sitemap: https://seudominio.com/sitemap.xml
Erros comuns
O erro mais comum é manter Disallow: / herdado de ambientes de staging. Outro é confundir robots.txt com noindex — bloquear no robots não remove URLs já indexadas, só impede crawl novo.
Perguntas frequentes
Bloquear GPTBot protege meu conteúdo?
Não totalmente. Outros bots e o navegador do ChatGPT-User continuam acessando.
Devo bloquear CCBot?
Se você quer treinar modelos com seu conteúdo, libere. Se não, bloqueie.
Robots.txt vale para subdomínios?
Cada subdomínio precisa do seu próprio robots.txt.
Posso testar antes de subir?
Sim, no robots.txt Tester do Search Console.
Quanto tempo para o Google reler?
De 24 a 72 horas em geral.
Conclusão
Robots.txt declara quais crawlers podem solicitar determinados caminhos e precisa refletir a política pública da organização. O arquivo não substitui autenticação, controle de acesso, WAF ou diretivas de indexação. Uma configuração responsável identifica agentes autorizados, protege áreas sensíveis e documenta preferências sem prometer que plataformas externas usarão ou citarão o conteúdo.
Como interpretar esta análise
A Quaerion separa implementação, prontidão estrutural, presença observada e resultado comercial porque cada etapa responde a uma pergunta diferente. Uma página tecnicamente correta pode melhorar acesso, compreensão e extraibilidade sem comprovar que um buscador ou sistema de IA escolheu, citou ou recomendou a marca. Para afirmar presença, é necessária uma execução documentada no ambiente analisado.
As afirmações desta publicação devem ser lidas dentro da fonte, data, amostra e limitações declaradas. O comportamento das plataformas varia conforme modelo, conta, localização, consulta e atualização; nenhuma observação isolada é apresentada como garantia universal. Quando uma fonte fica indisponível, a ausência de medição permanece explícita e não é convertida em resultado negativo ou positivo.
Use o Glossário Answer Intelligence para definições canônicas e a metodologia do Radar para protocolos de evidência, denominadores e ciclos de observação reproduzíveis.
Sr. Primus é estrategista de Answer Intelligence e criador do método AI Referral Engine™ na Quaerion. O trabalho integra SEO, AEO, AIO e GEO para estruturar marcas brasileiras com conteúdo, entidades, autoridade e medição documentada, aumentando a probabilidade de descoberta e citação sem prometer controle sobre respostas de ChatGPT, Gemini ou Perplexity.