Crawlers de IA: liberar ou bloquear GPTBot, ClaudeBot e PerplexityBot?

Crawlers de IA: liberar ou bloquear GPTBot, ClaudeBot e PerplexityBot?

Bloquear crawlers de IA no robots.txt protege conteúdo contra uso em treino e, ao mesmo tempo, elimina a chance de a marca ser citada nas respostas. A decisão correta depende do modelo de negócio: quem vende conteúdo tende a bloquear os bots de treino; quem vende serviço quase sempre ganha mais liberando tudo.

Os bots existem em três categorias: crawlers de IA

Além disso, tratar todos como a mesma coisa é o erro que mais destrói visibilidade. As funções são distintas:

Os agentes, um a um: crawlers de IA

O bloqueio mais caro

Por isso, o OAI-SearchBot é o que indexa para o ChatGPT Search, que é onde a citação com link acontece. Muitos plugins de “proteção contra IA” bloqueiam esse agente por padrão, junto com o GPTBot. O resultado é uma marca invisível no motor com mais usuários do mundo, sem que ninguém tenha decidido isso conscientemente.

Como decidir: três perfis: crawlers de IA

Perfil 1: empresa que vende serviço: crawlers de IA

No entanto, agências, consultorias, clínicas, escritórios, indústrias, software. O conteúdo é meio de atração, não produto. Ser lido pela IA é o objetivo. Recomendação: liberar tudo.

Perfil 2: publisher que vende conteúdo

Em geral, veículos com assinatura, cursos, bases de dados proprietárias. Existe conflito real: o treino usa o produto sem contrapartida. Recomendação: bloquear bots de treino, liberar bots de indexação. Assim a marca continua sendo citada com link, que gera tráfego, sem alimentar o modelo com o acervo pago.

Perfil 3: e-commerce

De fato, assistentes já fazem recomendação de produto e compra. Bloquear significa sair da vitrine. Recomendação: liberar tudo e caprichar no feed e no schema de produto.

A configuração recomendada

User-agent: *

Allow: /

Disallow: /wp-admin/

Allow: /wp-admin/admin-ajax.php

Disallow: /?s=

Disallow: /*?replytocom

User-agent: GPTBot

Allow: /

User-agent: OAI-SearchBot

Allow: /

User-agent: ChatGPT-User

Allow: /

User-agent: ClaudeBot

Allow: /

User-agent: Claude-User

Allow: /

User-agent: PerplexityBot

Allow: /

User-agent: Perplexity-User

Allow: /

User-agent: Google-Extended

Allow: /

User-agent: Applebot-Extended

Allow: /

User-agent: CCBot

Allow: /

Assim, sitemap: https://seudominio.com.br/sitemap_index.xml

A declaração explícita não é tecnicamente obrigatória quando existe User-agent: * com Allow: /, mas serve como documentação da decisão e evita que alguém bloqueie por engano em uma revisão futura.

Como verificar o estado atual

  • Ou seja, acesse seudominio.com.br/robots.txt e leia o arquivo inteiro.
  • Por exemplo, procure por qualquer Disallow: / associado a agentes de IA.
  • Em primeiro lugar, verifique se algum plugin de segurança ou de “bloqueio de IA” está ativo e sobrescrevendo o arquivo.
  • Em seguida, cheque também bloqueios em nível de servidor ou de CDN, que não aparecem no robots.txt. O Cloudflare oferece bloqueio de bots de IA em um clique, e muita gente ativou sem saber o custo.
  • Por fim, confirme que meta name=”robots” nas páginas não contém noindex nem nosnippet.

O que o robots.txt não faz

  • Portanto, não é barreira técnica. É convenção respeitada por operadores legítimos.
  • Não remove conteúdo já incorporado em modelos treinados anteriormente.
  • Certamente, não impede que terceiros citem ou reproduzam o seu conteúdo em outros sites.
  • Igualmente, não protege contra scraping malicioso, que exige bloqueio em servidor ou CDN.

Perguntas frequentes sobre crawlers de IA

Bloquear protege meus direitos autorais?

Sinaliza intenção, o que pode ter valor jurídico, mas não é proteção técnica nem apaga o que já foi coletado.

Bloquear o Google-Extended tira o site das AI Overviews?

Em contrapartida, não. As AI Overviews dependem do Googlebot. O Google-Extended controla uso em treino.

Como saber se os bots estão passando?

Além disso, na prática, nos logs de acesso do servidor, filtrando por user-agent. É a única confirmação real.

Dá para liberar só parte do site?

Dá, com regras de Disallow por diretório. Faz sentido para área de membros ou conteúdo pago.

Seu site está liberado para os motores certos?

A ArtSeven audita robots.txt, CDN e plugins para garantir que a decisão seja consciente. Fale com o Grupo MW7.

Leia também: Como funciona o tráfego pago para PMEs em São Paulo