Josimar JMV
Blog · Infraestrutura e ser encontrado · 27·09·2026

Cloudflare: bloquear treino de IA derruba o seu Googlebot

Eu estava gravando os vídeos do dia, abri o e-mail e caiu um aviso da Cloudflare. O liga/desliga de robô de IA virou três interruptores — e tem um detalhe na definição de um deles que pode tirar o seu site do Google sem você ter pedido isso em nenhum momento.

Resposta rápida: a Cloudflare trocou o antigo bloqueia ou libera robô de IA por três categorias separadas por comportamento — Search (indexa pra responder depois), Training (leva o seu conteúdo pra treinar modelo) e Agent (abre a página na hora, em nome de uma pessoa) —, cada uma com três opções: bloquear em tudo, bloquear só nas páginas com anúncio ou não bloquear. A armadilha está na letra da definição de Training: ela inclui os crawlers de duplo papel, e a própria Cloudflare escreve que Googlebot, Applebot e Bingbot serão bloqueados por quem escolher bloquear Training — mesmo com Search liberado. Desde 15/09/2026 o padrão de domínio novo é treino e agente bloqueados nas páginas com anúncio e busca liberada, e quem não quer o padrão sai dele nas configurações de segurança. Se você vende, se você faz site pra cliente ou se você tem agência, a tarefa é uma: abrir Security Settings → Configure AI bot policies e marcar os três de propósito, não por padrão.

Gravei esses 8 minutos no canal @josimarjmv hoje, 27 de setembro de 2026, com o e-mail ainda aberto na outra aba — reto, sem corte e sem teleprompter, do jeito que eu gravo. Assista e leia junto: aqui embaixo eu fui atrás da letra da documentação que no ar eu mandei você pesquisar, e achei uma armadilha que eu não sabia que estava lá.

🎧 PREFERE OUVIR? · 9 min

Este artigo também é um episódio do podcast Josimar JMV | Em Produção — o mesmo vídeo, só o áudio, normalizado pra fone.

Baixar MP3 · RSS · todos os episódios

A carteirada primeiro: eu cuido dessas contas, não comento sobre elas

Vou dar a minha carteirada antes de opinar, porque esse assunto virou terreno de palpite. Eu tenho empresa de tecnologia e eu lido com milhares de views todos os dias. Eu cuido de infraestrutura com a mão na massa, não de fora. E, pra ter isso de pé, a gente tem vários sites — e eu não uso WordPress em nenhum deles. Boa parte desses domínios está na Cloudflare, e é por isso que o e-mail dela cai na minha caixa e não numa caixa de marketing.

Não é palpite de fora: eu já tive que investigar log de verdade pra descobrir que o bloqueio de robô de IA estava ligado em domínio meu sem ninguém da minha equipe ter ligado. Contei esse caso inteiro quando escrevi que o meu site estava invisível pro ChatGPT e eu não sabia. O texto de hoje é a etapa seguinte, e ela é outra: agora não é sobre descobrir que travou, é sobre decidir o que você quer em cada uma das três chaves antes que a plataforma decida por você.

O e-mail que chegou: o que mudou de verdade

Eu estava mexendo aqui, fazendo os vídeos de hoje, abri o e-mail e lá estava a Cloudflare com um aviso até extenso. Resumo do que eu entendi lendo, e que eu depois fui conferir na documentação: antes existiam umas poucas chaves que faziam uma coisa só — bloqueia ou libera os robôs de inteligência artificial, em bloco. Agora ficou granular: o robô é tratado pelo que ele faz, não pelo rótulo de "robô de IA".

Apuração minha, feita em 27/09/2026, porque no ar eu falei de cabeça e aqui eu quero te dar a letra. A Cloudflare anunciou isso em 1º de julho de 2026, no post "Your site, your rules: new AI traffic options for all customers", e as definições das três categorias estão na documentação de bloqueio de robôs de IA, nestas palavras:

E cada uma das três aceita três ajustes, também na letra da documentação: "Block (on all pages)", "Block on pages with ads" — com detecção automática da Cloudflare pra saber se a página exibe anúncio — e "Allow (do not block)". O caminho é Security Settings → Configure AI bot policies, e o registro de mudanças da própria Cloudflare diz que isso vale pra todos os clientes, inclusive no plano grátis. Ou seja: não tem desculpa de "isso é coisa de plano caro".

A armadilha: o Googlebot conta como treino

Aqui está a parte que eu não sabia quando liguei a câmera, e é a mais importante deste texto. Eu abri a gravação dizendo que a Cloudflare está bloqueando o seu site, o treinamento das IAs e o robô da busca do Google. Eu falei isso pela sensação de quem administra essas contas. Quando eu fui ler a documentação com calma, descobri que tem base escrita, e ela é pior do que eu imaginava.

Repare de novo na definição de Training: ela inclui "mixed-purpose crawlers that are used both for Training and for Search". E o anúncio da Cloudflare fecha a conta sem rodeio: "Multi-purpose crawlers such as Googlebot, Applebot, and BingBot will be blocked by customers who have selected to block Training". A imprensa técnica registrou a mesma regra em 02/07/2026 com a frase que eu colaria na parede de quem cuida de site: "If a website blocks Training crawlers, multi-purpose crawlers such as Googlebot, Applebot, and BingBot will be blocked, even when Search crawlers are allowed".

Traduzindo pro nosso lado, porque isso vale dinheiro: Googlebot é o mesmo robô que alimenta a busca e que alimenta treino. Quando você marca "não quero ser usado pra treinar IA" no painel da Cloudflare, vale a regra mais restritiva e ele leva o robô da busca junto. Você achou que estava fazendo uma escolha ideológica sobre IA e fez uma escolha comercial sobre aparecer no Google.

Isso me obriga a um ajuste no que eu mesmo escrevi aqui quatro dias atrás. Quando eu tratei do meu site invisível, eu disse — e continua certo — que bloquear o Google-Extended no robots.txt não te tira do Google: a documentação do Google é explícita nisso. Só que o interruptor Training do painel da Cloudflare não é o Google-Extended: ele pega o crawler de duplo papel inteiro. São duas chaves com nome parecido e consequência oposta, e é exatamente aí que a pessoa se atropela.

Os três interruptores de robô de IA da Cloudflare e o efeito colateral do interruptor de treino Esquema em três colunas, uma por categoria de robô da Cloudflare. Primeira coluna, Search: crawlers que coletam ou indexam o conteúdo para responder perguntas depois; é o robô que traz visita; recomendação para quem vende: liberar. Segunda coluna, Training: crawlers que levam o conteúdo para treinar ou afinar modelo, incluindo crawlers de duplo papel usados para treino e para busca; recomendação: decidir com consciência, porque bloquear aqui também bloqueia Googlebot, Applebot e Bingbot mesmo com Search liberado. Terceira coluna, Agent: atividade automatizada agindo em tempo real em nome de uma pessoa, como bot de chat e agente que usa navegador; recomendação: liberar em site que vende e avaliar em site que vive de anúncio. Abaixo das colunas, uma faixa de alerta mostra que o interruptor de treino puxa junto os crawlers de duplo papel, com a regra mais restritiva vencendo, e que o resultado é o site sair da busca. Na base, o padrão para domínio novo desde 15 de setembro de 2026: treino e agente bloqueados nas páginas que exibem anúncio, busca liberada, com opção de sair do padrão nas configurações de segurança. SECURITY SETTINGS → CONFIGURE AI BOT POLICIES · TRÊS CHAVES, TRÊS DECISÕES SEARCH indexa hoje pra te citar depois é o robô que traz gente quem vende: LIBERAR TRAINING leva o conteúdo pra treinar/afinar modelo inclui crawler de DUPLO PAPEL decida CONSCIENTE AGENT abre a página AGORA, em nome de alguém pode ser cliente de verdade site que vende: LIBERAR A ARMADILHA — bloquear TRAINING não para em treino: Googlebot · Applebot · Bingbot servem a DOIS papéis (busca + treino) vale a regra MAIS RESTRITIVA → eles são bloqueados MESMO com Search liberado resultado prático: você recusou treino e saiu da busca PADRÃO DE DOMÍNIO NOVO DESDE 15·09·2026 Training e Agent bloqueados nas páginas COM ANÚNCIO · Search liberada · dá pra sair do padrão nas configurações de segurança
O quadro que eu montei pra conferir conta de cliente sem depender de memória. A coluna do meio é a que engana: ela parece uma decisão sobre IA e é uma decisão sobre busca.

Por que alguém bloquearia — e por que você, que vende, não

Antes de escolher, vale entender por que essa trava existe, porque na origem ela faz sentido. Empresa de mídia e comunicação — empresa que gasta dinheiro com jornalista, com produção de conteúdo único e relevante — não quer que a inteligência artificial fique acessando o site dela e raspando o conteúdo. Ir lá, catar a notícia e republicar. Essas empresas até têm processo na justiça pra que as IAs e o Google passem a remunerar os portais, porque na prática usam a notícia e ganham dinheiro em cima dela. É briga legítima e antiga.

A Cloudflare está empurrando o mercado pra esse lado de propósito. Apuração minha: no noticiário de 01/07/2026 sobre a nova política, a separação entre robô de busca e robô de treino aparece justo como o passo que viabiliza cobrar das empresas de IA, num modelo que ela chamou de "Pay Per Use" — cobrar quando o conteúdo gera valor, não só quando é baixado. Tem até um número que explica a irritação de quem paga banda: "over 50% of crawl traffic from AI crawlers is spent re-fetching unchanged pages". Metade do rastreio é robô relendo página que não mudou.

Só que agora vira a mesa pro nosso lado. Pra você que quer vender produto, pra você que está fazendo um site pro seu cliente: isso é relevante ou não é relevante? É relevante. Imagina você querer que o site apareça nas primeiras posições e que, quando a pessoa perguntar no ChatGPT, ele referencie o seu site. E ele não aparecer de jeito nenhum. Pois é — pode ser que a Cloudflare esteja bloqueando o seu site pra inteligência artificial, e a solução que nasceu pra proteger jornal está servida por padrão pro seu site de cinco páginas, que só queria ser encontrado.

Eu já escrevi o outro lado dessa mesma moeda quando mostrei que empresa sem site não vai ser recomendada nem pela IA. Ter site e estar bloqueado dá no mesmo — com o agravante de você estar pagando por ele achando que está resolvido.

Onde eu me corrijo: não é bloqueio geral, é nas páginas com anúncio

Eu falei no ar que, por padrão, a Cloudflare vai deixar bloqueado o treino de IA e bloqueada a visita do agente de IA, e liberado o web search — voltando a ser como era antes da IA. A direção está certa e o tamanho eu exagerei, e eu prefiro corrigir do que repetir.

O que está escrito: a partir de 15 de setembro de 2026, pra todo domínio novo entrando na Cloudflare, Training e Agent ficam bloqueados nas páginas que exibem anúncio e Search continua liberada. Não é o site inteiro fechado — é a página monetizada. E o próprio anúncio diz que quem não quer o padrão novo pode sair dele nas configurações de segurança antes da data, e que a Cloudflare continuaria notificando os clientes conforme a data chegasse. Foi um desses avisos que caiu na minha caixa — e isso também ajusta a minha leitura no ar de que a empresa "empurra goela abaixo sem avisar": ela empurra, mas avisa por e-mail, naquele e-mail extenso que quase todo mundo arquiva sem ler.

Uma ressalva honesta, porque eu não vou fingir precisão que eu não tenho: a documentação fala em "domínio novo". A leitura da imprensa especializada é que o padrão novo também alcança zona existente que nunca salvou uma preferência explícita, e conta de plano grátis. Isso eu não achei com essas palavras na documentação oficial, então trate como leitura de terceiro, não como fato da Cloudflare. E é justamente por isso que a minha recomendação não depende de resolver essa dúvida: abra e olhe. Quem administra centenas de domínios como eu aprende rápido que suposição nesse assunto custa tráfego.

O que eu faço na conta de cada cliente, na ordem

Isso aqui é o que eu faria hoje se eu tivesse uma agência de site ou uma carteira de clientes na Cloudflare — e é barato, é chato e leva poucos minutos por domínio:

  1. Abra Security Settings → Configure AI bot policies e olhe as três categorias. Não olhe uma e presuma as outras.
  2. Search: liberar, em site que quer cliente. Essa é a mais fácil das três e é a que paga a conta.
  3. Training: decida com consciência — e lembre que bloquear aqui leva Googlebot, Applebot e Bingbot junto. Se o seu conteúdo é a sua mercadoria, bloqueie sabendo o preço. Se o seu site é vitrine de serviço, bloquear treino pra "proteger" um texto de vitrine é tiro no próprio pé.
  4. Agent: pense em quem está do outro lado. Se o seu site vende, tira dúvida ou tem catálogo, o agente pode ser um cliente real que pediu pra IA resolver. Se o seu site vive de anúncio pra humano, aí a conta muda.
  5. Confira o robots.txt e as regras de bot depois. É o roteiro de diagnóstico que eu já detalhei no texto do site invisível — painel liberado com robots.txt fechado continua invisível.
  6. Anote a data da vistoria em cada conta. Esse assunto mudou em 01/07/2025, mudou em 15/09/2026, e vai mudar de novo.

E se você não sabe onde clicar: vá na Cloudflare, procure na documentação dela, procure no YouTube, ou pede ajuda pra IA que você usa — Claude, Codex, o que estiver na sua mão. Isso é trabalho chato que a IA faz bem: ler termo, achar menu, resumir o que mudou.

Repare na ordem das coisas, porque é o erro que eu mais vejo em quem está começando a viver de fazer site: primeiro a pessoa escolhe o nome — e eu já contei por que nome e domínio vêm antes do site; depois faz o site; e para. Falta a última parte, que é a que dá dinheiro: fazer o site ser encontrado. Quem entrega site pra cliente e não vistoria isso está entregando serviço pela metade — e eu já mostrei a conta de quem faz site e fatura de verdade com isso.

Nota de cronologia (importante)

Eu gravei em 27/09/2026, de manhã, com o e-mail recém-aberto, e escrevi este texto no mesmo dia — a apuração na documentação é de 27/09/2026. Duas coisas eu corrigi em relação ao que eu falei no ar, e faço isso de bom grado: o padrão novo bloqueia nas páginas que exibem anúncio, não o site todo, e a Cloudflare avisou por e-mail antes de mudar. Uma coisa a apuração confirmou e piorou: o interruptor de treino realmente atinge o robô da busca, porque Googlebot é crawler de duplo papel. Esse assunto está mudando rápido — o padrão de 01/07/2025 não é o de 15/09/2026, e o nome dos menus essas empresas trocam sem avisar. Não tome nada aqui como eterno; tome o método: abra, olhe as três chaves, anote a data.

TODA SEGUNDA · MEIO-DIA · AO VIVO

Discorda? Concorda? Tem um caso parecido? Aqui não tem caixa de comentário de propósito: segunda-feira, ao meio-dia, eu faço live no canal e a gente conversa sobre isso ao vivo — sem corte, como sempre.

Ver as lives no canal @josimarjmv →

Perguntas frequentes

Bloquear treino de IA na Cloudflare tira o meu site do Google?
Pode tirar, sim, e é por isso que eu trato essa chave com cuidado. A documentação da Cloudflare define a categoria Training como crawlers que levam o seu conteúdo para treinar ou afinar um modelo, incluindo os crawlers de duplo papel, usados tanto para Training quanto para Search. E o anúncio é explícito: crawlers de múltiplo propósito como Googlebot, Applebot e Bingbot serão bloqueados por quem escolheu bloquear Training. A imprensa técnica registrou a mesma coisa com outras palavras: se o site bloqueia crawler de treino, os de múltiplo propósito são bloqueados mesmo com Search liberado. Ou seja: marcar bloquear treino no painel não é só recusar treino, é também fechar a porta do robô que te indexa na busca.
Quais são as três categorias de robô de IA da Cloudflare?
São três comportamentos, e a definição é da própria Cloudflare. Search: crawlers que coletam ou indexam o seu conteúdo para responder perguntas sobre ele depois. Agent: atividade automatizada agindo em tempo real em nome de uma pessoa, como bot de busca de chat e agente que usa navegador. Training: crawler levando o seu conteúdo para treinar ou afinar um modelo, incluindo os crawlers de duplo papel, usados para treino e para busca. Cada uma das três aceita três ajustes: bloquear em todas as páginas, bloquear só nas páginas que exibem anúncio ou não bloquear.
O padrão novo bloqueia o meu site inteiro ou só as páginas com anúncio?
Só as páginas que exibem anúncio, e essa diferença é grande o suficiente para eu me corrigir em relação ao que eu falei de cabeça na gravação. O que a Cloudflare escreveu é que, a partir de 15 de setembro de 2026, para todo domínio novo entrando na plataforma, as categorias Training e Agent ficam bloqueadas por padrão nas páginas que exibem anúncio, enquanto Search continua liberada. A detecção de página com anúncio é automática, feita pela Cloudflare. Não é bloqueio geral do site, mas também não é inofensivo: se as suas páginas monetizam, é ali que o agente de IA vai bater na porta fechada.
Onde eu configuro as políticas de robô de IA na Cloudflare?
O caminho que está na documentação é Security Settings e depois Configure AI bot policies, e o registro de mudanças da Cloudflare diz que isso está disponível para todos os clientes, inclusive os do plano grátis. Lá você vê as três categorias, uma por uma, e marca o que quer em cada uma. Não é o único lugar em que esse bloqueio aparece na prática: eu já contei aqui no blog como o mesmo efeito também chega pelo robots.txt gerenciado e por regra antiga de bot no firewall. Desligar num lugar e esquecer do outro é o erro que mais me aparece.
Por que um portal de notícias quer bloquear robô de IA e eu não?
Porque o negócio de cada um é diferente. Quem paga jornalista e produz conteúdo único não quer que a inteligência artificial raspe a matéria e responda em cima dela sem mandar ninguém para o site, e essa turma está cobrando remuneração inclusive na justiça. Quem vende produto, serviço ou site quer o contrário: quer ser indexado, quer ser citado quando a pessoa pergunta para uma IA, porque a busca é fonte de tráfego e de cliente. A Cloudflare montou os controles para atender os dois, então a pergunta não é qual é a configuração certa no geral, é qual é a certa para o seu negócio.
Eu tenho conta paga na Cloudflare, preciso mexer em algo?
Vale abrir e olhar de todo jeito. O que a Cloudflare escreveu é que os novos padrões valem para os domínios novos que entram na plataforma, que quem não quer o padrão novo pode sair dele nas configurações de segurança, e que a empresa continuaria notificando os clientes sobre a mudança conforme a data se aproximasse. Foi um desses avisos que caiu no meu e-mail. Como eu cuido de centenas de domínios, eu não trabalho com suposição nesse assunto: eu abro a conta, olho as três categorias e deixo cada uma marcada de propósito, com data anotada.
Como eu descubro se o robô de IA está conseguindo entrar no meu site?
Esse é o outro lado do problema, e é o assunto do meu texto anterior sobre o site que estava invisível para o ChatGPT: lá eu conto o diagnóstico, que é olhar log, abrir o seu robots.txt no navegador, procurar pelos nomes dos robôs e conferir as regras de bot, além das políticas de IA no painel. Aqui eu estou tratando da decisão, que vem antes: o que você quer permitir em cada uma das três categorias. Diagnóstico e decisão são etapas diferentes, e a maior parte da confusão que eu vejo é gente tentando destravar sem ter decidido o que queria.
Agente de IA entrando no meu site é bom ou ruim?
Depende do que você faz da vida, e é a categoria em que eu vejo mais gente respondendo no automático. Agente, na definição da Cloudflare, é atividade automatizada agindo em tempo real em nome de uma pessoa, para resolver algo agora. Se o seu site vende, tira dúvida, tem catálogo ou formulário, esse agente pode estar levando um cliente real que pediu para a IA fazer a tarefa. Se o seu site vive de exibir anúncio para gente de carne e osso, aí o agente consome banda e não gera receita. Eu não trato as três chaves como uma decisão só, justamente por isso.

Resumindo o que eu levaria disso pra dentro da minha operação: quem se preocupa com site, quem precisa vender, quem precisa mostrar o site, tem que ir lá ajustar. Não por medo de IA — por controle. As três chaves existem pra você escolher, e escolher errado hoje tem um preço bem concreto, que é sumir da busca sem saber por quê. Se você tem agência de site ou quer aprender a construir site de uma forma escalável e simples, é disso que eu trato nas minhas imersões — e valor, data e condição ficam na página de cada uma, que é onde essa informação está certa. Um abraço, e até a próxima.

Baseado na gravação do canal @josimarjmv publicada em 27/09/2026 (8min50), com transcrição própria das legendas do próprio vídeo. São da minha vivência e foram ditos na gravação: ter empresa de tecnologia, lidar com milhares de views todos os dias e cuidar de infraestrutura com a mão na massa; ter vários sites e não usar WordPress; usar a Cloudflare e ter recebido dela, durante a gravação dos vídeos do dia, um e-mail extenso avisando da mudança; a lembrança de que antes havia poucas configurações que só bloqueavam ou liberavam os robôs de IA em bloco e que agora ficou granular, com indexação de conteúdo, treinamento de modelo e entrada de agente separados; a explicação de que empresas de mídia e comunicação, que gastam com jornalista e conteúdo único, não querem que a IA raspe o conteúdo delas e têm processo na justiça para que as IAs e o Google remunerem os portais; a pergunta de por que alguém não gostaria que o site fosse usado para treino e a observação de que, para quem vende, isso é relevante; o exemplo de querer aparecer nas primeiras posições e ser referenciado pelo ChatGPT e não aparecer de jeito nenhum; o alerta de que algumas contas podem já estar com o bloqueio ligado nativamente e de que é preciso vistoriar a configuração; a leitura de que o padrão deixaria treino e agente bloqueados e a busca liberada, voltando ao cenário de antes da IA; a recomendação de procurar na Cloudflare, no YouTube ou pedir ajuda à IA que você usa; o fato de os meus vídeos serem gravados reto, em uma câmera, sem edição e sem teleprompter, como experiência de vida de quem paga a conta no quinto dia e também desenvolve; e a menção à gravação da imersão de sites para quem tem agência ou quer aprender a construir site de forma escalável. É apuração minha, feita em 27/09/2026, e não estava na gravação: as definições literais das três categorias e as três opções de bloqueio, na documentação de bloqueio de robôs de IA da Cloudflare, incluindo o trecho em que Training abrange "mixed-purpose crawlers that are used both for Training and for Search" e o caminho Security Settings → Configure AI bot policies; o anúncio de 1º de julho de 2026, com a frase "Multi-purpose crawlers such as Googlebot, Applebot, and BingBot will be blocked by customers who have selected to block Training", o padrão de 15/09/2026 para domínio novo (Training e Agent bloqueados nas páginas que exibem anúncio, Search liberada), a possibilidade de sair do padrão nas configurações de segurança e o aviso de que a empresa seguiria notificando os clientes; a disponibilidade para todos os clientes, inclusive no plano grátis, no registro de mudanças da Cloudflare; a formulação "If a website blocks Training crawlers, multi-purpose crawlers such as Googlebot, Applebot, and BingBot will be blocked, even when Search crawlers are allowed", publicada em 02/07/2026; e o modelo "Pay Per Use" com o dado de que "over 50% of crawl traffic from AI crawlers is spent re-fetching unchanged pages", no noticiário de 01/07/2026. Duas correções minhas ao que eu falei no ar estão marcadas no texto: o padrão bloqueia nas páginas com anúncio, não o site inteiro, e a mudança foi avisada por e-mail. A leitura de que zona existente sem preferência salva e conta de plano grátis também recebem o padrão novo é de imprensa especializada e eu não a encontrei com essas palavras na documentação oficial — por isso está marcada como leitura de terceiro. Sobre as minhas imersões eu não repito preço, data nem condição aqui: essa informação é final e fica na página de cada imersão.