Skip to main content
Blog
Blog

Como Bloquear Bots de Scraping de Conteúdo Baseados em Agentes de IA (Guia)

Bots de scraping com IA usam navegadores reais, IPs residenciais e extração com LLM para recolher os seus preços e conteúdos. Eis como travá-los.

May 19, 2026 12 min read
Como bloquear bots de scraping de conteúdo baseados em agentes de IA
Índice

Resumo: como bloquear scrapers de conteúdo de agentes de IA

  • Duas famílias: crawlers identificados (GPTBot, ClaudeBot, PerplexityBot, CCBot) e agentes LLM furtivos a operar navegadores reais.
  • Verifica crawlers identificados: Os crawlers identificados param perante o robots.txt mais a verificação de IP e de DNS reverso. Os agentes furtivos ignoram os três.
  • O comportamento apanha o stealth: A deteção comportamental é a única camada que apanha agentes furtivos: trajetórias de rato determinísticas, leituras do DOM em rajada, artefactos de CDP.

Sem tempo? Veja a deteção de agentes IA da cside. Cobre tudo o que se segue numa única implementação.

O que são bots de scraping de conteúdo baseados em agentes de IA?

O que são bots de scraping de conteúdo baseados em agentes de IA

Os bots de scraping de conteúdo com IA usam capacidades de IA (por exemplo, extração com LLM ou agentes de navegador) para recolher conteúdo de sites. Distinguem-se dos scrapers tradicionais: usam navegadores reais, adaptam-se quando os layouts das páginas mudam e extraem significado estruturado em vez de apenas HTML em bruto.

O espetro dos scrapers de IA

Tipo de scraperIdentifica-se?Segue as regras?Como lidar
Crawlers de treino (GPTBot, ClaudeBot, CCBot)SimGeralmenteBloquear ou permitir no robots.txt
Bots de pesquisa (ChatGPT-User, PerplexityBot)SimSimPermitir se quiser visibilidade nas pesquisas com IA
Crawlers agressivos (Bytespider)Às vezesÀs vezesBloquear via robots.txt + intervalos de IP
Ferramentas comerciais de scrapingNãoNãoRequer deteção comportamental
Agentes de IA autónomosNãoNãoRequer deteção comportamental

Em 2026, a grande maioria do tráfego de agentes de IA no seu site ainda é composta por crawlers das principais plataformas de LLM (Claude, ChatGPT, Google). É nisto que a maioria das pessoas pensa quando ouve falar em "scrapers de IA". Este artigo aborda estes casos, mas o nosso foco principal será o problema mais difícil: scrapers concebidos especificamente para recolher informação concreta do seu site.

Scrapers de IA maliciosos

  • Vigilância competitiva de preços que percorre as suas páginas de produto ou fluxos de orçamento para perceber o seu modelo de preços. Utilizada por concorrentes ou plataformas de agregação.
  • Pirataria e republicação de conteúdo que copia o seu conteúdo original para revender ou republicar noutro lugar. Isto afeta editoras, empresas de investigação e qualquer empresa cujo conteúdo seja o próprio produto.
  • Arbitragem de stock (por exemplo, revenda de bilhetes): bots que vigiam os seus níveis de stock e preços de artigos com oferta limitada, usando depois essa informação para comprar antes dos clientes reais ou revender em mercados secundários. Operados por redes de revendedores e operações de revenda.
  • Geração de leads: scrapers que extraem dados de contacto ou perfis de utilizador da sua plataforma e os vendem como listas de leads. Operados por corretores de dados e empresas de geração de leads.

Scrapers das principais plataformas de LLM

Aqui há dois tipos: bots de pesquisa (como o ChatGPT-User e o PerplexityBot) que leem as suas páginas para poderem referenciá-lo nos resultados de pesquisa com IA, e crawlers de treino (como o GPTBot, o ClaudeBot e o Bytespider) que consomem o seu conteúdo para melhorar os seus modelos.

Para a maioria das empresas, este não é o problema urgente. Permite-se os bots de pesquisa, bloqueiam-se os de treino se fizer sentido para a empresa, e segue-se em frente. Desenvolvemos este tema no nosso guia sobre bloqueio de tráfego de agentes de IA (incluindo o motivo pelo qual o robots.txt por si só não é suficiente).

Como detetar bots de scraping de conteúdo baseados em agentes de IA

Como detetar bots de scraping de conteúdo baseados em agentes de IA

É necessária uma combinação de sinais de rede, de navegador e de comportamento

Nenhum sinal isolado apanha um scraper furtivo. A metodologia de deteção que usamos no cside (tanto para a nossa própria plataforma como para os nossos clientes) avalia em conjunto quatro camadas de sinais:

  • Sinais de identidade; verificando quem o visitante diz ser. Crawlers conhecidos como o GPTBot anunciam-se através de strings de user-agent. Outros bots automatizados, como os da Browserbase, têm uma assinatura de bot que pode ser verificada.
  • Sinais de rede; analisando de onde vem o tráfego. É um IP de datacenter? Um proxy conhecido? A localização declarada corresponde ao fuso horário do navegador? Isto apanha algumas configurações básicas, mas operações sofisticadas rotam IPs residenciais que parecem limpos.
  • Sinais de navegador/dispositivo; verificando se as características do navegador e do dispositivo são coerentes entre si. Ferramentas de automação como o Playwright deixam vestígios no runtime do navegador. O cside lê aqui uma base de mais de 250 sinais de navegador, dispositivo e rede por sessão, o suficiente para atar cada sessão ao dispositivo por trás dela e construir um fingerprint persistente. Quando esses detalhes de fingerprinting (renderização gráfica, processamento de áudio, especificações do ecrã) não contam uma história coerente, é sinal de que algo foi alterado.
  • Sinais comportamentais; observando como o visitante usa o seu site. Padrões de navegação, comportamento de scroll, posicionamento de cliques, tempo de preenchimento de formulários e sequenciamento de pedidos ao nível da sessão. Os bots de agentes de IA são muito melhores a mascarar isto do que os bots tradicionais, mas com uma monitorização detalhada continuam a ser apanhados.

Esta lista está condensada para simplificar. Se quiser uma análise mais aprofundada, temos um artigo completo sobre como detetar tráfego de agentes de IA, onde detalhamos alguns dos sinais específicos que os engenheiros do cside implementam na nossa plataforma de deteção.

Ferramentas especializadas de fornecedores para detetar agentes de IA fraudulentos

Se está preocupado com scrapers de conteúdo baseados em agentes de IA e quer travá-los, tem fundamentalmente duas opções. Comprar ou fazer você mesmo. A nossa perspetiva sobre tentar resolver isto com ferramentas DIY (construídas internamente) é simples: não o faça. O software de segurança contra bots é uma categoria que as equipas normalmente não tentam desenvolver internamente (nem "a olho") por razões bastante diretas.

É um jogo de gato e rato. As plataformas de automação fazem engenharia reversa da sua abordagem de deteção, pelo que a sua equipa tem de atualizar continuamente a filosofia de deteção.

Uma ferramenta de deteção de agentes de IA focada na deteção de fraude é uma abordagem muito mais simples.

O cside é um desses fornecedores, mas para manter os nossos artigos educativos objetivos, mencionamos frequentemente outros fornecedores (como a HUMAN e a Fingerprint).

Mas as ferramentas de fornecedores não são extremamente caras e destinadas a empresas de grande dimensão?

Muitas são (DataDome, HUMAN), como abordámos no nosso guia comparativo: 4 Ferramentas Para Detetar Agentes de IA No Seu Site. Mas existem opções como o cside e o Fingerprint, que têm planos empresariais mais acessíveis (a partir de 99 USD/mês) com a opção de enviar sinais de dados para os seus fluxos antifraude via API. Isto significa que só paga pelo que usa e tem flexibilidade quanto ao que fazer com os dados de deteção.

Assim, não acaba a pagar preços de nível empresarial por extras que não lhe interessam. Também pode testar os mecanismos de deteção sem ficar preso a um contrato.

O que os scrapers de IA visam no seu site

O que os scrapers de IA visam no seu site

  • Dados de preços e promoções. Os seus preços, regras de desconto e calendário promocional constituem inteligência competitiva em tempo real. Um scraper que percorra o seu catálogo ou fluxos de orçamento pode alimentar esses dados diretamente num motor de reprecificação que o desvaloriza em poucas horas. Para uma análise dedicada à deteção e travagem destes bots, veja o que é o price scraping e como o travar.
  • Catálogo de produtos e conteúdo. As suas descrições de produtos, imagens, especificações e estruturas de categorias representam meses ou anos de investimento em conteúdo. Os scrapers de IA conseguem absorver tudo isto e reestruturá-lo para um catálogo concorrente.
  • Sinais de stock. A monitorização repetida do que está e não está em stock revela os seus padrões de cadeia de fornecimento e sinais de procura. Essa informação é valiosa para concorrentes que tentam cronometrar as suas próprias promoções ou decisões de stock em função das suas.
  • Investigação proprietária e conteúdo premium. No caso de editoras, empresas de investigação e negócios de conteúdo, os scrapers recolhem material protegido por paywall para redistribuição ou revenda como dados de treino. O seu conteúdo torna-se o produto de outra pessoa.

Exemplo: scraping de conteúdo baseado em agentes de IA numa plataforma de seguros

Eis um exemplo em primeira mão que resolvemos com um dos nossos clientes:

  1. Uma seguradora suspeita que alguém está a fazer scraping das suas cotações. Várias sessões preenchem todo o fluxo de cotação, obtêm o preço final e saem sem comprar. Já tinham uma deteção básica de bots implementada, que indicava efetivamente um aumento da atividade de bots, mas a maioria passava sem qualquer ação de bloqueio.
  2. Implementam a API de deteção de agentes de IA do cside. De imediato, foram identificados bots que escapavam a outras camadas de defesa. Os sinais foram ligados aos fluxos antifraude da plataforma de seguros. Um campo de classificação de risco de bot passou a orientar as suas decisões de aplicação.
  3. Quando uma sessão é sinalizada como um provável agente de IA malicioso, o passo final apresenta uma página de "contacte-nos" em vez da cotação real. O scraper não obtém nada de útil. Mas se se tratar de uma pessoa real, esta consegue ainda assim concluir o processo. Nenhum dado de preços é revelado a concorrentes ou plataformas de agregação e nenhum cliente real é rejeitado.

Como o objetivo era "travar o scraping malicioso de preços" e não apenas detetar agentes de IA, esta plataforma de seguros também usou o cside para apanhar registos com endereços de e-mail descartáveis.

A deteção tradicional de bots falha contra scrapers de conteúdo movidos por agentes de IA

A deteção tradicional de bots foi criada para apanhar tráfego com sinais automatizados previsíveis: atividade padronizada, pedidos vindos de IPs de datacenter sem ambiente de navegador. Muitos podiam ser travados com um simples CAPTCHA. O que torna os bots de IA diferentes:

  • Automação alojada localmente. Os agentes de scraping com IA correm cada vez mais em hardware de consumo real em vez de servidores na nuvem. Uma instância do Playwright a correr num Mac Mini envia pedidos a partir de um IP residencial com fingerprints de dispositivo autênticos.
  • Usam navegadores reais. Correm dentro de instâncias reais do Chrome que renderizam as suas páginas, executam o seu JavaScript e se comportam exatamente como o navegador de um cliente.
  • São construídos para agir como pessoas. Os agentes de IA aleatorizam os seus tempos, variam o scroll e até resolvem CAPTCHAs.

Os custos de fraude do scraping de conteúdo

O scraping de conteúdo não é o tipo de ataque que faz soar alarmes. Não há interrupção de serviço, nem nota de resgate, nem incidente dramático. O prejuízo é mais silencioso: um concorrente que iguala sempre os seus preços em poucas horas, uma loja de imitações a vender produtos com as suas descrições exatas, uma plataforma de agregação a publicar os seus dados proprietários. A Aberdeen Research estimou que o scraping custa às empresas de comércio eletrónico entre 3% e 14% da receita anual do site, e que o impacto mediano pode consumir até 80% da rentabilidade global de um site.

O que torna isto ainda mais difícil de engolir é a assimetria. Manter uma operação de scraping custa algumas centenas de dólares por mês. A receita que drena do alvo pode ser ordens de grandeza superior. E a maioria das organizações nem consegue quantificar quanto está a ser recolhido, por falta de visibilidade para o medir.

Estratégias de aplicação para o scraping de conteúdo baseado em agentes de IA

Não parta do princípio de bloquear tudo. O instinto é bloquear tudo o que pareça automatizado, mas isso cria dois problemas. Avisa o scraper de que a sua deteção funciona, fazendo-o adaptar-se. E arrisca bloquear clientes reais, especialmente em períodos de tráfego elevado, quando as taxas de falsos positivos sobem.

Sirva antes um fluxo específico para bots. A jogada mais inteligente é trocar aquilo que o scraper vê. Em vez de um preço final, mostre uma página de "contacte-nos". Em vez de acesso livre, apresente uma verificação adicional. O scraper não obtém nada do que veio buscar, mas um cliente real que seja sinalizado pode continuar a concluir o processo através de um caminho alternativo.

Como o cside protege o seu site contra scrapers de conteúdo baseados em agentes de IA

Como o cside protege o seu site contra scrapers de conteúdo baseados em agentes de IA

O cside é uma plataforma de segurança web especializada na observação do runtime do navegador. A deteção de agentes de IA do cside foi concebida especificamente para identificar agentes de IA fraudulentos no seu site. Com o cside:

  • Obtenha um painel com os agentes que estão a aceder ao seu site e o que estão a fazer
  • Pontuações de risco automáticas com base em sinais comportamentais para apanhar agentes de IA maliciosos (incluindo os baseados em navegador e os alojados localmente) que escapam às defesas tradicionais contra bots
  • Alimente os seus próprios fluxos de ação antifraude com sinais de deteção
  • Previna fraudes de agentes de IA como o abuso de códigos promocionais, a pirataria de conteúdo, os testes de cartões de crédito, a descoberta de vulnerabilidades e o scraping avançado

Leitura relacionada

Juan Combariza
Growth Marketer

Researching & writing about client side security.

FAQ

Frequently Asked Questions

O scraping de conteúdo com IA é a recolha automatizada dos dados do seu site através de ferramentas que correm dentro de navegadores reais e usam IA para extrair informação estruturada. Ficou mais difícil de travar porque estes scrapers se adaptam quando o seu site muda, movem-se à velocidade humana e produzem tráfego que parece idêntico ao de uma sessão de visitante real.

Trava os que optam por obedecer. Crawlers declarados como o GPTBot e o ClaudeBot geralmente respeitam o robots.txt. Os scrapers que realmente lhe custam dinheiro nem sequer o verificam.

Os bots tradicionais enviavam pedidos em bruto e falhavam quando alterava o layout da sua página. Os scrapers de IA correm em navegadores reais, compreendem semanticamente o que está na página e resolvem CAPTCHAs com mais precisão do que os seus próprios clientes.

Combine deteção ao nível do navegador com uma estratégia de aplicação graduada. A abordagem que vimos funcionar melhor é servir uma página específica para bots (como um ecrã de contacte-nos) em vez do preço real quando uma sessão é sinalizada.

O cside monitoriza quatro camadas de sinais dentro da sessão do navegador: identidade, rede, ambiente do navegador e comportamento. O cruzamento das quatro é o que apanha os scrapers que passariam em qualquer verificação isolada. A camada comportamental, a forma como um visitante navega e interage com as suas páginas, é a mais difícil de falsificar para os scrapers.

Não. Parte do tráfego de IA é valiosa. Bots de referência de pesquisa do ChatGPT e do Perplexity enviam visitantes reais de volta ao seu site. O objetivo não é bloquear tudo o que é automatizado, é identificar o que cada bot está a tentar fazer e responder em conformidade.

A Aberdeen Research concluiu que o scraping custa às empresas de comércio eletrónico entre 3% e 14% da receita anual do site.

Monitore e proteja seus scripts de terceiros

Gain full visibility and control over every script delivered to your users to enhance site security and performance.

Comece grátis ou experimente o Business com um teste de 14 dias.

Interface do painel cside mostrando monitoramento de scripts e análises de segurança
Related Articles
Agende uma demonstração

Quer ver isso em detalhe com um engenheiro?

Trinta minutos, no seu próprio site. Sem slides.

Vamos mostrar:

Quais scripts de terceiros estão rodando no seu site agora
Como você está em relação aos requisitos 6.4.3 e 11.6.1 do PCI DSS
Qual parte do seu tráfego é de bots e agentes de IA

Prefere só mandar uma pergunta?

Procurando horários livres…

Apenas humanos de verdade. A gente saberia.

Problemas para agendar? Abrir o agendador em uma nova aba

O que você está tentando resolver?

Conte em uma linha e voltamos com algo útil, não com um discurso genérico.

Costumamos ajudar com:

Ver quais scripts de terceiros rodam no seu site
Evidências para PCI DSS 6.4.3 e 11.6.1
Bots, agentes de IA e roubo de contas

Prefere agendar um horário? Escolher um horário