Skip to main content
Blog
Blog Attacks

Comment Bloquer PerplexityBot sur Votre Site Web

PerplexityBot explore votre contenu pour la recherche IA. Voici comment le bloquer, pourquoi il a essuyé des critiques sur le droit d'auteur, et en quoi Perplexity Shopper diffère.

Jun 25, 2026 9 min read
Comment Bloquer PerplexityBot sur Votre Site Web
Table des matières

En bref : bloquer PerplexityBot après la controverse de conformité des éditeurs de 2024

  • Le problème de conformité de 2024 : L'hypothèse par défaut est qu'une ligne Disallow: PerplexityBot clôt la conversation. En 2024, Wired, The Atlantic et d'autres éditeurs ont rapporté que Perplexity continuait à afficher des extraits détaillés de contenu interdit par robots.txt, et les explications de Perplexity étaient incohérentes.
  • Blocage au niveau IP : PerplexityBot utilise PerplexityBot/1.0 (+https://docs.perplexity.ai/docs/perplexitybot) et Perplexity publie les plages IP dans sa documentation de crawler ; un blocage robots.txt plus un refus au niveau IP au pare-feu donne une application qui ne repose pas sur l'auto-déclaration du crawler, et le langage des conditions d'utilisation ajoute une couche juridique.
  • La décision : Si votre contenu est de l'actualité payante ou de la recherche originale et que des extraits sont apparus dans les réponses de Perplexity malgré un blocage robots.txt, passez au blocage IP et aux CGU ce trimestre. Si votre contenu correspond à des pages marketing et que vous souhaitez des citations Perplexity, laissez PerplexityBot autorisé et réévaluez la situation si le tableau de conformité évolue.

Peu de temps ? Découvrez la détection d'agents IA de cside. Elle couvre tout ce qui suit en un seul déploiement.

PerplexityBot est le crawler web déclaré qui alimente le moteur de recherche IA de Perplexity. Lorsqu'un utilisateur interroge Perplexity, les résultats de recherche s'appuient sur le contenu que PerplexityBot a indexé. En 2024, plusieurs éditeurs ont signalé que Perplexity reproduisait du contenu protégé par le droit d'auteur issu de leurs sites dans les résultats de recherche, et ce malgré des blocages robots.txt, ce qui en fait l'un des crawlers IA les plus controversés à bloquer.

Ce guide traite spécifiquement de PerplexityBot. Si vous cherchez à contrôler le shopping agent de Perplexity, consultez notre article complémentaire sur comment bloquer Perplexity Shopper, car il exige une approche entièrement différente. Pour le schéma plus large applicable aux crawlers déclarés, consultez notre guide pour bloquer les robots d'exploration IA qui aspirent le contenu.


Qu'est-ce que PerplexityBot ?

Réponse rapide : PerplexityBot est le crawler de recherche IA de Perplexity. Il indexe le contenu web pour alimenter les résultats de recherche générés par l'IA de Perplexity. Il s'identifie au moyen d'une chaîne de user-agent déclarée et est documenté sur docs.perplexity.ai. En 2024, il a essuyé d'importantes critiques de la part des éditeurs en raison d'un non-respect apparent de robots.txt et d'une reproduction de contenu sans attribution suffisante.

Le user-agent de PerplexityBot : PerplexityBot/1.0 (+https://docs.perplexity.ai/docs/perplexitybot)

La controverse de 2024 constitue un contexte pertinent pour votre décision de blocage. Plusieurs grands éditeurs, dont des médias et des organes de presse, ont signalé que Perplexity faisait remonter des reproductions détaillées de leur contenu payant ou restreint par robots.txt dans ses réponses de recherche IA. Perplexity a contesté certaines de ces descriptions, mais l'épisode a établi que la conformité de PerplexityBot est plus activement contestée que celle de GPTBot ou de ClaudeBot.


La Controverse de Conformité de 2024

Réponse rapide : En 2024, Wired, The Atlantic et d'autres éditeurs ont signalé que Perplexity reproduisait du contenu de leurs sites dans les résultats de recherche IA, alors même qu'ils avaient Disallow: PerplexityBot dans leur robots.txt. Les explications de Perplexity à l'époque étaient incohérentes, ce qui a conduit plusieurs éditeurs à prendre des mesures techniques et juridiques supplémentaires.

La préoccupation allait plus loin que l'exploration elle-même. La synthèse et la reproduction persistaient même lorsque PerplexityBot respectait robots.txt pour son exploration directe, car Perplexity pouvait accéder au même contenu et le résumer par d'autres moyens : copies en cache, sources de données tierces ou infrastructure de navigation en direct. Le résultat net, du point de vue des éditeurs, était que leur contenu apparaissait dans les réponses de Perplexity quels que soient leurs paramètres robots.txt.

Chronologie de la controverse de conformité de PerplexityBot de 2024 à 2025 : les éditeurs ajoutent un blocage robots.txt Disallow: PerplexityBot, le contenu restreint apparaît toujours sous forme d'extraits dans les réponses de Perplexity, Wired et The Atlantic signalent une non-conformité apparente, Perplexity conteste ces caractérisations avec des explications incohérentes, et les éditeurs passent au blocage par IP et à des actions juridiques ou liées aux conditions d'utilisation

La controverse s'est déroulée à peu près dans cet ordre entre 2024 et 2025 :

  1. Les éditeurs ont ajouté Disallow: PerplexityBot à leur robots.txt.
  2. Le contenu restreint a continué d'apparaître, sous forme d'extraits dans les réponses IA de Perplexity.
  3. Wired et The Atlantic ont signalé l'apparente non-conformité.
  4. Perplexity a contesté ces caractérisations ; ses explications étaient incohérentes.
  5. Plusieurs éditeurs sont passés au blocage par IP ainsi qu'à des actions juridiques ou liées aux conditions d'utilisation.

Le blocage par robots.txt conserve une utilité pour PerplexityBot, mais sa portée est limitée face à un produit de recherche disposant de plusieurs canaux d'acquisition de contenu. Le blocage au niveau de l'IP et une surveillance active offrent une application plus fiable.


Comment Bloquer PerplexityBot avec robots.txt

Réponse rapide : Ajoutez PerplexityBot à votre robots.txt. Compte tenu de la controverse de conformité de 2024, mettez également en place un blocage au niveau de l'IP et envisagez d'ajouter à vos conditions d'utilisation une clause juridique restreignant explicitement la collecte de données d'entraînement IA et la synthèse par recherche IA.

Pour bloquer PerplexityBot sur l'ensemble de votre site :

User-agent: PerplexityBot
Disallow: /

Pour un contrôle au niveau des chemins :

User-agent: PerplexityBot
Disallow: /premium/
Disallow: /members/
Disallow: /api/
Allow: /public/

Compte tenu de la controverse de 2024, considérez robots.txt comme une déclaration d'intention plutôt que comme un contrôle technique strict pour PerplexityBot. La même approche par crawler déclaré est plus fiable pour les crawlers ayant un historique de conformité plus propre, comme CCBot.


Blocage au Niveau de l'IP

Réponse rapide : Perplexity publie les plages d'IP de PerplexityBot dans sa documentation. Refuser ces plages au niveau du pare-feu ou du CDN fournit une application indépendante du fait que le crawler lise ou non robots.txt. Pour les éditeurs ou les sites à fort volume de contenu, le blocage d'IP est l'approche la plus fiable au vu de l'historique de conformité.

Repérez les plages d'IP actuelles de Perplexity dans sa documentation officielle sur docs.perplexity.ai. Ajoutez-les aux règles de refus de votre pare-feu, de la configuration de votre edge CDN ou de votre reverse proxy. Réexaminez cette liste chaque trimestre, car les plages d'IP de l'infrastructure d'exploration s'étendent à mesure que le volume d'exploration augmente.


PerplexityBot vs. Perplexity Shopper : une Distinction Cruciale

Réponse rapide : PerplexityBot (le crawler d'indexation) et Perplexity Shopper (l'agent transactionnel) sont des systèmes distincts. Bloquer PerplexityBot n'affecte pas Perplexity Shopper. Shopper utilise une véritable session de navigateur avec un user-agent Chrome standard. Il nécessite une détection au niveau du navigateur, et non un blocage par robots.txt.

SystèmeObjectifUser-agentApproche de détection
PerplexityBotExplore et indexe le contenuPerplexityBot/1.0 (déclaré)robots.txt + blocage d'IP
Perplexity ShopperFinalise des achats pour les utilisateursChrome standard (non déclaré)Signaux comportementaux au niveau du navigateur

Les ingénieurs qui ajoutent PerplexityBot à robots.txt et considèrent le problème Perplexity comme résolu n'ont traité qu'un seul des deux systèmes. Perplexity Shopper reste invisible pour tout ce qui relève de l'approche par liste de blocage. Lors des tests contrôlés de cside, les outils traditionnels ont raté des agents IA dans 81 scénarios de test contrôlés sur 100, et Shopper est exactement le type de session que ces outils manquent.

Voici à quoi cela ressemble en pratique : une session Perplexity Shopper chargée d'acheter un produit précis ouvre une véritable session Chrome, navigue vers la page de catégorie d'un détaillant, filtre selon la spécification demandée, sélectionne un produit et passe au checkout. Tous les signaux au niveau du réseau sont irréprochables : une IP résidentielle, un handshake TLS standard et une chaîne de user-agent Chrome indiscernable de celle d'un acheteur humain. L'indice comportemental se situe dans la couche du navigateur. L'agent parcourt le filtrage des produits sans aucune variance du curseur, sélectionne le premier résultat éligible sans s'arrêter pour comparer les alternatives, et saisit les données d'adresse à un intervalle de frappe uniforme sans le moindre événement de correction. L'instrumentation de détection d'agents IA de cside capture ces anomalies au niveau de l'interaction avant que tout événement de checkout ne se déclenche, offrant aux opérateurs une visibilité que la couche réseau ne fournit jamais.

Tableau de bord de détection d'agents IA de cside


Ce que le Blocage de PerplexityBot Accomplit Réellement

Réponse rapide : Un blocage de PerplexityBot empêche le crawler déclaré d'indexer directement votre contenu lors des futurs cycles d'exploration. Il n'empêche pas Perplexity de référencer du contenu déjà indexé, d'accéder à votre contenu via des sources tierces, ni de faire remonter des synthèses dans les résultats de recherche IA par des canaux autres que l'exploration directe.

Schéma des canaux montrant l'acquisition de contenu par Perplexity via le robot déclaré PerplexityBot, le contenu déjà indexé ou mis en cache, les sources tierces et les sessions de navigateur en direct, robots.txt ne couvrant que le chemin du robot déclaré

Le robots.txt et le blocage par IP ne régissent que le crawl déclaré. Les trois autres canaux atteignent une réponse de Perplexity malgré tout :

Canal d'acquisitionCe que c'estBloqué par robots.txt + blocage IP ?
Crawl déclaré (PerplexityBot)Le robot nommé de Perplexity effectuant des requêtes directesOui (le seul chemin qu'il régit)
Copies web en cacheContenu déjà indexé dans la base de connaissances de PerplexityNon (hors de la portée de robots.txt)
Licences de données tiercesJeux de données syndiqués, agrégés et sous licenceNon (hors de la portée de robots.txt)
Navigation en direct à la demandeRécupération ponctuelle lorsqu'une requête d'utilisateur déclenche une rechercheNon (hors de la portée de robots.txt)

C'est la limite que la controverse de 2024 a mise en lumière. Robots.txt empêche un crawler spécifique de faire de nouvelles requêtes. Il ne purge pas le contenu déjà indexé de la base de connaissances d'un produit de recherche, et il n'empêche pas l'acquisition de contenu via des canaux alternatifs que le crawler lui-même n'utilise pas directement.

Pour les organisations ayant des exigences strictes (contenu payant, recherche propriétaire, matériel sous licence), la combinaison de robots.txt, du blocage d'IP, d'une clause juridique dans les conditions d'utilisation et d'une protection technique du contenu telle que les murs d'authentification et le rendu dynamique offre une posture de protection plus complète que n'importe quelle approche isolée.

Mike Kutlu
Client-Side Security Consultant

Client-side security consultant at cside. 10+ years of experience implementing technology solutions for enterprises (previously at Oracle, Cloudflare, and Splunk). Now helping teams use client-side intelligence to catch & reduce fraud.

FAQ

Frequently Asked Questions

PerplexityBot est le crawler web de Perplexity qui indexe le contenu pour son moteur de recherche IA. Lorsque les utilisateurs interrogent Perplexity, les réponses générées par l'IA s'appuient sur le contenu collecté par PerplexityBot. En 2024, plusieurs éditeurs ont signalé des problèmes de conformité : leur contenu pourtant restreint par robots.txt apparaissait dans les réponses de Perplexity malgré un blocage explicite du bot.

Ajoutez `User-agent: PerplexityBot` suivi de `Disallow: /` à votre fichier `robots.txt`. Compte tenu de la controverse de conformité de 2024, complétez cette mesure par un blocage au niveau de l'IP en utilisant les plages d'IP publiées par Perplexity dans sa documentation sur les crawlers. Considérez `robots.txt` comme une déclaration d'intention plutôt que comme un contrôle technique strict pour ce crawler en particulier.

Plusieurs éditeurs ont signalé en 2024 que Perplexity faisait remonter des résumés détaillés de leur contenu dans les résultats de recherche IA, malgré des règles robots.txt bloquant PerplexityBot. Perplexity a contesté certains aspects de ces signalements. L'épisode a été documenté par Wired, The Atlantic et d'autres médias, et il a établi que la conformité de PerplexityBot est plus activement contestée que celle de la plupart des autres grands crawlers IA.

PerplexityBot est un crawler d'indexation doté d'un user-agent déclaré. Perplexity Shopper est un agent transactionnel qui utilise une véritable session de navigateur et présente un user-agent Chrome standard. Bloquer PerplexityBot n'a aucun effet sur Perplexity Shopper. Les sessions de Shopper nécessitent une détection comportementale au niveau du navigateur pour être identifiées et contrôlées.

Les stratégies juridiques varient selon la juridiction et le type de contenu concerné. Ajouter à vos conditions d'utilisation une clause explicite interdisant la collecte de données d'entraînement IA et la synthèse par recherche IA crée une base légale pour faire valoir vos droits, en complément du blocage technique. Sur la période 2024-2025, des éditeurs ont engagé des recours fondés à la fois sur les conditions d'utilisation et sur le droit d'auteur.

Surveillez et sécurisez vos scripts tiers

Gain full visibility and control over every script delivered to your users to enhance site security and performance.

Commencez gratuitement, ou essayez Business avec un essai de 14 jours.

Interface du tableau de bord cside affichant la surveillance des scripts et les analyses de sécurité
Related Articles
Réserver une démonstration

Envie de passer tout ça en revue avec un ingénieur ?

Trente minutes, sur votre propre site. Pas de slides.

Nous vous montrerons :

Quels scripts tiers s'exécutent actuellement sur votre site
Où vous en êtes sur les exigences PCI DSS 6.4.3 et 11.6.1
Quelle part de votre trafic provient de bots et d'agents IA

Vous préférez simplement poser une question ?

Recherche de créneaux…

Humains uniquement. On le saurait.

Un problème pour réserver ? Ouvrir le calendrier dans un nouvel onglet

Quel problème cherchez-vous à résoudre ?

Dites-le-nous en une ligne et nous reviendrons vers vous avec quelque chose d'utile, pas un discours générique.

Nous aidons souvent sur :

Voir quels scripts tiers s'exécutent sur votre site
Les preuves pour PCI DSS 6.4.3 et 11.6.1
Les bots, les agents IA et le vol de comptes

Vous préférez réserver un créneau ? Choisir un créneau