Aller au contenu
UCP
Menu

Infrastructure · Crawlers IA

Search, Agent, Training : comment contrôler les robots IA sur votre boutique en ligne

En 2026, ce ne sont plus seulement les moteurs de recherche qui lisent votre boutique, mais une flotte de robots IA aux intentions très différentes. Les traiter tous pareil — les bloquer ou les laisser passer en bloc — est une erreur coûteuse. Voici comment décider par finalité.

La rédaction · Mis à jour : juillet 2026 · Requête principale : contrôler robots IA e-commerce

Un robot qui indexe votre catalogue pour répondre à une question n'a rien à voir avec un robot qui aspire votre contenu pour entraîner un modèle, ni avec un agent qui agit en temps réel pour un acheteur. En 2026, la bonne question n'est plus « faut-il bloquer l'IA ? » mais « quel robot, pour quoi faire ? ».

Le trafic des agents IA a changé d'échelle

La lecture automatisée du web n'est plus marginale. D'après le rapport trimestriel de DataDome (données d'avril à juin 2026, réseau de 400+ entreprises), le nombre de requêtes d'agents IA a bondi de 45 % en un trimestre, passant de 12,2 milliards au T1 à 17,7 milliards au T2 2026.

Requêtes d'agents IA par mois, T2 2026 Avril 4,77 milliards, mai 6,29 milliards, juin 6,60 milliards de requêtes d'agents IA. Source : DataDome, AI Traffic Report Q2 2026. 4,77 Md Avril 6,29 Md Mai 6,60 Md Juin
Requêtes mensuelles d'agents IA sur le réseau DataDome, T2 2026 (+45 % vs T1). Source : DataDome, AI Traffic Report Q2 2026.

Le rapport souligne un point capital pour les marchands : volume de crawl et valeur de référencement évoluent en sens inverse. ChatGPT-User (l'agent déclenché par l'utilisateur) a vu son volume de requêtes baisser de 6 % sur le trimestre, alors même que ChatGPT reste, de loin, la première source de trafic de référence issu de l'IA, avec 80 à 88 % des referrals chaque mois. Autrement dit : ce n'est pas celui qui crawle le plus qui envoie le plus de visiteurs. D'où l'importance de raisonner par finalité, pas par volume.

La matrice par finalité : Search, Agent, Training

Cloudflare, qui protège une large part du web, a formalisé en juillet 2026 une taxonomie en trois usages plutôt qu'une étiquette binaire « IA / pas IA ». La question n'est plus « est-ce un robot IA ? » mais « que fait-il de mon contenu ? » :

  • Search — le robot collecte ou indexe votre contenu pour pouvoir répondre à des questions à son sujet plus tard. C'est ce qui vous rend citable et recommandable.
  • Agent — un comportement automatisé qui agit, en temps réel, pour le compte d'une personne, afin d'accomplir une tâche immédiate (comparer, ajouter au panier, acheter).
  • Training — un crawler qui récupère votre contenu pour entraîner ou affiner un modèle.

Cette distinction a une conséquence concrète : à partir du 15 septembre 2026, sur les pages qui affichent des publicités, Cloudflare bloquera par défaut les catégories Training et Agent pour les nouveaux domaines, tout en laissant Search autorisée. Les propriétaires peuvent modifier ces préférences avant cette date. Un marchand doit donc savoir précisément ce qu'il autorise.

Les robots à connaître (et à trier) côté e-commerce

OpenAI a séparé ses agents par finalité, chacun contrôlable indépendamment dans robots.txt. Le principe est explicite dans leur documentation : on peut autoriser la recherche tout en refusant l'entraînement.

RobotFinalitéEnjeu pour un marchand
OAI-SearchBotRecherche (ChatGPT Search)À autoriser : sinon absent des réponses de recherche ChatGPT
GPTBotEntraînementChoix stratégique : visibilité future vs contrôle du contenu
OAI-AdsBotValidation des pages de publicitéNe visite que les pages soumises comme annonces
ChatGPT-UserAction déclenchée par l'utilisateurAgent temps réel : lié aux parcours d'achat assistés

Côté Google, l'équivalent est Google-Extended (entraînement Gemini), distinct de Googlebot ; côté Perplexity, PerplexityBot. Chacun peut être autorisé ou refusé séparément. OpenAI précise qu'après une mise à jour de robots.txt, il faut compter environ 24 heures pour que ses systèmes de recherche s'ajustent.

Le piège à éviter

Bloquer « tous les robots IA » d'un seul geste — via une règle générique ou un réglage Cloudflare mal calibré — peut couper l'accès des crawlers de recherche. Résultat : votre boutique devient invisible dans ChatGPT, Perplexity et Gemini, alors même que ce sont eux qui envoient des acheteurs. La protection contre l'entraînement ne doit pas se payer d'une disparition des réponses.

La vidéo ci-dessous (chaîne Ahrefs) détaille les vérifications techniques — robots.txt, GPTBot, llms.txt, et le fameux réglage Cloudflare par défaut — qui peuvent empêcher une IA d'accéder à votre site :

Source : Ahrefs — « Technical SEO for AI: Robots.txt, GPTBot & llms.txt Explained » (mai 2026).

Un robots.txt orienté commerce agentique

Pour une boutique qui veut être découverte par les IA tout en gardant la main sur l'entraînement, une base raisonnable ressemble à ceci (à adapter à votre politique) :

# Recherche IA — autoriser pour rester citable
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Entraînement — choix stratégique (ici : refusé)
User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Ne jamais bloquer les pages produit/catalogue pour la recherche
Sitemap: https://votre-boutique.com/sitemap.xml

Attention : robots.txt exprime une politique déclarée. La réalité observée peut différer (règles WAF, pare-feu, CDN, robots qui ne respectent pas la norme). C'est pourquoi il faut vérifier ce qui se passe réellement, pas seulement ce que le fichier affirme.

Auditer l'accès de votre boutique aux crawlers IA

Savoir quels robots vous autorisez — et vérifier que cette politique est cohérente sur toutes vos surfaces — est le premier facteur, le plus bloquant, d'un audit GEO. Si les crawlers de recherche sont bloqués, aucun autre effort d'optimisation ne compte. Sur l'écosystème Shopify, l'audit GEO de VerityScore vérifie précisément cet accès crawler : lecture du robots.txt, détection des règles qui bloquent GPTBot, OAI-SearchBot ou Google-Extended, et cohérence des surfaces de découverte (sitemap, agent-card.json, manifestes UCP/ACP).

Vous pouvez tester gratuitement l'accessibilité IA d'une boutique Shopify (aperçu sans e-mail) pour repérer, avant tout le reste, si un réglage bloque silencieusement votre visibilité. C'est le contrôle numéro un : rendre la boutique lisible par les bons robots.

Contrôle des crawlers et UCP : lisibilité d'abord

Cette hygiène d'accès est le socle du Universal Commerce Protocol. Un agent ne peut ni comprendre, ni faire confiance, ni transacter avec une boutique qu'il n'a pas le droit de lire. Autoriser les robots de recherche, exposer un catalogue lisible (Catalog MCP, schema.org) et publier les bonnes surfaces de découverte : c'est la condition d'entrée pour exister dans le commerce agentique. Le contrôle par finalité n'est pas un frein à l'IA — c'est la façon d'y participer sans se faire aspirer.

Foire aux questions

Bloquer GPTBot me fait-il disparaître de ChatGPT ?

Pas de la recherche. GPTBot concerne l'entraînement ; c'est OAI-SearchBot qui gère l'apparition dans les résultats de recherche de ChatGPT. Vous pouvez refuser GPTBot et rester visible via OAI-SearchBot.

robots.txt suffit-il à contrôler les agents IA ?

Non. robots.txt est une politique déclarée que les robots respectueux suivent, mais les contrôles au niveau du réseau (Cloudflare, WAF) et la vérification cryptographique des agents (Web Bot Auth) prennent de plus en plus le relais pour ce qui relève de l'action en temps réel.

Un petit commerçant doit-il s'en préoccuper ?

Oui, surtout lui. Pour une petite boutique, le risque n'est pas tant l'entraînement que l'invisibilité : un réglage par défaut trop restrictif peut l'empêcher d'apparaître dans les réponses IA qui orientent les achats.

Pour aller plus loin