GEO

Mis à jour le 18 septembre 2026

Faut-il bloquer les robots des IA sur son site ?

Le débat oppose deux camps sincères : ceux qui refusent que leur travail nourrisse gratuitement des modèles, et ceux qui veulent exister dans les réponses des assistants. Pour un commerce de proximité, le calcul n'est pas le même que pour un média, et il penche assez nettement d'un côté.

Naskell4 min de lecture

L'essentiel

Tous les robots des IA ne font pas la même chose. Certains collectent du contenu pour entraîner des modèles, d'autres vont chercher une page précise parce qu'un utilisateur vient de poser une question. Bloquer les premiers est un choix de principe défendable ; bloquer les seconds revient à refuser des visiteurs qui vous cherchaient.

Deux familles de robots, deux décisions différentes

La confusion vient de ce qu'on met le même mot sur deux comportements très différents.

Les robots d'entraînement parcourent le web pour constituer les corpus qui servent à entraîner les modèles. Le contenu qu'ils collectent est absorbé, mélangé, et vous n'en tirez aucune visite. C'est le sujet des débats sur le droit d'auteur, et c'est là que la contestation est la plus fondée.

Les robots de récupération à la demande interviennent quand quelqu'un pose une question à un assistant et que celui-ci a besoin d'aller lire des pages pour répondre. Ils citent généralement leur source. Ce sont, littéralement, des visiteurs envoyés par une question.

Un même éditeur opère souvent les deux, sous des noms d'agents distincts. Bloquer en bloc, sans regarder lequel fait quoi, produit donc rarement l'effet voulu.

Ce que le blocage est, et ce qu'il n'est pas

Le fichier robots.txt, à la racine de votre site, contient des consignes. Ce n'est pas un mécanisme de sécurité : il n'empêche personne d'accéder à une page publique, il indique aux robots ce qu'ils sont invités à ne pas faire.

Les grands acteurs déclarent le respecter, et il n'y a pas de raison particulière d'en douter. En revanche, un acteur qui ne s'annonce pas, ou qui se présente sous un autre nom, ne sera pas arrêté par ce fichier. Bloquer donne une garantie de principe, pas une garantie technique.

Une conséquence pratique : bloquer ne récupère rien de ce qui a déjà été collecté. La décision vaut pour l'avenir.

Le calcul pour un commerce de proximité

Posez-vous la question du contenu réel de votre site.

Un coiffeur, un restaurant, un institut publient des horaires, une adresse, une carte, des prestations, des tarifs, quelques photos et parfois des articles. Ce corpus n'a pas de valeur d'entraînement significative : ce ne sont pas des textes rares dont la disparition changerait quelque chose à un modèle.

En revanche, sa présence dans les réponses des assistants a une valeur immédiate pour vous. Quand quelqu'un demande à un assistant un restaurant ouvert le dimanche dans le quinzième, vous voulez être dans la réponse. C'est exactement ce que nous avons mesuré en interrogeant les IA sur les agences web parisiennes : les commerces de proximité sont massivement absents de ces réponses, et cette absence est une place vide, pas une protection.

Bloquer, dans ce cas, revient à fermer une porte pour protéger une pièce vide.

Quand le blocage se justifie

L'arbitrage change dès que votre contenu est votre produit.

Un média qui vit de ses abonnements, un formateur dont les cours sont la valeur, un photographe dont les images sont l'œuvre, un cabinet dont les analyses constituent le savoir-faire : dans ces cas, laisser un modèle absorber la production pour la restituer sans renvoi ni rémunération est une perte réelle, et le refus est une position cohérente.

La bonne façon de le faire est alors sélective : refuser les agents d'entraînement, autoriser ceux qui vont chercher une page pour répondre à une question et qui citent la source. Vous gardez la visibilité, vous refusez l'absorption.

Cela suppose de maintenir la liste des agents à jour, car elle bouge. C'est un petit travail récurrent, pas une décision qu'on prend une fois pour toutes.

La question intermédiaire, souvent la bonne

Il existe une troisième voie, plus intéressante que le oui ou le non : décider quoi laisser lire.

Vous pouvez parfaitement ouvrir vos pages de service, vos horaires et vos articles, et fermer un espace client, des documents internes ou des pages sans intérêt public. C'est du bon sens, et cela vaut d'ailleurs pour tous les robots, pas seulement ceux des IA.

Dans le même esprit, le fichier llms.txt permet de présenter volontairement les pages que vous jugez les plus utiles, plutôt que de laisser un robot deviner. Nous en avons un sur ce site : c'est l'inverse d'un blocage, une manière de dire ce qu'on veut voir cité.

Notre position

Sur les sites de commerce que nous réalisons, nous laissons les robots des IA accéder au contenu public, et nous le disons à nos clients. Le raisonnement est simple : un commerce local a beaucoup à gagner à être présent dans les réponses et très peu à perdre en laissant lire des horaires et une carte.

Nous appliquons cette règle à notre propre site. Ce n'est pas neutre, puisque nos articles nous coûtent du travail. Nous préférons être cités que protégés.

Si votre situation est celle d'un producteur de contenu, l'inverse peut être le bon choix. Ce qui serait dommage, c'est de bloquer par réflexe défensif, sans regarder ce que vous protégez.

FAQ

Dans le fichier robots.txt à la racine du site, en nommant les agents concernés et en leur interdisant l'accès. C'est une consigne, pas une barrière technique : elle est respectée par les acteurs qui ont choisi de la respecter.

Cela dépend du robot bloqué. Certains agents servent l'entraînement, d'autres servent à aller chercher une page au moment où un utilisateur pose une question. Bloquer les seconds revient à disparaître des réponses tout en restant dans les résultats classiques.

Rarement. Le contenu d'un site de commerce, ce sont des horaires, des prestations, des tarifs et une adresse. Ces informations n'ont aucune valeur d'entraînement particulière, et leur diffusion dans les réponses des assistants est exactement ce que vous recherchez.

Là, l'arbitrage est réel et légitime. Un média, un formateur, un photographe peuvent vouloir refuser que leur production serve à entraîner un modèle qui la remplacera. Le blocage est alors une position défendable, à condition de savoir ce qu'elle coûte en visibilité.

Prochaine étape

Un site à créer, une visibilité à réparer ? Parlons-en.

Diagnostic visibilité + réservation : 30 minutes, gratuit, sans engagement. Vous repartez avec un plan chiffré sur notre grille publique.

L'auteur

Naskell

Studio web à Paris. Nous aidons les commerces à être trouvés sur Google et cités par les IA : sites vitrines, réservation en ligne, SEO local & GEO. Ce blog applique exactement la méthode que nous déployons pour nos clients.