Tous les outils fonctionnent dans votre navigateur — vos fichiers ne quittent jamais votre appareil.
All tools154

Design

Générateur de robots.txt

Fichiers robots.txt et llms.txt.

Ce que fait cet outil. Cet outil génère votre fichier robots.txt avec des règles bien formées, ainsi qu'un llms.txt, le fichier par lequel on déclare ce que les robots d'intelligence artificielle peuvent faire de votre contenu.
Fonctionne dans le navigateurAucun envoiSans inscriptionFonctionne hors ligne

Comment utiliser Générateur de robots.txt

  1. Choisissez les chemins à autoriser ou à interdire.
  2. Ajoutez l'adresse de votre sitemap.
  3. Téléchargez le fichier et placez-le à la racine du domaine.

Comment fonctionne robots.txt

C'est un fichier texte à la racine du domaine, aux règles simples mais piégeuses.

Il se compose de blocs. Chaque bloc commence par User-agent, qui désigne le robot concerné, suivi des règles Allow et Disallow.

L'astérisque dans User-agent signifie « tous les robots qui n'ont pas leur propre bloc ». Et voici le point important : un robot disposant de son bloc ignore complètement celui de l'astérisque, il ne les additionne pas.

C'est l'erreur la plus fréquente : mettre les règles générales dans le bloc de l'astérisque, puis ajouter un bloc dédié à un moteur avec une seule règle, ce qui annule tout le reste pour lui.

Entre deux règles qui correspondent, c'est la plus spécifique qui l'emporte, pas la première rencontrée.

Le fichier doit se trouver exactement à la racine : votredomaine.fr/robots.txt. Dans un sous-répertoire il n'est pas lu, et chaque sous-domaine a besoin du sien.

Une précision essentielle : robots.txt empêche l'exploration, pas l'indexation. Une URL bloquée peut continuer d'apparaître dans les résultats si des liens pointent vers elle. Pour qu'elle disparaisse, il faut un noindex — et pour le lire, le robot doit pouvoir entrer, donc vous ne pouvez pas la bloquer en même temps.

llms.txt et les robots d'IA

Un sujet récent et mouvant, sur lequel il vaut mieux trancher consciemment.

Les robots des modèles de langage collectent du contenu pour l'entraînement et pour répondre à des questions en temps réel. Ce sont deux usages distincts, et on ne souhaite pas forcément la même chose pour chacun.

La proposition llms.txt est un fichier à la racine qui oriente ces systèmes sur votre contenu : quelles pages sont pertinentes, comment il est organisé, et ce que vous préféreriez qu'ils en fassent.

Par ailleurs, les principaux robots d'IA respectent des règles dans robots.txt sous leurs propres noms d'agent, que vous pouvez autoriser ou bloquer comme n'importe quel autre.

L'arbitrage n'est pas évident. Bloquer protège votre contenu de l'entraînement mais vous exclut aussi des réponses des assistants, source de visites en croissance. Autoriser fait l'inverse.

Une position intermédiaire que retiennent beaucoup d'éditeurs : autoriser l'exploration destinée aux réponses avec citation, et bloquer celle destinée à l'entraînement, lorsque le robot distingue les deux.

Gardez en tête que ni robots.txt ni llms.txt ne sont des mécanismes contraignants : ce sont des déclarations de préférence que les acteurs respectueux suivent. En France, la protection juridique de votre contenu relève du droit d'auteur et des droits voisins, pas d'un fichier texte — et l'opposition à la fouille de textes et de données doit être exprimée par des moyens appropriés pour produire effet.

Que bloquer et que ne pas bloquer

Un robots.txt mal fait fait plus de mal que pas de robots.txt du tout.

À bloquer : espaces d'administration, paniers, résultats de recherche interne, URL à paramètres de filtre engendrant des milliers de combinaisons, pages de remerciement.

À ne jamais bloquer : le CSS et le JavaScript. Les moteurs ont besoin de rendre la page pour l'évaluer, et bloquer ces ressources la leur montre cassée. C'est une erreur classique héritée d'il y a quinze ans.

Ne bloquez pas non plus les images si la recherche d'images vous intéresse.

Et n'utilisez jamais robots.txt pour dissimuler des informations sensibles : le fichier est public, et le lire est le moyen le plus rapide de découvrir quels chemins existent. Ce qui ne doit pas être vu se protège par authentification, pas par un Disallow.

Ajoutez la ligne Sitemap avec l'URL complète de votre plan de site. C'est le moyen le plus simple de le faire trouver.

Et vérifiez le fichier après mise en ligne. Un Disallow: / laissé par erreur après une migration est l'une des façons les plus rapides de disparaître des moteurs, et cela se découvre en général des semaines plus tard.

Questions fréquentes

Où placer le fichier ?

Exactement à la racine du domaine. Dans un sous-répertoire il n'est pas lu, et chaque sous-domaine a le sien.

Les règles de l'astérisque s'ajoutent-elles aux règles spécifiques ?

Non. Un robot ayant son propre bloc ignore entièrement celui de l'astérisque.

Peut-on bloquer CSS et JavaScript ?

Il ne faut pas. Les moteurs doivent rendre la page et la verraient cassée.

Cela empêche-t-il l'apparition dans les résultats ?

Non. Cela empêche l'exploration, pas l'indexation. Pour cela il faut un noindex.

Qu'est-ce que llms.txt ?

Un fichier à la racine qui oriente les systèmes d'IA sur votre contenu et vos préférences d'usage.

Mes données sont-elles transmises ?

Non.

Guides pour Générateur de robots.txt