Générateur de dégradés CSS
Dégradés linéaires, radiaux et coniques.
Design
Fichiers robots.txt et llms.txt.
C'est un fichier texte à la racine du domaine, aux règles simples mais piégeuses.
Il se compose de blocs. Chaque bloc commence par User-agent, qui désigne le robot concerné, suivi des règles Allow et Disallow.
L'astérisque dans User-agent signifie « tous les robots qui n'ont pas leur propre bloc ». Et voici le point important : un robot disposant de son bloc ignore complètement celui de l'astérisque, il ne les additionne pas.
C'est l'erreur la plus fréquente : mettre les règles générales dans le bloc de l'astérisque, puis ajouter un bloc dédié à un moteur avec une seule règle, ce qui annule tout le reste pour lui.
Entre deux règles qui correspondent, c'est la plus spécifique qui l'emporte, pas la première rencontrée.
Le fichier doit se trouver exactement à la racine : votredomaine.fr/robots.txt. Dans un sous-répertoire il n'est pas lu, et chaque sous-domaine a besoin du sien.
Une précision essentielle : robots.txt empêche l'exploration, pas l'indexation. Une URL bloquée peut continuer d'apparaître dans les résultats si des liens pointent vers elle. Pour qu'elle disparaisse, il faut un noindex — et pour le lire, le robot doit pouvoir entrer, donc vous ne pouvez pas la bloquer en même temps.
Un sujet récent et mouvant, sur lequel il vaut mieux trancher consciemment.
Les robots des modèles de langage collectent du contenu pour l'entraînement et pour répondre à des questions en temps réel. Ce sont deux usages distincts, et on ne souhaite pas forcément la même chose pour chacun.
La proposition llms.txt est un fichier à la racine qui oriente ces systèmes sur votre contenu : quelles pages sont pertinentes, comment il est organisé, et ce que vous préféreriez qu'ils en fassent.
Par ailleurs, les principaux robots d'IA respectent des règles dans robots.txt sous leurs propres noms d'agent, que vous pouvez autoriser ou bloquer comme n'importe quel autre.
L'arbitrage n'est pas évident. Bloquer protège votre contenu de l'entraînement mais vous exclut aussi des réponses des assistants, source de visites en croissance. Autoriser fait l'inverse.
Une position intermédiaire que retiennent beaucoup d'éditeurs : autoriser l'exploration destinée aux réponses avec citation, et bloquer celle destinée à l'entraînement, lorsque le robot distingue les deux.
Gardez en tête que ni robots.txt ni llms.txt ne sont des mécanismes contraignants : ce sont des déclarations de préférence que les acteurs respectueux suivent. En France, la protection juridique de votre contenu relève du droit d'auteur et des droits voisins, pas d'un fichier texte — et l'opposition à la fouille de textes et de données doit être exprimée par des moyens appropriés pour produire effet.
Un robots.txt mal fait fait plus de mal que pas de robots.txt du tout.
À bloquer : espaces d'administration, paniers, résultats de recherche interne, URL à paramètres de filtre engendrant des milliers de combinaisons, pages de remerciement.
À ne jamais bloquer : le CSS et le JavaScript. Les moteurs ont besoin de rendre la page pour l'évaluer, et bloquer ces ressources la leur montre cassée. C'est une erreur classique héritée d'il y a quinze ans.
Ne bloquez pas non plus les images si la recherche d'images vous intéresse.
Et n'utilisez jamais robots.txt pour dissimuler des informations sensibles : le fichier est public, et le lire est le moyen le plus rapide de découvrir quels chemins existent. Ce qui ne doit pas être vu se protège par authentification, pas par un Disallow.
Ajoutez la ligne Sitemap avec l'URL complète de votre plan de site. C'est le moyen le plus simple de le faire trouver.
Et vérifiez le fichier après mise en ligne. Un Disallow: / laissé par erreur après une migration est l'une des façons les plus rapides de disparaître des moteurs, et cela se découvre en général des semaines plus tard.
Exactement à la racine du domaine. Dans un sous-répertoire il n'est pas lu, et chaque sous-domaine a le sien.
Non. Un robot ayant son propre bloc ignore entièrement celui de l'astérisque.
Il ne faut pas. Les moteurs doivent rendre la page et la verraient cassée.
Non. Cela empêche l'exploration, pas l'indexation. Pour cela il faut un noindex.
Un fichier à la racine qui oriente les systèmes d'IA sur votre contenu et vos préférences d'usage.
Non.