CSS-gradient generator
Lineaire, radiale en conische verlopen.
Ontwerp
robots.txt- en llms.txt-bestanden.
Het is een tekstbestand in de hoofdmap van het domein met eenvoudige maar verraderlijke regels.
Het bestaat uit blokken. Elk blok begint met User-agent, dat aangeeft voor welke crawler het geldt, gevolgd door Allow- en Disallow-regels.
De asterisk bij User-agent betekent "alle crawlers zonder eigen blok". En dit is het belangrijke punt: een crawler met een eigen blok negeert het asterisk-blok volledig, hij telt ze niet bij elkaar op.
Dat is de meest gemaakte fout: algemene regels in het asterisk-blok zetten en daarna een eigen blok voor één zoekmachine toevoegen met één regel, waardoor al het andere voor die crawler vervalt.
Bij twee regels die allebei passen wint de meest specifieke, niet de eerste.
Het bestand moet precies in de hoofdmap staan: jouwdomein.nl/robots.txt. In een submap wordt het niet gelezen, en elk subdomein heeft zijn eigen bestand nodig.
Een belangrijke nuance: robots.txt voorkomt crawlen, niet indexeren. Een geblokkeerde URL kan nog steeds in de resultaten verschijnen als er links naartoe wijzen. Om dat te voorkomen heb je noindex nodig — en om die te lezen moet de crawler binnen kunnen, dus je kunt hem niet tegelijk blokkeren.
Een recent en nog niet uitgekristalliseerd onderwerp, waarover je bewust een keuze wilt maken.
Crawlers van taalmodellen verzamelen inhoud voor training én om vragen live te beantwoorden. Dat zijn twee verschillende doeleinden, en niet iedereen wil bij allebei hetzelfde.
Het voorstel llms.txt is een bestand in de hoofdmap dat die systemen wegwijs maakt in je inhoud: welke pagina's relevant zijn, hoe alles is georganiseerd, en wat je liever wel of niet ziet gebeuren.
Daarnaast houden de belangrijkste AI-crawlers zich aan regels in robots.txt onder hun eigen agentnaam, die je net als elke andere kunt toestaan of blokkeren.
De afweging is niet vanzelfsprekend. Blokkeren beschermt je inhoud tegen training maar houdt je ook buiten de antwoorden van assistenten, en dat is een groeiende bezoekersbron. Toestaan doet het omgekeerde.
Een tussenpositie die veel uitgevers kiezen: crawlen voor antwoorden met bronvermelding toestaan, en crawlen voor training blokkeren, voor zover de crawler die twee onderscheidt.
Houd er rekening mee dat noch robots.txt noch llms.txt afdwingbaar is: het zijn voorkeursverklaringen die nette partijen opvolgen. De juridische bescherming van je inhoud komt uit het auteursrecht en de databankenwet, niet uit een tekstbestand — en een voorbehoud tegen tekst- en datamining moet op passende wijze kenbaar worden gemaakt om effect te hebben.
Een slecht robots.txt richt meer schade aan dan helemaal geen.
Wel blokkeren: beheeromgevingen, winkelwagens, interne zoekresultaten, URL's met filterparameters die duizenden combinaties opleveren, en bedankpagina's.
Nooit blokkeren: CSS en JavaScript. Zoekmachines moeten de pagina renderen om hem te beoordelen, en die bestanden blokkeren laat hem kapot zien. Dat is een klassieke fout uit vijftien jaar geleden.
Blokkeer ook geen afbeeldingen als je iets aan afbeeldingzoekopdrachten hebt.
En gebruik robots.txt nooit om gevoelige informatie te verbergen: het bestand is openbaar, en het lezen ervan is de snelste manier om te ontdekken welke paden er bestaan. Wat niet gezien mag worden bescherm je met authenticatie, niet met een Disallow.
Neem de regel Sitemap op met de volledige URL van je sitemap. Dat is de eenvoudigste manier om hem gevonden te laten worden.
En controleer het bestand na het plaatsen. Een Disallow: / die per ongeluk na een migratie is blijven staan, is een van de snelste manieren om uit de zoekmachines te verdwijnen, en dat wordt meestal weken later pas ontdekt.
Precies in de hoofdmap van het domein. In een submap wordt het niet gelezen.
Nee. Een crawler met een eigen blok negeert het asterisk-blok volledig.
Nee. Zoekmachines moeten de pagina renderen en zien hem dan kapot.
Nee. Het voorkomt crawlen, niet indexeren. Daarvoor heb je noindex nodig.
Een bestand in de hoofdmap dat AI-systemen wegwijs maakt in je inhoud en je voorkeuren aangeeft.
Nee.