Wat robots.txt precies regelt

Robots.txt staat op de hoofdmap van elke website, op jouwkantoor.nl/robots.txt. Het bestand zegt tegen elke crawler die langskomt welke paden hij mag bezoeken en welke niet. Voor Googlebot en Bingbot bestaat die afspraak al sinds het begin van internet. Voor AI-crawlers geldt dezelfde logica, alleen is die regel op veel sites nooit bijgewerkt.

Vier crawlers doen er inmiddels toe voor een advieskantoor. GPTBot haalt content op voor ChatGPT. ClaudeBot doet hetzelfde voor Claude. PerplexityBot voedt de antwoorden van Perplexity, en Google-Extended bepaalt wat er in de AI-overzichten van Google terechtkomt. Elke crawler leest zijn eigen regel in robots.txt. Staat die regel er niet, dan geldt de standaardinstelling van je site — en die pakt niet altijd gunstig uit.

Een blokkade werkt onopvallend. De rest van je website functioneert gewoon, dus je merkt niets. Alleen het antwoord dat een AI-model over jouw kantoor geeft, blijft leeg of gaat naar een concurrent die wél toegankelijk is.

Robots.txt heeft niets te maken met je positie in Google. Blokkeer je GPTBot, dan verandert er niets aan je vindbaarheid in de klassieke zoekresultaten. Het raakt alleen de vraag of AI-modellen je kantoor kunnen citeren wanneer iemand ernaar vraagt.

Een aanpassing werkt alleen voorwaarts. Content die een crawler al eerder heeft opgehaald, verdwijnt niet met terugwerkende kracht uit een taalmodel. Wat je nu instelt, bepaalt vooral wat er vanaf dit moment gebeurt.

Waarom kantoren dit per ongeluk blokkeren

De meeste robots.txt-bestanden zijn jaren geleden neergezet, door een websitebouwer of een CMS-template. Een veelgebruikte instelling blokkeert alle crawlers, op een lijst bekende zoekmachines na. Dat was logisch toen alleen Google en Bing ertoe deden. Inmiddels bepalen ook nieuwe crawlers of je kantoor in een ChatGPT-antwoord verschijnt.

Herkenbaar voorbeeld: een regel die ooit is toegevoegd om scrapers en spambots te weren, dekt tegenwoordig ook GPTBot en ClaudeBot, puur omdat de naam op een oude blokkeerlijst voorkwam. Niemand heeft die regel sindsdien opnieuw bekeken.

Sommige hostingpakketten en beveiligingsplugins zetten AI-crawlers standaard op een blokkeerlijst, als onderdeel van een privacy-instelling. Die keuze wordt gemaakt zonder dat de eigenaar van de site het ooit te zien krijgt. Wat bedoeld is als bescherming, werkt dan net zo goed als een blokkade voor zichtbaarheid.

Sommige kantoren blokkeren GPTBot bewust, uit zorg over auteursrecht op hun content. Dat is een gegronde afweging. Het gevolg wordt vaak onderschat: dezelfde regel die je content beschermt tegen training, houdt je ook buiten het antwoord dat een potentiële klant te zien krijgt. Steeds meer mensen stellen hun eerste financiële vraag aan een AI-model in plaats van aan Google. Sta je daar niet, dan mis je dat gesprek volledig.

Wat je wél toestaat — en wat niet

Voor een kantoor dat zichtbaar wil zijn, is de keuze meestal simpel: laat GPTBot, ClaudeBot, PerplexityBot en Google-Extended je publieke pagina's lezen. Denk aan je kennisbank, je productpagina's en je contactgegevens. Die informatie deel je toch al met iedereen die op je site komt.

Wat niet voor buitenstaanders bedoeld is, hou je dicht: klantportalen, inlogpagina's, conceptartikelen die nog niet gepubliceerd zijn. Daar hoort een Disallow-regel, voor mensen én voor AI-crawlers.

Controleren kost een paar minuten. Open jouwkantoor.nl/robots.txt in je browser en zoek naar een regel die alle bots blokkeert zonder uitzondering. Staat die regel er zonder uitzondering voor GPTBot, ClaudeBot of PerplexityBot, dan blokkeer je waarschijnlijk meer dan je bedoelt.

Na een aanpassing lees je de regel gewoon terug in je browser om te controleren of hij klopt. Een paar regels tekst bepalen of je kantoor straks wel of niet in beeld komt bij een AI-zoekopdracht.

Robots.txt werkt samen met een bestand dat steeds vaker meetelt: llms.txt geeft AI-modellen een korte, feitelijke samenvatting van wie je bent en wat je doet. Het ene bestand regelt de toegang, het andere stuurt de inhoud. Check zelf wat er nu op jouwkantoor.nl/robots.txt staat.

Met Contaqt Site zetten we de technische basis van je website goed, van robots.txt tot llms.txt. Jij hoeft niet in de bestanden te duiken.

Samengevat

  • Robots.txt op jouwkantoor.nl/robots.txt bepaalt welke crawlers je website mogen lezen.
  • GPTBot, ClaudeBot, PerplexityBot en Google-Extended zijn de crawlers achter ChatGPT, Claude, Perplexity en de AI-overzichten van Google.
  • Veel robots.txt-bestanden zijn jaren geleden ingesteld en blokkeren onbedoeld deze nieuwere AI-crawlers.
  • Een kantoor dat GPTBot blokkeert, verschijnt niet in de antwoorden die ChatGPT aan potentiële klanten geeft.
  • Publieke pagina's zoals de kennisbank en productpagina's kun je veilig openstellen voor AI-crawlers.
  • Klantportalen en inlogpagina's hou je met een Disallow-regel dicht, voor mensen én voor AI-crawlers.