Menu

Begrip

AI-crawler

Een AI-crawler haalt webcontent op voor AI-modellen. Ontdek training vs retrieval, bekende bots, en hoe je ze via robots.txt beheert.

Matt Timmermans
Matt Timmermans

SEO-, GEO- en AI-specialist · Bijgewerkt: 13 augustus 2026 · Leestijd: 4 min

Wat is een AI-crawler?

Een AI-crawler is een geautomatiseerde bot die openbare webpagina's ophaalt zodat een AI-systeem de inhoud kan gebruiken. Die inhoud dient een van drie doelen: het trainen van AI-modellen, het opbouwen van een zoekindex voor een AI-zoekfunctie, of het in real time beantwoorden van een vraag van een gebruiker. Een AI-crawler stuurt doorgaans een eenvoudige GET-request naar een URL, haalt alleen de eerste HTML op en wacht meestal niet op client-side JavaScript. Server-side gerenderde, schone HTML is daarom belangrijk om door AI-systemen geciteerd te worden.

Kernpunten

  • Een AI-crawler is een bot die openbare webpagina's ophaalt om een AI-systeem te voeden: voor training, een AI-zoekindex, of een real-time antwoord.
  • Training-crawlers (GPTBot, ClaudeBot) voeden toekomstige modellen; retrieval-crawlers (OAI-SearchBot, PerplexityBot) leveren actuele antwoorden met bronvermelding.
  • Voor AI-zichtbaarheid laat je retrieval-crawlers toe; training-crawlers kun je selectiever blokkeren.
  • Google-Extended blokkeren raakt alleen AI-training, niet je gewone Google-rankings.
  • Je stuurt AI-crawlers per user-agent via robots.txt, maar dat is een instructie, geen handhaving; user-initiated fetchers negeren robots.txt soms.

Wat is het verschil tussen een training-crawler en een retrieval-crawler?

Het onderscheid tussen een training-crawler en een retrieval-crawler bepaalt of je content bijdraagt aan een toekomstig AI-model of direct wordt gebruikt voor een actueel antwoord. Een training-crawler, zoals GPTBot of ClaudeBot, verzamelt content om AI-modellen mee te trainen: die content beïnvloedt pas een toekomstige versie van het model. Een retrieval-crawler, zoals OAI-SearchBot, Claude-SearchBot of PerplexityBot, haalt een pagina op om een actueel antwoord samen te stellen, vaak met directe bronvermelding aan de gebruiker. Voor zichtbaarheid binnen GEO (Generative Engine Optimization, het optimaliseren van content voor zichtbaarheid in AI-antwoorden) wil je retrieval-crawlers meestal toelaten, want die leveren citaties op; training-crawlers kun je selectiever blokkeren als je dat wilt.

Onderstaande tabel zet beide typen naast elkaar.

Type crawlerDoelVoorbeelden
Training-crawlerVerzamelt content voor een toekomstig AI-modelGPTBot, ClaudeBot, Google-Extended
Retrieval-crawlerHaalt content op voor een actueel antwoord, vaak met bronvermeldingOAI-SearchBot, Claude-SearchBot, PerplexityBot
Training-crawler versus retrieval-crawler.

Wat is het verschil tussen een AI-crawler en Googlebot?

Googlebot bouwt de klassieke zoekindex voor Google Search, terwijl een AI-crawler een AI-systeem voedt, voor training of voor een AI-gegenereerd antwoord. Google-Extended is het aparte token waarmee je specifiek Google's AI-training voor Gemini en AI Overviews aanstuurt. Google bevestigt in zijn eigen documentatie dat het blokkeren van Google-Extended geen enkele invloed heeft op je gewone Google-rankings of je opname in de zoekindex: het raakt uitsluitend of je content wordt gebruikt om Google's AI-modellen te trainen.

Welke AI-crawlers zijn er?

De belangrijkste AI-aanbieders werken elk met meerdere, apart aan te sturen bots per doel:

  • OpenAI: GPTBot (training), OAI-SearchBot (zoeken), ChatGPT-User (gebruikersvraag). OpenAI verwijderde op 9 december 2025 de robots.txt-naleving voor ChatGPT-User uit zijn documentatie, met als reden: "Because these actions are initiated by a user, robots.txt rules may not apply."
  • Anthropic: ClaudeBot (training), Claude-SearchBot (zoeken), Claude-User (gebruikersvraag). Anthropic werkte deze indeling op 20 februari 2026 verder uit in zijn documentatie, met per bot een expliciete uitleg van wat blokkeren betekent; alle drie bots respecteren daarbij wel robots.txt.
  • Perplexity: PerplexityBot (zoeken), Perplexity-User (gebruikersvraag, negeert robots.txt doorgaans).
  • Google: Google-Extended (training voor Gemini en AI Overviews, geen eigen HTTP-verkeer).

Elke bot identificeert zich met een eigen user-agent-string in je serverlogs, dus je kunt ze afzonderlijk herkennen en aansturen. Let op: de namen verschuiven. Anthropic gebruikte eerder de verouderde tokens anthropic-ai en Claude-Web; veel robots.txt-blocklists leunen nog op die achterhaalde namen. Uit ons eigen onderzoek naar AI-crawlers en robots.txt onder de 500 grootste Nederlandse websites (peildatum 17 juni 2026) blokkeert 20,4% minstens één AI-crawler, en juist trainingsbots zoals GPTBot worden vaker geblokkeerd dan de zoekindexbots die je AI-zichtbaarheid bepalen.

Hoe blokkeer of beheer je AI-crawlers?

Je stuurt AI-crawlers per user-agent aan via robots.txt, met een aparte regel voor elke bot die je wilt toelaten of blokkeren. Een belangrijke nuance: robots.txt is een instructie, geen technische handhaving. OpenAI en Perplexity geven zelf aan dat de regels bij hun user-initiated fetchers (ChatGPT-User en Perplexity-User) mogelijk niet gelden, omdat een gebruiker de actie start; Anthropic's vergelijkbare Claude-User respecteert robots.txt juist wel. Wil je een bot die zich niet aan robots.txt houdt echt tegenhouden, dan werkt alleen blokkeren op serverniveau, bijvoorbeeld via een WAF (web application firewall) of rate limiting.

Voor de meeste publieke marketingsites is alles blokkeren geen goed idee: dan verdwijn je uit AI-antwoorden zonder dat je iets waardevols beschermt. Blokkeer selectief, bijvoorbeeld gevoelige of betaalde paden zoals /login of /checkout, en laat je publieke content open zodat AI-systemen je kunnen citeren. Wil je weten hoe je zichtbaar wordt in AI-antwoorden? Bekijk onze GEO-dienst.

Matt Timmermans

Gratis vindbaarheidscheck

Weet jij hoe zichtbaar je bent in Google en AI?

In 30 minuten check ik je huidige vindbaarheid in Google, ChatGPT en Claude. Je krijgt direct inzicht in waar je nu staat, waar de kansen liggen en wat als eerste impact maakt. Geen verplichtingen.

  • Gesprek van 30 minuten, vrijblijvend
  • Check van je vindbaarheid in Google en AI
  • De drie kansen met de meeste impact
  • Eerlijk advies of mijn aanpak bij je past
Plan je vindbaarheidscheck

Veelgestelde vragen over AI-crawler

Verdwijn ik uit ChatGPT als ik GPTBot blokkeer?

Nee, niet automatisch. GPTBot is uitsluitend de training-crawler van OpenAI: blokkeren voorkomt dat je content wordt gebruikt om toekomstige modellen te trainen, maar het blokkeert niet OAI-SearchBot, de aparte crawler die content ophaalt voor actuele ChatGPT-zoekresultaten met bronvermelding. Voor zichtbaarheid in actuele ChatGPT-antwoorden moet je specifiek OAI-SearchBot open laten staan.

Blokkeert Google-Extended mijn gewone Google-rankings?

Nee, Google bevestigt expliciet dat het blokkeren van Google-Extended geen invloed heeft op je rankings, indexering of zichtbaarheid in Google Search. Het raakt uitsluitend of je content wordt gebruikt om Google's AI-modellen te trainen, los van je positie in de normale zoekresultaten.

Moet ik als mkb-ondernemer alle AI-crawlers blokkeren?

Nee, dat is meestal geen goed idee. Alle AI-crawlers blokkeren betekent dat je volledig verdwijnt uit AI-antwoorden, zonder dat je iets waardevols beschermt. Blokkeer selectief gevoelige of niet-publieke paden, en laat je reguliere content open, zodat retrieval-crawlers je kunnen citeren in AI-antwoorden.

Waarom werken sommige blocklists voor AI-crawlers niet meer?

Blocklists werken niet meer als ze verouderde user-agent-namen bevatten, terwijl de aanbieder inmiddels andere tokens gebruikt. Anthropic gebruikte bijvoorbeeld eerder anthropic-ai en Claude-Web, en werkte de indeling in aparte bots verder uit op 20 februari 2026. Een blocklist die nog op de oude namen leunt, laat de nieuwe bots ongehinderd door.

Delen:
Matt Timmermans

Geschreven door

Matt Timmermans

SEO-, GEO- en AI-specialist

Matt Timmermans is oprichter van Timmermans Media en gespecialiseerd in SEO, GEO en AI-zichtbaarheid. Sinds 2018 helpt hij bedrijven beter gevonden te worden door zowel Google als AI-zoekmachines. Als AI-expert heeft hij ruime ervaring met AI-automatisering en het bouwen van applicaties met AI.