Begrip
AI-crawler
Een AI-crawler haalt webcontent op voor AI-modellen. Ontdek training vs retrieval, bekende bots, en hoe je ze via robots.txt beheert.
SEO-, GEO- en AI-specialist · Bijgewerkt: 13 augustus 2026 · Leestijd: 4 min
Wat is een AI-crawler?
Een AI-crawler is een geautomatiseerde bot die openbare webpagina's ophaalt zodat een AI-systeem de inhoud kan gebruiken. Die inhoud dient een van drie doelen: het trainen van AI-modellen, het opbouwen van een zoekindex voor een AI-zoekfunctie, of het in real time beantwoorden van een vraag van een gebruiker. Een AI-crawler stuurt doorgaans een eenvoudige GET-request naar een URL, haalt alleen de eerste HTML op en wacht meestal niet op client-side JavaScript. Server-side gerenderde, schone HTML is daarom belangrijk om door AI-systemen geciteerd te worden.
Kernpunten
- Een AI-crawler is een bot die openbare webpagina's ophaalt om een AI-systeem te voeden: voor training, een AI-zoekindex, of een real-time antwoord.
- Training-crawlers (GPTBot, ClaudeBot) voeden toekomstige modellen; retrieval-crawlers (OAI-SearchBot, PerplexityBot) leveren actuele antwoorden met bronvermelding.
- Voor AI-zichtbaarheid laat je retrieval-crawlers toe; training-crawlers kun je selectiever blokkeren.
- Google-Extended blokkeren raakt alleen AI-training, niet je gewone Google-rankings.
- Je stuurt AI-crawlers per user-agent via robots.txt, maar dat is een instructie, geen handhaving; user-initiated fetchers negeren robots.txt soms.
Wat is het verschil tussen een training-crawler en een retrieval-crawler?
Het onderscheid tussen een training-crawler en een retrieval-crawler bepaalt of je content bijdraagt aan een toekomstig AI-model of direct wordt gebruikt voor een actueel antwoord. Een training-crawler, zoals GPTBot of ClaudeBot, verzamelt content om AI-modellen mee te trainen: die content beïnvloedt pas een toekomstige versie van het model. Een retrieval-crawler, zoals OAI-SearchBot, Claude-SearchBot of PerplexityBot, haalt een pagina op om een actueel antwoord samen te stellen, vaak met directe bronvermelding aan de gebruiker. Voor zichtbaarheid binnen GEO (Generative Engine Optimization, het optimaliseren van content voor zichtbaarheid in AI-antwoorden) wil je retrieval-crawlers meestal toelaten, want die leveren citaties op; training-crawlers kun je selectiever blokkeren als je dat wilt.
Onderstaande tabel zet beide typen naast elkaar.
| Type crawler | Doel | Voorbeelden |
|---|---|---|
| Training-crawler | Verzamelt content voor een toekomstig AI-model | GPTBot, ClaudeBot, Google-Extended |
| Retrieval-crawler | Haalt content op voor een actueel antwoord, vaak met bronvermelding | OAI-SearchBot, Claude-SearchBot, PerplexityBot |
Wat is het verschil tussen een AI-crawler en Googlebot?
Googlebot bouwt de klassieke zoekindex voor Google Search, terwijl een AI-crawler een AI-systeem voedt, voor training of voor een AI-gegenereerd antwoord. Google-Extended is het aparte token waarmee je specifiek Google's AI-training voor Gemini en AI Overviews aanstuurt. Google bevestigt in zijn eigen documentatie dat het blokkeren van Google-Extended geen enkele invloed heeft op je gewone Google-rankings of je opname in de zoekindex: het raakt uitsluitend of je content wordt gebruikt om Google's AI-modellen te trainen.
Welke AI-crawlers zijn er?
De belangrijkste AI-aanbieders werken elk met meerdere, apart aan te sturen bots per doel:
- OpenAI: GPTBot (training), OAI-SearchBot (zoeken), ChatGPT-User (gebruikersvraag). OpenAI verwijderde op 9 december 2025 de robots.txt-naleving voor ChatGPT-User uit zijn documentatie, met als reden: "Because these actions are initiated by a user, robots.txt rules may not apply."
- Anthropic: ClaudeBot (training), Claude-SearchBot (zoeken), Claude-User (gebruikersvraag). Anthropic werkte deze indeling op 20 februari 2026 verder uit in zijn documentatie, met per bot een expliciete uitleg van wat blokkeren betekent; alle drie bots respecteren daarbij wel robots.txt.
- Perplexity: PerplexityBot (zoeken), Perplexity-User (gebruikersvraag, negeert robots.txt doorgaans).
- Google: Google-Extended (training voor Gemini en AI Overviews, geen eigen HTTP-verkeer).
Elke bot identificeert zich met een eigen user-agent-string in je serverlogs, dus je kunt ze afzonderlijk herkennen en aansturen. Let op: de namen verschuiven. Anthropic gebruikte eerder de verouderde tokens anthropic-ai en Claude-Web; veel robots.txt-blocklists leunen nog op die achterhaalde namen. Uit ons eigen onderzoek naar AI-crawlers en robots.txt onder de 500 grootste Nederlandse websites (peildatum 17 juni 2026) blokkeert 20,4% minstens één AI-crawler, en juist trainingsbots zoals GPTBot worden vaker geblokkeerd dan de zoekindexbots die je AI-zichtbaarheid bepalen.
Hoe blokkeer of beheer je AI-crawlers?
Je stuurt AI-crawlers per user-agent aan via robots.txt, met een aparte regel voor elke bot die je wilt toelaten of blokkeren. Een belangrijke nuance: robots.txt is een instructie, geen technische handhaving. OpenAI en Perplexity geven zelf aan dat de regels bij hun user-initiated fetchers (ChatGPT-User en Perplexity-User) mogelijk niet gelden, omdat een gebruiker de actie start; Anthropic's vergelijkbare Claude-User respecteert robots.txt juist wel. Wil je een bot die zich niet aan robots.txt houdt echt tegenhouden, dan werkt alleen blokkeren op serverniveau, bijvoorbeeld via een WAF (web application firewall) of rate limiting.
Voor de meeste publieke marketingsites is alles blokkeren geen goed idee: dan verdwijn je uit AI-antwoorden zonder dat je iets waardevols beschermt. Blokkeer selectief, bijvoorbeeld gevoelige of betaalde paden zoals /login of /checkout, en laat je publieke content open zodat AI-systemen je kunnen citeren. Wil je weten hoe je zichtbaar wordt in AI-antwoorden? Bekijk onze GEO-dienst.

Gratis vindbaarheidscheck
Weet jij hoe zichtbaar je bent in Google en AI?
In 30 minuten check ik je huidige vindbaarheid in Google, ChatGPT en Claude. Je krijgt direct inzicht in waar je nu staat, waar de kansen liggen en wat als eerste impact maakt. Geen verplichtingen.
- Gesprek van 30 minuten, vrijblijvend
- Check van je vindbaarheid in Google en AI
- De drie kansen met de meeste impact
- Eerlijk advies of mijn aanpak bij je past
Veelgestelde vragen over AI-crawler
Verdwijn ik uit ChatGPT als ik GPTBot blokkeer?
Nee, niet automatisch. GPTBot is uitsluitend de training-crawler van OpenAI: blokkeren voorkomt dat je content wordt gebruikt om toekomstige modellen te trainen, maar het blokkeert niet OAI-SearchBot, de aparte crawler die content ophaalt voor actuele ChatGPT-zoekresultaten met bronvermelding. Voor zichtbaarheid in actuele ChatGPT-antwoorden moet je specifiek OAI-SearchBot open laten staan.
Blokkeert Google-Extended mijn gewone Google-rankings?
Nee, Google bevestigt expliciet dat het blokkeren van Google-Extended geen invloed heeft op je rankings, indexering of zichtbaarheid in Google Search. Het raakt uitsluitend of je content wordt gebruikt om Google's AI-modellen te trainen, los van je positie in de normale zoekresultaten.
Moet ik als mkb-ondernemer alle AI-crawlers blokkeren?
Nee, dat is meestal geen goed idee. Alle AI-crawlers blokkeren betekent dat je volledig verdwijnt uit AI-antwoorden, zonder dat je iets waardevols beschermt. Blokkeer selectief gevoelige of niet-publieke paden, en laat je reguliere content open, zodat retrieval-crawlers je kunnen citeren in AI-antwoorden.
Waarom werken sommige blocklists voor AI-crawlers niet meer?
Blocklists werken niet meer als ze verouderde user-agent-namen bevatten, terwijl de aanbieder inmiddels andere tokens gebruikt. Anthropic gebruikte bijvoorbeeld eerder anthropic-ai en Claude-Web, en werkte de indeling in aparte bots verder uit op 20 februari 2026. Een blocklist die nog op de oude namen leunt, laat de nieuwe bots ongehinderd door.

Geschreven door
Matt TimmermansSEO-, GEO- en AI-specialist
Matt Timmermans is oprichter van Timmermans Media en gespecialiseerd in SEO, GEO en AI-zichtbaarheid. Sinds 2018 helpt hij bedrijven beter gevonden te worden door zowel Google als AI-zoekmachines. Als AI-expert heeft hij ruime ervaring met AI-automatisering en het bouwen van applicaties met AI.
Wil je meer weten?
Gerelateerde begrippen
AI-zoekmachine
Een AI-zoekmachine geeft directe antwoorden met bronvermelding in plaats van links. Leer hoe het werkt en wat het betekent voor je vindbaarheid.
Lees uitleg→Crawler (webcrawler)
Een crawler doorzoekt websites voor zoekmachines en AI. Ontdek hoe crawlen werkt, het verschil met indexeren, en hoe je crawlers aanstuurt.
Lees uitleg→robots.txt
Robots.txt vertelt crawlers welke delen van je site ze mogen bezoeken. Ontdek de werking, de grootste mythe, en hoe je AI-crawlers blokkeert.
Lees uitleg→