aslain.dev
0%
01 Hizmetler 02 Hakkımda 03 Projeler 04 Stack 05 Blog 06 İletişim
← Tüm makaleler SEO & Marketing

robots.txt gebruiken: juiste opzet en veelgemaakte fouten

Een robots txt-bestand is een klein maar cruciaal tekstbestand dat zoekmachinebots vertelt welke delen van je site ze mogen crawlen. Correct geschreven beschermt het je crawlbudget en voorkomt het dat bots tijd verspillen aan nutteloze pagina's; verkeerd geschreven kan het je hele site afsluiten voor Google en je organische verkeer in één nacht wegvagen. Daarom is dit ogenschijnlijk eenvoudige bestand een van de meest foutgevoelige plekken in technische SEO.

Wat doet robots.txt precies?

robots.txt stuurt alleen het crawl-gedrag aan, niet het indexeren. Dat onderscheid is belangrijk. Het bestand staat in de root van je site, op https://jouwsite.com/robots.txt. Voordat een bot een URL opvraagt, leest hij dit bestand en past hij de regels toe die op hem van toepassing zijn. De standaard is geformaliseerd als RFC 9309 (het Robots Exclusion Protocol).

De meest voorkomende misvatting is: "als ik een pagina blokkeer in robots.txt, verdwijnt die uit Google." Dat klopt niet. robots.txt voorkomt geen indexering; het voorkomt alleen dat de inhoud wordt gelezen. Een pagina die geblokkeerd is voor crawlen maar gelinkt wordt vanaf andere sites, kan nog steeds in de resultaten verschijnen met de melding "Er is geen informatie beschikbaar voor deze pagina". Wil je een pagina volledig uit de resultaten halen, gebruik dan een noindex-metatag of HTTP-header — en blokkeer die pagina niet in robots.txt, want de bot moet de pagina kunnen crawlen om de noindex-instructie te zien.

Basisstructuur en richtlijnen

Het bestand is platte tekst (UTF-8) en wordt in groepen gelezen. Elke groep begint met een User-agent-regel:

User-agent: *
Disallow: /admin/
Disallow: /winkelwagen/
Allow: /admin/global.css

Sitemap: https://jouwsite.com/sitemap.xml
  • User-agent: geeft aan op welke bot de regel van toepassing is. * betekent alle bots. Voor een specifieke bot schrijf je bijv. Googlebot.
  • Disallow: verbiedt het crawlen van URL's die met het opgegeven padvoorvoegsel beginnen. Disallow: / sluit de hele site af; een lege Disallow: blokkeert niets.
  • Allow: maakt een uitzondering binnen een Disallow-regel. Bij Google wint de langste (meest specifieke) overeenkomende regel.
  • Sitemap: geeft de volledige URL van je sitemap op. Dit staat los van de groepen en mag overal in het bestand staan.

Google ondersteunt het jokerteken * (een willekeurige reeks tekens) en $ om het einde van een URL vast te leggen. Bijvoorbeeld om alle PDF-bestanden te blokkeren:

User-agent: *
Disallow: /*.pdf$

Veelgemaakte fouten en hun gevolgen

Fouten in dit bestand zijn stil: de site blijft werken, maar over een periode van maanden brokkelt je verkeer af. De meest voorkomende:

  • Per ongeluk de hele site blokkeren. Vergeten de regel Disallow: / te verwijderen bij de overgang van staging naar productie is de klassieke ramp. Staat die regel op de live site, dan stopt Google met crawlen.
  • CSS en JavaScript blokkeren. Een regel als Disallow: /assets/ belet Google de pagina correct te renderen. Google tekent de pagina als een browser; zonder toegang tot stijlen en scripts beoordeelt het je mobielvriendelijkheid en lay-out verkeerd.
  • robots.txt als indexeringsmiddel zien. Gevoelige bronnen (bijv. /geheim-rapport.pdf) hier vermelden stelt ze juist bloot — het bestand is openbaar en biedt nieuwsgierigen een register van paden. Om de toegang echt te beperken gebruik je authenticatie of bescherming op serverniveau.
  • Hoofdlettergevoeligheid negeren. Paden zijn hoofdlettergevoelig: /Pagina en /pagina worden als verschillend behandeld.
  • Een 5xx-fout teruggeven. Als robots.txt een serverfout geeft, kan Google dit tijdelijk interpreteren als "alles verboden" en het crawlen vertragen. Een 404 wordt daarentegen behandeld als "alles toegestaan".

Crawl-delay en andere misverstane richtlijnen

De richtlijn Crawl-delay wordt niet ondersteund door Google en wordt genegeerd, hoewel zoekmachines als Bing en Yandex haar wel respecteren. Wil je de crawlsnelheid van Googlebot beheren, doe dat dan via Search Console of door je serverresponstijden te verbeteren. Ook de richtlijn Noindex: werkte een tijd onofficieel, maar Google heeft de ondersteuning in 2019 verwijderd — die werkt niet meer. De enige juiste manier om indexering te blokkeren is een <meta name="robots" content="noindex"> op paginaniveau of een X-Robots-Tag HTTP-header.

Je bestand testen

Valideer altijd vóór de livegang. Een praktische aanpak:

  • Het robots.txt-rapport in Google Search Console laat zien welke versie van het bestand Google ziet en of het fouten bevat.
  • Test of een specifieke URL geblokkeerd is met de live URL-inspectietool.
  • Open na een wijziging het bestand rechtstreeks in de browser (/robots.txt) om te bevestigen dat het echt teruggeeft wat je verwacht; cache of een redirect serveert soms een oude versie.

Houd het klein en eenvoudig. Voor de meeste sites is een helder bestand van tien regels veel veiliger dan een uitdijende structuur van honderd regels. Hoe minder uitzonderingen, hoe kleiner de kans op fouten.

Veelgestelde vragen

Wordt mijn site gecrawld zonder robots.txt?

Ja. robots.txt is niet verplicht; ontbreekt het bestand, dan beschouwen bots alles als crawlbaar. Toch is zelfs een leeg bestand bewaren een goede gewoonte, zodat je je sitemap kunt opgeven en indien nodig regels kunt toevoegen.

Kan ik een pagina met zowel robots.txt als noindex blokkeren?

Nee, gebruik die twee niet samen. Als je de pagina in robots.txt blokkeert, kan de bot er niet in en ziet hij de noindex-tag niet, waardoor de pagina geïndexeerd kan blijven. Om indexering te blokkeren laat je de pagina crawlbaar en gebruik je alleen noindex.

Hoe lang duurt het voordat een wijziging effect heeft?

Google bewaart robots.txt meestal ongeveer 24 uur in de cache. Heb je een dringende correctie gemaakt, dan kun je via Search Console een nieuwe crawl aanvragen; anders wordt het binnen enkele uren automatisch bijgewerkt.

Zijn de crawl-instellingen van je site uit de hand gelopen? Wil je je robots.txt, sitemap en indexering van begin tot eind laten controleren en op een veilige basis brengen, neem dan contact met me op.

Bu kategorideki tüm yazılar →

Devamı için