robots.txt: een briefje bij de voordeur voor zoekmachines
Er is een fout die een hele website in een week uit Google kan halen. Hij past op een regel en staat in een bestand dat vrijwel niemand bekijkt. Er komt geen waarschuwing. Je merkt hem pas als je bezoekcijfers instorten.
Die fout heet een verkeerd ingestelde robots.txt. Meestal blijft hij staan na een verhuizing van een testomgeving naar de echte site.
Op zo’n testomgeving hoort namelijk een blokkade voor zoekmachines. Gaat de site live en verhuist die regel mee, dan sluit je jezelf buiten.
Het is daarom het eerste wat ik na een oplevering controleer. Het kost dertig seconden en het voorkomt maanden schade.
Een tekstbestandje dat zoekmachines vertelt waar ze niet hoeven te kijken.
Wat is robots.txt?
Het is een tekstbestand voor zoekmachines dat op de hoofdmap van je server staat. Je vindt het door achter je domein een schuine streep en de bestandsnaam te typen.
Daarin staat welke delen van je site zoekmachines wel en niet hoeven te bezoeken. Dat bezoeken heet crawlen.
Het is een verzoek
Dat is het belangrijkste om te snappen. Google en Bing houden zich eraan, maar niet iedereen doet dat.
Er zijn genoeg partijen die het bestand negeren. Het is dus een instructie op basis van goede wil.
Wat erin hoort
Minder dan mensen denken. Voor een gewone bedrijfssite is een korte inhoud prima.
Wat ik erin zet
Een verwijzing naar je sitemap.
Uitsluiting van je inlogpagina en beheerdersmappen.
Uitsluiting van zoekresultaten binnen je eigen site.
Bij een webshop: filterpagina’s die eindeloos varieren.
Die eerste is de nuttigste. Zo weet een zoekmachine direct waar je overzicht van pagina’s staat.
Waarom je filters uitsluit
Een webshop met vijf filters kan duizenden adressen opleveren. Die zijn vrijwel allemaal een variatie op dezelfde lijst.
Laat je die allemaal bezoeken, dan verspil je de aandacht van Google. Die tijd gaat af van je echte pagina’s.
Het verschil met no-index
Dit is de meest gemaakte denkfout, en hij heeft echte gevolgen.
Met dit bestand zeg je: kom hier niet kijken. Met een no-index zeg je: kijk gerust, maar zet het niet in je resultaten.
Waarom dat verschil telt
Blokkeer je een pagina hier, dan kan Google de no-index niet lezen. Hij komt immers niet binnen.
Staat die pagina al in de resultaten, dan blijft hij daar mogelijk staan. Zonder omschrijving, maar wel zichtbaar.
Wil je iets echt uit Google hebben? Gebruik dan een no-index en blokkeer de pagina hier juist niet. Dat geldt ook bij een nofollow-vraagstuk.
Het is geen beveiliging
Dit bestand is voor iedereen zichtbaar. Zet je er een map in die geheim moet blijven, dan wijs je er juist naar.
Ik heb sites gezien waar de beheeromgeving netjes stond opgesomd. Dat is een uitnodiging in plaats van een geen beveiliging.
Wil je iets afschermen, gebruik dan een wachtwoord of een afgeschermde map. Dat is de enige echte oplossing.
Hoe je het controleert
Typ je domein in met de bestandsnaam erachter en lees wat er staat. Zie je een regel die alles blokkeert, dan heb je een probleem.
Google Search Console heeft daarnaast een gereedschap dat je bestand test. Daarin zie je per adres of hij geblokkeerd is.
Bij het controleren van je bestand let ik ook op de sitemapregel. Die verwijst na een verhuizing nog weleens naar een oud domein.
Loop dit een keer per jaar na, samen met je overige controles. Meer daarover lees je bij onpage SEO en error 404.
Controleer het direct na een oplevering
Dat is het eerste wat ik doe zodra een site live staat. Typ je domein in met de bestandsnaam erachter.
Zie je een regel die alles blokkeert, dan heb je een probleem. Dat is in vijf minuten opgelost en het scheelt je maanden.
Waarom filters bij een webshop tellen
Vijf filters kunnen duizenden adressen opleveren. Die zijn vrijwel allemaal een variatie op dezelfde lijst.
Laat je die allemaal bezoeken, dan verspil je de aandacht van Google. Die tijd gaat af van je echte productpagina’s, zie permalink.
De sitemapregel na een verhuizing
Die verwijst nog weleens naar een oud domein. Dan zoekt een zoekmachine een overzicht dat er niet meer is.
Loop dit een keer per jaar na, samen met je overige controles. Het is een controle van een minuut.
Meer vragen over robots.txt
Dit zijn de vragen die ik hierover het vaakst krijg. Ik werk ze los uit.
Wat is robots.txt?
Wat zet je in een robots.txt?
Is robots.txt hetzelfde als no-index?
Kun je met robots.txt pagina’s afschermen?
Hoe controleer je je robots.txt?
Wat gebeurt er als je robots.txt verkeerd staat?
Wat is robots.txt?
Minder dan mensen denken. Voor een gewone bedrijfssite is een korte inhoud prima.
Ik zet er vier dingen in. Een verwijzing naar je sitemap. Uitsluiting van je inlogpagina en beheerdersmappen.
Uitsluiting van zoekresultaten binnen je eigen site. En bij een webshop de filterpagina’s die eindeloos varieren.
Die eerste is de nuttigste. Zo weet een zoekmachine direct waar je overzicht van pagina’s staat.
Die filters zijn bij een webshop belangrijk. Vijf filters kunnen duizenden adressen opleveren die vrijwel allemaal een variatie zijn op dezelfde lijst. Laat je die allemaal bezoeken, dan gaat die aandacht af van je echte pagina’s.
Houd het kort. Elke extra regel is een regel die fout kan staan zonder dat iemand het merkt.
Voeg vooral je sitemap toe als die er nog niet in staat. Dat is de nuttigste regel van allemaal. Laat je bouwer uitleggen waarom elke regel er staat. Regels die niemand kan verklaren, kunnen meestal weg.
Wat zet je in een robots.txt?
Het is een tekstbestand op de hoofdmap van je server. Je vindt het door achter je domein een schuine streep en de bestandsnaam te typen.
Daarin staat welke delen van je site zoekmachines wel en niet hoeven te bezoeken. Dat bezoeken heet crawlen.
Het belangrijkste om te snappen: het is een verzoek en geen slot. Google en Bing houden zich eraan, maar niet iedereen doet dat.
Er zijn genoeg partijen die het bestand gewoon negeren. Het werkt dus op basis van goede wil.
Het bestand is bovendien voor iedereen zichtbaar. Iedereen kan lezen welke mappen jij liever niet bezocht ziet worden, en dat maakt het ongeschikt om iets te verbergen.
Bekijk je eigen bestand een keer, want dat kan iedereen. Typ je domein in met de bestandsnaam erachter.
Staat er iets in wat je niet begrijpt, vraag het dan aan je bouwer. Het is een van de weinige technische bestanden die je zelf kunt lezen.
Is robots.txt hetzelfde als no-index?
Nee, en dit is de meest gemaakte denkfout met echte gevolgen.
Met dit bestand zeg je: kom hier niet kijken. Met een no-index zeg je: kijk gerust, maar zet het niet in je resultaten.
Blokkeer je een pagina in dit bestand, dan kan Google de no-index niet eens lezen. Hij komt immers niet binnen.
Staat die pagina al in de resultaten, dan blijft hij daar mogelijk staan. Zonder omschrijving, maar wel zichtbaar voor iedereen.
Wil je iets echt uit Google hebben, gebruik dan een no-index en blokkeer de pagina hier juist niet. Dat klinkt tegenstrijdig en het is precies andersom dan de meeste mensen denken.
Onthoud het verschil zo: dit bestand gaat over binnenkomen, een no-index gaat over tonen.
Wil je een pagina uit de resultaten hebben, dan moet Google er juist wel bij kunnen. Anders leest hij je instructie niet. Dit is de meest gemaakte denkfout in dit onderwerp. Hij kost mensen maanden zichtbaarheid zonder dat ze het doorhebben.
Kun je met robots.txt pagina's afschermen?
Nee. Dit bestand is voor iedereen zichtbaar en het is geen enkele vorm van beveiliging.
Zet je er een map in die geheim moet blijven, dan wijs je er juist naar. Je publiceert dan een lijstje met interessante plekken.
Ik heb sites gezien waar de complete beheeromgeving netjes stond opgesomd. Dat is een uitnodiging in plaats van een blokkade.
Wil je iets echt afschermen, gebruik dan een wachtwoord of een afgeschermde map op je server.
Dat is de enige echte oplossing. Alles wat via dit bestand loopt, blijft namelijk afhankelijk van de goede wil van degene die het leest.
Gebruik een wachtwoord of een afgeschermde map als iets echt geheim moet blijven.
Zet nooit de naam van een gevoelige map in dit bestand. Je publiceert dan precies wat je wilde verbergen. Vraag je hostingpartij hoe je een map afschermt. Bij een fatsoenlijke partij is dat een kwestie van een instelling.
Wat gebeurt er als je robots.txt verkeerd staat?
In het ergste geval verdwijnt je hele site binnen een week uit Google.
Dat gebeurt bij een regel die alles blokkeert. Die staat er meestal omdat een testomgeving is meeverhuisd naar de echte site.
Op zo’n testomgeving hoort die blokkade namelijk wel. Gaat de site live en blijft die regel staan, dan sluit je jezelf buiten.
Je krijgt geen waarschuwing. Je merkt het pas als je bezoekcijfers instorten, en dan ben je weken verder.
Het is daarom het eerste wat ik na een oplevering controleer. Het kost dertig seconden en het voorkomt maanden schade.
Controleer dit direct na elke oplevering en na elke verhuizing. Dat kost dertig seconden.
Loop het daarnaast een keer per jaar na, samen met je overige controles. Ook de sitemapregel verwijst na een verhuizing nog weleens naar een oud domein. Vraag na een oplevering expliciet of dit is nagekeken. Het staat zelden op een opleverlijst en het is de goedkoopste controle die er is.
Weet je niet zeker of je site goed vindbaar is voor Google? Stuur me de link via het formulier hieronder. Ik controleer je robots.txt en kijk of er niets wordt geblokkeerd dat juist gevonden moet worden. Vermeld je plaats, dan weet ik meteen waar je zit.