Robots.txt er en tekstfil i roden af et website, der giver instruktioner til søgemaskinernes robotter om, hvilke dele af sitet de må crawle. Filen kan bruges til at holde robotter væk fra bestemte mapper eller filer. Den forhindrer dog ikke i sig selv, at en side kan blive indekseret, hvis den linkes til andre steder.
En robots.txt kan blokere robotter fra en intern søgesektion, så de i stedet bruger deres tid på indholdssiderne.
Dybdegående guide
Robots.txt er en lille tekstfil, der ligger i roden af et website på adressen deteksempel.dk/robots.txt. Den er det første, en søgemaskine kigger efter, når den besøger et site, og den fortæller, hvilke dele af sitet robotterne må crawle, og hvilke de skal holde sig fra. Filen styrer altså adgang, ikke indeksering, og den forskel er værd at holde styr på.
En typisk robots.txt ser sådan ud:
User-agent: *
Disallow: /kurv/
Disallow: /min-konto/
Allow: /
Sitemap: https://eksempel.dk/sitemap-index.xml
Linjerne betyder følgende. User-agent: * gælder alle robotter. Disallow spærrer en mappe eller sti. Allow giver adgang, også inde i en ellers spærret mappe. Og Sitemap peger søgemaskinen hen på dit sitemap, hvilket er en god vane at have med.
/robots.txt i browseren, for eksempel dinshop.dk/robots.txt.En Disallow i robots.txt forhindrer crawl, men ikke nødvendigvis at siden indekseres. Har andre links til siden, kan Google finde på at vise den i resultaterne uden beskrivelse, fordi den ikke må læse indholdet. Vil du holde en side helt ude af søgeresultaterne, er værktøjet et noindex-meta-tag på selve siden, ikke en Disallow i robots.txt. En klassisk fejl er at blokere en side i robots.txt og samtidig sætte noindex på den. Så når robotten aldrig at læse noindex, fordi den er spærret ude. De to skal ikke bruges sammen.
Læs videre
Uddybende om seo og optimering:
Book et uforpligtende møde på 30 minutter, så oversætter vi teorien til noget, der flytter dine tal.