robots.txt

Le robots.txt est un fichier texte brut placé à la racine d'un domaine (p. ex., example.com/robots.txt) qui indique aux robots d'exploration conformes quelles parties du site ils peuvent ou non accéder. Il utilise des directives du protocole d'exclusion des robots comme User-agent, Disallow et Allow. Bloquer des sections via robots.txt préserve le budget d'exploration pour les pages importantes, mais les pages bloquées ne peuvent pas être indexées même si elles ont des [[backlinks|backlinks]] — ce qui fait du sur-blocage une erreur SEO courante. Le fichier doit également déclarer l'emplacement du [[sitemap-domain|plan de site XML]] pour la découverte des robots.

Exemple

Adding 'Disallow: /admin/' to robots.txt prevents Google from crawling internal admin pages, while 'Sitemap: https://example.com/sitemap.xml' advertises the sitemap location to all crawlers.