robots.txt

robots.txt — текстовый файл в корне домена (например, example.com/robots.txt), сообщающий совместимым веб-краулерам, к каким частям сайта они могут или не могут обращаться. Файл использует директивы протокола исключения роботов: User-agent, Disallow и Allow. Блокировка разделов через robots.txt экономит краулинговый бюджет для важных страниц, однако заблокированные страницы не могут быть проиндексированы даже при наличии [[backlinks|обратных ссылок]] — из-за чего избыточная блокировка является распространённой ошибкой SEO. Файл также должен указывать расположение [[sitemap-domain|XML-карты сайта]] для обнаружения краулерами.

Пример

Adding 'Disallow: /admin/' to robots.txt prevents Google from crawling internal admin pages, while 'Sitemap: https://example.com/sitemap.xml' advertises the sitemap location to all crawlers.