robots.txt

robots.txtはドメインのルート(例:example.com/robots.txt)に置かれたプレーンテキストファイルで、準拠したウェブクローラーにサイトのどの部分にアクセスできるかを通知します。User-agent、Disallow、Allowなどのロボット排除プロトコルのディレクティブを使用します。robots.txtでセクションをブロックするとクロールバジェットを重要なページに節約できますが、ブロックされたページは[[backlinks|バックリンク]]があってもインデックスされず、過剰なブロックがよくあるSEOミスになります。このファイルにはクローラーが発見できるよう[[sitemap-domain|XMLサイトマップ]]の場所も宣言する必要があります。

使用例

Adding 'Disallow: /admin/' to robots.txt prevents Google from crawling internal admin pages, while 'Sitemap: https://example.com/sitemap.xml' advertises the sitemap location to all crawlers.