🤖 robots.txt生成

個別ルール
robots.txt
User-agent: *
Allow: /
Disallow: /admin/

Sitemap: https://example.com/sitemap.xml

クロール許可・拒否のルールや、クロール間隔、サイトマップのURLを設定するだけで、検索エンジン向けのrobots.txtファイルを生成できるツールです。全体の公開・非公開設定に加えて、パスごとの細かいルールも追加できます。

使い方

  1. サイト全体をクロール許可するかどうかを選びます。
  2. 特定のパスに対する許可・拒否ルールを必要な数だけ追加します。
  3. サイトマップのURLとクロール間隔(任意)を入力すると、robots.txtの内容が自動的に生成されます。

計算の仕組み

robots.txtは、検索エンジンのクローラー(巡回プログラム)に、サイトのどのページを巡回してよいかを伝えるファイルで、2022年にRFC 9309として標準化されました。サイトのルート(https://example.com/robots.txt)に置きます。 このツールは、次の内容を組み立てます。 ・User-agent: *(すべてのクローラーを対象にする) ・Allow: / (「すべて許可」をオンにした場合) ・Allow / Disallow: 指定したパスごとの許可・拒否 ・Crawl-delay: 巡回の間隔(秒) ・Sitemap: サイトマップのURL RFC 9309では、複数のルールがURLに当てはまる場合、パスが最も長く一致するルールが優先されます。そのため「Allow: /」と「Disallow: /admin/」を並べると、/admin/以下だけが巡回されなくなります。

計算例

初期設定の出力 User-agent: * Allow: / Disallow: /admin/ Sitemap: https://example.com/sitemap.xml この場合、/admin/ と /admin/users などは巡回されず、それ以外のページは巡回されます。

使用上の注意

  • robots.txtは「お願い」であり、アクセスを禁止する仕組みではありません。悪意のあるクローラーは無視しますし、ファイル自体を誰でも読めます。公開したくないページは、ログインやパスワードで保護してください。
  • Disallowで巡回を止めても、ほかのサイトからリンクされていれば、URLだけが検索結果に出ることがあります。検索結果に出したくない場合は、ページにnoindexを指定してください(その場合、そのページのDisallowは外す必要があります)。
  • GoogleはCrawl-delayに対応していません。Bingなど一部の検索エンジンだけが使います。

よくある質問

robots.txtはどこに配置すればいいですか?

サイトのルートディレクトリ(例: https://example.com/robots.txt)に配置する必要があります。

Crawl-delayはすべての検索エンジンに効果がありますか?

いいえ。Googleなど一部の検索エンジンはCrawl-delayディレクティブを無視します。効果はクローラーによって異なります。

特定のクローラー(User-agent)ごとにルールを分けられますか?

現在のバージョンはすべてのクローラー共通(User-agent: *)のルール生成のみに対応しています。