概要

クロールとは、検索エンジンのクローラーがWeb上のページへアクセスし、ページの内容を取得する処理です。

Google検索では、Googlebotが新しいページや更新されたページのURLを見つけ、ページへアクセスしてテキスト・画像・動画などを取得します。[1] クロールは検索エンジンがページを認識するための重要な工程ですが、クロールされたことと、インデックスに登録されたこと、検索結果に表示されたことは同じではありません。[1]

用語

意味

クロール

クローラーがページへアクセスし、内容を取得する処理

インデックス登録

取得したページを解析し、検索エンジンのインデックスへ保存する処理

検索結果への表示

検索語句に応じて、インデックス内の情報から結果を返す段階

クロールとは

ページの内容を取得する処理

検索エンジンは、Web上に存在するすべてのページを最初から把握しているわけではありません。

Googleは、新しいページや更新されたページを見つけてURLを既知のページの一覧へ加え、そのURLへアクセスして内容を取得します。このページへのアクセスと取得がクロールです。[1]

Googleの場合、ページを取得するクローラーはGooglebotと呼ばれます。[1]

URLを見つけることとクロールは同じではない

Googleの説明では、まず新しいURLを検出し、その後にURLへアクセスしてクロールします。[1]

URLは、例えば既知のページから張られたリンクやサイトマップなどを通じて検出されます。[1]

サイトマップ自体の形式や作成方法、Search Consoleからの送信方法については、MulberDen用語集の「サイトマップ」で詳しく扱っているため、本記事ではクロールとの関係だけを扱います。

すべてのページがクロールされるわけではない

Googlebotは、検出したすべてのページを必ずクロールするわけではありません。[1]

Googleは、クロールできない・しにくい代表的な要因として、ログインが必要なページ、robots.txtによる制御、サーバーやネットワークの問題などを挙げています。[1]

つまり、Webサイト上にページが存在していても、検索エンジンのクローラーがそのページへアクセスできなければ、通常のクロール処理は進みません。

なお、robots.txtの具体的な書き方やGooglebotそのものの仕様は、それぞれ個別の用語として扱う内容なので、ここではクロールとの関係に限定します。

クロール状況を確認する方法

URL単位ではURL検査ツール

Google Search ConsoleのURL検査ツールでは、GoogleがそのURLをどのように認識しているかや、クロール・インデックス登録に関する情報を確認できます。[3]

本記事ではツールの操作方法そのものは扱わず、「特定URLの状態を確認できる」という位置づけにとどめます。

サイト全体ではクロールの統計情報レポート

Search Consoleの「クロールの統計情報レポート」では、クロールリクエスト数、ダウンロードサイズ、平均レスポンス時間、ホストのステータス、クロールレスポンス、Googlebotの種類などを確認できます。[2]

Googleはこのレポートを上級ユーザー向けとしており、ページ数が1,000未満のサイトでは通常使用する必要はないと説明しています。[2]

クロール回数が多いこと自体をSEOの成果として扱うのではなく、Googleがサイトへアクセスした際に配信上の問題が起きていないかを確認するための情報として見ることが重要です。[2]

クロールとインデックスの違い

クロールは「ページを取得する工程」、インデックス登録は「取得したページを解析して検索エンジンのインデックスへ保存する工程」です。

Googleは、ページがクロールされても、すべてのページがインデックスに登録されるわけではないと説明しています。[1]

そのため、

  • クロールされた
  • インデックスに登録された
  • 検索結果に表示された
  • 上位に表示された

は、それぞれ別の状態として考える必要があります。

クロール後にどのように情報が保存されるかについては、「インデックス」で詳しく扱います。

Contact us

『ホームページ制作の相談をしたい』『もっとたくさん商品を売りたい』等、ご要望をお伝えくださいませ。

疑問に思っていること、お困りごと、具体的な内容が未定でも、まずはお気軽にご相談くださいませ。