「じゃらん」とは、日本最大級の旅行予約サイトです。リッチな温泉旅館から便利なビジネスホテルまで目的に合わせて簡単に検索します。航空券や新幹線と宿泊のセットでさらにお得、レジャー体験を予約できる「遊び・体験予約」、豊富な観光情報と口コミであなたの旅行をサポートします。
じゃらんnetで全国のホテル・宿泊施設を都道府県や駅、市区町村からお探し頂けますので、ご利用の目的に合わせて探し方をご選択ください。また、宿詳細ページにはお得な宿泊プラン・周辺観光情報等もございますので、宿探しに是非お役立てください。
スクレイピングツールの概要
ScrapeStormには人工知能に基づき、Webスクレイピングツールです。プログラミングが必要なく、ほとんどのWebサイトからデータをスクレイピングします。強い機能を持つ、使いやすいです。URLを入力するだけで、自動的にWebサイト内容と次のページボタンを識別できます。1-ClickでWebサイトからデータを自動的に抽出します。デスクトップアプリとしてのScrapeStormには、Windows、Macと Linux のシステムに適用します。
1.タスクを新規作成する
(1)URLをコピーする
今回は、任意の人気ホテルの口コミページを例として、データクローラの手順を紹介します。まず、目標ホテルの口コミページのURLをコピーしてください。
(2)スマートモードタスクを新規作成する
ソフトウェアのホムページ画面に新規作成できます。
新しいタスクを作成しますか、持っているタスクをインポートすることもできます。
詳細には下記のチュートリアルをご参照ください。
2.タスクを構成する
(1)ページボタンを選択
ホテル情報ページのリスト識別にはXpathを編集する必要がありますが、ScrapeStormは口コミページのページボタンをうまく識別できます。
ページボタンの設定詳細には下記のチュートリアルをご参照ください。
(2)フィールドの編集と追加
ScrapeStormは自動的にリスト要素を識別できますが、じゃらんのホテル情報ページから抽出されたデータが乱雑上、必要に応じてフィールドの名前の変更または削除、結合できます。
フィールドの追加には、「フィールドを追加」ボタンをクリックして、画面に抽出する要素を選択、データが自動的に抽出されます。
フィールドの設定の詳細には下記のチュートリアルをご参照ください。
(3)フィルター
Webページの広告のせいで、抽出されたデータには空白があります。フィルター機能を利用してください。フィルダー画面に「データを保存しない」を選択、フィールドによって条件を追加します。
詳細は下記のチュートリアルをご参照ください。
3.タスクの設定と起動
(1)起動の設定
必要に応じて、スケジュール、アンチブロック、自動エクスポート、画像のダウンロード、スピードブーストを設定できます。
スクレイピングタスクを配置する方法については、下記のチュートリアルをご参照ください。
(2)しばらくすると、データがスクレイピングされる。
4.抽出されたデータのエクスポートと表示
(1)エクスポートをクリックして、データをダウンロードする
(2)必要に応じてエクスポートする形式を選択します。
ScrapeStormは、Excel、csv、html、txt、データベース、ローカルなどさまざまなエクスポート方法を提供します。ライトプラン以上のユーザーは、WordPressに直接投稿することもできます。
抽出結果を表示し、抽出されたデータを消去する方法の詳細には下記のチュートリアルをご参照ください。
抽出結果のエクスポート方法の詳細には下記のチュートリアルをご参照ください。