RSS が無いサイトの更新を追いかける
フィードを配信していないサイトでも、記事が並んでいるページから更新を検出して購読できます。
フィードを配信しないサイトが増えた
企業のお知らせページ、行政のサイト、個人の日記など、RSS を用意していないページは珍しくありません。以前は配信していたのに、サイトの作り直しでやめてしまった例もあります。
このサービスには、そうしたページから見出しを拾ってフィードの形に組み立てる機能があります。ログイン後に使えます。
使い方
サイトを追加するときに、記事や更新が一覧で並んでいるページの URL を入れます。フィードが見つからなければ、そのページから見出しを拾う候補が出ます。
記事が1本だけのページや、トップページのように内容が入れ替わるだけのページには向きません。「日付とタイトルが縦に並んでいるページ」がいちばんうまくいきます。
取得の条件
負荷の大きい取得なので、通常のフィードとは扱いが違います。
- 確認は1時間ごとです
- 1つのページから拾うのは最新20本までです
- 本文は取得しません。届くのはタイトルとリンクです
- サイトが robots.txt で拒否している場合は作成できません。自 User-Agent と * の両方を見て、厳しい方に従います
ふつうのフィードとの違い
サイトの HTML を手がかりにしているため、ページの作りが変われば拾い方も変わります。取りこぼしや、記事でないものを拾ってしまうことが起こり得ます。
記事ごとの ID や正確な公開日時も、フィードのようには手に入りません。並び順が期待とずれることがあります。
そのサイトがフィードの配信を再開したら、そちらに切り替える方が確実です。
サイトを運営していて止めたい場合
robots.txt で該当の URL を Disallow していただければ、こちらへ連絡しなくても自動的に停止します。
それ以外の希望(生成済みのフィードや公開ページの削除など)は、クローラの説明ページから申請できます。ドメインの所有を自動で確認したうえで処理します。
よくある質問
- 本文も取得されますか?
- されません。取得するのはタイトルとリンクだけです。
- どれくらいの間隔で確認されますか?
- 1時間ごとです。1つのページから拾うのは最新20本までです。
- ログインせずに使えますか?
- 使えません。取得の負荷が大きいため、ログイン後の機能にしています。
- 自分のサイトで作られたくない場合はどうすればいいですか?
- robots.txt で該当 URL を Disallow してください。申請は不要で、自動的に停止します。