追蹤沒有 RSS 的網站
完全沒有提供訂閱來源的網站也追得到:我們會從列出文章的那個頁面偵測更新。
不提供來源的網站越來越多
企業的公告頁、政府機關的網站、個人的日記,沒有 RSS 的並不少見。也有以前有、改版之後就拿掉的例子。
本服務可以從這類頁面撈出標題,組成訂閱來源的形式。登入後即可使用。
怎麼用
新增來源時,輸入列出文章或更新的那一頁的網址。如果找不到訂閱來源,就會提供「從該頁面撈標題」的選項。
它不適合只放一篇文章的頁面,也不適合內容單純輪播的首頁。標題附帶日期、一列一列往下排的頁面效果最好。
抓取的規則
因為抓取的成本較高,它的待遇和一般的訂閱來源不同。
- 每小時檢查一次頁面
- 一頁最多取最新的 20 則
- 不抓取文章內文——你拿到的是標題與連結
- 在 robots.txt 中拒絕的網站無法建立。本爬蟲的 User-Agent 與 * 都會評估,以較嚴格的一方為準
和真正的來源差在哪
因為它是從網站的 HTML 來的,頁面版型一改,撈到的東西就會跟著變。漏掉更新,或偶爾撈到不是文章的東西,都有可能。
每則的 ID 與精確的發布時間,沒有辦法像來源那樣取得,所以排序可能和你預期的不同。
如果網站把來源放回來了,改訂閱那個會可靠得多。
如果你是網站經營者,想停掉這件事
在 robots.txt 對該網址加上 Disallow,就會自動停止——不需要向我們提出任何申請。
其他事情,例如刪除已經產生的來源、移除公開頁面,可以用爬蟲說明頁上的表單。我們會在自動確認網域所有權之後處理。
常見問題
- 會抓取文章內文嗎?
- 不會,只有標題與連結。
- 多久檢查一次頁面?
- 每小時一次,最多取最新的 20 則。
- 不登入也能用嗎?
- 不行。因為抓取的成本較高,這是登入後才有的功能。
- 我不想讓別人對我的網站這樣做,怎麼辦?
- 在 robots.txt 對該網址加上 Disallow 即可。不必通知我們,它會自動停止。