關於我們的爬蟲
FreeFeedBot/1.0 (+https://freefeed.app/bot)
它會抓取什麼
使用者訂閱的 RSS/Atom 來源,以及用來偵測更新的 HTML 頁面(針對沒有提供來源的網站)。只抓取公開的頁面,絕不進入需要驗證的區域。
robots.txt 的處理
以 HTML 產生擬似訂閱來源時,完全遵守 robots.txt(同時評估本爬蟲的 User-Agent 與 *,並以較嚴格的一方為準,也會遵守 Crawl-delay)。一般 RSS/Atom 來源的抓取不受 robots.txt 阻擋——許多網站在 robots.txt 裡擋掉了自己的訂閱來源,若照做,讀者的訂閱就無法成立。若希望停止抓取,請用下面的方式與我們聯絡。
頻率
對同一主機只有 1 個同時連線,間隔至少 1 秒。會依來源實際的更新頻率,在 15 分鐘到 24 小時之間自動調整抓取間隔,沒有更新的來源就不會去抓。一定會送出條件式 GET(If-None-Match / If-Modified-Since)。
若你回傳 429 / 503
我們會以指數退避拉長間隔,若持續發生則自動停止抓取該主機。
想停止收錄或抓取時
只要在 robots.txt 裡對該網址加上 Disallow,擬似訂閱來源的產生就會自動停止。要從公開頁面移除,請從下面的頁面提出申請。
申請移除或排除若想停止抓取 RSS/Atom 來源本身,請與我們聯絡: support@freefeed.app