Acompanhar um site que não tem feed RSS

Sites que não publicam feed também dão para acompanhar: percebemos as novidades na página em que as publicações estão listadas.

Muitos sites não publicam feed

Páginas de novidades de empresas, sites de governo e diários pessoais muitas vezes não têm RSS. Alguns tinham e largaram numa reforma do site.

Este serviço consegue ler os títulos de uma página dessas e montar um feed com eles. Fica disponível depois que você entra.

Como usar

Ao adicionar um site, digite o endereço da página em que as publicações ou as novidades estão listadas. Se nenhum feed for achado, aparece a opção de ler os títulos daquela página.

Não serve para uma página com um artigo só, nem para uma capa cujo conteúdo simplesmente gira. O que funciona melhor é uma página com títulos datados um embaixo do outro.

Regras de busca

Como é caro buscar, isto é tratado de um jeito diferente de um feed comum.

Como difere de um feed de verdade

Como ele trabalha em cima do HTML do site, uma mudança no leiaute muda o que é pego. Podem escapar novidades e pode entrar algo que não era artigo.

Os identificadores por item e a hora exata de publicação não existem do jeito que um feed dá, então a ordem pode sair diferente do que você espera.

Se o site voltar a ter feed, trocar para ele é a opção mais confiável.

Se você cuida de um site e quer que isso pare

Colocar um Disallow para aquele endereço no seu robots.txt para sozinho: não precisa pedir nada para a gente.

Para o resto, como apagar os feeds já gerados ou tirar as páginas públicas, existe um formulário com link na página do rastreador. Os pedidos são processados depois de verificarmos automaticamente a propriedade do domínio.

Perguntas frequentes

O texto dos artigos é buscado?
Não. Só títulos e links.
De quanto em quanto tempo a página é conferida?
Uma vez por hora, pegando no máximo os 20 itens mais recentes.
Dá para usar sem entrar?
Não. É um recurso para quem entrou, porque buscar essas páginas sai caro.
Como evito que isso seja criado para o meu site?
Ponha um Disallow para aquele endereço no seu robots.txt. Não precisa pedir nada: para sozinho.

Outros guias