Acompanhar um site que não tem feed RSS
Sites que não publicam feed também dão para acompanhar: percebemos as novidades na página em que as publicações estão listadas.
Muitos sites não publicam feed
Páginas de novidades de empresas, sites de governo e diários pessoais muitas vezes não têm RSS. Alguns tinham e largaram numa reforma do site.
Este serviço consegue ler os títulos de uma página dessas e montar um feed com eles. Fica disponível depois que você entra.
Como usar
Ao adicionar um site, digite o endereço da página em que as publicações ou as novidades estão listadas. Se nenhum feed for achado, aparece a opção de ler os títulos daquela página.
Não serve para uma página com um artigo só, nem para uma capa cujo conteúdo simplesmente gira. O que funciona melhor é uma página com títulos datados um embaixo do outro.
Regras de busca
Como é caro buscar, isto é tratado de um jeito diferente de um feed comum.
- A página é conferida uma vez por hora
- De cada página são pegos no máximo os 20 itens mais recentes
- O texto dos artigos não é buscado: você recebe títulos e links
- Não dá para criar em sites que proíbem isso no robots.txt. Avaliamos tanto o nosso User-Agent quanto o *, e vale o mais rígido
Como difere de um feed de verdade
Como ele trabalha em cima do HTML do site, uma mudança no leiaute muda o que é pego. Podem escapar novidades e pode entrar algo que não era artigo.
Os identificadores por item e a hora exata de publicação não existem do jeito que um feed dá, então a ordem pode sair diferente do que você espera.
Se o site voltar a ter feed, trocar para ele é a opção mais confiável.
Se você cuida de um site e quer que isso pare
Colocar um Disallow para aquele endereço no seu robots.txt para sozinho: não precisa pedir nada para a gente.
Para o resto, como apagar os feeds já gerados ou tirar as páginas públicas, existe um formulário com link na página do rastreador. Os pedidos são processados depois de verificarmos automaticamente a propriedade do domínio.
Perguntas frequentes
- O texto dos artigos é buscado?
- Não. Só títulos e links.
- De quanto em quanto tempo a página é conferida?
- Uma vez por hora, pegando no máximo os 20 itens mais recentes.
- Dá para usar sem entrar?
- Não. É um recurso para quem entrou, porque buscar essas páginas sai caro.
- Como evito que isso seja criado para o meu site?
- Ponha um Disallow para aquele endereço no seu robots.txt. Não precisa pedir nada: para sozinho.
Outros guias
- O que é RSS?
- Trabalhando com OPML
- Encontrar feeds
- RSS, Atom e JSON Feed
- Quando um site para de atualizar
- Levar suas assinaturas do Feedly
- Levar suas assinaturas do Inoreader
- Acompanhar um canal do YouTube por RSS
- Acompanhar o note e o Hatena Blog por RSS
- Baixar a pilha com regras e filtros
- O que é um leitor de RSS na nuvem
- Glossário de RSS