Seguir un sitio que no tiene feed RSS

A los sitios que no publican feed igual se los puede seguir: detectamos las novedades en la página donde están listadas las publicaciones.

Muchos sitios no publican feed

Las páginas de novedades de empresas, los sitios de gobierno y los diarios personales muchas veces no tienen RSS. Algunos lo tenían y lo dejaron en un rediseño.

Este servicio puede leer los títulos de una página así y armar con ellos un feed. Está disponible una vez que inicias sesión.

Cómo se usa

Al agregar un sitio, escribe la dirección de la página donde se listan las publicaciones o las novedades. Si no se encuentra ningún feed, se te ofrece leer los títulos de esa página.

No sirve para una página con un solo artículo, ni para una portada cuyo contenido simplemente rota. Lo que mejor funciona es una página con títulos fechados uno debajo del otro.

Reglas de descarga

Como es caro de traer, se lo trata distinto que a un feed común.

En qué se diferencia de un feed de verdad

Como trabaja sobre el HTML del sitio, un cambio en la maquetación cambia lo que se recoge. Se pueden escapar novedades y se puede colar algo que no era un artículo.

Los identificadores por elemento y la hora exacta de publicación no están como los da un feed, así que el orden puede salir distinto del que esperas.

Si el sitio recupera su feed, cambiarse a él es la opción más confiable.

Si administras un sitio y quieres que esto pare

Agregar un Disallow para esa dirección en tu robots.txt lo detiene solo: no hay que pedirnos nada.

Para todo lo demás, como borrar los feeds ya generados o quitar las páginas públicas, hay un formulario enlazado desde la página del rastreador. Los pedidos se procesan después de verificar automáticamente la propiedad del dominio.

Preguntas frecuentes

¿Se descarga el texto de los artículos?
No. Solo títulos y enlaces.
¿Cada cuánto se revisa la página?
Una vez por hora, tomando como máximo los 20 elementos más recientes.
¿Puedo usarlo sin iniciar sesión?
No. Es una función para quien inició sesión, porque traer estas páginas sale caro.
¿Cómo evito que se cree esto para mi sitio?
Pon un Disallow para esa dirección en tu robots.txt. No hace falta pedirnos nada: se detiene solo.

Otras guías