Seguir un sitio que no tiene feed RSS
A los sitios que no publican feed igual se los puede seguir: detectamos las novedades en la página donde están listadas las publicaciones.
Muchos sitios no publican feed
Las páginas de novedades de empresas, los sitios de gobierno y los diarios personales muchas veces no tienen RSS. Algunos lo tenían y lo dejaron en un rediseño.
Este servicio puede leer los títulos de una página así y armar con ellos un feed. Está disponible una vez que inicias sesión.
Cómo se usa
Al agregar un sitio, escribe la dirección de la página donde se listan las publicaciones o las novedades. Si no se encuentra ningún feed, se te ofrece leer los títulos de esa página.
No sirve para una página con un solo artículo, ni para una portada cuyo contenido simplemente rota. Lo que mejor funciona es una página con títulos fechados uno debajo del otro.
Reglas de descarga
Como es caro de traer, se lo trata distinto que a un feed común.
- La página se revisa una vez por hora
- De cada página se toman como máximo los 20 elementos más recientes
- El texto de los artículos no se descarga: obtienes títulos y enlaces
- No se puede crear para sitios que lo prohíben en su robots.txt. Se evalúan tanto nuestro User-Agent como *, y gana el más estricto
En qué se diferencia de un feed de verdad
Como trabaja sobre el HTML del sitio, un cambio en la maquetación cambia lo que se recoge. Se pueden escapar novedades y se puede colar algo que no era un artículo.
Los identificadores por elemento y la hora exacta de publicación no están como los da un feed, así que el orden puede salir distinto del que esperas.
Si el sitio recupera su feed, cambiarse a él es la opción más confiable.
Si administras un sitio y quieres que esto pare
Agregar un Disallow para esa dirección en tu robots.txt lo detiene solo: no hay que pedirnos nada.
Para todo lo demás, como borrar los feeds ya generados o quitar las páginas públicas, hay un formulario enlazado desde la página del rastreador. Los pedidos se procesan después de verificar automáticamente la propiedad del dominio.
Preguntas frecuentes
- ¿Se descarga el texto de los artículos?
- No. Solo títulos y enlaces.
- ¿Cada cuánto se revisa la página?
- Una vez por hora, tomando como máximo los 20 elementos más recientes.
- ¿Puedo usarlo sin iniciar sesión?
- No. Es una función para quien inició sesión, porque traer estas páginas sale caro.
- ¿Cómo evito que se cree esto para mi sitio?
- Pon un Disallow para esa dirección en tu robots.txt. No hace falta pedirnos nada: se detiene solo.
Otras guías
- ¿Qué es RSS?
- Trabajar con OPML
- Encontrar feeds
- RSS, Atom y JSON Feed
- Cuando un sitio deja de actualizarse
- Llevarte tus suscripciones de Feedly
- Llevarte tus suscripciones de Inoreader
- Seguir un canal de YouTube por RSS
- Seguir note y Hatena Blog por RSS
- Bajar la pila con reglas y filtros
- Qué es un lector de RSS en la nube
- Glosario de RSS