Automatiser sa veille avec les flux RSS et n8n : collecte, déduplication, résumé IA et digest
Publié le 29 juillet 2026 · 5 min de lecture
La veille manuelle a un défaut structurel : elle se fait quand on a le temps, c'est-à-dire irrégulièrement, et elle s'interrompt précisément dans les périodes chargées — celles où il se passe des choses. Les flux RSS, technologie sans gloire mais partout disponible, plus n8n et un modèle de langage, produisent l'inverse : une collecte constante, filtrée, résumée et livrée en un digest quotidien qui se lit en trois minutes. Ce guide monte le pipeline complet, de la liste de sources à la livraison.
L'architecture : un pipeline en cinq étages
Une veille RSS robuste suit toujours la même colonne vertébrale :
- Collecte : lire chaque flux de la liste de sources ;
- Déduplication : ne garder que les articles jamais vus ;
- Filtrage : écarter le hors-sujet avant tout appel IA ;
- Enrichissement IA : score de pertinence, résumé, catégorie ;
- Livraison : un digest groupé (Slack, email, Notion) plutôt que des notifications au fil de l'eau.
Ce découpage n'est pas un luxe d'ingénieur : chaque étage protège le suivant. Sans déduplication, le digest radote ; sans filtrage, la facture IA enfle ; sans regroupement, la veille redevient une source d'interruptions — le problème qu'elle devait résoudre.
Étage 1 — Collecter : Trigger mono-flux ou lecture multi-flux
Pour un seul flux, le node RSS Feed Trigger suffit : il surveille l'URL par polling et déclenche le workflow sur chaque nouvel article.
Pour une vraie veille multi-sources, préférez un Schedule Trigger (une à deux fois par jour — voir notre guide du Schedule Trigger et des fuseaux horaires) qui déroule une liste de flux avec un RSS Feed Read dans une boucle Loop Over Items. La liste des sources mérite d'être externalisée — dans une Data Table n8n, un Google Sheet ou une base Notion — pour qu'ajouter une source ne demande pas d'éditer le workflow. Activez « Continue On Fail » sur le node RSS : un flux en panne ne doit pas faire tomber la veille entière, et l'échec se signale via votre workflow d'erreur.
Sources sans flux ? Beaucoup en cachent un (/feed, /rss.xml — WordPress en expose d'office), les newsletters se convertissent par passerelle email-vers-RSS, et en dernier recours un scraping léger avec extraction IA remplace le flux manquant.
Étage 2 — Dédupliquer : la clé d'une veille qui ne radote pas
Un flux RSS renvoie ses N derniers articles à chaque lecture. Sans mémoire, votre pipeline retraite chaque matin les mêmes liens. La solution idiomatique tient en un node : Remove Duplicates en mode « Remove Items Processed in Previous Executions », avec le lien (ou le GUID) de l'article comme clé — n8n conserve l'historique des valeurs vues d'une exécution à l'autre et ne laisse passer que le neuf. Les modes, options et limites de ce node sont détaillés dans notre guide du node Remove Duplicates.
Subtilité utile : le même article syndiqué par deux sources porte deux URL différentes. Une normalisation légère (retrait des paramètres UTM, minuscules) ou une seconde déduplication sur le titre attrape l'essentiel de ces faux nouveaux.
Étage 3 — Filtrer avant de payer
Tout appel IA évité est gagné deux fois — en coût et en bruit. Avant l'étage IA, un node Filter (ou IF) élimine le hors-sujet sur critères simples : mots-clés dans le titre ou l'extrait, source, date. Sur une veille large, ce filtre écarte souvent plus de la moitié des articles ; le reste seulement mérite un jugement plus fin.
Étage 4 — L'IA en deux temps : scorer petit, résumer grand
Le pattern économique : un modèle rapide et peu coûteux attribue à chaque article survivant un score de pertinence (0-10) et une catégorie, via un Structured Output Parser pour garantir un JSON propre ; puis le modèle puissant ne résume que les articles au-dessus du seuil — trois phrases factuelles, l'angle « pourquoi c'est pertinent pour nous » explicité dans le prompt. Cette division du travail par paliers rejoint notre approche du suivi et de la maîtrise des coûts IA, et le fallback multi-fournisseurs la fiabilise. Veille internationale ? Un étage de traduction automatique s'insère naturellement ici.
Ce tri automatisé répond à un problème documenté de longue date par la recherche en management : la synthèse de Martin Eppler et Jeanne Mengis, « The Concept of Information Overload » (The Information Society, 2004, voir sur Google Scholar), montre que passé un certain volume d'information, la qualité des décisions décroît — la surcharge inverse le bénéfice de l'information supplémentaire. Une veille qui filtre et hiérarchise avant de livrer travaille précisément sur ce point de bascule : plus de couverture, moins de volume à absorber.
Étage 5 — Livrer en digest, pas en rafale
Regroupez : un node Aggregate (voir Split Out et Aggregate) rassemble les articles retenus, triés par score, en un seul message — sections par catégorie, titre cliquable, résumé, source. Livraison au choix : message Slack matinal (le format de notre workflow de digest quotidien, appliqué aux articles plutôt qu'aux emails), email, ou page Notion qui archive la veille et devient consultable — voire interrogeable si vous versez ces résumés dans une base vectorielle pour un RAG d'historique de veille.
Et si la veille est concurrentielle — surveiller les annonces, les prix et les pages des concurrents plutôt que la presse — le même squelette s'applique avec des sources différentes : notre guide de la veille concurrentielle par IA en est le prolongement direct.
En résumé
Une veille RSS sérieuse dans n8n, c'est cinq étages : Schedule Trigger sur une liste de sources externalisée, RSS Feed Read en boucle tolérante aux pannes, Remove Duplicates avec mémoire entre exécutions, filtre par mots-clés puis IA en deux temps (scorer économique, résumé haut de gamme), et un digest quotidien groupé. Comptez une demi-journée pour monter le pipeline — et chaque matin ensuite, trois minutes de lecture pour une couverture qu'aucune veille manuelle ne tiendrait.
FAQ
Questions fréquentes
Quelle est la différence entre le node RSS Feed Read et le RSS Feed Trigger dans n8n ?
RSS Feed Trigger surveille un seul flux et déclenche le workflow à chaque nouvel article détecté (par polling à l'intervalle configuré). RSS Feed Read lit un flux à la demande, au sein d'un workflow déjà déclenché — c'est lui qu'il faut pour une veille multi-sources : un Schedule Trigger, une liste de flux, une boucle, et un RSS Feed Read par passage.
Comment éviter de retraiter les mêmes articles à chaque exécution ?
Le flux RSS renvoie ses derniers articles à chaque lecture, déjà traités ou non. La parade idiomatique est le node Remove Duplicates en mode « Remove Items Processed in Previous Executions », avec le lien ou le GUID de l'article comme clé : n8n mémorise les valeurs déjà vues d'une exécution à l'autre et ne laisse passer que le neuf.
Un site sans flux RSS peut-il entrer dans la veille ?
Souvent oui : beaucoup de sites exposent un flux non annoncé (/feed, /rss.xml, /atom.xml — WordPress en génère un d'office), et les newsletters se convertissent en flux via des passerelles email-vers-RSS. En dernier recours, un scraping léger de la page des nouveautés, avec extraction par IA, remplace le flux manquant.
Comment limiter le coût IA d'une veille qui résume beaucoup d'articles ?
Trois leviers : filtrer par mots-clés avant tout appel IA (la majorité des articles ne méritent pas un résumé), résumer le extrait/chapeau du flux plutôt que l'article complet quand il suffit, et utiliser un modèle économique pour le scoring de pertinence en réservant le modèle puissant aux articles retenus pour le digest. Le coût par article traité chute d'un ordre de grandeur.
Bundle FlowKit Complet
269 €