Connecter Firecrawl à n8n : scraper le web en markdown prêt-pour-LLM pour vos pipelines RAG et agents IA
Publié le 2 août 2026 · 7 min de lecture
Un pipeline RAG ou un agent IA vaut ce que vaut le contenu qu'on lui donne à lire. Le problème, c'est que le web n'est pas écrit pour les LLM : une page produit contient trois fois plus de menu, de bandeau cookies et de scripts que de texte utile, et une bonne partie du contenu n'apparaît qu'après exécution du JavaScript — invisible pour un simple node HTTP Request. Firecrawl est un service de scraping conçu spécifiquement pour ce problème : il rend la page, élimine le bruit, et renvoie un markdown propre directement exploitable par un modèle de langage. Depuis 2026, il dispose d'un node natif dans n8n. Ce guide couvre l'installation, les opérations disponibles, et deux cas d'usage concrets : alimenter un pipeline RAG et équiper un AI Agent d'un outil de recherche web autonome.
Pourquoi un scraper dédié plutôt que HTTP Request + HTML Extract
Notre guide du scraping avec n8n détaille l'approche générique : HTTP Request récupère le HTML brut, HTML Extract ou un LLM en tire les champs utiles. Cette combinaison reste pertinente pour une page statique simple, mais elle bute sur trois cas fréquents : les sites rendus en JavaScript (le HTML brut est vide de contenu), les protections anti-bot qui bloquent les requêtes automatisées, et le bruit résiduel — navigation, publicités, pieds de page — qui pollue le contexte envoyé au LLM.
Ce dernier point n'est pas cosmétique : Christian Kohlschütter et ses co-auteurs montrent dans Boilerplate Detection using Shallow Text Features (WSDM 2010) que le texte de navigation et de gabarit dégrade la précision des traitements en aval dès qu'il n'est pas isolé du contenu principal — un problème directement transposable à un LLM qui doit répondre à partir d'un contexte scrapé : chaque token de menu ou de bandeau consommé est un token en moins pour l'information utile, et une source de confusion en plus. Firecrawl s'occupe de ce nettoyage en amont : rendu JavaScript, contournement raisonnable des protections anti-bot, et conversion en markdown qui élimine l'essentiel du gabarit — Firecrawl annonce environ 67 % de tokens en moins qu'un envoi du HTML brut au modèle.
Installer le node Firecrawl dans n8n
Sur n8n Cloud
Depuis le partenariat annoncé en mars 2026, l'intégration est native : ajoutez le node Firecrawl à votre canvas, cliquez sur Connect, et créez (ou reliez) votre compte Firecrawl sans jamais quitter l'éditeur — aucune clé API à copier-coller.
Sur une instance self-hosted
Le node communautaire officiel s'appelle @mendable/n8n-nodes-firecrawl. Un administrateur de l'instance doit d'abord activer et installer les nodes communautaires :
- Settings > Community Nodes, puis Install a community node.
- Renseignez le nom du package (
@mendable/n8n-nodes-firecrawl) et validez. - Une fois l'installation confirmée, créez un credential Firecrawl API avec une clé récupérée sur le tableau de bord firecrawl.dev — traitez-la comme n'importe quelle clé sensible, en suivant nos conseils pour sécuriser les credentials API dans n8n.
Vérifiez la version de votre instance : l'utilisation du node comme outil d'un AI Agent (voir plus bas) nécessite n8n 1.79.0 ou supérieur.
Les opérations du node : scrape, crawl, map, search, extract
Le node expose plusieurs opérations, à combiner selon le besoin :
- Scrape : récupère une seule URL et renvoie son contenu en markdown, HTML, données structurées (via extraction par LLM) ou capture d'écran. L'opération de base pour une page identifiée.
- Map : liste toutes les URL découvrables d'un site sans en récupérer le contenu — utile pour repérer les pages pertinentes avant de les scraper une par une, plutôt que de tout crawler à l'aveugle.
- Crawl, avec son suivi Crawl Status, Crawl Active et Crawl Errors : parcourt un site (ou une section) en suivant les liens et scrape chaque page trouvée. Le job est asynchrone — on le lance, puis on interroge son statut jusqu'à complétion.
- Batch Scrape, avec Batch Scrape Status et Batch Scrape Errors : scrape une liste connue d'URL en un seul job, plus efficace qu'une boucle de Scrape unitaires quand on dispose déjà de la liste.
- Search : effectue une recherche web et peut récupérer le contenu des résultats en une seule opération.
- Extract : demande à un modèle d'extraire des données structurées à partir d'une ou plusieurs pages selon un schéma défini, plutôt qu'un texte brut à retraiter ensuite.
- Team Usage Metrics : remonte la consommation de crédits de l'équipe, pratique pour surveiller le coût depuis n8n sans repasser par le tableau de bord Firecrawl.
Le node ne couvre pas la totalité de l'API Firecrawl : l'endpoint /agent, par exemple, n'est pas exposé et reste réservé à un appel HTTP Request direct pour qui en a besoin.
Cas d'usage 1 : alimenter un pipeline RAG en contenu web frais
Pour une base de connaissances qui doit refléter un contenu public à jour (documentation produit publiée sur un site tiers, pages concurrentes suivies dans le cadre d'une veille concurrentielle, articles d'un blog partenaire), le pipeline type ressemble à ceci :
- Schedule Trigger hebdomadaire ou déclenchement manuel.
- Firecrawl — Map sur le site cible pour lister les URL, éventuellement filtrées par motif (
/docs/*,/blog/*). - Firecrawl — Batch Scrape sur les URL retenues, en sortie markdown.
- Chunking du markdown obtenu, selon les mêmes principes que pour un PDF — voir notre guide du chunking pour un RAG n8n — le markdown ayant l'avantage d'être déjà structuré par titres, ce qui facilite un découpage qui respecte les sections.
- Embeddings puis stockage dans votre base vectorielle, en suivant l'architecture décrite dans notre guide du RAG avec n8n et Supabase.
Le Pack Assistant RAG (119 €) fournit déjà les briques d'ingestion, de vectorisation et de chatbot avec citations : il suffit d'y substituer la source PDF par ce pipeline Firecrawl en amont pour ingérer du contenu web plutôt que des documents internes.
Cas d'usage 2 : Firecrawl comme outil d'un AI Agent
Plutôt qu'un pipeline planifié, Firecrawl peut aussi devenir un outil que l'agent invoque lui-même en cours de conversation — le même principe que pour n'importe quel outil personnalisé branché sur un AI Agent, détaillé dans notre guide du node AI Agent. Concrètement, attachez le node Firecrawl en mode outil sur le connecteur Tool de l'agent, avec une description précise de son usage (« recherche des informations récentes sur le web quand la question porte sur un fait après ta date de connaissance, ou sur un site externe précis fourni par l'utilisateur »).
L'agent décide alors seul quand chercher : un assistant de veille peut scraper à la demande la page produit d'un concurrent mentionnée dans la conversation, sans qu'un pipeline planifié n'ait eu besoin de l'anticiper. C'est un complément naturel au RAG agentique, où le Vector Store Tool interroge une base déjà constituée pendant que le Firecrawl Tool va chercher ce qui n'y est pas encore.
Crédits et coûts : ce qu'il faut surveiller
Firecrawl facture à l'usage, en crédits. Scrape, Crawl, Map et Monitor coûtent chacun 1 crédit par page ; les opérations plus lourdes coûtent davantage (Interact : 2 crédits par minute de navigateur ; Stealth Mode, pour les sites très protégés : 5 crédits par page). Un palier gratuit de 1000 crédits par mois suffit pour tester le node ou faire tourner un petit pipeline occasionnel ; les plans payants démarrent autour de 16 $/mois. Point d'attention : une page qui renvoie une erreur consomme quand même un crédit, et les crédits non utilisés ne se reportent pas d'un mois sur l'autre — un Crawl mal ciblé sur un site de plusieurs milliers de pages peut épuiser un forfait rapidement si l'opération Map n'a pas été utilisée en amont pour filtrer les URL pertinentes.
Légalité et bonnes pratiques
Firecrawl gère la mécanique technique du scraping, pas le cadre juridique qui l'entoure. Les repères posés par Vlad Krotov et ses co-auteurs dans Tutorial: Legality and Ethics of Web Scraping (Communications of the AIS, 2020) restent valables quel que soit l'outil utilisé : vérifiez le fichier robots.txt et les conditions d'utilisation du site cible, limitez le périmètre du Crawl à ce qui est réellement nécessaire, et soyez particulièrement prudent dès que des données personnelles apparaissent dans le contenu récupéré. Firecrawl facilite l'accès au contenu, il ne dispense d'aucune de ces vérifications.
En résumé
Firecrawl comble un manque réel entre HTTP Request brut et un scraping industriel : rendu JavaScript, contournement des blocages courants, et surtout markdown propre directement injectable dans un pipeline RAG ou un agent, sans sélecteurs CSS à maintenir. Sur n8n Cloud, la connexion tient en un clic ; en self-hosted, le node communautaire @mendable/n8n-nodes-firecrawl s'installe en quelques minutes. Reste à choisir le bon mode : Scrape/Crawl planifiés pour alimenter une base vectorielle en continu, ou Firecrawl en outil d'agent pour une recherche web à la demande — les deux se combinent très bien avec le Pack Assistant RAG (119 €) comme socle.
FAQ
Questions fréquentes
Firecrawl est-il un node natif de n8n ou faut-il l'installer ?
Sur n8n Cloud, l'intégration est native depuis mars 2026 : on ajoute le node Firecrawl et on se connecte en un clic, sans clé API à gérer. Sur une instance self-hosted, c'est un node communautaire (@mendable/n8n-nodes-firecrawl) qu'un administrateur installe depuis Settings > Community Nodes, puis chacun se connecte avec sa propre clé API Firecrawl.
Quelle est la différence entre Scrape, Crawl et Map dans le node Firecrawl ?
Scrape récupère une seule URL et renvoie son contenu en markdown, HTML, données structurées ou capture d'écran. Map liste toutes les URL découvrables d'un site sans en récupérer le contenu, utile pour cibler ensuite précisément quelles pages scraper. Crawl parcourt un site entier (ou une section) en suivant les liens et scrape chaque page trouvée, avec des opérations de suivi (Crawl Status, Crawl Errors) pour un job forcément asynchrone.
Firecrawl remplace-t-il le scraping avec HTTP Request et HTML Extract dans n8n ?
Pas systématiquement. Pour une page statique simple, HTTP Request + HTML Extract reste gratuit et suffisant. Firecrawl devient pertinent dès que le site est rendu en JavaScript, protégé par des mesures anti-bot, ou que vous voulez du markdown propre et directement injectable dans un LLM sans écrire de sélecteurs CSS fragiles à chaque refonte du site cible.
Combien coûte l'utilisation de Firecrawl dans un workflow n8n ?
Firecrawl facture au crédit : 1 crédit par page pour Scrape, Crawl, Map et Monitor, davantage pour les opérations avancées (Interact, Stealth Mode). Un palier gratuit offre 1000 crédits par mois, suffisant pour tester ou alimenter un petit pipeline ; les plans payants démarrent autour de 16 $/mois. L'opération Team Usage Metrics du node permet de suivre la consommation directement depuis n8n.
Bundle FlowKit Complet
269 €