FlowKit

Enrichir automatiquement ses leads avec n8n : de l'email au profil complet

Publié le 27 juillet 2026 · 7 min de lecture

Un lead vient de remplir votre formulaire : « Marie », « marie@exemple-industrie.fr », et un message de deux lignes. C'est tout. Pour savoir si ce lead vaut un appel dans l'heure ou un email groupé la semaine prochaine, votre commercial ouvre LinkedIn, tape le nom de l'entreprise dans Google, cherche l'effectif, le secteur, les actualités récentes — dix à quinze minutes par lead, multipliées par vingt soumissions par jour. Ce travail de recherche est entièrement automatisable. Cet article construit, brique par brique, un pipeline n8n qui part d'un simple email professionnel et livre au CRM un profil complet : domaine, activité, taille, identifiants légaux français, le tout en moins d'une minute après la soumission.

Enrichir d'abord, qualifier ensuite

L'enrichissement se place avant la qualification, et les deux ne font pas la même chose. Notre guide sur la qualification des leads entrants par IA montre comment scorer un lead à partir de son message ; mais un scoring ne vaut que ce que valent ses données d'entrée. « Nous cherchons une solution de gestion des devis » n'a pas le même poids venant d'un artisan seul ou d'une ETI de 200 personnes — et cette information ne figure jamais dans le formulaire. L'enrichissement fournit précisément le contexte qui rend le scoring pertinent : secteur, taille, ancienneté, signaux d'activité.

Le point d'entrée du pipeline est le même que pour la qualification : un webhook qui reçoit la soumission du formulaire — voir notre guide complet des webhooks n8n pour la mise en place et la sécurisation, ou un Form Trigger natif si vous préférez héberger le formulaire dans n8n. À partir de là, quatre étapes : extraire le domaine, visiter le site, interroger les bases de données, consolider et pousser au CRM.

Étape 1 — Extraire le domaine et filtrer les emails personnels

Tout part du domaine de l'email. Un node Code (n8n-nodes-base.code) suffit :

const email = ($json.email || '').toLowerCase().trim();
const domain = email.split('@')[1] ?? '';
const personalDomains = [
  'gmail.com', 'outlook.com', 'outlook.fr', 'hotmail.com', 'hotmail.fr',
  'yahoo.com', 'yahoo.fr', 'icloud.com', 'protonmail.com', 'proton.me',
  'orange.fr', 'wanadoo.fr', 'free.fr', 'sfr.fr', 'laposte.net'
];
return [{
  json: {
    ...$json,
    domain,
    isPro: domain !== '' && !personalDomains.includes(domain)
  }
}];

Un node IF route ensuite sur isPro. Les emails personnels (Gmail, Outlook, Orange…) ne sont pas des déchets — un dirigeant de TPE écrit souvent depuis son adresse perso — mais l'enrichissement par domaine ne s'applique pas à eux : ils filent directement vers le scoring du message, pendant que les emails professionnels empruntent en plus la branche d'enrichissement. Pour un cas simple, une expression en une ligne ({{ $json.email.split('@')[1] }}) remplace le node Code, mais la liste de domaines personnels justifie à elle seule d'écrire les trois lignes de JavaScript.

Étape 2 — Visiter le site de l'entreprise et le faire lire par un LLM

Le domaine donne l'URL du site : un node HTTP Request en GET sur https://{{ $json.domain }} récupère la page d'accueil (activez « Ignore SSL Issues » avec parcimonie, et surtout un timeout court : un site qui ne répond pas en dix secondes ne doit pas bloquer le pipeline). Le HTML brut part ensuite dans une chaîne LLM avec un prompt d'extraction structurée : activité principale, produits ou services, taille apparente (mentions d'équipe, « nos agences », recrutements en cours), actualités visibles, langue et marchés cibles.

Deux briques rendent cette étape fiable. D'abord le nettoyage du HTML avant l'appel au modèle — balises scripts et styles supprimées, texte tronqué à quelques milliers de caractères — pour maîtriser le coût en tokens, une technique détaillée dans notre guide du scraping web avec n8n et l'IA. Ensuite le Structured Output Parser, qui force le LLM à répondre dans un schéma JSON strict (activite, taille_estimee, signaux_achat, resume_une_phrase) : sans lui, vous récupérez un paragraphe libre impossible à mapper sur des champs CRM.

Ce que le LLM apporte ici et qu'aucune base de données ne fournit : la lecture à date du site. Une actualité de levée de fonds, une page « recrutement » bien remplie ou une refonte récente sont des signaux d'achat que le commercial exploitera dans son premier message — exactement ce qu'il allait chercher à la main.

Étape 3 — Bases spécialisées et données ouvertes françaises

En parallèle du site (les deux branches partent du même node, c'est tout l'intérêt de l'exécution parallèle), deux familles de sources structurées complètent le tableau.

Les APIs d'enrichissement commerciales. Des services comme Dropcontact, Clearbit ou Hunter maintiennent des bases B2B interrogeables par email ou par domaine : ils renvoient selon les cas la fiche entreprise, des contacts vérifiés, la fonction de la personne, les technologies détectées sur le site. Dans n8n, chacun s'appelle via un simple node HTTP Request avec la clé d'API en header — consultez leur documentation pour les endpoints et les conditions, qui évoluent régulièrement. Leur valeur ajoutée est la donnée vérifiée et déduplicée ; leur limite, la couverture, meilleure sur certains marchés que d'autres.

Les données ouvertes françaises. Pour un lead français, l'API Recherche d'entreprises (recherche-entreprises.api.gouv.fr), gratuite et sans clé d'API, interroge la base SIRENE par nom ou par domaine et renvoie le SIREN, le code NAF (donc le secteur officiel), la tranche d'effectifs, la date de création et l'adresse du siège. Un GET sur /search?q=nom-de-l-entreprise suffit. C'est la source la plus sous-utilisée des pipelines d'enrichissement : officielle, exhaustive sur la France, et sans coût. Le SIREN récupéré devient en plus une clé de déduplication fiable dans le CRM — deux leads du même groupe se rattachent à la même fiche entreprise.

Étape 4 — Consolider avec un Merge, scorer, pousser dans le CRM

Les branches parallèles (extraction LLM du site, API commerciale éventuelle, SIRENE) se rejoignent sur un node Merge en mode combinaison : chaque branche apporte ses champs, et l'item de sortie contient le profil complet. Les subtilités de position, de clé de jointure et de champs en conflit sont couvertes dans notre guide pour combiner des données avec le node Merge — le piège classique ici étant une branche qui ne renvoie rien (site injoignable, entreprise absente de SIRENE) et qu'il faut configurer pour ne pas bloquer la jointure.

Sur ce profil consolidé, le scoring de notre guide de qualification devient nettement plus discriminant : le barème peut désormais pondérer le secteur (code NAF dans votre cible ou non), la taille (tranche d'effectifs SIRENE) et les signaux d'achat détectés sur le site, en plus du message lui-même. Enfin, un node HubSpot ou Pipedrive écrit le lead avec tous les champs enrichis — SIREN, NAF, effectifs, résumé d'activité, score et justification — en suivant les bonnes pratiques de notre guide de synchronisation CRM HubSpot/Pipedrive : recherche du contact existant avant création, et le SIREN comme champ de rapprochement côté entreprise.

Le RGPD n'interdit pas l'enrichissement — il le cadre

Enrichir des données professionnelles en B2B repose classiquement sur la base légale de l'intérêt légitime, défendable pour de la prospection ciblée sur des personnes contactées en leur qualité professionnelle. Trois conditions pour rester du bon côté :

  • Minimisation : ne conserver que les champs que le scoring et le commercial utilisent réellement. Un pipeline qui aspire tout ce que les APIs renvoient « au cas où » contredit frontalement ce principe.
  • Information : la personne doit être informée de la collecte indirecte au plus tard lors du premier contact — une ligne dans l'email du commercial et une politique de confidentialité à jour suffisent en pratique.
  • Maîtrise du cycle de vie : durée de conservation définie, et capacité à retrouver et supprimer les données d'une personne qui l'exige. Si ce volet n'est pas encore outillé chez vous, notre guide pour traiter les demandes RGPD avec n8n et le Pack Conformité & Audit (149 €) couvrent l'automatisation des demandes d'accès et d'effacement avec piste d'audit.

Un garde-fou simple dans le workflow : un node Set final qui liste explicitement les champs conservés, plutôt que de pousser l'objet entier au CRM. La minimisation devient alors une propriété du pipeline, pas une bonne intention.

Pourquoi tout ça doit se jouer en minutes, pas en heures

Si l'enrichissement était fait à la main le lendemain matin, autant dire qu'il ne servirait à rien. L'étude de référence sur le sujet, « The Short Life of Online Sales Leads » d'Oldroyd, McElheran et Elkington, publiée dans la Harvard Business Review en 2011 (voir sur Google Scholar), a analysé de grands volumes de leads B2B et leurs délais de traitement : les entreprises qui contactent un lead dans l'heure suivant sa soumission ont environ sept fois plus de chances de le qualifier que celles qui attendent ne serait-ce qu'une heure de plus — et l'écart devient vertigineux au-delà de 24 heures. Le lead en ligne est un produit périssable.

C'est l'argument central en faveur de ce pipeline : l'enrichissement automatique ne fait pas seulement gagner dix minutes de recherche par lead, il rend possible un premier contact informé pendant la fenêtre où le lead est encore chaud. Le commercial reçoit la notification avec le profil complet et le score pendant que le prospect est encore devant son écran, potentiellement encore sur votre site.

Aller plus loin

Ce pipeline d'enrichissement partage son squelette — webhook, appels parallèles, extraction IA structurée, routage — avec les workflows de tri d'emails entrants du Pack Inbox IA (79 €) : si votre acquisition passe autant par la boîte mail que par le formulaire, les mêmes briques trient, résument et priorisent les demandes entrantes avant même l'étape CRM. Et une fois le lead enrichi, scoré et poussé dans le CRM, l'étape suivante logique est de raccourcir encore le délai de premier contact en laissant le lead réserver directement un créneau — c'est l'objet de notre guide sur la planification de rendez-vous par IA avec n8n.

FAQ

Questions fréquentes

Faut-il payer une API d'enrichissement pour commencer ?

Non. Un premier pipeline très utile se construit sans aucun abonnement : extraction du domaine depuis l'email, visite du site de l'entreprise avec extraction par LLM, et interrogation de l'API Recherche d'entreprises de l'État français, gratuite et sans clé, pour le SIREN, le code NAF et la tranche d'effectifs. Les APIs commerciales (Dropcontact, Clearbit, Hunter…) s'ajoutent ensuite si vous avez besoin de données qu'elles seules fournissent, comme les contacts vérifiés ou les technologies utilisées.

Que faire des leads qui s'inscrivent avec un email personnel (Gmail, Outlook…) ?

Ne les jetez pas : un email personnel ne signifie pas un mauvais lead, seulement que l'enrichissement par domaine ne s'applique pas. Le bon réflexe est un node IF qui route ces leads vers le pipeline de qualification classique (scoring du message par LLM), pendant que les emails professionnels passent en plus par la branche d'enrichissement entreprise.

L'enrichissement de leads B2B est-il compatible avec le RGPD ?

Oui, à condition de le cadrer : base légale de l'intérêt légitime (défendable en prospection B2B sur des données professionnelles), minimisation (ne collecter que les champs réellement utilisés par le scoring et le commercial), information de la personne lors du premier contact, et durée de conservation définie. Enrichir des données sensibles ou constituer un profil disproportionné par rapport à la finalité ferait basculer le dispositif du mauvais côté.

Combien de temps met le pipeline pour enrichir un lead ?

De quelques secondes à une minute environ, selon le temps de réponse du site visité et des APIs appelées. C'est le cœur de l'argument : la recherche d'Oldroyd et ses co-auteurs montre que la probabilité de qualifier un lead chute fortement au-delà de la première heure. Un enrichissement automatique déclenché à la soumission garantit que le commercial dispose d'un dossier complet dans les minutes qui suivent, pas le lendemain.

Bundle FlowKit Complet

269 €