FlowKit

Connecter Groq à n8n : l'inférence IA la plus rapide du marché pour vos automatisations

Publié le 3 août 2026 · 6 min de lecture

Groq occupe une niche à part dans le paysage des fournisseurs de LLM : l'entreprise ne cherche pas à sortir le modèle le plus intelligent, mais à faire tourner les meilleurs modèles ouverts (Llama en tête) sur un matériel conçu pour une seule chose — répondre vite. Son LPU (Language Processing Unit), une puce dédiée à l'inférence plutôt qu'à l'entraînement, affiche des débits de génération très supérieurs à ceux obtenus sur GPU classique, pour un coût par token parmi les plus bas du marché. Pour un workflow n8n, cette combinaison vitesse + prix ouvre des cas d'usage que les fournisseurs plus lents rendent simplement peu pratiques : agents conversationnels en temps réel, callbots vocaux, tri d'emails à très haut volume. Ce guide montre comment connecter Groq à n8n par le node natif ou par l'API compatible OpenAI, et où cette rapidité change vraiment la donne.

Pourquoi Groq dans un workflow n8n

Deux arguments justifient d'ajouter Groq à votre boîte à outils, à côté de vos fournisseurs habituels.

  • La vitesse change l'expérience utilisateur, pas juste le confort. Une étude publiée en 2025 dans International Journal of Human–Computer Interaction (Kim et al., « From Seconds to Sentiments: Differential Effects of Chatbot Response Latency on Customer Evaluations » — voir sur Google Scholar) montre que la latence de réponse d'un chatbot influence directement la satisfaction et la confiance perçue par l'utilisateur, avec un effet particulièrement marqué dès que la réponse s'écarte du rythme d'une conversation naturelle. Pour un chatbot ou un widget de chat IA sur votre site, ou pire pour un agent vocal qui répond au téléphone, chaque seconde d'attente au niveau du LLM se répercute directement sur l'expérience — et Groq est justement pensé pour éliminer ce maillon-là de la latence.
  • Le matériel spécialisé change l'équation coût/vitesse. Un état de l'art académique sur l'accélération matérielle de l'inférence des grands modèles de langage (Li et al., « Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective », arXiv 2024 — voir sur Google Scholar) situe les puces dédiées à l'inférence comme le LPU de Groq parmi les architectures qui obtiennent les meilleurs débits par rapport aux GPU généralistes, précisément parce qu'elles sont taillées pour un seul usage plutôt que pour l'entraînement et l'inférence à la fois. C'est cette spécialisation qui explique pourquoi Groq peut proposer des tarifs par token très compétitifs sur des modèles ouverts que vous pourriez, par ailleurs, faire tourner vous-même.

Pour un workflow n8n, la traduction est concrète : des étapes IA qui répondaient en 3 ou 4 secondes chez un fournisseur généraliste peuvent répondre en une fraction de seconde chez Groq, sans changer de modèle (Llama reste Llama), juste en changeant d'hébergeur.

Créer la clé API

  1. Créez un compte sur console.groq.com.
  2. Aucune carte bancaire n'est nécessaire pour démarrer sur le tier gratuit — pratique pour tester avant de vous engager.
  3. Dans la section API Keys, générez une clé et copiez-la immédiatement.

Comme pour tout fournisseur IA, stockez cette clé exclusivement dans le gestionnaire de crédentiels de n8n, jamais en dur dans un node Code — les bons réflexes sont détaillés dans notre guide sur la sécurisation des crédentiels API.

Méthode 1 : le node Groq Chat Model natif

n8n propose un node Groq Chat Model intégré (n8n-nodes-langchain.lmChatGroq). Comme les autres modèles de chat, c'est un sous-node LangChain : il ne s'exécute pas seul, il se branche sur un node parent — AI Agent, LLM Chain, Text Classifier ou Information Extractor. Si ces briques sont nouvelles pour vous, notre guide pour débuter avec les nodes IA de n8n pose les bases.

  1. Ajoutez le node parent (un AI Agent, par exemple), puis attachez un Groq Chat Model comme modèle de langage.
  2. Créez le crédentiel avec votre clé API Groq.
  3. Choisissez le modèle dans la liste chargée dynamiquement depuis l'API Groq (les modèles Llama de Meta sont le choix par défaut le plus courant ; Groq héberge aussi d'autres modèles ouverts selon les disponibilités du moment).

C'est la méthode à privilégier pour tout nouveau workflow : crédentiel dédié, paramètres exposés proprement, aucune URL à bricoler.

Méthode 2 : API compatible OpenAI (base URL ou HTTP Request)

L'API de Groq est compatible avec le format OpenAI. Deux conséquences pratiques :

  • Crédentiel OpenAI détourné : créez un crédentiel OpenAI dans n8n avec votre clé Groq et remplacez la base URL par https://api.groq.com/openai/v1. Les nodes OpenAI existants fonctionnent alors avec Groq en saisissant le nom du modèle à la main — utile pour comparer la latence de Groq sur un workflow déjà câblé pour GPT ou Claude sans rien recâbler.
  • Node HTTP Request : pour un contrôle total sur les paramètres, appelez l'endpoint directement :
POST https://api.groq.com/openai/v1/chat/completions
Authorization: Bearer {{ $credentials.apiKey }}
{
  "model": "llama-3.3-70b-versatile",
  "messages": [
    { "role": "system", "content": "Tu classes les emails en : facture, support, spam, autre. Réponds par un seul mot." },
    { "role": "user", "content": "{{ $json.emailBody }}" }
  ],
  "temperature": 0
}

Troisième voie : passer par OpenRouter, qui propose Groq comme un hébergeur possible parmi d'autres pour les mêmes modèles ouverts. Vous y perdez un peu de marge tarifaire et de latence brute, mais vous y gagnez une bascule instantanée vers un autre hébergeur si Groq est saturé ou indisponible.

Un cas particulier : la transcription audio avec Whisper

Groq héberge aussi des modèles Whisper (reconnaissance vocale) sur son infrastructure LPU, avec des temps de transcription nettement plus courts que sur une exécution classique. Si vos workflows transcrivent des réunions ou des messages vocaux, c'est un axe à tester en complément de notre guide sur la transcription et le résumé de réunions : même pipeline, même modèle, mais un aller-retour beaucoup plus rapide — un vrai avantage pour tout ce qui doit rester perçu comme « en direct ».

Où Groq excelle dans n8n

Le positionnement naturel de Groq, c'est tout ce où la latence se voit :

  • Agents vocaux et callbots : chaque aller-retour LLM s'ajoute à la reconnaissance vocale et à la synthèse ; réduire ce maillon à quelques centaines de millisecondes change la fluidité perçue d'une conversation téléphonique automatisée.
  • Chatbots et widgets de chat en temps réel : sur un site ou une app, un temps de réponse proche de l'instantané rapproche l'échange d'une vraie conversation plutôt que d'un formulaire qui répond en différé.
  • Triage à très haut volume : classer des milliers d'emails, tickets ou avis clients par jour à la fois vite et à faible coût — le même terrain que couvre notre Pack Inbox IA (79 €), qui peut tourner sur des modèles Groq pour les étapes de classification les plus fréquentes.
  • Étage rapide d'une cascade multi-fournisseurs : Groq en première ligne pour les cas simples, un modèle plus lent mais plus capable en recours pour les cas ambigus — le pattern est détaillé dans notre guide du fallback multi-fournisseurs.

Limites et prudence

Restez lucide sur deux points avant de bâtir un workflow critique dessus.

Rotation des modèles disponibles. Groq n'entraîne pas ses propres modèles : il héberge des modèles ouverts, et son catalogue évolue au fil des versions disponibles (Llama en particulier change de génération régulièrement). Un workflow qui code en dur un nom de modèle précis peut se retrouver en défaut le jour où ce modèle est retiré du catalogue ; vérifiez la liste des modèles actifs dans la console Groq avant un déploiement en production, et prévoyez un modèle de repli.

Débit limité côté gratuit. Le tier gratuit est généreux pour tester, mais ses limites de requêtes par minute deviennent vite le facteur limitant sur un vrai volume de production. Si votre workflow monte en charge, passez sur un plan payant et surveillez la consommation avec la même rigueur que pour n'importe quel fournisseur — notre méthode de suivi du coût des appels IA par workflow s'applique aussi bien à Groq qu'à OpenAI ou Anthropic.

En résumé

  • Créez votre clé sur console.groq.com (aucune carte bancaire requise pour démarrer) et stockez-la dans le gestionnaire de crédentiels de n8n.
  • Utilisez le node Groq Chat Model natif pour les nouveaux workflows, ou la base URL https://api.groq.com/openai/v1 sur un crédentiel OpenAI pour recycler l'existant.
  • Réservez Groq aux étapes où la latence se voit : agents vocaux, chatbots temps réel, triage à haut volume, ou comme étage rapide d'une cascade multi-fournisseurs.
  • Vérifiez régulièrement la liste des modèles actifs et surveillez les limites de débit avant de dépendre de Groq en production.

FAQ

Questions fréquentes

Groq et Grok, c'est la même chose ?

Non, et la confusion est fréquente. Grok est le chatbot de xAI (Elon Musk). Groq (sans « k » après le « o ») est une entreprise d'infrastructure IA qui fabrique des puces spécialisées pour l'inférence — le LPU (Language Processing Unit) — et héberge des modèles ouverts comme Llama. C'est ce second Groq que ce guide connecte à n8n.

Groq entraîne-t-il ses propres modèles ?

Non. Groq n'entraîne pas de modèles frontière : l'entreprise héberge des modèles ouverts (Llama de Meta, Kimi de Moonshot, Whisper d'OpenAI pour l'audio…) sur son propre matériel, taillé pour l'inférence à très basse latence. La valeur ajoutée est la vitesse et le coût, pas la nouveauté des modèles eux-mêmes.

Le node OpenAI de n8n fonctionne-t-il avec Groq ?

Oui. L'API de Groq est compatible avec le format OpenAI : créez un crédentiel OpenAI dans n8n avec votre clé Groq et remplacez la base URL par https://api.groq.com/openai/v1, puis saisissez le nom du modèle Groq voulu. C'est utile pour tester Groq sur un workflow déjà câblé, mais le node Groq Chat Model natif reste plus simple pour un nouveau montage.

Le tier gratuit de Groq suffit-il pour un workflow en production ?

Pour prototyper ou pour un faible volume, oui — aucune carte bancaire n'est requise à l'inscription. Mais le tier gratuit applique des limites de requêtes par minute qui deviennent vite le facteur limitant sur un workflow n8n à volume réel (tri d'emails, agent conversationnel). Passez sur un plan payant dès que le workflow quitte le stade du test, et surveillez vos limites de débit comme n'importe quelle API tierce.

Bundle FlowKit Complet

269 €