FlowKit

Transcrire et résumer des vidéos YouTube dans n8n : pipeline complet avec IA

Publié le 3 août 2026 · 6 min de lecture

Un concurrent publie une démonstration produit de 40 minutes sur YouTube, un client vous envoie le lien d'un webinaire à « regarder quand vous aurez le temps », ou votre veille sectorielle repose de plus en plus sur des vidéos plutôt que des articles. Dans les trois cas, le goulot d'étranglement est le même : personne n'a une heure à consacrer à chaque vidéo pour en extraire l'essentiel. n8n peut automatiser ce travail — transcription, résumé structuré, diffusion — mais contrairement à ce qu'on pourrait attendre, il n'existe pas de bouton « récupérer la transcription » intégré au node YouTube. Ce guide explique pourquoi, et détaille les trois façons de construire ce pipeline malgré tout.

Pourquoi le node YouTube de n8n ne suffit pas

Le node natif YouTube (catégorie Google, authentification OAuth2) est pensé pour gérer votre propre chaîne : uploader une vidéo, modifier son titre ou sa description, lister ou répondre aux commentaires, consulter des statistiques. Aucune de ces opérations ne renvoie le texte des sous-titres — et pour cause : l'API officielle YouTube Data v3 ne permet de télécharger une piste de sous-titres (captions.download) que si le compte authentifié est propriétaire de la vidéo. Pour analyser la vidéo d'un tiers, même publique et même si elle affiche des sous-titres, cette voie officielle est fermée.

Il reste trois façons de contourner cette limite, avec des compromis différents.

Méthode 1 — Une API tierce via HTTP Request (la plus simple)

Plusieurs services exposent une API REST dédiée à l'extraction de transcriptions YouTube (RapidAPI héberge plusieurs offres de ce type, tout comme des plateformes comme Apify ou DumplingAI). Le principe est identique à toute intégration par API que nous documentons ailleurs, par exemple pour Firecrawl ou Perplexity : un node HTTP Request envoie l'URL ou l'ID de la vidéo, l'API retourne le texte de la transcription (souvent avec horodatage par segment), en JSON.

Avantages : aucune infrastructure à gérer, une réponse en quelques secondes, un coût par appel généralement de l'ordre de quelques centimes. C'est la méthode à privilégier pour un workflow en production, surtout sur n8n Cloud où l'exécution de commandes système n'est pas disponible.

Limite à connaître : ces API reposent elles-mêmes sur les sous-titres publiés par YouTube (automatiques ou ajoutés par le créateur). Si une vidéo n'en a aucun, l'appel échoue — il faut alors basculer sur une transcription audio (méthode 3).

Méthode 2 — YouTube Data API v3, uniquement pour vos propres vidéos

Si le besoin porte sur votre propre chaîne (par exemple générer automatiquement un article de blog à partir de vos webinaires ou tutoriels), la YouTube Data API v3 redevient pertinente : le node YouTube de n8n liste les sous-titres disponibles (captions.list) et un appel HTTP authentifié permet de les télécharger. Le quota gratuit (10 000 unités/jour) est largement suffisant pour ce cas d'usage, une opération de téléchargement coûtant environ 200 unités.

Cette méthode ne fonctionne pas pour une vidéo dont vous n'êtes pas propriétaire : Google bloque explicitement ce cas pour des raisons de droits d'auteur.

Méthode 3 — yt-dlp en self-hosted, pour un contrôle total

Sur une instance n8n self-hosted, un node Execute Command peut appeler yt-dlp (l'outil open source successeur de youtube-dl) pour télécharger directement les sous-titres au format texte, ou l'audio brut si aucun sous-titre n'existe. C'est la méthode la plus flexible et la moins coûteuse à l'usage — mais elle a un prix en maintenance : yt-dlp doit être mis à jour régulièrement pour suivre les changements côté YouTube, et cette option n'existe pas sur n8n Cloud, où l'exécution de commandes système est désactivée pour des raisons de sécurité — un arbitrage de plus à peser dans notre comparatif n8n self-hosted ou cloud.

Si aucun sous-titre n'est disponible, yt-dlp télécharge l'audio, qui part ensuite vers le node OpenAI en mode transcription (whisper-1) — exactement le pipeline détaillé dans notre guide sur la transcription de réunions avec Whisper, à la différence près que la source est une vidéo publique plutôt qu'un enregistrement interne.

Construire le pipeline complet

Une fois la transcription récupérée, quelle que soit la méthode, le reste du workflow est identique :

  1. Déclencheur : un Form Trigger où l'on colle une URL pour un usage ponctuel, ou un Schedule Trigger qui surveille une playlist ou une liste de chaînes concurrentes pour une veille automatisée.
  2. Extraction : la méthode choisie ci-dessus, avec un nœud IF pour basculer sur la transcription audio si l'appel de sous-titres échoue.
  3. Résumé structuré : une Basic LLM Chain couplée à un Structured Output Parser pour forcer une sortie JSON exploitable — titre, résumé en 3-4 phrases, points clés, citations marquantes avec horodatage. Un modèle économique comme GPT-4.1 mini ou Claude Haiku suffit pour cette tâche d'extraction, comme détaillé dans notre guide connecter Claude ou GPT à n8n.
  4. Diffusion : un message Slack pour l'équipe (même canal que le digest quotidien du Pack Inbox IA), ou une page Notion pour l'archivage — le même pattern de diffusion que celui utilisé dans notre guide sur les comptes-rendus de réunion.
  5. Recherche a posteriori : si le volume de vidéos traitées grossit (veille concurrentielle hebdomadaire, archive de webinaires), vectoriser les transcriptions dans la même architecture que notre guide RAG avec Supabase pgvector permet de poser des questions du type « qu'a dit tel concurrent sur tel sujet ce trimestre » plutôt que de rouvrir chaque résumé un par un.

Si la vidéo n'est pas en français, une étape de traduction avant résumé — voir notre guide traduire des contenus automatiquement avec l'IA — évite de perdre en nuance par rapport à un résumé fait directement dans la langue source puis traduit après coup.

Gérer les échecs

Trois points de rupture reviennent souvent sur ce type de pipeline : vidéo sans sous-titres (bascule vers la transcription audio), vidéo privée ou supprimée (l'API renvoie une erreur explicite qu'il faut capter plutôt que laisser planter tout le workflow), et quota API tierce dépassé en cas de pic de volume. Un Retry On Fail sur l'appel d'extraction, une branche d'erreur dédiée et une alerte Slack en cas d'échec persistant couvrent l'essentiel — la méthode est la même que celle détaillée dans notre guide gérer les erreurs dans n8n.

Pourquoi convertir une vidéo en texte structuré change la donne

Ce n'est pas qu'une question de gain de temps. Les travaux de Richard Mayer sur la théorie cognitive de l'apprentissage multimédia (Applying the Science of Learning to Multimedia Instruction, 2008 — voir sur Google Scholar) montrent que l'information présentée de façon redondante en plusieurs canaux — ici vidéo et résumé textuel structuré — améliore la rétention par rapport à la vidéo seule, en particulier pour une information qu'on doit retrouver et exploiter plus tard plutôt que simplement consommer une fois. Côté qualité du résumé lui-même, les architectures de résumé automatique par LLM s'appuient sur les avancées posées par des travaux comme celui de See, Liu et Manning sur les réseaux « pointeur-générateur » (Get To The Point: Summarization with Pointer-Generator Networks, ACL 2017 — voir sur Google Scholar), qui ont posé les bases d'un résumé fidèle au texte source plutôt qu'une reformulation approximative — exactement ce qu'on recherche quand le résumé doit rester exploitable comme note de veille.

En résumé

n8n ne propose pas de raccourci natif pour transcrire une vidéo YouTube tierce, mais trois voies fonctionnent selon votre contexte : une API tierce via HTTP Request pour la simplicité en production, la YouTube Data API pour vos propres vidéos, ou yt-dlp en self-hosted pour un contrôle total sans dépendance à un service payant. Une fois la transcription en main, le reste du pipeline — résumé structuré, diffusion, archivage — reprend des briques déjà éprouvées ailleurs sur ce blog. Si votre objectif final est de rendre ces résumés interrogeables au fil des mois, le Pack Assistant RAG (119 €) fournit déjà l'ingestion, le découpage et le chatbot avec citations ; combiné à un digest automatique façon Pack Inbox IA (79 €), c'est une veille vidéo qui tourne seule.

FAQ

Questions fréquentes

Le node YouTube officiel de n8n permet-il de récupérer la transcription d'une vidéo ?

Non. Le node YouTube de n8n (catégorie Google) sert à gérer une chaîne dont vous êtes propriétaire : publier une vidéo, modifier ses métadonnées, lister les commentaires. Il n'expose aucune opération pour lire le texte des sous-titres d'une vidéo tierce, même publique — il faut passer par une API dédiée ou un outil d'extraction en dehors du node natif.

Peut-on résumer une vidéo YouTube sans sous-titres disponibles ?

Oui, à condition de transcrire l'audio vous-même : téléchargez la piste audio avec yt-dlp puis envoyez-la au node OpenAI en mode transcription (whisper-1), exactement comme pour un enregistrement de réunion. C'est plus lent et plus coûteux qu'une lecture directe des sous-titres existants, mais ça fonctionne même sur une vidéo qui n'en a aucun.

Quelle méthode choisir pour un usage en production ?

Une API tierce spécialisée (type RapidAPI, Apify ou service équivalent) via un simple node HTTP Request est le compromis le plus robuste : pas d'infrastructure à maintenir, un coût prévisible par vidéo, et une API stable dans le temps. Les nodes communautaires basés sur du scraping du DOM YouTube sont plus fragiles et cassent silencieusement au moindre changement de mise en page côté YouTube.

Bundle FlowKit Complet

269 €