Node n8n pour la conversion de fichiers et les données web#

@enconvert/n8n-nodes-enconvert est le node communautaire officiel de n8n pour EnConvert. Un seul node couvre seize opérations réparties sur six ressources : convertir des fichiers d'un format à un autre, compresser des images, scraper des pages web en markdown, extraire des champs structurés d'une page, chercher sur le web, et crawler un site entier en passages prêts à embarquer dans un vector store. Il renvoie de vraies données binary n8n : une capture d'écran ou un PDF converti part donc directement en pièce jointe Gmail ou en upload Google Drive, sans node HTTP Request supplémentaire.

npm : @enconvert/n8n-nodes-enconvert · Source : enconvert/n8n-nodes-enconvert · Licence : MIT

Ce que fait le node#

n8n embarque deux nodes de fichiers maison. Extract From File lit les CSV, HTML, JSON, ICS, ODS, le texte des PDF, RTF, TXT, XLS et XLSX. Convert to File réécrit le même ensemble. Ni l'un ni l'autre ne lit Word, PowerPoint ou EPUB, aucun des deux ne rend une page web, et sur n8n Cloud vous ne pouvez pas installer les outils en ligne de commande qui combleraient normalement ces manques.

Ce node couvre exactement ce terrain :

Ce qu'il vous faut Ce que le node vous donne
Word, PowerPoint, Excel, EPUB ou RTF en texte File > Convert to Markdown, qui renvoie le texte dans l'item
Presque n'importe quoi en PDF File > Convert to PDF, avec format de page, marges, en-tête et pied de page
Une page web en markdown propre Web Page > Scrape, environ six fois plus léger que le HTML brut
Une capture d'écran ou un PDF de page en vrai fichier Web Page > Scrape, joint en binary n8n
Des champs nommés extraits d'une page Web Page > Extract, décrits en langage naturel
Un site entier dans un vector store Website > Crawl, un item par passage

Tout passe par la même API REST documentée sur ce site : votre quota du tableau de bord, vos limites de débit et les fonctionnalités de votre plan s'appliquent donc exactement comme partout ailleurs.


Installation#

Les nodes communautaires n8n s'installent depuis l'éditeur. Ouvrez Settings → Community nodes → Install (Paramètres → Nodes communautaires → Installer), puis saisissez le nom du paquet :

@enconvert/n8n-nodes-enconvert

Sur une instance n8n auto-hébergée, vous pouvez aussi l'installer en ligne de commande depuis votre répertoire de données n8n :

npm install @enconvert/n8n-nodes-enconvert
n8n Cloud n'installe que des nodes vérifiés. Si le bouton d'installation est absent ou si le paquet reste introuvable sur Cloud, c'est que le node n'a pas encore terminé la revue de vérification de n8n. En attendant, les instances auto-hébergées peuvent l'installer, et n'importe quelle instance peut appeler l'API directement avec le node HTTP Request.

Redémarrez n8n après l'installation. Le node apparaît dans le panneau des nodes sous le nom EnConvert, et chaque opération est indexée séparément : taper « docx », « screenshot » ou « crawl » le fait donc remonter aussi.


Ajouter votre credential EnConvert#

  1. Générez une clé API privée dans le tableau de bord. Les clés privées commencent par sk_.
  2. Dans n8n, ouvrez le node, cliquez sur Create new credential et choisissez EnConvert API.
  3. Collez la clé, cliquez sur Save, puis sur Test.

Le test du credential appelle GET /v1/whoami, qui n'accepte que les clés privées. Une clé publique pk_ échoue donc ici, au moment précis où vous la collez, au lieu d'échouer plus tard pendant l'exécution d'un workflow avec un message obscur.

Champ Requis Par défaut Objectif
API Key Oui -- Votre clé privée (sk_...)
Base URL Non https://api.enconvert.com À modifier uniquement si un autre endpoint vous a été communiqué
Les clés publiques ne fonctionnent pas. Les clés commençant par pk_ sont destinées aux widgets navigateur et sont rejetées par toutes les opérations de ce node. Plus de détails dans Clés privées.

Opérations#

File#

Opération Ce qu'elle fait
Convert to PDF Transforme un document, un tableur, une présentation, une page web, une image ou un fichier texte en PDF. Le format de page, l'orientation, les marges, l'échelle, le niveau de gris, l'en-tête et le pied de page s'appliquent au HTML, au markdown, au texte, à l'EPUB, aux images et au SVG. Les fichiers Office embarquent leur propre mise en page : seul Grayscale les affecte, et le node signale les réglages qu'il a ignorés plutôt que de faire échouer l'exécution.
Convert to Markdown Transforme les fichiers Word, PowerPoint, Excel, PDF, EPUB, RTF, HTML et texte en markdown. Renvoie le texte dans l'item par défaut, de sorte qu'il alimente directement un node IA. Basé sur Anything to Markdown.
Convert Data Convertit entre JSON, CSV, XML, YAML, TOML et HTML. Une conversion vers JSON vous donne un objet déjà parsé sous data, prêt pour des expressions comme {{ $json.data.total }}.
Split Into Chunks Téléverse le fichier de chaque item d'entrée en un seul job et renvoie des passages qui se chevauchent, prêts à embarquer. Jusqu'à 200 fichiers par exécution.

Image#

Opération Ce qu'elle fait
Convert Format Convertit entre JPEG, PNG, WebP, HEIC et SVG, et rastérise une page de PDF en JPEG. Width et Height fixent la taille du canevas lorsque l'entrée est un SVG.
Compress Réduit le poids d'un PNG, d'un JPEG ou d'un WebP vers une taille cible en Ko. Le format ne change jamais. La cible est traitée au mieux : un budget hors d'atteinte renvoie le plus petit fichier obtenu plutôt qu'une erreur, vérifiez donc la taille renvoyée.

Web Page#

Opération Ce qu'elle fait
Scrape Rend une page et renvoie dans l'item le markdown, le HTML nettoyé, le HTML brut, les liens, les images et les données structurées, plus les captures d'écran et les PDF en binary. Les résultats sont mis en cache environ une heure et un cache hit ne coûte rien. Basé sur Perceive.
Scrape Many Rend jusqu'à 1000 pages en une seule exécution. Le champ URLs accepte une liste que vous saisissez ou une expression qui se résout en tableau : il s'enchaîne donc directement après Website > Map. Régler Output Mode sur un fichier ZIP unique avec la sortie PDF archive tout un ensemble de pages en une fois.
Extract Récupère des champs nommés sur une ou plusieurs pages. Décrivez ce que vous voulez en langage naturel, listez les champs par leur nom, ou fournissez un JSON Schema. Des sélecteurs CSS optionnels répondent à tout ce qu'ils peuvent avant que quoi que ce soit ne bascule vers l'extraction par IA, ce qui abaisse le coût sur les pages à mise en page fixe. Basé sur Distill.

Website#

Opération Ce qu'elle fait
Map Liste les adresses d'un site sans en rendre aucune. C'est rapide, et cela ne consomme rien de votre allocation de pages. Basé sur Discover.
Crawl Lit un site entier et renvoie des passages prêts à embarquer, chacun portant son URL source, son titre et son chemin de titres. S'exécute sans cookies ni connexion, par conception. Basé sur Ingest.
Opération Ce qu'elle fait
Search Cherche sur le web, dans l'actualité, les images, les publications scientifiques, les brevets ou les cartes, et renvoie un item par résultat. Scrape Top Results rend en plus les premiers résultats et joint leur markdown : une seule exécution vous donne donc à la fois la page de résultats et le contenu des pages. Basé sur Lookup.

Job#

Opération Ce qu'elle fait
Get Récupère n'importe quel job EnConvert par son ID. Le node choisit le bon endpoint d'après le préfixe : les ID de scrape (per_), de scrape multi-pages (batch_), de crawl (ing_) et de conversion de fichier fonctionnent tous dans le même champ.
Get Many Liste vos jobs de crawl récents, avec Return All ou une limite.
Cancel Arrête un crawl ou un scrape multi-pages en cours.
Retry Webhook Renvoie le webhook de fin d'un crawl terminé.

Choisir la forme des résultats#

Chaque opération File et Image propose trois formes sous Response Format :

Valeur Ce qui atterrit sur l'item
File Le fichier converti en binary n8n, prêt pour Gmail, Drive, S3 ou Write to Disk
Text Le contenu en texte sous text. Une conversion vers JSON donne à la place un objet parsé sous data
URL Only Uniquement un lien de téléchargement sous downloadUrl, sans aucun transfert d'octets

Convert to PDF et les deux opérations Image ont File par défaut. Convert to Markdown et Convert Data ont Text par défaut, parce qu'une chaîne markdown ou un objet parsé est presque toujours ce qu'attend le node suivant du workflow.

Utilisez URL Only au-delà de 16 Mo. La taille maximale par item est de 16 Mo par défaut dans n8n et elle n'est pas réglable sur n8n Cloud : une grosse conversion échoue donc quand le node tente de transporter les octets. URL Only contourne le problème. Les liens de téléchargement restent valides 15 minutes.

Les opérations qui s'exécutent comme des jobs#

Scrape Many, Crawl et Split Into Chunks soumettent un travail qui peut prendre plusieurs minutes. Par défaut, le node attend et vous remet le résultat terminé. Trois réglages sous Options pilotent cela :

Option Par défaut Ce qu'elle fait
Wait for Completion Activé Désactivez-la pour recevoir immédiatement l'ID du job et continuer ailleurs
Max Wait Time (Seconds) 120 Combien de temps attendre avant de renoncer à l'attente
Poll Interval (Seconds) 3 À quelle fréquence vérifier

Si l'attente expire, le travail n'est pas perdu. L'erreur indique l'ID du job, et Job > Get récupère le résultat terminé quand vous y revenez.

Sur n8n Cloud, gardez Max Wait Time sous les 300 secondes. Cloud peut annuler une exécution à ce stade, quel que soit le réglage propre du node. Pour un crawl de plusieurs centaines de pages, renseignez une Webhook URL, désactivez Wait for Completion, pointez le webhook vers un node Webhook n8n, et poursuivez le workflow là-bas quand EnConvert vous rappelle.

Formats pris en charge#

Convert to PDF accepte bmp csv doc docx epub gif heic heif htm html jpeg jpg markdown md mdown mkd numbers odp ods odt ots pages pdf png ppt pptx rtf svg text tif tiff txt webp xhtml xls xlsx.

Convert to Markdown accepte csv doc docx epub htm html markdown md mdown mkd odp ods odt pdf ppt pptx rtf text txt xhtml xls xlsx.

Convert Data couvre le JSON vers et depuis XML, YAML, TOML et CSV, le CSV vers et depuis XML, et le markdown vers HTML.

Convert Format couvre JPEG, PNG, WebP, HEIC et SVG dans n'importe quelle combinaison, plus PDF vers JPEG. Width et Height ne s'appliquent que lorsque l'entrée est un SVG, chacun accepte une valeur de 1 à 10000, et leur produit ne peut pas dépasser 25 millions.

Compress accepte png jpg jpeg webp.

Le node vérifie la paire avant d'envoyer quoi que ce soit. Demandez une combinaison qui n'existe pas et il vous le dit dans l'éditeur, en listant les formats vers lesquels ce fichier peut réellement être converti. Les pages numérisées sous forme d'images, sans couche de texte, ne sont pas lues, car le node ne fait pas d'OCR.


Exemples de workflows#

Document Word vers un résumé par IA#

Google Drive (Download)  ->  EnConvert                       ->  Basic LLM Chain
                             File · Convert to Markdown
                             Response Format: Text

Le markdown arrive dans {{ $json.text }}. C'est le chemin que Extract From File ne peut pas prendre, puisqu'il ne lit pas le .docx.

Facture HTML vers un PDF en pièce jointe#

Set (build the HTML)  ->  Convert to File   ->  EnConvert                 ->  Gmail (Send)
                          (Text to File)       File · Convert to PDF
                                               PDF Options: A4, margins

Site web vers un vector store#

EnConvert                     ->  Embeddings  ->  Pinecone
Website · Crawl
Mode: Sitemap, Max Pages: 200
Output: Chunks

Chaque item porte content, sourceUrl, title, headingsPath, wordCount et chunkIndex, c'est-à-dire exactement la forme qu'attendent un Default Data Loader et un node de vector store. Un seul node remplace le pipeline habituel de crawl, de découpage, de boucle et de code.

Tarifs concurrents vers un tableur#

EnConvert         ->  EnConvert                          ->  Google Sheets
Website · Map         Web Page · Extract
Mode: Sitemap         Source: Specific URLs
                      Define Fields By: Description
                      "the plan name and the monthly price"

Map est ici la première étape économique. Elle liste les adresses du site sans les rendre : vous ne dépensez donc de l'allocation de pages que sur les pages qui vous intéressent vraiment.

Capture d'écran quotidienne dans Slack#

Schedule Trigger  ->  EnConvert            ->  Slack (Upload file)
                      Web Page · Scrape
                      Outputs: Screenshot

Le PNG arrive en binary sous screenshot. Aucun second node n'est nécessaire pour aller le chercher.


Utiliser le node comme outil d'AI Agent#

Chaque opération est disponible comme outil pour le node AI Agent de n8n. Ce sont les opérations web qui conviennent le mieux à un agent, parce qu'un agent peut fournir une URL ou une requête de recherche mais n'a aucun moyen de transmettre un fichier.

Les quatre à exposer en priorité sont Web Page > Scrape, Search > Search, Web Page > Extract et Website > Map. Ensemble, elles permettent à un agent de trouver des pages, de les lire en markdown et d'en extraire des faits structurés, c'est-à-dire la boucle dont ont besoin la plupart des agents de recherche et de génération de leads.


Dépannage#

Le node n'apparaît pas après l'installation. Redémarrez n8n. Les nodes communautaires se chargent au démarrage. Sur n8n Cloud, vérifiez que le paquet s'est bien installé, puisque Cloud n'accepte que les nodes vérifiés.

EnConvert rejected the API key. La clé est incorrecte, ou c'est une clé publique pk_. Ouvrez le credential et lancez Test. Générez une clé privée dans le tableau de bord.

This operation is not included in your EnConvert plan. Scrape, Extract, Search, Map et Crawl dépendent du plan, et chacune dispose d'une allocation mensuelle. Réessayer n'y changera rien. Vérifiez votre consommation et votre plan sur la page des tarifs.

Could not tell what kind of file is in "data". Le fichier entrant n'a pas d'extension dans son nom, ce qui arrive avec les téléchargements effectués par le node HTTP Request. Renseignez Input File Format dans Options pour indiquer de quoi il s'agit, par exemple docx.

This operation expects the node's input data to contain a binary file. Le node précédent n'a pas produit de fichier, ou il a utilisé un autre nom de champ. Vérifiez Input Binary Field, qui vaut data sur la plupart des nodes n8n.

Une grosse conversion échoue à l'intérieur de n8n. Passez Response Format sur URL Only. Les items n8n sont plafonnés à 16 Mo par défaut et cette limite est figée sur Cloud.

Un crawl expire. Augmentez Max Wait Time, ou désactivez Wait for Completion et récupérez le résultat plus tard avec Job > Get, en utilisant l'ID de job indiqué dans le message d'erreur.


Source et liens#


Questions fréquentes#

Comment convertir un fichier DOCX en PDF dans n8n ?#

Ajoutez le node EnConvert, choisissez la ressource File et l'opération Convert to PDF, puis pointez Input Binary Field vers le champ qui contient le fichier, data sur la plupart des nodes. Le PDF revient en binary sur le même item, prêt à être joint à un e-mail ou envoyé vers un stockage. Les fichiers Word embarquent leur propre mise en page : le format de page et les marges ne s'y appliquent donc pas, et le node vous indique les réglages qu'il a ignorés.

Comment extraire le texte d'un document Word dans n8n ?#

Utilisez File > Convert to Markdown avec Response Format réglé sur Text. Le texte atterrit dans {{ $json.text }}. Le node Extract From File intégré à n8n ne sait pas le faire : il lit les CSV, HTML, JSON, ICS, ODS, le texte des PDF, RTF, TXT, XLS et XLSX, mais pas les .doc, .docx ni .pptx.

Puis-je utiliser ce node sur n8n Cloud ?#

n8n Cloud n'installe que les nodes communautaires ayant passé la revue de vérification de n8n. Tant que ce node n'a pas terminé cette revue, installez-le sur une instance auto-hébergée, ou appelez l'API directement depuis le node HTTP Request, ce qui fonctionne sur tous les plans. C'est justement sur Cloud que le node est le plus utile, puisque les utilisateurs Cloud ne peuvent installer ni outils système ni paquets npm pour convertir des fichiers localement.

Comment scraper une page web en markdown dans n8n ?#

Utilisez Web Page > Scrape avec Markdown sélectionné dans Outputs. Le markdown arrive dans {{ $json.markdown }}. Il est environ six fois plus léger que le HTML brut de la même page, ce qui réduit le coût en tokens de tous les nodes IA en aval et laisse au modèle beaucoup moins de code passe-partout pour s'égarer.

Comment prendre une capture d'écran d'un site web dans n8n ?#

Utilisez Web Page > Scrape et sélectionnez Screenshot ou Full-Page Screenshot dans Outputs. Le PNG arrive en binary n8n sous screenshot : vous pouvez donc l'envoyer sur Slack ou le joindre à un e-mail immédiatement. La plupart des nodes de scraping renvoient un lien à la place, ce qui vous oblige à ajouter un node HTTP Request pour aller chercher l'image avant de pouvoir l'utiliser.

Comment charger un site web entier dans un vector store avec n8n ?#

Utilisez Website > Crawl avec Output réglé sur Chunks. Le node renvoie un item par passage, chacun portant content, sourceUrl, title, headingsPath et chunkIndex, ce qui se branche directement sur un Default Data Loader, un node Embeddings et un vector store comme Pinecone, Qdrant ou Supabase. Cela remplace le pipeline habituel : crawl du sitemap, scraper, node Code et boucle.

Pourquoi ma conversion renvoie-t-elle un lien au lieu du fichier ?#

Response Format est réglé sur URL Only. Passez-le sur File pour recevoir du binary n8n. L'inverse est utile aussi : les résultats de plus de 16 Mo ne peuvent pas voyager dans un item n8n sur Cloud, URL Only est donc la bonne façon de traiter les gros fichiers. Les liens de téléchargement restent valides 15 minutes.

Que se passe-t-il si un crawl dépasse le temps d'attente ?#

Le job continue de tourner chez EnConvert. Le node lève une erreur qui contient l'ID du job, et Job > Get récupère le résultat terminé plus tard. Pour les longs crawls, renseignez une Webhook URL, désactivez Wait for Completion, et laissez EnConvert appeler un node Webhook n8n à la fin.

Ce node fonctionne-t-il avec le node AI Agent de n8n ?#

Oui, chaque opération est exposée comme outil d'agent. Les opérations web sont les mieux adaptées à un agent, parce qu'un agent peut passer une URL ou une requête de recherche mais ne peut pas transmettre un fichier. Scrape, Search, Extract et Map sont les quatre qui rendent un agent vraiment utile pour la recherche et la génération de leads.