Bundle Langflow per Rendering Web e Conversione File#

Il bundle EnConvert per Langflow aggiunge sei componenti a qualsiasi flusso di lavoro: renderizzare le pagine web in markdown o dati strutturati, cercare sul web, scoprire gli URL di un sito, estrarre campi da una pagina rispetto a uno schema, e convertire i file caricati in markdown o PDF. Ogni rendering di pagina ha un punteggio render_quality da 0,0 a 1,0, quindi le applicazioni mono-pagina bloccate o vuote sono contrassegnate invece di essere considerate come contenuto reale.

Pacchetto: lfx-enconvert · Fonte: enconvert/langflow-enconvert · Licenza: MIT

I sei componenti#

Componente Endpoint Attività
Perceive URL POST /v2/perceive Renderizza una pagina in markdown, HTML pulito, HTML grezzo, screenshot, PDF, link, immagini o dati strutturati con un punteggio render_quality. Basato su Perceive.
Web Search POST /v2/lookup Ricerca web, notizie, immagini, accademici, brevetti e mappe con titolo, URL, snippet e posizione. Basato su Lookup.
Discover URLs POST /v2/discover Elenca gli URL di un sito per sitemap, crawl o entrambi, senza renderizzarli. Basato su Discover.
Extract Structured POST /v2/distill Estrae campi denominati da una o più pagine o da un sito che il sistema esplora. Basato su Distill.
Convert File to Markdown POST /v1/convert/anything-to-markdown Converte file Word, PowerPoint, Excel, PDF, EPUB, RTF, HTML e testo in markdown. Basato su Anything to Markdown.
Convert File to PDF POST /v1/convert/anything-to-pdf Converte un documento, foglio di calcolo, presentazione, immagine, HTML o file di testo in PDF. Basato su Anything to PDF.

Tutto viene eseguito sulla stessa API REST documentata su questo sito, quindi la quota del piano, i limiti di velocità e le funzioni si applicano esattamente come altrove.


Installazione#

pip install lfx-enconvert

Langflow scopre automaticamente il bundle all'avvio del server. I sei componenti vengono visualizzati sotto il bundle EnConvert nella barra laterale dei componenti — nessuna configurazione richiesta.

Per lo sviluppo locale o i test senza installazione pip, puoi copiare la cartella dei componenti nella tua istanza Langflow tramite la variabile di ambiente LANGFLOW_COMPONENTS_PATH. Vedi la guida di distribuzione per i dettagli.


Aggiungi la tua chiave API#

Ognuno dei sei componenti ha un campo Chiave API EnConvert.

  1. Genera una chiave API privata nel dashboard. Le chiavi private iniziano con sk_.
  2. Crea una variabile globale in Langflow per la chiave (in modo che non appaia mai nel JSON del flusso di lavoro):
  3. Vai a Settings > Global Variables e aggiungi una nuova variabile chiamata enconvert_key con la tua chiave privata.
  4. In ogni componente che aggiungi al flusso di lavoro, seleziona questa variabile globale nel campo Chiave API EnConvert.
Le chiavi pubbliche non funzioneranno. Le chiavi che iniziano con pk_ sono destinate ai widget del browser e vengono rifiutate da ogni componente in questo bundle. Scopri di più su Private Keys.

Renderizza una pagina#

Perceive URL accetta l'URL dal flusso di lavoro e due parametri del modulo:

Parametro Impostato da Predefinito Scopo
URL Il flusso di lavoro -- L'URL assoluto da renderizzare
Outputs Il modulo markdown Uno qualsiasi tra markdown, html_cleaned, html_raw, screenshot, screenshot_full_page, pdf, links, images, structured, separati da virgole
Only Main Content Il modulo Disabilitato Rimuovi navigazione, intestazioni e piè di pagina, mantieni l'articolo

Il componente restituisce ogni artefatto come un URL valido per 15 minuti, più il testo di markdown, HTML pulito e HTML grezzo in linea fino a 256 KB. Tutto ciò che è più grande e tutto ciò che è binario rimane un link. Il risultato structured è l'eccezione e arriva in linea.


Il punteggio render_quality#

Ogni risultato di Perceive ha render_quality, un numero da 0,0 a 1,0. Zero significa che la pagina è stata bloccata o è vuota; uno significa un rendering pulito. Il contenuto torna comunque, contrassegnato, quindi una lettura scadente non penetra mai silenziosamente in un riassunto.

Usa un componente If/Else dopo Perceive per diramati in base al punteggio prima di passare il markdown a un componente LLM. Un punteggio basso è un segnale che la pagina non è quello che l'agente si aspettava.


Cerca e scopri#

Web Search accetta una query e filtri facoltativi e restituisce un array di risultati, ognuno con titolo, URL, snippet e posizione.

Discover URLs accetta un URL del sito e una modalità (sitemap, crawl o hybrid) e restituisce un elenco piatto di URL su quel sito senza renderizzare ognuno. Usalo prima di Perceive per mappare un sito quando vuoi sapere cosa c'è lì senza il costo del rendering.


Estrai campi#

Extract Structured ha bisogno di uno schema e esattamente una fonte. Lo schema è un oggetto JSON in una di due forme. Una mappa piatta del nome del campo a una descrizione in linguaggio naturale è la veloce:

{"title": "il titolo della pagina", "price": "il prezzo mensile in USD"}

Uno schema JSON completo, {"type": "object", "properties": {...}}, è l'altro, vale la pena scrivere quando hai bisogno di tipi o oggetti annidati forzati.

Per la fonte, passa URLs, un elenco separato da virgole limitato a 50, o Discover From URL, un singolo sito che l'API esplora, modellato da Discover Mode e Discover Max Pages. Passare entrambi o nessuno restituisce un messaggio di errore.

I risultati arrivano come array, una voce per URL, ognuno con i suoi dati e il suo extraction_tier, che dice se un passaggio deterministico o una lettura del modello della pagina ha prodotto la risposta.


Converti file#

Convert File to Markdown e Convert File to PDF accettano un file di Langflow, non un URL. Collega un file dall'input del file di un componente Input o una variabile di file da un componente precedente. Il componente carica i byte e restituisce un URL di download firmato per il risultato, valido per circa 15 minuti.

Il nome del file caricato comunica al componente il formato di input. Langflow porta il nome originale, quindi questo è normalmente invisibile, ma un file che arriva senza un'estensione utilizzabile torna ai suoi byte: un PDF, un'immagine o un DOCX viene recuperato dalla sua firma, mentre un formato di testo come CSV o HTML non ne ha nessuno ed è rifiutato con un 400.


Costruisci con esso#

Un agente che fa ricerca#

Dai a un agente Web Search, Perceive URL e Discover URLs. La ricerca trova le pagine candidate, Perceive legge quelle promettenti come markdown, e Discover mappa un sito quando l'agente ha bisogno di sapere cos'altro c'è lì senza renderizzare nulla.

Un flusso di lavoro che estrae dati strutturati#

Collega Discover URLs a Extract Structured per estrarre gli stessi campi da ogni pagina di un sito alla volta, esplorato ed estratto dal server, fornito come array di risultati.

Un flusso di lavoro che converte un caricamento in un riassunto#

Input (file)  →  Convert File to Markdown  →  Text Splitter  →  LLM  →  Risposta

Converti il file in markdown, dividilo in chunk, passa ogni chunk a un LLM per il riassunto e combina i risultati.


Risoluzione dei problemi#

Il componente non riesce con 401 o 403. La chiave API è scorretta, mancante o è una chiave pubblica pk_. Verifica di aver memorizzato una chiave privata (prefisso sk_) nella variabile globale e l'hai selezionata nella Chiave API EnConvert del componente. Prova la chiave nel dashboard facendo clic sulla sua riga.

Perceive restituisce un link dove era previsto il markdown. Il markdown ha superato il limite di 256 KB in linea, quindi il componente ha fornito l'URL firmato invece. Recuperalo con un semplice GET e senza chiave API. Only Main Content normalmente porta una pagina lunga sotto il limite.

Un componente segnala che l'operazione non è nel mio piano. Perceive, Web Search, Discover ed Extract Structured traggono dall'allocazione mensionale di ops del tuo piano. Verifica il tuo utilizzo sulla pagina dei prezzi.

Convert File to Markdown restituisce un 400 con "unsupported format". Il file non ha un'estensione riconosciuta e i suoi byte non corrispondono a una firma di file nota. Aggiungi o correggi l'estensione del nome del file (ad esempio .pdf, .docx, .csv) e riprova.



Domande frequenti#

Come installo il bundle EnConvert in Langflow?#

Installa il pacchetto PyPI (pip install lfx-enconvert) e riavvia Langflow. I sei componenti vengono visualizzati sotto il bundle EnConvert nella barra laterale. Nessuna configurazione richiesta.

Posso usare una chiave API pubblica?#

No. Le chiavi pubbliche pk_ sono solo per i widget del browser e vengono rifiutate da ogni componente. Genera una chiave privata nel dashboard e usala.

Come memorizzo in modo sicuro la chiave API in modo che non appaia nel JSON del flusso di lavoro?#

Crea una variabile globale in Langflow (Settings > Global Variables), memorizza la tua chiave privata lì e seleziona quella variabile nella Chiave API EnConvert di ogni componente. Le variabili globali vengono memorizzate in modo sicuro e non vengono mai esportate nel flusso di lavoro.

Come renderizo una pagina web in Langflow?#

Aggiungi il componente Perceive URL, dagli un URL e lascia Outputs al valore predefinito. Il componente renderizza la pagina e restituisce il markdown in linea nell'output del componente. Attiva Only Main Content per rimuovere la navigazione e i piè di pagina.

Cosa significa render_quality?#

Un punteggio da 0,0 (bloccato/vuoto) a 1,0 (rendering pulito). Usa un componente If/Else dopo Perceive per diramati in base a questo punteggio, in modo che il tuo flusso di lavoro diffidi di una lettura scadente.

Posso estrarre campi da più pagine alla volta?#

Sì. Discover URLs elenca tutti gli URL di un sito, e Extract Structured accetta un elenco separato da virgole di URL (fino a 50). Passa gli URL scoperti e lo schema a Extract Structured per estrarre gli stessi campi da ogni pagina.