L’estrazione del testo dai file PDF è una necessità frequente quando si costruiscono pipeline di elaborazione dei documenti, soprattutto per l’indicizzazione della ricerca o l’analisi dei dati. GroupDocs.Parser Cloud SDK for Node.JS fornisce una libreria robusta che consente di estrarre programmaticamente il testo da PDF in Node.JS senza doversi occupare della logica di parsing a basso livello. In questa guida imparerai come estrarre il testo da PDF in Node.JS usando un esempio di codice completo, un’alternativa cURL REST e i passaggi di configurazione necessari, coprendo sia PDF semplici che crittografati.
Estrai testo da PDF in Node.JS - Esempio di codice completo
Il seguente esempio dimostra come estrarre testo da un PDF in Node.JS con GroupDocs.Parser Cloud SDK. Include l’inizializzazione, la costruzione della richiesta, l’esecuzione e il salvataggio del risultato in un file locale.
const GroupDocsParserCloud = require("@groupdocs/parser-cloud");
const fs = require("fs");
(async () => {
// Initialize configuration with your credentials
const config = new GroupDocsParserCloud.Configuration({
clientId: "YOUR_CLIENT_ID",
clientSecret: "YOUR_CLIENT_SECRET"
});
// Create Parser API instance
const parserApi = new GroupDocsParserCloud.ParserApi(config);
// Build request to extract text from a PDF file stored in cloud storage
const request = new GroupDocsParserCloud.ExtractTextRequest({
fileInfo: new GroupDocsParserCloud.FileInfo({
filePath: "input.pdf" // path to the PDF in GroupDocs cloud storage
})
});
try {
// Execute the request
const result = await parserApi.extractText(request);
// result.text contains the extracted plain text
console.log("Extracted Text:\n", result.text);
// Save extracted text to a local file
fs.writeFileSync("extracted.txt", result.text, "utf8");
console.log("Text saved to extracted.txt");
} catch (error) {
console.error("Error extracting text:", error);
}
})();
Nota: Questo esempio di codice dimostra la funzionalità principale. Prima di usarlo nel tuo progetto, assicurati di aggiornare tutti i percorsi dei file e i valori di configurazione per corrispondere al tuo ambiente reale, verifica che tutte le dipendenze richieste siano correttamente installate e testa accuratamente nel tuo ambiente di sviluppo. Se incontri problemi, consulta la documentazione ufficiale o contatta il team di supporto per assistenza.
Recupera il testo PDF usando cURL e l’API REST
Se preferisci un approccio indipendente dal linguaggio, puoi ottenere lo stesso risultato con comandi cURL che chiamano l’API REST di GroupDocs.Parser Cloud. I passaggi seguenti mostrano come autenticarsi, caricare un PDF, estrarne il testo e scaricare il risultato.
# 1. Get an access token
curl -X POST "https://api.groupdocs.cloud/v2.0/auth/token" \
-H "Content-Type: application/json" \
-d '{"client_id":"YOUR_CLIENT_ID","client_secret":"YOUR_CLIENT_SECRET"}'
# Response contains "access_token"
# 2. Upload the PDF to cloud storage
curl -X PUT "https://api.groupdocs.cloud/v2.0/storage/file/input.pdf" \
-H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
-H "Content-Type: application/pdf" \
--data-binary @input.pdf
# 3. Extract text from the uploaded PDF
curl -X POST "https://api.groupdocs.cloud/v2.0/parser/extractText" \
-H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
-H "Content-Type: application/json" \
-d '{"fileInfo":{"filePath":"input.pdf"}}' \
-o result.json
# 4. Save the extracted text locally
jq -r '.text' result.json > extracted.txt
Questi comandi eseguono la stessa operazione di estrazione del testo da PDF in Node.JS, ma tramite l’API cloud, facilitando l’integrazione con qualsiasi piattaforma. Per ulteriori dettagli, consultare il riferimento ufficiale dell’API.
Analisi dell’estrazione del testo da PDF in Node.JS
Comprendere ogni parte del codice ti aiuta ad adattarlo a scenari più complessi, come l’elaborazione di PDF scansionati o crittografati.
- Inizializzazione della configurazione -
const config = new GroupDocsParserCloud.Configuration({
clientId: "YOUR_CLIENT_ID",
clientSecret: "YOUR_CLIENT_SECRET"
});
Questo crea un oggetto di configurazione che contiene le tue credenziali di autenticazione. La classe è documentata nella API reference.
- Istanza dell’API Parser -
const parserApi = new GroupDocsParserCloud.ParserApi(config);
La classe ParserApi fornisce metodi per tutte le operazioni di parsing, inclusa extractText.
- Creazione della ExtractTextRequest -
const request = new GroupDocsParserCloud.ExtractTextRequest({
fileInfo: new GroupDocsParserCloud.FileInfo({
filePath: "input.pdf"
})
});
ExtractTextRequest indica al servizio quale file elaborare. È inoltre possibile impostare le opzioni OCR qui per i PDF scansionati.
- Esecuzione della Richiesta -
const result = await parserApi.extractText(request);
Il metodo extractText invia la richiesta al cloud e restituisce un oggetto di risposta contenente il testo semplice.
- Gestione del risultato -
console.log("Extracted Text:\n", result.text);
fs.writeFileSync("extracted.txt", result.text, "utf8");
La proprietà result.text contiene il contenuto estratto, che puoi registrare, memorizzare o elaborare ulteriormente.
Installazione e configurazione GroupDocs.Parser Cloud SDK for Node.JS
Prima di poter eseguire il codice, installa l’SDK e configura il tuo ambiente.
npm install groupdocs-parser-cloud
Prerequisiti: Node.js 14 o versioni successive, un account attivo di GroupDocs Cloud e credenziali client (client ID e client secret). Scarica l’ultimo pacchetto dalla pagina di download ufficiale. Dopo l’installazione, crea un config.json (o utilizza le variabili d’ambiente) per memorizzare le tue credenziali in modo sicuro.
Conclusione
Estrazione del testo da PDF in Node.JS diventa semplice con il GroupDocs.Parser Cloud SDK for Node.JS. L’SDK astrae la complessità dell’analisi dei PDF, supporta l’OCR per PDF scansionati e gestisce i documenti crittografati fin da subito. Ricorda di ottenere una licenza valida per l’uso in produzione; puoi acquistare un abbonamento o richiedere una licenza temporanea per valutare la libreria. Con l’esempio di codice, l’alternativa cURL e i passaggi di installazione coperti, sei pronto a integrare l’estrazione del testo PDF nel tuo flusso di lavoro dei documenti e a sbloccare potenti capacità di ricerca e analisi.
Domande frequenti
Come estrarre testo da PDF in Node.JS usando GroupDocs.Parser?
Usa il metodoextractTextdiParserApicome mostrato nell’esempio di codice completo. L’SDK restituisce automaticamente testo semplice e puoi abilitare l’OCR per i PDF scansionati.Posso estrarre testo da PDF scansionati in Node.JS?
Sì. Imposta le opzioni OCR nellaExtractTextRequestper consentire al servizio di riconoscere il testo nelle pagine basate su immagini.Cosa succede se il mio PDF è protetto da password?
Includi la password nell’oggettoFileInfo(password: "yourPassword"). L’SDK decritterà il file prima di estrarre il testo.C’è un modo per chiamare il servizio senza scrivere codice Node.JS?
Assolutamente. I comandi cURL nella sezione “Retrieve PDF Text Using cURL and the REST API” dimostrano un approccio indipendente dal linguaggio tramite l’API REST.
