L’estrazione del testo dai file PDF è una necessità frequente quando si costruiscono pipeline di elaborazione dei documenti, soprattutto per l’indicizzazione della ricerca o l’analisi dei dati. GroupDocs.Parser Cloud SDK for Node.JS fornisce una libreria robusta che consente di estrarre programmaticamente il testo da PDF in Node.JS senza doversi occupare della logica di parsing a basso livello. In questa guida imparerai come estrarre il testo da PDF in Node.JS usando un esempio di codice completo, un’alternativa cURL REST e i passaggi di configurazione necessari, coprendo sia PDF semplici che crittografati.

Estrai testo da PDF in Node.JS - Esempio di codice completo

Il seguente esempio dimostra come estrarre testo da un PDF in Node.JS con GroupDocs.Parser Cloud SDK. Include l’inizializzazione, la costruzione della richiesta, l’esecuzione e il salvataggio del risultato in un file locale.

const GroupDocsParserCloud = require("@groupdocs/parser-cloud");
const fs = require("fs");

(async () => {
    // Initialize configuration with your credentials
    const config = new GroupDocsParserCloud.Configuration({
        clientId: "YOUR_CLIENT_ID",
        clientSecret: "YOUR_CLIENT_SECRET"
    });

// Create Parser API instance
    const parserApi = new GroupDocsParserCloud.ParserApi(config);

// Build request to extract text from a PDF file stored in cloud storage
    const request = new GroupDocsParserCloud.ExtractTextRequest({
        fileInfo: new GroupDocsParserCloud.FileInfo({
            filePath: "input.pdf" // path to the PDF in GroupDocs cloud storage
        })
    });

try {
        // Execute the request
        const result = await parserApi.extractText(request);

// result.text contains the extracted plain text
        console.log("Extracted Text:\n", result.text);

// Save extracted text to a local file
        fs.writeFileSync("extracted.txt", result.text, "utf8");
        console.log("Text saved to extracted.txt");
    } catch (error) {
        console.error("Error extracting text:", error);
    }
})();

Nota: Questo esempio di codice dimostra la funzionalità principale. Prima di usarlo nel tuo progetto, assicurati di aggiornare tutti i percorsi dei file e i valori di configurazione per corrispondere al tuo ambiente reale, verifica che tutte le dipendenze richieste siano correttamente installate e testa accuratamente nel tuo ambiente di sviluppo. Se incontri problemi, consulta la documentazione ufficiale o contatta il team di supporto per assistenza.

Recupera il testo PDF usando cURL e l’API REST

Se preferisci un approccio indipendente dal linguaggio, puoi ottenere lo stesso risultato con comandi cURL che chiamano l’API REST di GroupDocs.Parser Cloud. I passaggi seguenti mostrano come autenticarsi, caricare un PDF, estrarne il testo e scaricare il risultato.

# 1. Get an access token
curl -X POST "https://api.groupdocs.cloud/v2.0/auth/token" \
     -H "Content-Type: application/json" \
     -d '{"client_id":"YOUR_CLIENT_ID","client_secret":"YOUR_CLIENT_SECRET"}'
# Response contains "access_token"

# 2. Upload the PDF to cloud storage
curl -X PUT "https://api.groupdocs.cloud/v2.0/storage/file/input.pdf" \
     -H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
     -H "Content-Type: application/pdf" \
     --data-binary @input.pdf

# 3. Extract text from the uploaded PDF
curl -X POST "https://api.groupdocs.cloud/v2.0/parser/extractText" \
     -H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
     -H "Content-Type: application/json" \
     -d '{"fileInfo":{"filePath":"input.pdf"}}' \
     -o result.json

# 4. Save the extracted text locally
jq -r '.text' result.json > extracted.txt

Questi comandi eseguono la stessa operazione di estrazione del testo da PDF in Node.JS, ma tramite l’API cloud, facilitando l’integrazione con qualsiasi piattaforma. Per ulteriori dettagli, consultare il riferimento ufficiale dell’API.

Analisi dell’estrazione del testo da PDF in Node.JS

Comprendere ogni parte del codice ti aiuta ad adattarlo a scenari più complessi, come l’elaborazione di PDF scansionati o crittografati.

  1. Inizializzazione della configurazione -
const config = new GroupDocsParserCloud.Configuration({
    clientId: "YOUR_CLIENT_ID",
    clientSecret: "YOUR_CLIENT_SECRET"
});

Questo crea un oggetto di configurazione che contiene le tue credenziali di autenticazione. La classe è documentata nella API reference.

  1. Istanza dell’API Parser -
const parserApi = new GroupDocsParserCloud.ParserApi(config);

La classe ParserApi fornisce metodi per tutte le operazioni di parsing, inclusa extractText.

  1. Creazione della ExtractTextRequest -
const request = new GroupDocsParserCloud.ExtractTextRequest({
    fileInfo: new GroupDocsParserCloud.FileInfo({
        filePath: "input.pdf"
    })
});

ExtractTextRequest indica al servizio quale file elaborare. È inoltre possibile impostare le opzioni OCR qui per i PDF scansionati.

  1. Esecuzione della Richiesta -
const result = await parserApi.extractText(request);

Il metodo extractText invia la richiesta al cloud e restituisce un oggetto di risposta contenente il testo semplice.

  1. Gestione del risultato -
console.log("Extracted Text:\n", result.text);
fs.writeFileSync("extracted.txt", result.text, "utf8");

La proprietà result.text contiene il contenuto estratto, che puoi registrare, memorizzare o elaborare ulteriormente.

Installazione e configurazione GroupDocs.Parser Cloud SDK for Node.JS

Prima di poter eseguire il codice, installa l’SDK e configura il tuo ambiente.

npm install groupdocs-parser-cloud

Prerequisiti: Node.js 14 o versioni successive, un account attivo di GroupDocs Cloud e credenziali client (client ID e client secret). Scarica l’ultimo pacchetto dalla pagina di download ufficiale. Dopo l’installazione, crea un config.json (o utilizza le variabili d’ambiente) per memorizzare le tue credenziali in modo sicuro.

Conclusione

Estrazione del testo da PDF in Node.JS diventa semplice con il GroupDocs.Parser Cloud SDK for Node.JS. L’SDK astrae la complessità dell’analisi dei PDF, supporta l’OCR per PDF scansionati e gestisce i documenti crittografati fin da subito. Ricorda di ottenere una licenza valida per l’uso in produzione; puoi acquistare un abbonamento o richiedere una licenza temporanea per valutare la libreria. Con l’esempio di codice, l’alternativa cURL e i passaggi di installazione coperti, sei pronto a integrare l’estrazione del testo PDF nel tuo flusso di lavoro dei documenti e a sbloccare potenti capacità di ricerca e analisi.

Domande frequenti

  • Come estrarre testo da PDF in Node.JS usando GroupDocs.Parser?
    Usa il metodo extractText di ParserApi come mostrato nell’esempio di codice completo. L’SDK restituisce automaticamente testo semplice e puoi abilitare l’OCR per i PDF scansionati.

  • Posso estrarre testo da PDF scansionati in Node.JS?
    Sì. Imposta le opzioni OCR nella ExtractTextRequest per consentire al servizio di riconoscere il testo nelle pagine basate su immagini.

  • Cosa succede se il mio PDF è protetto da password?
    Includi la password nell’oggetto FileInfo (password: "yourPassword"). L’SDK decritterà il file prima di estrarre il testo.

  • C’è un modo per chiamare il servizio senza scrivere codice Node.JS?
    Assolutamente. I comandi cURL nella sezione “Retrieve PDF Text Using cURL and the REST API” dimostrano un approccio indipendente dal linguaggio tramite l’API REST.

Leggi di più