Extrair texto de arquivos PDF é uma necessidade frequente ao construir pipelines de processamento de documentos, especialmente para indexação de busca ou análise de dados. O GroupDocs.Parser Cloud SDK for Node.JS fornece uma biblioteca robusta que permite extrair texto de PDFs programaticamente no Node.JS sem lidar com lógica de parsing de baixo nível. Neste guia, você aprenderá como extrair texto de PDFs no Node.JS usando um exemplo de código completo, uma alternativa cURL REST e as etapas de configuração necessárias, cobrindo PDFs simples e criptografados.

Extrair Texto de PDF em Node.JS - Exemplo de Código Completo

O exemplo a seguir demonstra como extrair texto de um PDF em Node.JS com o GroupDocs.Parser Cloud SDK. Ele inclui inicialização, construção da solicitação, execução e salvamento do resultado em um arquivo local.

const GroupDocsParserCloud = require("@groupdocs/parser-cloud");
const fs = require("fs");

(async () => {
    // Initialize configuration with your credentials
    const config = new GroupDocsParserCloud.Configuration({
        clientId: "YOUR_CLIENT_ID",
        clientSecret: "YOUR_CLIENT_SECRET"
    });

// Create Parser API instance
    const parserApi = new GroupDocsParserCloud.ParserApi(config);

// Build request to extract text from a PDF file stored in cloud storage
    const request = new GroupDocsParserCloud.ExtractTextRequest({
        fileInfo: new GroupDocsParserCloud.FileInfo({
            filePath: "input.pdf" // path to the PDF in GroupDocs cloud storage
        })
    });

try {
        // Execute the request
        const result = await parserApi.extractText(request);

// result.text contains the extracted plain text
        console.log("Extracted Text:\n", result.text);

// Save extracted text to a local file
        fs.writeFileSync("extracted.txt", result.text, "utf8");
        console.log("Text saved to extracted.txt");
    } catch (error) {
        console.error("Error extracting text:", error);
    }
})();

Nota: Este exemplo de código demonstra a funcionalidade principal. Antes de usá‑lo em seu projeto, certifique‑se de atualizar quaisquer caminhos de arquivo e valores de configuração para corresponder ao seu ambiente real, verifique se todas as dependências necessárias estão devidamente instaladas e teste minuciosamente em seu ambiente de desenvolvimento. Se encontrar algum problema, consulte a documentação oficial ou entre em contato com a equipe de suporte para obter assistência.

Recuperar Texto de PDF Usando cURL e a API REST

Se você preferir uma abordagem independente de linguagem, pode obter o mesmo resultado com comandos cURL que chamam a API REST do GroupDocs.Parser Cloud. As etapas abaixo mostram como autenticar, enviar um PDF, extrair seu texto e baixar o resultado.

# 1. Get an access token
curl -X POST "https://api.groupdocs.cloud/v2.0/auth/token" \
     -H "Content-Type: application/json" \
     -d '{"client_id":"YOUR_CLIENT_ID","client_secret":"YOUR_CLIENT_SECRET"}'
# Response contains "access_token"

# 2. Upload the PDF to cloud storage
curl -X PUT "https://api.groupdocs.cloud/v2.0/storage/file/input.pdf" \
     -H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
     -H "Content-Type: application/pdf" \
     --data-binary @input.pdf

# 3. Extract text from the uploaded PDF
curl -X POST "https://api.groupdocs.cloud/v2.0/parser/extractText" \
     -H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
     -H "Content-Type: application/json" \
     -d '{"fileInfo":{"filePath":"input.pdf"}}' \
     -o result.json

# 4. Save the extracted text locally
jq -r '.text' result.json > extracted.txt

Esses comandos executam a mesma operação de extrair texto de PDF em Node.JS, mas através da API em nuvem, facilitando a integração com qualquer plataforma. Para mais detalhes, veja a referência oficial da API.

Desmembrando a Extração de Texto de PDF em Node.JS

Compreender cada parte do código ajuda a adaptá‑lo a cenários mais complexos, como o processamento de PDFs digitalizados ou criptografados.

  1. Inicialização da Configuração -
const config = new GroupDocsParserCloud.Configuration({
    clientId: "YOUR_CLIENT_ID",
    clientSecret: "YOUR_CLIENT_SECRET"
});

Isso cria um objeto de configuração que contém suas credenciais de autenticação. A classe está documentada na referência da API.

  1. Instância da API Parser -
const parserApi = new GroupDocsParserCloud.ParserApi(config);

A classe ParserApi fornece métodos para todas as operações de análise, incluindo extractText.

  1. Construindo o ExtractTextRequest -
const request = new GroupDocsParserCloud.ExtractTextRequest({
    fileInfo: new GroupDocsParserCloud.FileInfo({
        filePath: "input.pdf"
    })
});

ExtractTextRequest informa ao serviço qual arquivo processar. Você também pode definir opções de OCR aqui para PDFs digitalizados.

  1. Executando a Solicitação -
const result = await parserApi.extractText(request);

O método extractText envia a solicitação para a nuvem e retorna um objeto de resposta contendo o texto simples.

  1. Manipulando o Resultado -
console.log("Extracted Text:\n", result.text);
fs.writeFileSync("extracted.txt", result.text, "utf8");

A propriedade result.text contém o conteúdo extraído, que você pode registrar, armazenar ou processar ainda mais.

Instalando e Configurando GroupDocs.Parser Cloud SDK for Node.JS

Antes de executar o código, instale o SDK e configure seu ambiente.

npm install groupdocs-parser-cloud

Pré-requisitos: Node.js 14 ou posterior, uma conta ativa do GroupDocs Cloud e credenciais de cliente (ID do cliente e segredo do cliente). Baixe o pacote mais recente na página oficial de download. Após a instalação, crie um config.json (ou use variáveis de ambiente) para armazenar suas credenciais com segurança.

Conclusão

Extrair texto de PDF em Node.JS torna‑se simples com o GroupDocs.Parser Cloud SDK for Node.JS. O SDK abstrai a complexidade da análise de PDF, oferece suporte a OCR para PDFs digitalizados e lida com documentos criptografados prontamente. Lembre‑se de obter uma licença válida para uso em produção; você pode adquirir uma assinatura ou solicitar uma licença temporária para avaliar a biblioteca. Com o exemplo de código, a alternativa cURL e as etapas de instalação cobertas, você está pronto para integrar a extração de texto de PDF ao seu fluxo de trabalho de documentos e desbloquear recursos poderosos de pesquisa e análise.

Perguntas Frequentes

  • Como faço para extrair texto de PDF em Node.JS usando GroupDocs.Parser?
    Use o método extractText de ParserApi conforme mostrado no exemplo de código completo. O SDK retorna automaticamente texto simples, e você pode habilitar OCR para PDFs digitalizados.

  • Posso extrair texto de PDF digitalizado em Node.JS?
    Sim. Defina as opções de OCR no ExtractTextRequest para que o serviço reconheça o texto em páginas baseadas em imagem.

  • E se o meu PDF estiver protegido por senha?
    Inclua a senha no objeto FileInfo (password: "yourPassword"). O SDK descriptografará o arquivo antes de extrair o texto.

  • Existe uma maneira de chamar o serviço sem escrever Node.JS?
    Absolutamente. Os comandos cURL na seção “Retrieve PDF Text Using cURL and the REST API” demonstram uma abordagem independente de linguagem via a REST API.

Read More