Extraer texto de archivos PDF es un requisito frecuente al construir canalizaciones de procesamiento de documentos, especialmente para la indexación de búsqueda o el análisis de datos. GroupDocs.Parser Cloud SDK for Node.JS ofrece una biblioteca robusta que permite extraer texto de PDF en Node.JS de forma programática sin tener que lidiar con la lógica de análisis de bajo nivel. En esta guía aprenderá cómo extraer texto de PDF en Node.JS usando un ejemplo de código completo, una alternativa REST con cURL y los pasos de configuración necesarios, cubriendo tanto PDFs simples como cifrados.
Extraer texto de PDF en Node.JS - Ejemplo de código completo
El siguiente ejemplo muestra cómo extraer texto de un PDF en Node.JS con el SDK de GroupDocs.Parser Cloud. Incluye la inicialización, la construcción de la solicitud, la ejecución y el guardado del resultado en un archivo local.
const GroupDocsParserCloud = require("@groupdocs/parser-cloud");
const fs = require("fs");
(async () => {
// Initialize configuration with your credentials
const config = new GroupDocsParserCloud.Configuration({
clientId: "YOUR_CLIENT_ID",
clientSecret: "YOUR_CLIENT_SECRET"
});
// Create Parser API instance
const parserApi = new GroupDocsParserCloud.ParserApi(config);
// Build request to extract text from a PDF file stored in cloud storage
const request = new GroupDocsParserCloud.ExtractTextRequest({
fileInfo: new GroupDocsParserCloud.FileInfo({
filePath: "input.pdf" // path to the PDF in GroupDocs cloud storage
})
});
try {
// Execute the request
const result = await parserApi.extractText(request);
// result.text contains the extracted plain text
console.log("Extracted Text:\n", result.text);
// Save extracted text to a local file
fs.writeFileSync("extracted.txt", result.text, "utf8");
console.log("Text saved to extracted.txt");
} catch (error) {
console.error("Error extracting text:", error);
}
})();
Nota: Este ejemplo de código muestra la funcionalidad principal. Antes de usarlo en su proyecto, asegúrese de actualizar cualquier ruta de archivo y valores de configuración para que coincidan con su entorno real, verifique que todas las dependencias requeridas estén correctamente instaladas y pruebe exhaustivamente en su entorno de desarrollo. Si encuentra algún problema, consulte la documentación oficial o póngase en contacto con el equipo de soporte para obtener ayuda.
Recuperar texto PDF usando cURL y la API REST
Si prefieres un enfoque independiente del lenguaje, puedes lograr el mismo resultado con comandos cURL que llamen a la GroupDocs.Parser Cloud REST API. Los pasos a continuación muestran cómo autenticarte, subir un PDF, extraer su texto y descargar el resultado.
# 1. Get an access token
curl -X POST "https://api.groupdocs.cloud/v2.0/auth/token" \
-H "Content-Type: application/json" \
-d '{"client_id":"YOUR_CLIENT_ID","client_secret":"YOUR_CLIENT_SECRET"}'
# Response contains "access_token"
# 2. Upload the PDF to cloud storage
curl -X PUT "https://api.groupdocs.cloud/v2.0/storage/file/input.pdf" \
-H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
-H "Content-Type: application/pdf" \
--data-binary @input.pdf
# 3. Extract text from the uploaded PDF
curl -X POST "https://api.groupdocs.cloud/v2.0/parser/extractText" \
-H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
-H "Content-Type: application/json" \
-d '{"fileInfo":{"filePath":"input.pdf"}}' \
-o result.json
# 4. Save the extracted text locally
jq -r '.text' result.json > extracted.txt
Estos comandos realizan la misma operación extraer texto de PDF en Node.JS, pero a través de la API en la nube, lo que facilita la integración con cualquier plataforma. Para obtener más detalles, consulte la referencia oficial de la API.
Desglosando la extracción de texto de PDF en Node.JS
Comprender cada parte del código le ayuda a adaptarlo a escenarios más complejos, como procesar PDFs escaneados o cifrados.
- Inicialización de la configuración -
const config = new GroupDocsParserCloud.Configuration({
clientId: "YOUR_CLIENT_ID",
clientSecret: "YOUR_CLIENT_SECRET"
});
Esto crea un objeto de configuración que contiene sus credenciales de autenticación. La clase está documentada en la referencia de API.
- Instancia de la API Parser -
const parserApi = new GroupDocsParserCloud.ParserApi(config);
La clase ParserApi proporciona métodos para todas las operaciones de análisis, incluido extractText.
- Construyendo el ExtractTextRequest -
const request = new GroupDocsParserCloud.ExtractTextRequest({
fileInfo: new GroupDocsParserCloud.FileInfo({
filePath: "input.pdf"
})
});
ExtractTextRequest indica al servicio qué archivo procesar. También puedes establecer opciones de OCR aquí para PDFs escaneados.
- Ejecutando la solicitud -
const result = await parserApi.extractText(request);
El método extractText envía la solicitud a la nube y devuelve un objeto de respuesta que contiene el texto plano.
- Manejo del Resultado -
console.log("Extracted Text:\n", result.text);
fs.writeFileSync("extracted.txt", result.text, "utf8");
La propiedad result.text contiene el contenido extraído, que puedes registrar, almacenar o procesar más adelante.
Instalación y configuración de GroupDocs.Parser Cloud SDK for Node.JS
Antes de poder ejecutar el código, instala el SDK y configura tu entorno.
npm install groupdocs-parser-cloud
Requisitos previos: Node.js 14 o posterior, una cuenta activa de GroupDocs Cloud y credenciales de cliente (ID de cliente y secreto de cliente). Descargue el paquete más reciente desde la página oficial de descarga. Después de la instalación, cree un config.json (o use variables de entorno) para almacenar sus credenciales de forma segura.
Conclusión
Extraer texto de PDF en Node.JS se vuelve sencillo con el GroupDocs.Parser Cloud SDK for Node.JS. El SDK abstrae la complejidad del análisis de PDF, admite OCR para PDFs escaneados y maneja documentos cifrados de forma nativa. Recuerde obtener una licencia válida para uso en producción; puede adquirir una suscripción o solicitar una licencia temporal para evaluar la biblioteca. Con el ejemplo de código, la alternativa cURL y los pasos de instalación cubiertos, está listo para integrar la extracción de texto de PDF en su flujo de trabajo de documentos y desbloquear potentes capacidades de búsqueda y análisis.
Preguntas frecuentes
¿Cómo extraer texto de un PDF en Node.JS usando GroupDocs.Parser?
Use el métodoextractTextdeParserApicomo se muestra en el ejemplo de código completo. El SDK devuelve automáticamente texto sin formato y puede habilitar OCR para PDFs escaneados.¿Puedo extraer texto de un PDF escaneado en Node.JS?
Sí. Establezca las opciones de OCR enExtractTextRequestpara que el servicio reconozca el texto en páginas basadas en imágenes.¿Qué pasa si mi PDF está protegido con contraseña?
Incluya la contraseña en el objetoFileInfo(password: "yourPassword"). El SDK descifrará el archivo antes de extraer el texto.¿Hay alguna forma de llamar al servicio sin escribir código Node.JS?
Absolutamente. Los comandos cURL en la sección “Retrieve PDF Text Using cURL and the REST API” demuestran un enfoque independiente del lenguaje mediante la API REST.
