L’extraction de texte à partir de fichiers PDF est une exigence fréquente lors de la création de pipelines de traitement de documents, notamment pour l’indexation de recherche ou l’analyse de données. Le GroupDocs.Parser Cloud SDK for Node.JS fournit une bibliothèque robuste qui vous permet d’extraire programmatiquement du texte de PDF dans Node.JS sans gérer la logique de parsing de bas niveau. Dans ce guide, vous apprendrez comment extraire du texte d’un PDF dans Node.JS en utilisant un exemple de code complet, une alternative cURL REST, ainsi que les étapes de configuration nécessaires, couvrant à la fois les PDF simples et les PDF chiffrés.
Extraire du texte d’un PDF avec Node.JS - Exemple complet de code
L’exemple suivant montre comment extraire du texte d’un PDF en Node.JS avec GroupDocs.Parser Cloud SDK. Il comprend l’initialisation, la construction de la requête, l’exécution et l’enregistrement du résultat dans un fichier local.
const GroupDocsParserCloud = require("@groupdocs/parser-cloud");
const fs = require("fs");
(async () => {
// Initialize configuration with your credentials
const config = new GroupDocsParserCloud.Configuration({
clientId: "YOUR_CLIENT_ID",
clientSecret: "YOUR_CLIENT_SECRET"
});
// Create Parser API instance
const parserApi = new GroupDocsParserCloud.ParserApi(config);
// Build request to extract text from a PDF file stored in cloud storage
const request = new GroupDocsParserCloud.ExtractTextRequest({
fileInfo: new GroupDocsParserCloud.FileInfo({
filePath: "input.pdf" // path to the PDF in GroupDocs cloud storage
})
});
try {
// Execute the request
const result = await parserApi.extractText(request);
// result.text contains the extracted plain text
console.log("Extracted Text:\n", result.text);
// Save extracted text to a local file
fs.writeFileSync("extracted.txt", result.text, "utf8");
console.log("Text saved to extracted.txt");
} catch (error) {
console.error("Error extracting text:", error);
}
})();
Note : Cet exemple de code démontre la fonctionnalité principale. Avant de l’utiliser dans votre projet, assurez‑vous de mettre à jour tous les chemins de fichiers et les valeurs de configuration pour qu’ils correspondent à votre environnement réel, vérifiez que toutes les dépendances requises sont correctement installées et testez soigneusement dans votre environnement de développement. Si vous rencontrez des problèmes, veuillez consulter la documentation officielle ou contacter l’équipe de support pour obtenir de l’aide.
Récupérer le texte PDF à l’aide de cURL et de l’API REST
Si vous préférez une approche indépendante du langage, vous pouvez obtenir le même résultat avec des commandes cURL qui appellent l’API REST de GroupDocs.Parser Cloud. Les étapes ci‑dessous montrent comment s’authentifier, télécharger un PDF, extraire son texte et télécharger le résultat.
# 1. Get an access token
curl -X POST "https://api.groupdocs.cloud/v2.0/auth/token" \
-H "Content-Type: application/json" \
-d '{"client_id":"YOUR_CLIENT_ID","client_secret":"YOUR_CLIENT_SECRET"}'
# Response contains "access_token"
# 2. Upload the PDF to cloud storage
curl -X PUT "https://api.groupdocs.cloud/v2.0/storage/file/input.pdf" \
-H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
-H "Content-Type: application/pdf" \
--data-binary @input.pdf
# 3. Extract text from the uploaded PDF
curl -X POST "https://api.groupdocs.cloud/v2.0/parser/extractText" \
-H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
-H "Content-Type: application/json" \
-d '{"fileInfo":{"filePath":"input.pdf"}}' \
-o result.json
# 4. Save the extracted text locally
jq -r '.text' result.json > extracted.txt
Ces commandes effectuent la même opération extraction de texte PDF en Node.JS, mais via l’API cloud, ce qui facilite l’intégration avec n’importe quelle plateforme. Pour plus de détails, consultez la référence officielle de l’API.
Décomposer l’extraction de texte PDF en Node.JS
Comprendre chaque partie du code vous aide à l’adapter à des scénarios plus complexes, tels que le traitement de PDF numérisés ou cryptés.
- Initialisation de la configuration -
const config = new GroupDocsParserCloud.Configuration({
clientId: "YOUR_CLIENT_ID",
clientSecret: "YOUR_CLIENT_SECRET"
});
Cela crée un objet de configuration qui contient vos informations d’authentification. La classe est documentée dans la référence API.
- Instance de l’API Parser -
const parserApi = new GroupDocsParserCloud.ParserApi(config);
La classe ParserApi fournit des méthodes pour toutes les opérations d’analyse, y compris extractText.
Construction de la requête ExtractTextRequest -
const request = new GroupDocsParserCloud.ExtractTextRequest({ fileInfo: new GroupDocsParserCloud.FileInfo({ filePath: "input.pdf" }) });ExtractTextRequestindique au service quel fichier traiter. Vous pouvez également définir les options OCR ici pour les PDF numérisés.Exécution de la requête -
const result = await parserApi.extractText(request);
La méthode extractText envoie la requête au cloud et renvoie un objet de réponse contenant le texte brut.
- Gestion du résultat -
console.log("Extracted Text:\n", result.text);
fs.writeFileSync("extracted.txt", result.text, "utf8");
La propriété result.text contient le contenu extrait, que vous pouvez consigner, stocker ou traiter davantage.
Installation et configuration GroupDocs.Parser Cloud SDK for Node.JS
Avant de pouvoir exécuter le code, installez le SDK et configurez votre environnement.
npm install groupdocs-parser-cloud
Prérequis: Node.js 14 ou version ultérieure, un compte GroupDocs Cloud actif et des informations d’identification client (ID client et secret client). Téléchargez le dernier package depuis la page de téléchargement officielle. Après l’installation, créez un fichier config.json (ou utilisez des variables d’environnement) pour stocker vos informations d’identification en toute sécurité.
Conclusion
L’extraction de texte à partir de PDF en Node.JS devient simple avec le GroupDocs.Parser Cloud SDK for Node.JS. Le SDK abstrait la complexité de l’analyse PDF, prend en charge l’OCR pour les PDF numérisés et gère les documents chiffrés dès le départ. N’oubliez pas d’obtenir une licence valide pour une utilisation en production ; vous pouvez acheter un abonnement ou demander une licence temporaire pour évaluer la bibliothèque. Avec l’exemple de code, l’alternative cURL et les étapes d’installation présentés, vous êtes prêt à intégrer l’extraction de texte PDF dans votre flux de travail documentaire et à débloquer de puissantes capacités de recherche et d’analyse.
FAQs
Comment extraire du texte d’un PDF en Node.JS avec GroupDocs.Parser ?
Utilisez la méthodeextractTextdeParserApicomme indiqué dans l’exemple complet de code. Le SDK renvoie automatiquement du texte brut, et vous pouvez activer l’OCR pour les PDF numérisés.Puis-je extraire du texte d’un PDF numérisé dans Node.JS ?
Oui. Définissez les options OCR dans leExtractTextRequestpour permettre au service de reconnaître le texte sur les pages basées sur des images.Et si mon PDF est protégé par un mot de passe ?
Incluez le mot de passe dans l’objetFileInfo(password: "yourPassword"). Le SDK déchiffrera le fichier avant d’extraire le texte.Existe-t-il un moyen d’appeler le service sans écrire du code Node.JS ?
Absolument. Les commandes cURL dans la section « Retrieve PDF Text Using cURL and the REST API » démontrent une approche indépendante du langage via l’API REST.
