Das Extrahieren von Text aus PDF-Dateien ist eine häufige Anforderung beim Aufbau von Dokumenten‑Verarbeitungspipelines, insbesondere für die Suchindizierung oder Datenanalyse. GroupDocs.Parser Cloud SDK for Node.JS bietet eine robuste Bibliothek, mit der Sie programmgesteuert Text aus PDF in Node.JS extrahieren können, ohne sich mit Low‑Level‑Parsing‑Logik befassen zu müssen. In diesem Leitfaden erfahren Sie, wie Sie Text aus PDF in Node.JS mithilfe eines vollständigen Codebeispiels, einer cURL‑REST‑Alternative und der erforderlichen Einrichtungsschritte extrahieren, wobei sowohl unverschlüsselte als auch verschlüsselte PDFs abgedeckt werden.
Text aus PDF in Node.JS extrahieren – Vollständiges Codebeispiel
Das folgende Beispiel zeigt, wie man Text aus einer PDF in Node.JS mit dem GroupDocs.Parser Cloud SDK extrahiert. Es beinhaltet die Initialisierung, das Erstellen der Anfrage, die Ausführung und das Speichern des Ergebnisses in einer lokalen Datei.
const GroupDocsParserCloud = require("@groupdocs/parser-cloud");
const fs = require("fs");
(async () => {
// Initialize configuration with your credentials
const config = new GroupDocsParserCloud.Configuration({
clientId: "YOUR_CLIENT_ID",
clientSecret: "YOUR_CLIENT_SECRET"
});
// Create Parser API instance
const parserApi = new GroupDocsParserCloud.ParserApi(config);
// Build request to extract text from a PDF file stored in cloud storage
const request = new GroupDocsParserCloud.ExtractTextRequest({
fileInfo: new GroupDocsParserCloud.FileInfo({
filePath: "input.pdf" // path to the PDF in GroupDocs cloud storage
})
});
try {
// Execute the request
const result = await parserApi.extractText(request);
// result.text contains the extracted plain text
console.log("Extracted Text:\n", result.text);
// Save extracted text to a local file
fs.writeFileSync("extracted.txt", result.text, "utf8");
console.log("Text saved to extracted.txt");
} catch (error) {
console.error("Error extracting text:", error);
}
})();
Hinweis: Dieses Codebeispiel demonstriert die Kernfunktionalität. Bevor Sie es in Ihrem Projekt verwenden, stellen Sie sicher, dass Sie alle Dateipfade und Konfigurationswerte an Ihre tatsächliche Umgebung anpassen, überprüfen Sie, dass alle erforderlichen Abhängigkeiten ordnungsgemäß installiert sind, und testen Sie gründlich in Ihrer Entwicklungsumgebung. Wenn Sie auf Probleme stoßen, lesen Sie bitte die offizielle Dokumentation oder wenden Sie sich an das Support‑Team für Unterstützung.
PDF-Text mit cURL und der REST-API abrufen
Wenn Sie einen sprachunabhängigen Ansatz bevorzugen, können Sie dasselbe Ergebnis mit cURL‑Befehlen erzielen, die die GroupDocs.Parser Cloud REST‑API aufrufen. Die nachstehenden Schritte zeigen, wie Sie sich authentifizieren, ein PDF hochladen, dessen Text extrahieren und das Ergebnis herunterladen.
# 1. Get an access token
curl -X POST "https://api.groupdocs.cloud/v2.0/auth/token" \
-H "Content-Type: application/json" \
-d '{"client_id":"YOUR_CLIENT_ID","client_secret":"YOUR_CLIENT_SECRET"}'
# Response contains "access_token"
# 2. Upload the PDF to cloud storage
curl -X PUT "https://api.groupdocs.cloud/v2.0/storage/file/input.pdf" \
-H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
-H "Content-Type: application/pdf" \
--data-binary @input.pdf
# 3. Extract text from the uploaded PDF
curl -X POST "https://api.groupdocs.cloud/v2.0/parser/extractText" \
-H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
-H "Content-Type: application/json" \
-d '{"fileInfo":{"filePath":"input.pdf"}}' \
-o result.json
# 4. Save the extracted text locally
jq -r '.text' result.json > extracted.txt
Diese Befehle führen dieselbe Text aus PDF in Node.JS extrahieren Operation aus, jedoch über die Cloud‑API, wodurch die Integration in jede Plattform einfach wird. Weitere Details finden Sie in der offiziellen API‑Referenz.
Aufschlüsselung der Textextraktion aus PDF in Node.JS
Das Verständnis jedes Teils des Codes hilft Ihnen, ihn an komplexere Szenarien anzupassen, wie z. B. die Verarbeitung gescannter oder verschlüsselter PDFs.
- Konfigurationsinitialisierung -
const config = new GroupDocsParserCloud.Configuration({
clientId: "YOUR_CLIENT_ID",
clientSecret: "YOUR_CLIENT_SECRET"
});
Dies erstellt ein Konfigurationsobjekt, das Ihre Authentifizierungsdaten enthält. Die Klasse ist in der API-Referenz dokumentiert.
- Parser API Instanz -
const parserApi = new GroupDocsParserCloud.ParserApi(config);
Die ParserApi-Klasse stellt Methoden für alle Parsing‑Operationen bereit, einschließlich extractText.
- Erstellen der ExtractTextRequest -
const request = new GroupDocsParserCloud.ExtractTextRequest({
fileInfo: new GroupDocsParserCloud.FileInfo({
filePath: "input.pdf"
})
});
ExtractTextRequest teilt dem Dienst mit, welche Datei verarbeitet werden soll. Hier können Sie auch OCR-Optionen für gescannte PDFs festlegen.
- Ausführen der Anforderung -
const result = await parserApi.extractText(request);
Die extractText‑Methode sendet die Anforderung an die Cloud und gibt ein Antwortobjekt zurück, das den Klartext enthält.
- Verarbeitung des Ergebnisses -
console.log("Extracted Text:\n", result.text);
fs.writeFileSync("extracted.txt", result.text, "utf8");
Die result.text‑Eigenschaft enthält den extrahierten Inhalt, den Sie protokollieren, speichern oder weiter verarbeiten können.
Installation und Konfiguration GroupDocs.Parser Cloud SDK für Node.JS
Bevor Sie den Code ausführen können, installieren Sie das SDK und richten Sie Ihre Umgebung ein.
npm install groupdocs-parser-cloud
Voraussetzungen: Node.js 14 oder höher, ein aktives GroupDocs Cloud‑Konto und Client‑Anmeldeinformationen (Client‑ID und Client‑Secret). Laden Sie das neueste Paket von der offiziellen Download‑Seite herunter. Nach der Installation erstellen Sie eine config.json (oder verwenden Sie Umgebungsvariablen), um Ihre Anmeldeinformationen sicher zu speichern.
Fazit
Das Extrahieren von Text aus PDF in Node.JS wird mit dem GroupDocs.Parser Cloud SDK for Node.JS unkompliziert. Das SDK abstrahiert die Komplexität der PDF-Analyse, unterstützt OCR für gescannte PDFs und verarbeitet verschlüsselte Dokumente sofort einsatzbereit. Denken Sie daran, eine gültige Lizenz für die Produktion zu erhalten; Sie können ein Abonnement erwerben oder eine temporäre Lizenz anfordern, um die Bibliothek zu evaluieren. Mit dem Codebeispiel, der cURL-Alternative und den Installationsschritten sind Sie bereit, den PDF-Textauszug in Ihren Dokumenten‑Workflow zu integrieren und leistungsstarke Such‑ und Analysefunktionen freizuschalten.
FAQs
Wie extrahiere ich Text aus PDF in Node.JS mit GroupDocs.Parser?
Verwenden Sie die MethodeextractTextvonParserApi, wie im vollständigen Codebeispiel gezeigt. Das SDK gibt automatisch reinen Text zurück, und Sie können OCR für gescannte PDFs aktivieren.Kann ich Text aus gescannten PDFs in Node.JS extrahieren?
Ja. Setzen Sie OCR-Optionen imExtractTextRequest, damit der Dienst Text auf bildbasierten Seiten erkennt.Was ist, wenn mein PDF passwortgeschützt ist?
Fügen Sie das Passwort in dasFileInfo-Objekt ein (password: "yourPassword"). Das SDK entschlüsselt die Datei, bevor der Text extrahiert wird.Gibt es eine Möglichkeit, den Service aufzurufen, ohne Node.JS-Code zu schreiben?
Absolut. Die cURL-Befehle im Abschnitt “Retrieve PDF Text Using cURL and the REST API” demonstrieren einen sprachunabhängigen Ansatz über die REST API.
