Ekstrahowanie tekstu z plików PDF jest częstym wymogiem przy budowaniu potoków przetwarzania dokumentów, szczególnie w przypadku indeksowania wyszukiwania lub analizy danych. GroupDocs.Parser Cloud SDK for Node.JS zapewnia solidną bibliotekę, która umożliwia programowe wyodrębnianie tekstu z PDF w Node.JS bez konieczności zajmowania się niskopoziomową logiką parsowania. W tym przewodniku dowiesz się, jak wyodrębnić tekst z PDF w Node.JS przy użyciu pełnego przykładu kodu, alternatywy cURL REST oraz niezbędnych kroków konfiguracji, obejmując zarówno zwykłe, jak i zaszyfrowane pliki PDF.

Wyodrębnianie tekstu z PDF w Node.JS - Pełny przykład kodu

Poniższy przykład demonstruje, jak wyodrębnić tekst z pliku PDF w Node.JS przy użyciu GroupDocs.Parser Cloud SDK. Zawiera inicjalizację, budowanie żądania, wykonanie oraz zapisanie wyniku do lokalnego pliku.

const GroupDocsParserCloud = require("@groupdocs/parser-cloud");
const fs = require("fs");

(async () => {
    // Initialize configuration with your credentials
    const config = new GroupDocsParserCloud.Configuration({
        clientId: "YOUR_CLIENT_ID",
        clientSecret: "YOUR_CLIENT_SECRET"
    });

// Create Parser API instance
    const parserApi = new GroupDocsParserCloud.ParserApi(config);

// Build request to extract text from a PDF file stored in cloud storage
    const request = new GroupDocsParserCloud.ExtractTextRequest({
        fileInfo: new GroupDocsParserCloud.FileInfo({
            filePath: "input.pdf" // path to the PDF in GroupDocs cloud storage
        })
    });

try {
        // Execute the request
        const result = await parserApi.extractText(request);

// result.text contains the extracted plain text
        console.log("Extracted Text:\n", result.text);

// Save extracted text to a local file
        fs.writeFileSync("extracted.txt", result.text, "utf8");
        console.log("Text saved to extracted.txt");
    } catch (error) {
        console.error("Error extracting text:", error);
    }
})();

Uwaga: Ten przykład kodu demonstruje podstawową funkcjonalność. Przed użyciem go w swoim projekcie upewnij się, że zaktualizowałeś wszystkie ścieżki plików i wartości konfiguracyjne, aby odpowiadały rzeczywistemu środowisku, sprawdź, czy wszystkie wymagane zależności są prawidłowo zainstalowane, oraz dokładnie przetestuj w środowisku deweloperskim. Jeśli napotkasz jakiekolwiek problemy, odwołaj się do oficjalnej dokumentacji lub skontaktuj się z zespołem wsparcia w celu uzyskania pomocy.

Pobieranie tekstu PDF przy użyciu cURL i REST API

Jeśli wolisz podejście niezależne od języka, możesz osiągnąć ten sam rezultat przy użyciu poleceń cURL wywołujących GroupDocs.Parser Cloud REST API. Poniższe kroki pokazują, jak uwierzytelnić się, przesłać plik PDF, wyodrębnić jego tekst i pobrać wynik.

# 1. Get an access token
curl -X POST "https://api.groupdocs.cloud/v2.0/auth/token" \
     -H "Content-Type: application/json" \
     -d '{"client_id":"YOUR_CLIENT_ID","client_secret":"YOUR_CLIENT_SECRET"}'
# Response contains "access_token"

# 2. Upload the PDF to cloud storage
curl -X PUT "https://api.groupdocs.cloud/v2.0/storage/file/input.pdf" \
     -H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
     -H "Content-Type: application/pdf" \
     --data-binary @input.pdf

# 3. Extract text from the uploaded PDF
curl -X POST "https://api.groupdocs.cloud/v2.0/parser/extractText" \
     -H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
     -H "Content-Type: application/json" \
     -d '{"fileInfo":{"filePath":"input.pdf"}}' \
     -o result.json

# 4. Save the extracted text locally
jq -r '.text' result.json > extracted.txt

Te polecenia wykonują tę samą operację wyodrębnianie tekstu z PDF w Node.JS, ale przy użyciu interfejsu API w chmurze, co ułatwia integrację z dowolną platformą. Aby uzyskać więcej szczegółów, zobacz oficjalną dokumentację API.

Rozbijanie wyodrębniania tekstu z PDF w Node.JS

Zrozumienie każdej części kodu pomaga dostosować go do bardziej złożonych scenariuszy, takich jak przetwarzanie zeskanowanych lub zaszyfrowanych plików PDF.

  1. Inicjalizacja konfiguracji -
const config = new GroupDocsParserCloud.Configuration({
    clientId: "YOUR_CLIENT_ID",
    clientSecret: "YOUR_CLIENT_SECRET"
});

Tworzy obiekt konfiguracji, który przechowuje Twoje dane uwierzytelniające. Klasa jest udokumentowana w referencji API.

  1. Instancja Parser API -
const parserApi = new GroupDocsParserCloud.ParserApi(config);

Klasa ParserApi udostępnia metody do wszystkich operacji parsowania, w tym extractText.

  1. Budowanie żądania ExtractTextRequest -

    const request = new GroupDocsParserCloud.ExtractTextRequest({
        fileInfo: new GroupDocsParserCloud.FileInfo({
            filePath: "input.pdf"
        })
    });
    

    ExtractTextRequest informuje usługę, który plik ma zostać przetworzony. Możesz również ustawić opcje OCR tutaj dla zeskanowanych plików PDF.

  2. Wykonywanie żądania -

const result = await parserApi.extractText(request);

Metoda extractText wysyła żądanie do chmury i zwraca obiekt odpowiedzi zawierający zwykły tekst.

  1. Obsługa wyniku -
console.log("Extracted Text:\n", result.text);
fs.writeFileSync("extracted.txt", result.text, "utf8");

Właściwość result.text zawiera wyodrębnioną treść, którą możesz zalogować, zapisać lub dalej przetwarzać.

Instalowanie i konfigurowanie GroupDocs.Parser Cloud SDK for Node.JS

Zanim będziesz mógł uruchomić kod, zainstaluj SDK i skonfiguruj środowisko.

npm install groupdocs-parser-cloud

Wymagania wstępne: Node.js 14 lub nowszy, aktywne konto GroupDocs Cloud oraz poświadczenia klienta (identyfikator klienta i tajny klucz). Pobierz najnowszy pakiet ze strony oficjalnego pobierania. Po instalacji utwórz plik config.json (lub użyj zmiennych środowiskowych), aby bezpiecznie przechowywać swoje poświadczenia.

Podsumowanie

Ekstrahowanie tekstu z PDF w Node.JS staje się proste dzięki GroupDocs.Parser Cloud SDK for Node.JS. SDK ukrywa złożoność parsowania PDF, obsługuje OCR dla zeskanowanych PDF‑ów oraz obsługuje zaszyfrowane dokumenty od razu. Pamiętaj, aby uzyskać ważną licencję do użytku produkcyjnego; możesz zakupić subskrypcję lub poprosić o tymczasową licencję, aby ocenić bibliotekę. Z przykładem kodu, alternatywą cURL i opisanymi krokami instalacji, jesteś gotowy zintegrować ekstrakcję tekstu z PDF w swoim przepływie dokumentów i odblokować potężne możliwości wyszukiwania i analiz.

FAQs

  • Jak wyodrębnić tekst z PDF w Node.JS przy użyciu GroupDocs.Parser?
    Użyj metody extractText klasy ParserApi, jak pokazano w pełnym przykładzie kodu. SDK automatycznie zwraca zwykły tekst, a także możesz włączyć OCR dla zeskanowanych plików PDF.

  • Czy mogę wyodrębnić tekst ze zeskanowanego PDF w Node.JS?
    Tak. Ustaw opcje OCR w ExtractTextRequest, aby usługa rozpoznawała tekst na stronach opartych na obrazie.

  • Co jeśli mój PDF jest zabezpieczony hasłem?
    Umieść hasło w obiekcie FileInfo (password: "yourPassword"). SDK odszyfruje plik przed wyodrębnieniem tekstu.

  • Czy istnieje sposób wywołania usługi bez pisania kodu Node.JS?
    Zdecydowanie. Polecenia cURL w sekcji “Retrieve PDF Text Using cURL and the REST API” demonstrują podejście niezależne od języka za pośrednictwem REST API.

Czytaj więcej