Mengekstrak teks dari PDF adalah kebutuhan yang sering ketika membangun pipeline pemrosesan dokumen, terutama untuk pengindeksan pencarian atau analisis data. GroupDocs.Parser Cloud SDK for Node.JS menyediakan pustaka yang kuat yang memungkinkan Anda mengekstrak teks dari PDF secara programatis di Node.JS tanpa harus menangani logika parsing tingkat rendah. Dalam panduan ini Anda akan mempelajari cara mengekstrak teks dari PDF di Node.JS menggunakan contoh kode lengkap, alternatif cURL REST, serta langkah‑langkah penyiapan yang diperlukan, mencakup PDF biasa maupun PDF yang terenkripsi.

Ekstrak Teks dari PDF di Node.JS - Contoh Kode Lengkap

Contoh berikut menunjukkan cara mengekstrak teks dari PDF di Node.JS dengan GroupDocs.Parser Cloud SDK. Ini mencakup inisialisasi, pembuatan permintaan, eksekusi, dan menyimpan hasil ke file lokal.

const GroupDocsParserCloud = require("@groupdocs/parser-cloud");
const fs = require("fs");

(async () => {
    // Initialize configuration with your credentials
    const config = new GroupDocsParserCloud.Configuration({
        clientId: "YOUR_CLIENT_ID",
        clientSecret: "YOUR_CLIENT_SECRET"
    });

// Create Parser API instance
    const parserApi = new GroupDocsParserCloud.ParserApi(config);

// Build request to extract text from a PDF file stored in cloud storage
    const request = new GroupDocsParserCloud.ExtractTextRequest({
        fileInfo: new GroupDocsParserCloud.FileInfo({
            filePath: "input.pdf" // path to the PDF in GroupDocs cloud storage
        })
    });

try {
        // Execute the request
        const result = await parserApi.extractText(request);

// result.text contains the extracted plain text
        console.log("Extracted Text:\n", result.text);

// Save extracted text to a local file
        fs.writeFileSync("extracted.txt", result.text, "utf8");
        console.log("Text saved to extracted.txt");
    } catch (error) {
        console.error("Error extracting text:", error);
    }
})();

Catatan: Contoh kode ini menunjukkan fungsi inti. Sebelum menggunakannya dalam proyek Anda, pastikan untuk memperbarui semua jalur file dan nilai konfigurasi agar sesuai dengan lingkungan Anda yang sebenarnya, verifikasi bahwa semua dependensi yang diperlukan telah terpasang dengan benar, dan uji secara menyeluruh di lingkungan pengembangan Anda. Jika Anda menemukan masalah, silakan merujuk ke dokumentasi resmi atau hubungi tim dukungan untuk bantuan.

Mengambil Teks PDF Menggunakan cURL dan REST API

Jika Anda lebih memilih pendekatan yang tidak bergantung pada bahasa, Anda dapat mencapai hasil yang sama dengan perintah cURL yang memanggil GroupDocs.Parser Cloud REST API. Langkah‑langkah di bawah ini menunjukkan cara mengautentikasi, mengunggah PDF, mengekstrak teksnya, dan mengunduh hasilnya.

# 1. Get an access token
curl -X POST "https://api.groupdocs.cloud/v2.0/auth/token" \
     -H "Content-Type: application/json" \
     -d '{"client_id":"YOUR_CLIENT_ID","client_secret":"YOUR_CLIENT_SECRET"}'
# Response contains "access_token"

# 2. Upload the PDF to cloud storage
curl -X PUT "https://api.groupdocs.cloud/v2.0/storage/file/input.pdf" \
     -H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
     -H "Content-Type: application/pdf" \
     --data-binary @input.pdf

# 3. Extract text from the uploaded PDF
curl -X POST "https://api.groupdocs.cloud/v2.0/parser/extractText" \
     -H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
     -H "Content-Type: application/json" \
     -d '{"fileInfo":{"filePath":"input.pdf"}}' \
     -o result.json

# 4. Save the extracted text locally
jq -r '.text' result.json > extracted.txt

Perintah‑perintah ini melakukan operasi extract text from PDF in Node.JS yang sama, tetapi melalui cloud API, memudahkan integrasi dengan platform apa pun. Untuk detail lebih lanjut, lihat referensi API resmi.

Membongkar Ekstrak Teks dari PDF di Node.JS

Memahami setiap bagian kode membantu Anda menyesuaikannya dengan skenario yang lebih kompleks, seperti memproses PDF yang dipindai atau terenkripsi.

  1. Inisialisasi Konfigurasi -
const config = new GroupDocsParserCloud.Configuration({
    clientId: "YOUR_CLIENT_ID",
    clientSecret: "YOUR_CLIENT_SECRET"
});

Ini membuat objek konfigurasi yang menyimpan kredensial otentikasi Anda. Kelas ini didokumentasikan dalam API reference.

  1. Instansi API Parser -
const parserApi = new GroupDocsParserCloud.ParserApi(config);

Kelas ParserApi menyediakan metode untuk semua operasi parsing, termasuk extractText.

  1. Membangun ExtractTextRequest -

    const request = new GroupDocsParserCloud.ExtractTextRequest({
        fileInfo: new GroupDocsParserCloud.FileInfo({
            filePath: "input.pdf"
        })
    });
    

    ExtractTextRequest memberi tahu layanan file mana yang akan diproses. Anda juga dapat mengatur opsi OCR di sini untuk PDF yang dipindai.

  2. Menjalankan Permintaan -

const result = await parserApi.extractText(request);

Metode extractText mengirimkan permintaan ke cloud dan mengembalikan objek respons yang berisi teks polos.

  1. Menangani Hasil -
console.log("Extracted Text:\n", result.text);
fs.writeFileSync("extracted.txt", result.text, "utf8");

Properti result.text berisi konten yang diekstrak, yang dapat Anda log, simpan, atau proses lebih lanjut.

Menginstal dan Mengonfigurasi GroupDocs.Parser Cloud SDK for Node.JS

Sebelum Anda dapat menjalankan kode, instal SDK dan siapkan lingkungan Anda.

npm install groupdocs-parser-cloud

Prasyarat: Node.js 14 atau lebih baru, akun GroupDocs Cloud yang aktif, dan kredensial klien (ID klien dan rahasia klien). Unduh paket terbaru dari halaman unduhan resmi. Setelah instalasi, buat file config.json (atau gunakan variabel lingkungan) untuk menyimpan kredensial Anda dengan aman.

Conclusion

Mengekstrak teks dari PDF di Node.JS menjadi sederhana dengan GroupDocs.Parser Cloud SDK for Node.JS. SDK menyederhanakan kompleksitas parsing PDF, mendukung OCR untuk PDF yang dipindai, dan menangani dokumen terenkripsi secara otomatis. Pastikan untuk memperoleh lisensi yang valid untuk penggunaan produksi; Anda dapat membeli langganan atau meminta lisensi sementara untuk mengevaluasi perpustakaan. Dengan contoh kode, alternatif cURL, dan langkah-langkah instalasi yang telah dibahas, Anda siap mengintegrasikan ekstraksi teks PDF ke dalam alur kerja dokumen Anda dan membuka kemampuan pencarian serta analitik yang kuat.

FAQs

  • Bagaimana cara mengekstrak teks dari PDF di Node.JS menggunakan GroupDocs.Parser?
    Gunakan metode extractText dari ParserApi seperti yang ditunjukkan dalam contoh kode lengkap. SDK secara otomatis mengembalikan teks biasa, dan Anda dapat mengaktifkan OCR untuk PDF yang dipindai.

  • Apakah saya dapat mengekstrak teks dari PDF yang dipindai di Node.JS?
    Ya. Atur opsi OCR dalam ExtractTextRequest agar layanan dapat mengenali teks pada halaman berbasis gambar.

  • Bagaimana jika PDF saya dilindungi kata sandi?
    Masukkan kata sandi ke dalam objek FileInfo (password: "yourPassword"). SDK akan mendekripsi file sebelum mengekstrak teks.

  • Apakah ada cara memanggil layanan tanpa menulis kode Node.JS?
    Tentu saja. Perintah cURL dalam bagian “Retrieve PDF Text Using cURL and the REST API” menunjukkan pendekatan yang tidak bergantung pada bahasa melalui REST API.

Baca Selengkapnya