การสกัดข้อความจากไฟล์ PDF เป็นความต้องการที่พบบ่อยเมื่อสร้าง pipeline การประมวลผลเอกสาร โดยเฉพาะสำหรับการทำดัชนีการค้นหาหรือการวิเคราะห์ข้อมูล. GroupDocs.Parser Cloud SDK for Node.JS ให้ไลบรารีที่แข็งแกร่งที่ช่วยให้คุณสกัดข้อความจาก PDF ใน Node.JS อย่างโปรแกรมเมติกโดยไม่ต้องจัดการกับตรรกะการพาร์เซระดับต่ำ. ในคู่มือนี้คุณจะได้เรียนรู้วิธีการสกัดข้อความจาก PDF ใน Node.JS ด้วยตัวอย่างโค้ดเต็ม, ตัวเลือก cURL REST, และขั้นตอนการตั้งค่าที่จำเป็น, ครอบคลุมทั้ง PDF ปกติและ PDF ที่เข้ารหัส.

ดึงข้อความจาก PDF ใน Node.JS - ตัวอย่างโค้ดเต็ม

ตัวอย่างต่อไปนี้แสดงวิธีการดึงข้อความจาก PDF ใน Node.JS ด้วย GroupDocs.Parser Cloud SDK รวมถึงการเริ่มต้น การสร้างคำขอ การดำเนินการ และการบันทึกผลลัพธ์ไปยังไฟล์ในเครื่อง.

const GroupDocsParserCloud = require("@groupdocs/parser-cloud");
const fs = require("fs");

(async () => {
    // Initialize configuration with your credentials
    const config = new GroupDocsParserCloud.Configuration({
        clientId: "YOUR_CLIENT_ID",
        clientSecret: "YOUR_CLIENT_SECRET"
    });

// Create Parser API instance
    const parserApi = new GroupDocsParserCloud.ParserApi(config);

// Build request to extract text from a PDF file stored in cloud storage
    const request = new GroupDocsParserCloud.ExtractTextRequest({
        fileInfo: new GroupDocsParserCloud.FileInfo({
            filePath: "input.pdf" // path to the PDF in GroupDocs cloud storage
        })
    });

try {
        // Execute the request
        const result = await parserApi.extractText(request);

// result.text contains the extracted plain text
        console.log("Extracted Text:\n", result.text);

// Save extracted text to a local file
        fs.writeFileSync("extracted.txt", result.text, "utf8");
        console.log("Text saved to extracted.txt");
    } catch (error) {
        console.error("Error extracting text:", error);
    }
})();

หมายเหตุ: ตัวอย่างโค้ดนี้แสดงการทำงานหลัก ก่อนนำไปใช้ในโครงการของคุณ โปรดตรวจสอบให้แน่ใจว่าได้อัปเดตเส้นทางไฟล์และค่าการกำหนดค่าต่าง ๆ ให้ตรงกับสภาพแวดล้อมจริงของคุณ ตรวจสอบว่าขึ้นตอนการพึ่งพาที่จำเป็นทั้งหมดได้ติดตั้งอย่างถูกต้อง และทดสอบอย่างละเอียดในสภาพแวดล้อมการพัฒนา หากคุณพบปัญหาใด ๆ โปรดดูที่ เอกสารอย่างเป็นทางการ หรือ ติดต่อทีม สนับสนุน เพื่อขอความช่วยเหลือ

ดึงข้อความ PDF ด้วย cURL และ REST API

หากคุณต้องการวิธีที่ไม่ขึ้นกับภาษา คุณสามารถบรรลุผลเดียวกันด้วยคำสั่ง cURL ที่เรียกใช้ GroupDocs.Parser Cloud REST API ขั้นตอนด้านล่างแสดงวิธีการรับรองความถูกต้อง, อัปโหลด PDF, ดึงข้อความ, และดาวน์โหลดผลลัพธ์.

# 1. Get an access token
curl -X POST "https://api.groupdocs.cloud/v2.0/auth/token" \
     -H "Content-Type: application/json" \
     -d '{"client_id":"YOUR_CLIENT_ID","client_secret":"YOUR_CLIENT_SECRET"}'
# Response contains "access_token"

# 2. Upload the PDF to cloud storage
curl -X PUT "https://api.groupdocs.cloud/v2.0/storage/file/input.pdf" \
     -H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
     -H "Content-Type: application/pdf" \
     --data-binary @input.pdf

# 3. Extract text from the uploaded PDF
curl -X POST "https://api.groupdocs.cloud/v2.0/parser/extractText" \
     -H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
     -H "Content-Type: application/json" \
     -d '{"fileInfo":{"filePath":"input.pdf"}}' \
     -o result.json

# 4. Save the extracted text locally
jq -r '.text' result.json > extracted.txt

คำสั่งเหล่านี้ทำการดำเนินการ extract text from PDF in Node.JS เดียวกัน แต่ผ่าน Cloud API ทำให้การรวมเข้ากับแพลตฟอร์มใดก็ง่ายขึ้น สำหรับรายละเอียดเพิ่มเติม ดูที่ เอกสารอ้างอิง API อย่างเป็นทางการ.

ทำความเข้าใจการดึงข้อความจาก PDF ใน Node.JS

การทำความเข้าใจแต่ละส่วนของโค้ดช่วยให้คุณปรับใช้กับสถานการณ์ที่ซับซ้อนมากขึ้น เช่น การประมวลผลไฟล์ PDF ที่สแกนหรือเข้ารหัส

  1. การเริ่มต้นการกำหนดค่า -
const config = new GroupDocsParserCloud.Configuration({
    clientId: "YOUR_CLIENT_ID",
    clientSecret: "YOUR_CLIENT_SECRET"
});

นี่จะสร้างอ็อบเจ็กต์การกำหนดค่าที่เก็บข้อมูลประจำตัวการตรวจสอบของคุณ คลาสนี้ได้รับการอธิบายไว้ใน เอกสารอ้างอิง API.

  1. อินสแตนซ์ของ Parser API -
const parserApi = new GroupDocsParserCloud.ParserApi(config);

คลาส ParserApi มีเมธอดสำหรับการดำเนินการพาร์เซอร์ทั้งหมด รวมถึง extractText.

  1. สร้าง ExtractTextRequest -
const request = new GroupDocsParserCloud.ExtractTextRequest({
    fileInfo: new GroupDocsParserCloud.FileInfo({
        filePath: "input.pdf"
    })
});

ExtractTextRequest บอกบริการว่าไฟล์ใดที่จะประมวลผล คุณยังสามารถตั้งค่าตัวเลือก OCR ที่นี่สำหรับ PDF ที่สแกน

  1. การดำเนินการคำขอ -
const result = await parserApi.extractText(request);

extractText เมธอดส่งคำขอไปยังคลาวด์และคืนอ็อบเจ็กต์การตอบสนองที่มีข้อความธรรมดาอยู่

  1. การจัดการผลลัพธ์ -
console.log("Extracted Text:\n", result.text);
fs.writeFileSync("extracted.txt", result.text, "utf8");

คุณสมบัติ result.text เก็บเนื้อหาที่ถูกดึงออกมา ซึ่งคุณสามารถบันทึก, เก็บไว้ หรือประมวลผลต่อได้.

การติดตั้งและกำหนดค่า GroupDocs.Parser Cloud SDK for Node.JS

ก่อนที่คุณจะสามารถรันโค้ดได้ ให้ติดตั้ง SDK และตั้งค่าสภาพแวดล้อมของคุณ.

npm install groupdocs-parser-cloud

ข้อกำหนดเบื้องต้น: Node.js 14 หรือใหม่กว่า, บัญชี GroupDocs Cloud ที่ใช้งานอยู่, และข้อมูลประจำตัวของลูกค้า (client ID และ client secret). ดาวน์โหลดแพคเกจล่าสุดจาก หน้าดาวน์โหลดอย่างเป็นทางการ. หลังการติดตั้ง, สร้างไฟล์ config.json (หรือใช้ตัวแปรสภาพแวดล้อม) เพื่อเก็บข้อมูลประจำตัวของคุณอย่างปลอดภัย.

สรุป

การสกัดข้อความจาก PDF ใน Node.JS กลายเป็นเรื่องง่ายด้วย GroupDocs.Parser Cloud SDK for Node.JS. SDK ทำให้ซับซ้อนของการแยกวิเคราะห์ PDF หายไป, รองรับ OCR สำหรับ PDF ที่สแกน, และจัดการกับเอกสารที่เข้ารหัสโดยอัตโนมัติ. จำไว้ว่าให้ได้รับใบอนุญาตที่ถูกต้องสำหรับการใช้งานในสภาพแวดล้อมการผลิต; คุณสามารถซื้อการสมัครสมาชิกหรือขอ ใบอนุญาตชั่วคราว เพื่อประเมินไลบรารี. ด้วยตัวอย่างโค้ด, ทางเลือก cURL, และขั้นตอนการติดตั้งที่ครอบคลุม, คุณพร้อมที่จะรวมการสกัดข้อความ PDF เข้าไปในกระบวนการทำงานเอกสารของคุณและเปิดใช้งานความสามารถในการค้นหาและวิเคราะห์ที่ทรงพลัง.

คำถามที่พบบ่อย

  • ฉันจะดึงข้อความจาก PDF ใน Node.JS โดยใช้ GroupDocs.Parser ได้อย่างไร?
    ใช้เมธอด extractText ของ ParserApi ตามที่แสดงในตัวอย่างโค้ดเต็ม SDK จะคืนค่าข้อความธรรมชาติอัตโนมัติ และคุณสามารถเปิดใช้งาน OCR สำหรับ PDF ที่สแกนได้

  • ฉันสามารถดึงข้อความจาก PDF ที่สแกนใน Node.JS ได้หรือไม่?
    ใช่. ตั้งค่าตัวเลือก OCR ใน ExtractTextRequest เพื่อให้บริการจดจำข้อความบนหน้าที่เป็นภาพ

  • ถ้า PDF ของฉันถูกป้องกันด้วยรหัสผ่านจะทำอย่างไร?
    ใส่รหัสผ่านในอ็อบเจ็กต์ FileInfo (password: "yourPassword"). SDK จะถอดรหัสไฟล์ก่อนทำการดึงข้อความออก.

  • มีวิธีเรียกใช้บริการโดยไม่ต้องเขียน Node.JS code หรือไม่?
    แน่นอน คำสั่ง cURL ในส่วน “Retrieve PDF Text Using cURL and the REST API” แสดงแนวทางที่ไม่ขึ้นกับภาษาโดยใช้ REST API

Read More