استخراج النص من ملفات PDF هو طلب شائع عند بناء خطوط معالجة المستندات، خاصةً لفهرسة البحث أو تحليل البيانات. يوفر GroupDocs.Parser Cloud SDK for Node.JS مكتبة قوية تتيح لك استخراج النص من PDF برمجيًا في Node.JS دون الحاجة للتعامل مع منطق التحليل منخفض المستوى. في هذا الدليل ستتعلم كيفية استخراج النص من PDF في Node.JS باستخدام مثال شفري كامل، بديل cURL REST، وخطوات الإعداد اللازمة، مع تغطية كل من ملفات PDF العادية والمشفرة.
استخراج النص من PDF في Node.JS - مثال كامل للكود
يوضح المثال التالي كيفية استخراج النص من ملف PDF في Node.JS باستخدام GroupDocs.Parser Cloud SDK. يتضمن ذلك التهيئة، بناء الطلب، التنفيذ، وحفظ النتيجة في ملف محلي.
const GroupDocsParserCloud = require("@groupdocs/parser-cloud");
const fs = require("fs");
(async () => {
// Initialize configuration with your credentials
const config = new GroupDocsParserCloud.Configuration({
clientId: "YOUR_CLIENT_ID",
clientSecret: "YOUR_CLIENT_SECRET"
});
// Create Parser API instance
const parserApi = new GroupDocsParserCloud.ParserApi(config);
// Build request to extract text from a PDF file stored in cloud storage
const request = new GroupDocsParserCloud.ExtractTextRequest({
fileInfo: new GroupDocsParserCloud.FileInfo({
filePath: "input.pdf" // path to the PDF in GroupDocs cloud storage
})
});
try {
// Execute the request
const result = await parserApi.extractText(request);
// result.text contains the extracted plain text
console.log("Extracted Text:\n", result.text);
// Save extracted text to a local file
fs.writeFileSync("extracted.txt", result.text, "utf8");
console.log("Text saved to extracted.txt");
} catch (error) {
console.error("Error extracting text:", error);
}
})();
ملاحظة: يوضح مثال الشيفرة هذا الوظيفة الأساسية. قبل استخدامه في مشروعك، تأكد من تحديث أي مسارات ملفات وقيم التكوين لتتناسب مع بيئتك الفعلية، وتحقق من أن جميع الاعتمادات المطلوبة مثبتة بشكل صحيح، واختبر بدقة في بيئة التطوير الخاصة بك. إذا واجهت أي مشكلات، يرجى الرجوع إلى الوثائق الرسمية أو التواصل مع فريق الدعم للحصول على المساعدة.
استرجاع نص PDF باستخدام cURL وواجهة برمجة التطبيقات REST
إذا كنت تفضل نهجًا غير مرتبط بلغة معينة، يمكنك تحقيق النتيجة نفسها باستخدام أوامر cURL التي تستدعي GroupDocs.Parser Cloud REST API. الخطوات أدناه توضح كيفية المصادقة، تحميل ملف PDF، استخراج نصه، وتنزيل النتيجة.
# 1. Get an access token
curl -X POST "https://api.groupdocs.cloud/v2.0/auth/token" \
-H "Content-Type: application/json" \
-d '{"client_id":"YOUR_CLIENT_ID","client_secret":"YOUR_CLIENT_SECRET"}'
# Response contains "access_token"
# 2. Upload the PDF to cloud storage
curl -X PUT "https://api.groupdocs.cloud/v2.0/storage/file/input.pdf" \
-H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
-H "Content-Type: application/pdf" \
--data-binary @input.pdf
# 3. Extract text from the uploaded PDF
curl -X POST "https://api.groupdocs.cloud/v2.0/parser/extractText" \
-H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
-H "Content-Type: application/json" \
-d '{"fileInfo":{"filePath":"input.pdf"}}' \
-o result.json
# 4. Save the extracted text locally
jq -r '.text' result.json > extracted.txt
تقوم هذه الأوامر بأداء نفس عملية استخراج النص من PDF في Node.JS، ولكن عبر واجهة برمجة التطبيقات السحابية، مما يجعل من السهل دمجها مع أي منصة. لمزيد من التفاصيل، راجع المرجع الرسمي لواجهة برمجة التطبيقات.
تحليل استخراج النص من PDF في Node.JS
فهم كل جزء من الشيفرة يساعدك على تكييفها مع سيناريوهات أكثر تعقيدًا، مثل معالجة ملفات PDF الممسوحة ضوئيًا أو المشفرة.
- تهيئة التكوين -
const config = new GroupDocsParserCloud.Configuration({
clientId: "YOUR_CLIENT_ID",
clientSecret: "YOUR_CLIENT_SECRET"
});
هذا ينشئ كائن تكوين يحتوي على بيانات الاعتماد الخاصة بالمصادقة. تم توثيق الفئة في مرجع API.
- مثيل Parser API -
const parserApi = new GroupDocsParserCloud.ParserApi(config);
توفر فئة ParserApi طرقًا لجميع عمليات التحليل، بما في ذلك extractText.
- إنشاء ExtractTextRequest -
const request = new GroupDocsParserCloud.ExtractTextRequest({
fileInfo: new GroupDocsParserCloud.FileInfo({
filePath: "input.pdf"
})
});
ExtractTextRequest يخبر الخدمة بأي ملف يجب معالجته. يمكنك أيضًا تعيين خيارات OCR هنا لملفات PDF الممسوحة ضوئيًا.
- تنفيذ الطلب -
const result = await parserApi.extractText(request);
ترسل طريقة extractText الطلب إلى السحابة وتعيد كائن استجابة يحتوي على النص العادي.
- معالجة النتيجة -
console.log("Extracted Text:\n", result.text);
fs.writeFileSync("extracted.txt", result.text, "utf8");
الخاصية result.text تحتوي على المحتوى المستخرج، والذي يمكنك تسجيله، تخزينه، أو معالجته لاحقًا.
تثبيت وتكوين GroupDocs.Parser Cloud SDK for Node.JS
قبل أن تتمكن من تشغيل الكود، قم بتثبيت SDK وإعداد بيئتك.
npm install groupdocs-parser-cloud
المتطلبات المسبقة: Node.js 14 or later، حساب GroupDocs Cloud نشط، وبيانات اعتماد العميل (معرف العميل والسر الخاص بالعميل). قم بتنزيل أحدث حزمة من صفحة التحميل الرسمية. بعد التثبيت، أنشئ ملف config.json (أو استخدم متغيرات البيئة) لتخزين بيانات الاعتماد الخاصة بك بأمان.
الخلاصة
استخراج النص من PDF في Node.JS يصبح بسيطًا مع GroupDocs.Parser Cloud SDK for Node.JS. يقوم SDK بتجريد تعقيد تحليل PDF، ويدعم OCR لملفات PDF الممسوحة ضوئيًا، ويتعامل مع المستندات المشفرة مباشرةً. تذكر الحصول على ترخيص صالح للاستخدام في الإنتاج؛ يمكنك شراء اشتراك أو طلب ترخيص مؤقت لتقييم المكتبة. مع مثال الشيفرة، بديل cURL، وخطوات التثبيت المشروحة، أنت جاهز لدمج استخراج نص PDF في سير عمل المستندات الخاص بك وإطلاق إمكانيات البحث والتحليل القوية.
الأسئلة المتكررة
كيف يمكنني استخراج النص من PDF في Node.JS باستخدام GroupDocs.Parser؟
استخدم طريقةextractTextمنParserApiكما هو موضح في مثال الكود الكامل. يقوم SDK تلقائيًا بإرجاع النص العادي، ويمكنك تمكين OCR لملفات PDF الممسوحة ضوئيًا.هل يمكنني استخراج النص من ملف PDF الممسوح ضوئياً في Node.JS؟
نعم. قم بتعيين خيارات OCR فيExtractTextRequestللسماح للخدمة بالتعرف على النص في الصفحات القائمة على الصور.ماذا لو كان ملف PDF محميًا بكلمة مرور؟
قم بتضمين كلمة المرور في كائنFileInfo(password: "yourPassword"). سيقوم SDK بفك تشفير الملف قبل استخراج النص.هل هناك طريقة لاستدعاء الخدمة دون كتابة كود Node.JS؟
بالتأكيد. أوامر cURL في قسم “استرجاع نص PDF باستخدام cURL و REST API” توضح نهجًا غير مرتبط بلغة معينة عبر REST API.
