PDF 파일에서 텍스트를 추출하는 것은 문서‑처리 파이프라인을 구축할 때, 특히 검색 인덱싱이나 데이터 분석을 위해 자주 요구되는 작업입니다. GroupDocs.Parser Cloud SDK for Node.JS는 저수준 파싱 로직을 다루지 않고도 Node.JS에서 PDF 텍스트를 프로그래밍 방식으로 추출할 수 있는 강력한 라이브러리를 제공합니다. 이 가이드에서는 전체 코드 예제, cURL REST 대안 및 필요한 설정 단계와 함께 일반 PDF와 암호화된 PDF 모두에서 텍스트를 추출하는 방법을 배웁니다.
Node.JS에서 PDF 텍스트 추출 - 전체 코드 예제
다음 예제는 Node.JS에서 GroupDocs.Parser Cloud SDK를 사용하여 PDF에서 텍스트를 추출하는 방법을 보여줍니다. 여기에는 초기화, 요청 빌드, 실행 및 결과를 로컬 파일에 저장하는 과정이 포함됩니다.
const GroupDocsParserCloud = require("@groupdocs/parser-cloud");
const fs = require("fs");
(async () => {
// Initialize configuration with your credentials
const config = new GroupDocsParserCloud.Configuration({
clientId: "YOUR_CLIENT_ID",
clientSecret: "YOUR_CLIENT_SECRET"
});
// Create Parser API instance
const parserApi = new GroupDocsParserCloud.ParserApi(config);
// Build request to extract text from a PDF file stored in cloud storage
const request = new GroupDocsParserCloud.ExtractTextRequest({
fileInfo: new GroupDocsParserCloud.FileInfo({
filePath: "input.pdf" // path to the PDF in GroupDocs cloud storage
})
});
try {
// Execute the request
const result = await parserApi.extractText(request);
// result.text contains the extracted plain text
console.log("Extracted Text:\n", result.text);
// Save extracted text to a local file
fs.writeFileSync("extracted.txt", result.text, "utf8");
console.log("Text saved to extracted.txt");
} catch (error) {
console.error("Error extracting text:", error);
}
})();
참고: 이 코드 예제는 핵심 기능을 보여줍니다. 프로젝트에 사용하기 전에 파일 경로와 구성 값을 실제 환경에 맞게 업데이트하고, 모든 필수 종속성이 올바르게 설치되었는지 확인하며, 개발 환경에서 충분히 테스트하십시오. 문제가 발생하면 공식 문서를 참조하거나 지원 팀에 문의하십시오.
cURL 및 REST API를 사용한 PDF 텍스트 검색
언어에 구애받지 않는 접근 방식을 선호한다면, GroupDocs.Parser Cloud REST API를 호출하는 cURL 명령을 사용하여 동일한 결과를 얻을 수 있습니다. 아래 단계에서는 인증 방법, PDF 업로드, 텍스트 추출 및 결과 다운로드 방법을 보여줍니다.
# 1. Get an access token
curl -X POST "https://api.groupdocs.cloud/v2.0/auth/token" \
-H "Content-Type: application/json" \
-d '{"client_id":"YOUR_CLIENT_ID","client_secret":"YOUR_CLIENT_SECRET"}'
# Response contains "access_token"
# 2. Upload the PDF to cloud storage
curl -X PUT "https://api.groupdocs.cloud/v2.0/storage/file/input.pdf" \
-H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
-H "Content-Type: application/pdf" \
--data-binary @input.pdf
# 3. Extract text from the uploaded PDF
curl -X POST "https://api.groupdocs.cloud/v2.0/parser/extractText" \
-H "Authorization: Bearer YOUR_ACCESS_TOKEN" \
-H "Content-Type: application/json" \
-d '{"fileInfo":{"filePath":"input.pdf"}}' \
-o result.json
# 4. Save the extracted text locally
jq -r '.text' result.json > extracted.txt
이 명령은 extract text from PDF in Node.JS 작업을 동일하게 수행하지만, 클라우드 API를 통해 수행되어 모든 플랫폼과 쉽게 통합할 수 있습니다. 자세한 내용은 공식 API 참조를 확인하세요.
Node.JS에서 PDF 텍스트 추출 분석
코드의 각 부분을 이해하면 스캔된 PDF나 암호화된 PDF와 같은 더 복잡한 시나리오에 맞게 코드를 적용할 수 있습니다.
- 구성 초기화 -
const config = new GroupDocsParserCloud.Configuration({
clientId: "YOUR_CLIENT_ID",
clientSecret: "YOUR_CLIENT_SECRET"
});
이 코드는 인증 자격 증명을 보유하는 구성 객체를 생성합니다. 클래스는 API reference에서 문서화되어 있습니다.
- Parser API 인스턴스 -
const parserApi = new GroupDocsParserCloud.ParserApi(config);
ParserApi 클래스는 extractText를 포함한 모든 파싱 작업에 대한 메서드를 제공합니다.
- ExtractTextRequest 빌드 -
const request = new GroupDocsParserCloud.ExtractTextRequest({
fileInfo: new GroupDocsParserCloud.FileInfo({
filePath: "input.pdf"
})
});
ExtractTextRequest는 서비스에 처리할 파일을 알려줍니다. 여기에서 스캔한 PDF에 대한 OCR 옵션도 설정할 수 있습니다.
- 요청 실행 -
const result = await parserApi.extractText(request);
extractText 메서드는 요청을 클라우드로 전송하고 평문 텍스트를 포함하는 응답 객체를 반환합니다.
- 결과 처리 -
console.log("Extracted Text:\n", result.text);
fs.writeFileSync("extracted.txt", result.text, "utf8");
result.text 속성은 추출된 내용을 보유하며, 이를 로그에 기록하거나, 저장하거나, 추가로 처리할 수 있습니다.
설치 및 구성 GroupDocs.Parser Cloud SDK for Node.JS
코드를 실행하기 전에 SDK를 설치하고 환경을 설정하십시오.
npm install groupdocs-parser-cloud
전제 조건: Node.js 14 이상, 활성화된 GroupDocs Cloud 계정, 그리고 클라이언트 자격 증명(클라이언트 ID 및 클라이언트 비밀). 최신 패키지를 공식 다운로드 페이지에서 다운로드하십시오. 설치 후, config.json을 생성(또는 환경 변수를 사용)하여 자격 증명을 안전하게 저장하십시오.
결론
Node.JS에서 PDF 텍스트를 추출하는 것이 GroupDocs.Parser Cloud SDK for Node.JS를 사용하면 간단해집니다. 이 SDK는 PDF 파싱의 복잡성을 추상화하고, 스캔된 PDF에 대한 OCR을 지원하며, 암호화된 문서를 기본적으로 처리합니다. 프로덕션 사용을 위해 유효한 라이선스를 획득해야 함을 기억하세요; 구독을 구매하거나 라이브러리를 평가하기 위해 임시 라이선스를 요청할 수 있습니다. 코드 예제, cURL 대안 및 설치 단계가 포함되어 있으므로 PDF 텍스트 추출을 문서 워크플로에 통합하고 강력한 검색 및 분석 기능을 활용할 준비가 되었습니다.
FAQs
Node.JS에서 GroupDocs.Parser를 사용하여 PDF에서 텍스트를 추출하려면 어떻게 해야 하나요?
전체 코드 예제에 표시된 대로ParserApi의extractText메서드를 사용하십시오. SDK는 자동으로 일반 텍스트를 반환하며, 스캔한 PDF에 대해 OCR을 활성화할 수 있습니다.스캔한 PDF에서 텍스트를 추출할 수 있나요?
예.ExtractTextRequest에서 OCR 옵션을 설정하여 서비스가 이미지 기반 페이지의 텍스트를 인식하도록 합니다.PDF가 비밀번호로 보호되어 있으면 어떻게 해야 하나요?
FileInfo객체에 비밀번호를 포함하세요 (password: "yourPassword"). SDK가 텍스트를 추출하기 전에 파일을 복호화합니다.서비스를 Node.JS 코드를 작성하지 않고 호출할 수 있는 방법이 있나요?
물론입니다. “Retrieve PDF Text Using cURL and the REST API” 섹션의 cURL 명령은 REST API를 통한 언어에 구애받지 않는 접근 방식을 보여줍니다.
