ブラウザでのPDFテキスト抽出の仕組み
ブラウザでPDFテキスト抽出が動作する仕組み
PDF文書からのテキスト抽出は、従来はデスクトップソフトウェアまたはクラウドサービスが必要でしたが,两者ともプライバシー上の問題を引き起こします。当ツールはMozillaが開発した強力なJavaScriptライブラリであるpdf.jsを使用して、ブラウザ内で直接PDFバイナリデータを解析します。つまり、文書はデバイスを離れることはありません。
OCR技術の理解
スキャンされたPDFやPDFに埋め込まれた画像の場合、通常のテキスト抽出は機能しません。なぜなら、コンテンツは本質的に写真だからです。ここがOCR(光学文字認識)の出番です。当ツールはTesseract.jsを統合して画像からテキストを「読み取り」、英語、韓国語、中国語、日本語を含む複数の言語をサポートします。
- OCR使用のタイミング: スキャン文書、传真、写真から作成されたPDF
- 通常の抽出: 選択可能なテキストを持つネイティブPDF
- 言語サポート: 最高の精度のために正しいOCR言語モデルを選択