PDF OCR

スキャンした書類のPDFから、文字を読み取ってコピーできるテキストにします。読み取りAI(OCR)もこの端末の中で動くため、書類はどこにも送信されません。横向き・上下逆のページは自動で回して読み直し、文字がすでに入っているページは読み取らずそのまま取り出します(そのほうが速く、正確なため)。

全機能無料。 使う・確認はそのまま。結果の持ち帰り(ダウンロード)だけ無料の登録を1回お願いしています(メールの用途はメルマガと製品のお知らせのみ)。API・MCP・CLIからの利用はドキュメントへ。

よくある質問

書類はどこかに送られますか?

送られません。文字を読み取るAIエンジン(OCR)自体をこの端末のブラウザの中で動かしているため、書類も読み取った文字も端末の外に出ません。契約書・請求書・カルテのような社外に出せない書類もそのまま扱えます。

「PDF テキスト 抽出」との違いは何ですか?

PDF テキスト 抽出PDFの中に入っている文字を取り出す道具で、このツールはページを画像として読み取って文字にする道具です。文字が入っているPDFなら、あちらのほうが速く、しかも1文字も間違えません。このツールはページごとに文字の有無を見分けて、文字が入っているページは読み取らずそのまま取り出します(画面のチェックを外すと、あえて画像から読み直せます)。紙をスキャンしたPDFで文字が1つも取り出せなかったときが、このツールの出番です。

どのくらい正確ですか?

はっきりした活字なら9割以上読み取れます。ただし100%ではありません。実測では数字の区切りが「12,800」→「12.800」のようにカンマとピリオドを取り違えます。手書き・ぼやけた写真・薄い印字は読み取れません(読めなかったページは「自信なし」と表示します)。また日本語向けのエンジンなので、英語だけの書類は取りこぼすことがあります。結果は画面でそのまま編集できるので、コピー・保存の前にご確認ください。

横向きや上下逆にスキャンしたページも読めますか?

読めます。まず見えているとおりの向きで読み、うまく読めなかったページだけ90度・180度・270度で読み直して、いちばん確からしい結果を採ります(実測の確信度は、正しい向き92に対して横向き14・上下逆23と、はっきり差が出ます)。回して読んだページは「90度回して読み取り」と表示します。2ページ目からは当たった向きを先に試すので、全ページ横向きのスキャンでも遅くなりません。

何ページまで読めますか?どのくらい時間がかかりますか?

ページ数の制限はありません。ただし読み取りは1ページ数秒かかるため(端末の速さによります)、数十ページのスキャンだと数分かかります。20ページを超えるPDFではその案内を出します。途中で「読み取りを中止」を押すと、そこまでのページの結果は残ります。読み取りエンジン(約9MB)は最初に読み取るページで一度だけ読み込むので、全ページに文字が入っているPDFでは読み込みません。

PDFの道具