スキャンしたPDFの文字がコピーできない
複合機で読み取った資料や、受け取ったPDFの文字を選択しようとしてもできない。 検索しても引っかからない。ドラッグすると文字ではなく四角い範囲が選ばれる——という症状です。
原因は、そのPDFが紙を撮影した画像を貼っただけのファイルだからです。 スキャナは紙の見た目をそのまま画像として保存します。 人間の目には文字に見えますが、ファイルの中では写真と変わりません。 文字のデータが最初から存在しないので、選択もコピーも検索もできません。
取り出すには画像から文字を読み取る処理が要ります。 印字がかすれている、傾いている、解像度が低いといった条件では読み取れない箇所が出ます。 PDFIntact は読み取れなかった箇所を空欄にせず、読み取り不可として明示します。黙って埋めると、間違いに気づけないまま使われるためです。
いま試す
お手元のPDFで確認できます
診断はブラウザの中だけで行います。ファイルはどこにも送信されません。登録も不要です。何ページ・いくつの表や図が取り出せるかを、買う前に確認できます。
実例
まず見分けてください
同じ「PDF」でも、原因によって対処が変わります。次のどれに当てはまるかで判断できます。
- 文字を選択できない・検索しても出てこない
- スキャンPDF(画像)です。このページの対象です。
- 選択もコピーもできるが、貼り付けると読めない文字になる
- 画像ではなく、フォントの対応表が欠けている状態です。PDFをコピーすると文字化けする をご覧ください。
- 文字は取り出せるが、表の行と列がずれる
- PDFが表の構造を持っていないためです。PDFの表をExcelに貼り付けるとずれる をご覧ください。
よくある質問
- スキャンしたPDFの文字がコピーできないのはなぜですか
- スキャンで作られたPDFは、紙を撮影した画像がページに貼られているだけで、文字のデータを持っていないためです。人間の目には文字に見えますが、ファイルの中では写真と同じ扱いなので、選択もコピーもできません。
- コピーできるようにするにはどうすればよいですか
- 画像から文字を読み取る処理(文字認識)が必要です。PDFIntactはページを解析して本文・表・グラフを読み取り、Excel・Word・Markdown・JSONに書き出します。買う前にブラウザの中だけで診断できるので、読み取れるかを先に確認できます。
- 手書きの文書も読み取れますか
- 手書きのみで構成された文書は対象外です。印刷された文字が中心の文書をご利用ください。診断の画面で、変換できないものは購入前にお知らせします。
- スキャンした資料の表も取り出せますか
- 取り出せます。罫線と結合セルを再現してExcelに書き出します。ただし印字がかすれている、傾いている、解像度が低いといった条件では読み取れない箇所が出ます。読み取れなかった箇所は空欄にせず、読み取り不可として明示します。
- アップロードした資料はどう扱われますか
- 診断はブラウザの中だけで完結し、原本は送信しません。変換のために送信したPDFは24時間以内に削除します。決済が完了するまでPDF本体をサーバーに置かない設計です。