PDFIntact

Tabellen und Text aus PDFs herausholen — unverändert

PDFの文字をコピーすると文字化けする

PDFの本文を選択してコピーし、貼り付けると 「ᆅ᪉බඹᅋయ」のような読めない文字列になる。 画面上は正しく表示されているのに、コピーした瞬間に別物になる——という症状です。

原因は、PDFに埋め込まれたフォントに字形と文字コードの対応表(ToUnicode CMap)が入っていないことです。 表示は「この字形を描け」という指示だけで成立するため、対応表が無くても正しく見えます。 しかしコピーは文字コードを必要とするので、そこで対応が失われます。 論文誌・官公庁の資料・古い組版ソフトで作られたPDFに多く見られます。

文字が壊れているわけではありません。ページには読める字形が描かれています。 だから、ページを画像として読み直せば本文を取り出せます。 フォントを変えても、Wordに貼り直しても直らないのは、コピーの時点で情報が失われているためです。

いま試す

お手元のPDFで確認できます

診断はブラウザの中だけで行います。ファイルはどこにも送信されません。登録も不要です。何ページ・いくつの表や図が取り出せるかを、買う前に確認できます。

実例

実際のPDFからコピーした文字列

下は官公庁の資料からコピーした実物です。左が化けたもの、右が復元したものです。左をコピーして、お使いのエディタに貼ってみてください。同じ結果になります。

コピーした結果

ᆅ᪉බඹᅋయ࡟࠾ࡅࡿ᭩㠃つไࠊᢲ༳ࠊᑐ㠃つไࡢぢ┤ࡋ࡟ࡘ࠸࡚

PDFIntact で取り出した結果

地方公共団体における書面規制、押印、対面規制の見直しについて

お手元の文字列で判定する

コピーした文字列を貼ると、それがこの種類の文字化けかどうかをその場で判定します。PDFを用意しなくても、コピーした結果だけで確かめられます。

判定はこのブラウザの中だけで行っています。入力した文字列はどこにも送信されません。

よくある質問

PDFをコピーすると文字化けするのはなぜですか
PDFに埋め込まれたフォントに、字形と文字コードの対応表(ToUnicode CMap)が入っていないためです。画面には正しく表示されますが、コピーすると別の文字に化けます。文字が壊れているのではなく、対応表が欠けているだけなので、ページを画像として読み直せば本文を取り出せます。
文字化けしたPDFから正しい文字を取り出せますか
取り出せます。PDFIntactはページを画像として読み直し、文字認識で本文を復元します。購入前にブラウザの中だけで診断できるので、実際に復元できるかを先に確認できます。ファイルはどこにも送信されません。
Wordに貼り付けても直りますか
直りません。コピーの時点で文字コードが失われているため、貼り付け先を変えても同じ文字化けが起きます。フォントを変えても直りません。
料金はいくらですか
1〜10ページ160円、11〜30ページ300円、31〜60ページ550円、61〜100ページ850円、101〜200ページ1,500円の買い切りです。アカウント登録は不要です。診断は無料で、買う前に何が取り出せるかを確認できます。

ほかの症状もまとめて診断する書き出し形式の違い