PDFIntact

Tabellen und Text aus PDFs herausholen — unverändert

Ein zweispaltiges PDF kommt mit verschränkten Spalten heraus

Sie markieren den Fließtext eines zweispaltig gesetzten Aufsatzes, kopieren ihn, fügen ihn in Word ein — und auf eine Zeile der linken Spalte folgt eine Zeile der rechten, immer abwechselnd. Zwei getrennte Gedankengänge sind ineinander geflochten, und wo ein Satz endet, ist nicht mehr zu erkennen.

Der Grund: Ein PDF speichert für Spalten keine Struktur. Sein Inhalt sind Anweisungen: „zeichne diese Glyphe an diese Koordinate“. Nirgends in der Datei steht, wo die eine Spalte beginnt und die andere endet. Kopieren und Textextraktion gehen die Seite von oben nach unten zeilenweise nach Zeichenposition durch, und so werden zwei Spalten auf gleicher Höhe abwechselnd Zeile für Zeile aufgegriffen.

Die Spalten müssen also aus dem Layout zurückgelesen werden. PDFIntact findet die Blöcke der Seite — Fließtext, Überschriften, Tabellen, Abbildungen — und bringt sie in die Lesereihenfolge zurück, bevor nach Word, Markdown und JSON geschrieben wird. Der Spaltensatz selbst wird nicht nachgebildet: Sie erhalten ein einspaltiges Dokument in Lesereihenfolge.

Jetzt ausprobieren

Prüfen Sie es an Ihrem eigenen PDF

Die Prüfung läuft vollständig in Ihrem Browser. Ihre Datei wird nie hochgeladen, ein Konto ist nicht nötig. Sehen Sie vor dem Bezahlen, wie viele Seiten sowie wie viele Tabellen und Abbildungen sich herausholen lassen.

Beispiel

行の拾われ方が変わります

左右に並んだ3行ずつの段が、どの順で並ぶかを示した図です。実際の文面ではなく、拾われる順序だけを表しています。

コピーしたとき(描かれた位置の順)

左の段 1行目
右の段 1行目
左の段 2行目
右の段 2行目
左の段 3行目
右の段 3行目

PDFIntact を通したとき(読み順)

左の段 1行目
左の段 2行目
左の段 3行目
右の段 1行目
右の段 2行目
右の段 3行目

形式ごとに、どう入るか

同じ読み順でも、書き出す形式によって入り方が違います。

Word(.docx)

読み順のまま、1段の段落として並びます。段組は再現しません。

Markdown(.md)

同じ範囲を、ページごとの見出しの下に読み順で置きます。

JSON

ブロックの種別・ページ番号・ページ内の座標つきで入るので、どの段のどこから来た文章かを後から辿れます。

Excel(.xlsx)

本文は入りません。Excelに書き出すのは表とグラフだけです。

脚注・キャプション・ページ番号

これらは本文とは別のブロックとして、読み順のその位置に段落で入ります。 2段組の論文では図のキャプションが本文と分けて取れること、 書籍のスキャンでは脚注の区切り線より下が別ブロックになりページ番号が本文に混ざらないことを、 それぞれ確認しています。Wordの脚注機能には入れません。段落として入ります。

Häufige Fragen

Warum verschränken sich die Spalten, wenn ich ein zweispaltiges PDF kopiere?
Weil ein PDF eine Spalte nicht als Spalte speichert. In der Datei steht nur „zeichne diese Glyphe an diese Koordinate“, und nichts markiert, wo die eine Spalte beginnt und die andere endet. Kopieren geht die Seite von oben nach unten zeilenweise durch, deshalb werden zwei Spalten auf gleicher Höhe abwechselnd Zeile für Zeile aufgegriffen.
Wie wird die Lesereihenfolge wiederhergestellt?
Die Blöcke der Seite — Fließtext, Überschriften, Tabellen, Abbildungen — werden zuerst gefunden und dann in die Lesereihenfolge zurückgebracht, bevor irgendetwas geschrieben wird. Der zweispaltige Satz selbst wird nicht nachgebildet: Word und Markdown erhalten ein einspaltiges Dokument in Lesereihenfolge.
Was passiert mit Fußnoten und Bildunterschriften?
Sie kommen als eigene Blöcke heraus, als Absätze an ihrer Stelle in der Lesereihenfolge. In unseren Prüfungen blieben Bildunterschriften vom Fließtext getrennt, alles unterhalb des Fußnotenstrichs wurde ein eigener Block, und Seitenzahlen wurden nicht in den Text gemischt. Zu Word-Fußnoten werden sie nicht; sie kommen als Absätze.
In welche Formate lässt sich der Text ausgeben?
Word, Markdown und JSON. Das JSON führt zusätzlich Blockart, Seitenzahl und Position auf der Seite mit, sodass sich nachvollziehen lässt, aus welcher Spalte und von welcher Stelle eine Passage stammt. Fließtext geht nicht nach Excel: Ein Excel-Export enthält nur Tabellen und Diagramme.
Wenn die Lesereihenfolge stimmt, stimmen dann auch die Zeichen?
Das sind zwei verschiedene Dinge. Die Lesereihenfolge kann halten, während die Zeichenerkennung zusammenbricht; genau das haben wir an einem Prüfstück gesehen. Deshalb trägt jeder Block ein Vertrauensband — gelesen, geschätzt oder nicht lesbar. Prüfen Sie die Ausgabe gegen das Original-PDF.

Ein PDF auf alle Symptome prüfenWas in welches Format kommt