Anleitungen

„The file is damaged and could not be repaired" — ein kaputtes PDF reparieren

Wenn Acrobat sagt, es habe ein PDF nicht reparieren können, bedeutet das meist, dass der Index der Datei beim Transport beschädigt oder abgeschnitten wurde, nicht dass die Seiten darin verloren sind, und diesen Index neu aufzubauen öffnet das Dokument oft wieder.

Die genauen Fehler und die Ironie in Adobes Formulierung

Adobe Acrobat und Reader zeigen dies, wörtlich, wenn ein PDF sich nicht öffnen lässt:

There was an error opening this document. The file is damaged and could not be repaired.

Chromes eingebauter Viewer formuliert denselben Fehler knapper:

Failed to load PDF document.

Lies Adobes Satz genau, denn seine Formulierung verleitet viele Menschen dazu aufzugeben. Er sagt nicht, dass die Datei nicht repariert werden kann. Er sagt, dass Acrobat sie nicht reparieren konnte. Acrobat hat einen eingebauten Reparaturdurchlauf, der automatisch startet, wenn es auf ein kaputtes PDF trifft, und dieser Durchlauf ist konservativ: Er bewältigt einfache Probleme und bricht bei allem Schwierigeren ab. Wenn er abbricht, meldet er die Datei als beschädigt und jenseits seiner eigenen Reparatur, was eine Aussage über Acrobats Bemühen ist, nicht über die tatsächliche Wiederherstellbarkeit der Datei. Zahlreiche PDFs, die diese Meldung auslösen, öffnen sich nach einem gründlicheren strukturellen Neuaufbau problemlos.

Die xref-Tabelle ist der Index des PDFs

Ein PDF besteht aus nummerierten Objekten: Jede Seite, jede Schrift, jedes Bild und jeder Textblock ist ein Objekt, das irgendwo in der Datei gespeichert ist. Um sie schnell zu finden, führt ein PDF eineQuerverweistabelle, die xref, nahe dem Ende der Datei. Die xref ist eine Nachschlageliste, die den genauen Byte-Offset jedes Objekts festhält, und direkt dahinter sitzt ein kleiner Trailer, der den Reader auf die xref und auf die Wurzel des Dokuments verweist. Wenn du ein PDF öffnest, springt der Reader ans Ende, liest den Trailer, liest die xref und nutzt diese Offsets, um alles andere zu lokalisieren.

Ein PDF speichert zuerst seine Seitenobjekte und nahe dem Ende den xref-Index, der sie lokalisiert. Beschädige die xref, und der Reader kann die Seiten nicht finden, obwohl die Seiten noch da sind.

Dieses Design ist dieselbe Geschichte wie der Index eines Videos oder das Verzeichnis eines ZIP: eine kleine Karte am Ende, die ein Reader braucht, bevor er den großen Datenkörper davor nutzen kann. Und es hat dieselbe Konsequenz. Ist die xref beschädigt, verweist sie auf falsche Offsets oder wurde sie ganz abgeschnitten, kann der Reader kein einziges Objekt finden, obwohl die Seiten unversehrt in der Datei liegen. Das Dokument ist unbrauchbar, aber der Inhalt ist nicht verloren, er ist nur nicht indexiert. Diese Lücke zwischen „unbrauchbar" und „verloren" ist der Ort, an dem die Reparatur lebt.

Warum ein abgebrochener Download das ganze PDF zerstört

Zwei Dinge gehen am häufigsten schief, und beide lassen die Objekte intakt, während sie den Index zerstören. Das erste ist das Abschneiden. Ein PDF wird, wie die meisten Dateien, von vorne nach hinten übertragen, sodass ein Download, der hängen bleibt, eine Cloud-Synchronisierung, die abbricht, oder ein Datenträger, der mitten im Kopieren herausgezogen wird, dir den Anfang der Datei und nichts nach dem Schnitt hinterlässt. Weil xref und Trailer am Ende liegen, entfernt das Abschneiden sie zuerst, während die Seitenobjekte nahe dem Anfang überleben. Eine schnelle Größenprüfung verrät es: Ein Vertrag, der 4 MB haben sollte und als 2,6 MB ankommt, ist abgeschnitten, und die fehlenden Bytes sind nicht beschädigt, sie fehlen schlicht.

Das zweite ist die Verfälschung während der Übertragung. Ein PDF ist eine Mischung aus Binärdaten und textartiger Struktur, und eine Übertragung, die unterwegs Bytes verändert, ein E-Mail-Gateway, das Zeilenenden „repariert", ein Werkzeug, das die Datei als Text behandelt, ein Codierungsschritt, der bestimmte Zeichen beschädigt, kann die tatsächliche Position der Objekte verschieben, sodass sie nicht mehr zu den Offsets passen, die die xref festhält. Die xref verweist jetzt ein paar Bytes daneben, wo jedes Objekt wirklich sitzt, und der Reader, der diesen veralteten Zeigern folgt, findet Datenmüll und erklärt die Datei für beschädigt.

Beide Fälle teilen sich dieselbe Reihenfolge der Behebung. Weil die sicherste Reparatur für eine abgeschnittene oder verfälschte Datei eine saubere Kopie der Bytes ist, die verloren gingen oder sich änderten, lade oder kopiere die Datei zuerst erneut von ihrer ursprünglichen Quelle. Hol sie erneut über eine stabile Verbindung, oder zieh sie direkt vom Gerät oder Datenträger, von dem sie kam, und öffne die frische Kopie. Ein sauberer Download repariert das ganze Dokument auf einmal, während die Reparatur nur um das herum aufbauen kann, was du bereits hast, es lohnt sich also immer, die zwei Minuten in die ursprüngliche Quelle zu investieren, bevor du etwas anderes versuchst.

Das xref neu aufbauen

Wenn keine saubere Kopie verfügbar ist, besteht die Reparatur darin, den Index zu rekonstruieren. Jedes PDF-Objekt trägt einen erkennbaren Marker in der Datei, sodass ein Reparatur-Tool die kaputte xref vollständig ignorieren und die Datei von vorne durchsuchen kann, jedes überlebende Objekt findet und notiert, wo es wirklich sitzt. Aus diesem Scan baut es eine frische, korrekte Querverweistabelle und einen passenden Trailer auf und schreibt dann ein neues PDF, dessen Index tatsächlich auf seine Objekte verweist. Ein Reader, der die neu aufgebaute Datei öffnet, geht die neue xref durch, findet jedes Objekt dort, wo die Tabelle es angibt, und rendert das Dokument.

Das ist genau die Arbeit, die Acrobats eigener Reparaturdurchlauf versucht und oft aufgibt, nur gründlicher erledigt. Wenn die Objekte überlebt haben und nur der Index kaputt war, was der häufige Fall hinter diesem Fehler ist, stellt der Neuaufbau das Dokument vollständig wieder her. Er ist außerdem zerstörungsfrei, wenn er richtig gemacht wird: Das Tool liest deine beschädigte Datei und schreibt eine neue, sodass ein fehlgeschlagener Versuch das Original genau so lässt, wie es war, und dich nichts kostet, es zu versuchen.

Wenn ein Neuaufbau nicht reicht

Das Neuaufbauen der xref stellt ein Dokument wieder her, dessen Objekte hinter einem kaputten Index intakt sind. Es kann keinen Inhalt herbeizaubern, der nicht in der Datei ist, und ein paar Situationen liegen außerhalb dessen, was irgendeine Reparatur leisten kann. Sie klar zu benennen ist nützlicher als ein Versprechen:

  • Die Objekte selbst fehlen. Hat das Abschneiden einen Teil der Datei abgetrennt, sind die Seiten, die im entfernten Abschnitt lagen, verloren. Ein Neuaufbau stellt die Objekte wieder her, die bis zum Schnitt überlebt haben, und das Dokument kommt unvollständig statt ganz zurück. Es gibt nichts zu indexieren, wo die Bytes nicht mehr existieren.
  • Das PDF ist verschlüsselt und du hast das Passwort nicht. Ein passwortgeschütztes PDF speichert seinen Inhalt verschlüsselt. Die Struktur lässt sich neu aufbauen, aber die Seiten bleiben verschlüsselt, sodass die wiederhergestellte Datei ohne das Passwort weiterhin unlesbar ist. Die Reparatur umgeht die Verschlüsselung nicht, und sie sollte es auch nicht.
  • Es ist ein PDF aus gescannten Bildern mit beschädigten Seiten. Ein gescanntes Dokument ist im Wesentlichen ein Bild pro Seite, verpackt in einem PDF. Die Wiederherstellung erfolgt seitenweise: Seiten, deren Bilddaten überlebt haben, kommen sauber zurück, und Seiten, deren Bilddaten abgeschnitten oder überschrieben wurden, nicht, da es innerhalb eines komprimierten Bildes keine Redundanz gibt, aus der sich rekonstruieren ließe. Erwarte manche Seiten zurück und manche fehlend statt einer teilweisen Unschärfe über alle Seiten.
  • Die Datei ist nahezu leer. Ein PDF, das als ein paar Kilobyte eines mehrere Megabyte großen Originals zurückkam, oder das sich als überwiegend Nullen liest, enthält keine echten Objekte zum Indexieren. Das ist ein Download- oder Wiederherstellungsproblem, kein Reparaturproblem.

Außerhalb dieser Fälle ist ein PDF, das Acrobat als beschädigt und nicht reparierbar bezeichnet hat, häufig ein unkomplizierter Index-Neuaufbau, denn der Fehler betrifft weit öfter die Karte als das Gelände.

Häufige Fragen

Was bedeutet „the file is damaged and could not be repaired"?

Es bedeutet, dass Adobe Acrobat oder Reader erkannt hat, dass die Struktur des PDFs kaputt ist und dass sein eigener eingebauter Reparaturversuch fehlgeschlagen ist. Die Formulierung lohnt es sich, genau zu lesen: Sie sagt, dass Acrobat die Datei nicht reparieren konnte, nicht dass die Datei unreparierbar sei. Die häufigste Ursache ist eine beschädigte oder abgeschnittene Querverweistabelle, der Index, der einem Reader sagt, wo jedes Objekt des Dokuments liegt. Acrobat gibt bei einem defekten Index schnell auf, aber der Seiteninhalt selbst ist oft noch vorhanden und durch den Neuaufbau dieses Index erreichbar.

Wie repariere ich ein PDF, das beschädigt ist und nicht repariert werden konnte?

Beginne damit, die Datei erneut von ihrer ursprünglichen Quelle herunterzuladen oder zu kopieren, denn einem abgeschnittenen Download fehlen Bytes, die keine lokale Lösung wiederherstellen kann. Ist keine saubere Kopie verfügbar, besteht der nächste Schritt darin, die Querverweistabelle des PDFs neu aufzubauen: Ein Reparatur-Tool durchsucht die Datei nach den Objekten, die überlebt haben, und rekonstruiert einen gültigen Index, der auf sie verweist, was es einem Reader erlaubt, das Dokument wieder zu öffnen. Das funktioniert, wenn die Objekte intakt sind und nur der Index kaputt ist, was die übliche Situation hinter diesem Fehler ist.

Warum sagt Chrome „Failed to load PDF document"?

Chromes eingebauter PDF-Viewer zeigt diese Meldung, wenn er die Struktur der Datei nicht gut genug interpretieren kann, um sie darzustellen. Es ist Chromes Entsprechung zu Acrobats Fehler der beschädigten Datei und verweist auf dasselbe zugrunde liegende Problem: eine kaputte oder unvollständige PDF-Struktur, häufig ein abgeschnittener Download. Bevor du die Datei für beschädigt hältst, versuche, sie erneut herunterzuladen, und versuche, sie in einem anderen Reader zu öffnen, da Viewer sich darin unterscheiden, wie viel strukturellen Schaden sie tolerieren.

Kann ein beschädigtes PDF ohne Adobe repariert werden?

Ja. Die Struktur eines PDFs ist gut dokumentiert, sodass der Neuaufbau seiner Querverweistabelle keine Adobe-Software erfordert. Ein dediziertes Reparatur-Tool durchsucht die Datei nach gültigen Objekten und rekonstruiert den Index, der auf sie verweist, was genau das ist, was ein Dokument wiederherstellt, von dem Acrobat sagte, es könne es nicht reparieren. Du brauchst kein installiertes Acrobat, um an die Seiten zu gelangen, wirst aber irgendeinen PDF-Reader wollen, um das wiederhergestellte Ergebnis anzuzeigen.

Kann ein verschlüsseltes PDF repariert werden?

Seine Struktur lässt sich neu aufbauen, aber der Inhalt bleibt verschlüsselt. Ein passwortgeschütztes PDF speichert seine Seiten als verschlüsselte Daten, und die Reparatur des Datei-Index entschlüsselt sie nicht. Wenn du das Passwort hast, kannst du die reparierte Datei öffnen und sie normal lesen; ohne das Passwort bleiben die wiederhergestellten Objekte unlesbar. Die Reparatur behebt den Behälter rund um den Inhalt, und sie entfernt oder umgeht die Verschlüsselung nicht, was so beabsichtigt ist.

Ein PDF ist oft ein Vertrag, ein Ausweis oder eine Krankenakte, deshalb ist es wichtig, wo die Datei verarbeitet wird: repariere deins im Browser, ohne etwas hochzuladen.