PDF-Dateigröße: Was macht PDFs groß?
Eine einseitige Text-PDF kann 30 KB groß sein. Dieselbe Seite gescannt kann 3 MB erreichen. Der Unterschied ist keine Magie — er stammt aus vier spezifischen Dingen innerhalb der Datei. Wenn Sie diese verstehen, wissen Sie genau, wohin Ihre Bytes gehen.
Faktor 1
Eingebettete Bilder
Bilder sind meist der größte Einzelbeitragsfaktor zur PDF-Größe. Ein hochauflösendes Foto, das mit 300 DPI eingebettet ist, kann leicht mehrere Megabyte beanspruchen. Dasselbe Bild als JPEG niedriger Qualität mit 72 DPI gespeichert könnte 5 % dieser Größe haben. PDFs speichern Bilder in ihrer ursprünglichen Codierung — JPEG, PNG oder unkomprimiert —, daher wird ein zu großes Quellbild zu einem zu großen PDF.
Die Lösung besteht selten darin, „das Bild zu entfernen". Es ist, die richtige Auflösung für den vorgesehenen Verwendungszweck (Bildschirm vs. Druck) und ein geeignetes Kompressionsformat zu verwenden. Ein Foto, das für eine Website bestimmt ist, benötigt keine Druckqualitätsauflösung.
Faktor 2
Eingebettete Schriften
PDFs können Schriften einbetten, damit das Dokument auf Rechnern, die diese Schriften nicht installiert haben, identisch aussieht. Eine vollständige Schriftdatei kann 200 KB oder mehr betragen, und ein Dokument, das mehrere Schriften verwendet, kann den größten Teil seiner Größe für Schriftdaten aufwenden.
Die Standardmaßnahme ist Schrift-Subsetting: es werden nur die Glyphen (Zeichen) eingebettet, die im Dokument tatsächlich verwendet werden. Wenn eine 200-KB-Schrift für einen englischen Einzelsatz verwendet wird, kann ein Subset nur 10 KB groß sein. Die meisten PDF-Werkzeuge setzen standardmäßig auf Subsetting, aber nicht alle — und ein PDF, das vollständige Schriften einbettet, ist spürbar größer als eines, das dies nicht tut.
Faktor 3
Gescannte Seiten
Ein gescanntes PDF ist im Wesentlichen ein Stapel von Bildern, eines pro Seite. Da jede Seite ein ganzseitiges Rasterbild ist statt auswählbarem Text und Vektorgrafiken, sind gescannte PDFs die größte häufige Sorte. Ein 20-seitiges gescanntes Dokument kann leicht 20–60 MB erreichen.
Die einzige Möglichkeit, ein gescanntes PDF wesentlich zu verkleinern, besteht darin, die Bilder mit niedrigerer Auflösung neu zu codieren oder ein Kompressionsformat zu verwenden, das für bitonalen Text entwickelt wurde (wie JBIG2 oder CCITT Group 4). Einen Scan durch OCR in auswählbaren Text umzuwandeln, ändert die Datei von Bildern zu Text und Vektoren, was dramatisch kleiner ist — aber die OCR-Qualität variiert und ist nicht immer verfügbar.
Faktor 4
Wiederholte Objekte und Metadaten
PDFs können redundante Daten tragen: dasselbe Bild auf jeder Seite platziert, mehrere Kopien einer Schrift oder geschwätzige Metadaten und versteckte Inhaltsschichten aus der Erstellungsanwendung. Einige Office-Exporteure lassen auch ungenutzte Objekte in der Datei, die Teil von Zwischenentwürfen waren.
Ein erneutes Speichern eines PDFs kann diese ungenutzten Objekte abwerfen und Duplikate konsolidieren, oft ohne sichtbare Änderung. Das ist es, was eine Komprimierungsoperation typischerweise tut: sie schreibt die Datei mit Objektströmen neu und verwirft alles Unreferenzierte.
Aktion
Was Sie tun können
Wenn Ihr PDF größer ist als erwartet, liegt die Ursache fast immer an einer der obigen vier. Sie können es verkleinern, ohne es irgendwo hochzuladen: geben Sie es durch ein lokalesPDF komprimieren-Werkzeug, das mit Objektströmen neu speichert und ungenutzte Objekte abwirft. Bei bildlastigen PDFs kommen die größten Gewinne davon, die Quellbilder neu zu codieren, bevor sie überhaupt in das PDF gelangen.
Weiterlesen
Verwandte Ressourcen
Weiterlesen