PDF 파일 크기: 무엇이 PDF를 크게 만드는가?
텍스트 한 페이지의 PDF는 30KB일 수 있습니다. 같은 페이지를 스캔하면 3MB일 수 있습니다. 차이는 마법이 아닙니다 — 파일 안 네 가지 특정 것에서 비롯됩니다. 이를 이해하면 바이트가 어디로 가는지 정확히 알 수 있습니다.
요인 1
임베드된 이미지
이미지는 일반적으로 PDF 크기에 가장 큰 개별 기여자입니다. 300DPI로 임베드된 고해상도 사진은 쉽게 수 메가바이트를 차지합니다. 같은 이미지를 72DPI의 낮은 품질 JPEG으로 저장하면 그 크기의 5%일 수 있습니다. PDF는 이미지를 원래 인코딩(JPEG, PNG 또는 비압축)으로 저장하므로 너무 큰 원본 이미지는 너무 큰 PDF가 됩니다.
해결책은 거의 "이미지 삭제"가 아닙니다. 의도된 용도(화면 대 인쇄)에 맞는 해상도와 적절한 압축 형식을 사용하는 것입니다. 웹사이트용 사진에는 인쇄 품질 해상도가 필요 없습니다.
요인 2
임베드된 글꼴
PDF는 해당 글꼴이 설치되지 않은 기기에서도 문서가 동일하게 표시되도록 글꼴을 임베드할 수 있습니다. 완전한 글꼴 파일은 200KB 이상일 수 있으며 여러 글꼴을 사용하는 문서는 크기의 대부분을 글꼴 데이터만으로 소비할 수 있습니다.
표준 완화 방법은 글꼴 서브셋입니다: 문서에서 실제로 사용되는 글리프(문자)만 임베드합니다. 200KB 글꼴이 한 문장에만 사용되면 서브셋은 10KB만 될 수 있습니다. 대부분의 PDF 도구는 기본적으로 서브셋을 만들지만 전부는 아닙니다 — 완전한 글꼴을 임베드하는 PDF는 그렇지 않은 것보다 눈에 띄게 더 큽니다.
요인 3
스캔된 페이지
스캔된 PDF는 본질적으로 페이지당 하나씩의 이미지 더미입니다. 각 페이지가 선택 가능한 텍스트와 벡터 그래픽이 아니라 전체 페이지 래스터 이미지이므로 스캔된 PDF는 일반적으로 가장 큰 종류입니다. 20페이지 스캔 문서는 쉽게 20–60MB에 달할 수 있습니다.
스캔된 PDF를 실질적으로 줄이는 유일한 방법은 이미지를 낮은 해상도로 재인코딩하거나 이진 텍스트용으로 설계된 압축 형식(JBIG2 또는 CCITT Group 4)을 사용하는 것입니다. OCR로 스캔을 선택 가능한 텍스트로 변환하면 파일이 이미지에서 텍스트와 벡터로 바뀌어 극적으로 작아지지만 OCR 품질은 들쭉날쭉하며 항상 사용 가능한 것은 아닙니다.
요인 4
반복 객체와 메타데이터
PDF는 중복 데이터를 가질 수 있습니다: 모든 페이지에 같은 이미지, 글꼴의 여러 복사, 장황한 메타데이터, 생성 애플리케이션의 숨겨진 콘텐츠 레이어. 일부 사무용 내보내기는 중간 초안의 일부였던 미사용 객체도 파일에 남겨둡니다.
PDF를 다시 저장하면 이 미사용 객체를 제거하고 중복을 통합할 수 있으며, 종종 가시적 변화 없이 가능합니다. 이것이 일반적으로 압축 작업이 하는 일입니다: 객체 스트림으로 파일을 다시 쓰고 참조되지 않은 모든 것을 제거합니다.
행동
할 수 있는 일
PDF가 예상보다 크면, 원인은 거의 항상 위 네 가지 중 하나입니다. 어디에도 업로드하지 않고 줄일 수 있습니다: 객체 스트림으로 다시 저장하고 미사용 객체를 제거하는 로컬 PDF 압축 도구를 통과시키세요. 이미지가 많은 PDF의 경우 가장 큰 이득은 이미지가 PDF에 들어가기 전에 원본 이미지를 재인코딩하는 것에서 옵니다.
더 읽기
관련 리소스
더 읽기