处理 PDF 时有两个常见担心:压缩之后文字还能不能选中、复制?转成网页之后排版会不会乱?本文先讲清楚这两件事背后的原理,再说明图映(ImgIng,imging.cn)的 PDF 压缩和 PDF 转 HTML 是怎么做的,以及它们的边界。
一、PDF 压缩后文字还能选中吗
PDF 为什么大
文字和矢量图形本身很小,把 PDF 撑到几十兆的,几乎总是里面的扫描页、照片和截图。所以压缩 PDF,关键是处理每一张内嵌图片,而不是把整页转成图片。
有些压缩方式会把页面栅格化成图片,体积是小了,但文字就再也选不中、搜不到了。判断一个工具是否“保文字”,压缩后试着在 PDF 里搜索一个词即可。
图映的做法
图映的 PDF 压缩只动内嵌图片,页面尺寸、文字和矢量图形始终保持原样:
- 先算有效 DPI:同一张图可能跨页复用,也可能被非等比缩放。图映跟踪页面内容流,分别汇总横向和纵向真正需要的像素,只有明显高于所选档位的方向才重采样;
- 逐张选编码:判断每张图是截图、插画、图标、照片还是高纹理,让 JPEG、索引调色板和灰度无损几种编码同时试,选出体积更小的那种。截图、图表类图片走调色板,通常又小又不糊;
- 回读校验:写出后用同一套引擎回读,页数、页面尺寸、文字或链接对不上,就自动退回原文件。
压缩档位有 72 dpi(屏幕/邮件)、150 dpi(电子书,推荐)、300 dpi(打印)和无损结构四档,档位只决定内嵌图片的分辨率上限,已经低于该 DPI 的图片不会被重新采样。解析、重编码和写出都在浏览器本地完成,PDF 不上传。
边界
- 图映目前不做字体子集化,纯文字排版的 PDF 通常只有 5%–20% 的结构收益,这类文件专业排版工具会更合适;
- 优势区间是扫描件、图文报告、演示导出这类以图片为主的 PDF;
- 加密 PDF 需要先解除保护;JPEG 2000、JBIG2 和 CMYK 印刷 JPEG 浏览器解不了,会原样保留。
二、PDF 转 HTML 怎么保留排版
两种“转 HTML”
一种是把原 PDF 嵌进网页、用查看器显示,本质还是 PDF;另一种是把页面内容真正重建成 HTML。前者排版不会变,但离不开查看器;后者才是独立的网页文件。
图映的做法
图映不嵌入 PDF 查看器,也不把原文件藏进网页,而是在浏览器本地解析页面结构后重建:
- 按页面框、旋转、文字矩阵和字距定位,文字仍可选择;
- 路径、裁剪、蒙版图片、ICC/索引色、轴向和径向渐变重建为内联 SVG;
- 读取 OpenType 嵌入许可,只嵌入获准使用的字体;
- 导出一个单文件 HTML,无外部依赖、无查看器菜单,关闭网络也能打开。
官网版本记录中的一个样本:15 页报告转换后,单文件 HTML 由约 12.7 MB 精简到约 4.75 MB,页面内容保持不变。
边界
这是固定版式重建,不是把 PDF 改写成响应式网页。网格着色、特殊混合、多媒体和部分交互表单可能需要人工验收,工作台会在质量报告中标明具体页码。PDF 不上传,也不会执行 PDF 里的 JavaScript。
怎么自己验证
- 压缩后:在 PDF 里搜索一个词、点一下链接,确认都还在;
- 转 HTML 后:断网打开 HTML,选中一段文字复制出来。
PDF 压缩:https://imging.cn/pdf
PDF 转 HTML:https://imging.cn/pdf-html
免责声明:此文内容为广告,不代表本网的观点及立场。其内容由广告方提供,与本网无关,本文所涉文、图等资料之一切权力和法律责任归材料提供方所有和承担。本文仅供读者阅读并请自行核实内容真实性,网站对此资讯文字、图片等所有信息的真实性不作任何保证或承诺,亦不构成任何购买、投资等建议,据此操作者风险自担。

