指南··6 分钟阅读

合并、拆分、提取还是删除:PDF 页面操作怎么选

四个看起来可以互换、实际并不能的工具。每一个对文件做了什么、哪些文档结构能存活、以及按什么顺序跑才不会白做。

合并、拆分、提取页、删除页,几乎所有 PDF 任务最后都能拆成这四个操作。 它们重叠得足够多,以至于人们往往随手挑上次用过的那个,然后花十分钟把结果改回来。

这些差别在界面上很小,在输出上却很关键。下面说清楚每一个到底做了什么。

它们唯一的共同点

四个操作底层是同一套做法:新建一个空白 PDF,把你要的页面复制进去。 没有任何"就地编辑"。磁盘上的源文件永远不会被改动——每个操作都是写出一个新文档。

这带来两个值得记住的后果。第一,出错的代价很低:原件始终还在。 第二,页面内容能完美存活——文字仍是矢量文字、图片保持原有编码、嵌入字体一并带上——但文档级结构不会。 书签和大纲、表单域以及部分批注类型是挂在文档层而不是单个页面上的, 所以页面被复制进新容器时它们就被留下了。

合并:多个文档变一个文件

合并把若干 PDF 按你拖动队列设定的顺序合成一个。适合组装投标材料、 拼合分批扫描的结果、或者在报告前面加一封说明信。

两个实务提醒。合并后的文件体积大致是各输入之和——合并不是压缩步骤,也不会重新编码任何内容。 另外加密的 PDF 会被直接拒绝而不是静默跳过,所以带密码的输入必须先在生成它的软件里解锁。

拆分:一个文档变多个文件

拆分是反过来的操作。 你给它区间——"1-5, 6-10, 11"——每个区间成为一个独立的输出文件,可以逐个下载或打包 ZIP。

当这些输出各有各的去处时才用它:一章一个文件、一张发票一个文件、一个客户的部分一个文件。 如果你要保留的内容反正都是发给同一个人,那"提取"更合适。

提取:保留这些页

提取页把你选中的页面汇集进一个新文档。"把第 4 到 9 条发我"是提取的活; "每章单独给我一份"是拆分的活。区别就这么简单。

有个细节常常让人措手不及:印在页面上的页码是画在页面自身上的, 所以提取第 40 到 45 页后,新文档第一页上仍然写着"40"。 需要连续新编号的话,随后跑一次添加页码

删除:去掉这些页

删除页产出的结果和"提取"属于同一类,只是你描述的是要丢弃哪些页而不是要保留哪些页。 面对一份 200 页、夹着六张空白分隔页的扫描件,这就是"列六个数字"和"列一百九十四个数字"的差别。

因为输出是逐页组装的,被删掉的页面在新文件里是真的不存在—— 不会藏在某个图层里等着被有心人还原。但这和"密文涂黑"不是一回事: 要把你保留的页面上某一段涂黑,需要专门的密文工具,因为画个黑矩形盖住的文字仍然是文字。

顺序很重要

串联多个操作时,顺序能省下不少返工:

  • 先删页再合并。逐个清理源文件,比在合并后的 300 页文档里翻找容易得多。
  • 页码最后加。编号之后再做任何页面操作,都会在页面上留下一串断掉的序号。
  • 水印同样最后加。理由一样——而且这样只会给最终留下来的页面盖章。
  • 压缩放在最后。压缩会把页面渲染成图片,之后再做的一切都是在处理图片而不是文字了。

速查

  • 多个文件进,一个文件出 → 合并
  • 一个文件进,多个文件出 → 拆分
  • 一个文件进,一个更小的文件出,说"留什么"更省事 → 提取
  • 一个文件进,一个更小的文件出,说"去什么"更省事 → 删除

四个操作全部在你的浏览器内运行——这一点在这里比平时更重要, 因为人们真正需要重组的文档,通常是合同、法庭案卷、病历和投标材料。文件从不离开标签页。

延伸阅读

继续阅读