合并、拆分、提取还是删除:PDF 页面操作怎么选
四个看起来可以互换、实际并不能的工具。每一个对文件做了什么、哪些文档结构能存活、以及按什么顺序跑才不会白做。
合并、拆分、提取页、删除页,几乎所有 PDF 任务最后都能拆成这四个操作。 它们重叠得足够多,以至于人们往往随手挑上次用过的那个,然后花十分钟把结果改回来。
这些差别在界面上很小,在输出上却很关键。下面说清楚每一个到底做了什么。
它们唯一的共同点
四个操作底层是同一套做法:新建一个空白 PDF,把你要的页面复制进去。 没有任何"就地编辑"。磁盘上的源文件永远不会被改动——每个操作都是写出一个新文档。
这带来两个值得记住的后果。第一,出错的代价很低:原件始终还在。 第二,页面内容能完美存活——文字仍是矢量文字、图片保持原有编码、嵌入字体一并带上——但文档级结构不会。 书签和大纲、表单域以及部分批注类型是挂在文档层而不是单个页面上的, 所以页面被复制进新容器时它们就被留下了。
合并:多个文档变一个文件
合并把若干 PDF 按你拖动队列设定的顺序合成一个。适合组装投标材料、 拼合分批扫描的结果、或者在报告前面加一封说明信。
两个实务提醒。合并后的文件体积大致是各输入之和——合并不是压缩步骤,也不会重新编码任何内容。 另外加密的 PDF 会被直接拒绝而不是静默跳过,所以带密码的输入必须先在生成它的软件里解锁。
拆分:一个文档变多个文件
拆分是反过来的操作。 你给它区间——"1-5, 6-10, 11"——每个区间成为一个独立的输出文件,可以逐个下载或打包 ZIP。
当这些输出各有各的去处时才用它:一章一个文件、一张发票一个文件、一个客户的部分一个文件。 如果你要保留的内容反正都是发给同一个人,那"提取"更合适。
提取:保留这些页
提取页把你选中的页面汇集进一个新文档。"把第 4 到 9 条发我"是提取的活; "每章单独给我一份"是拆分的活。区别就这么简单。
有个细节常常让人措手不及:印在页面上的页码是画在页面自身上的, 所以提取第 40 到 45 页后,新文档第一页上仍然写着"40"。 需要连续新编号的话,随后跑一次添加页码。
删除:去掉这些页
删除页产出的结果和"提取"属于同一类,只是你描述的是要丢弃哪些页而不是要保留哪些页。 面对一份 200 页、夹着六张空白分隔页的扫描件,这就是"列六个数字"和"列一百九十四个数字"的差别。
因为输出是逐页组装的,被删掉的页面在新文件里是真的不存在—— 不会藏在某个图层里等着被有心人还原。但这和"密文涂黑"不是一回事: 要把你保留的页面上某一段涂黑,需要专门的密文工具,因为画个黑矩形盖住的文字仍然是文字。
顺序很重要
串联多个操作时,顺序能省下不少返工:
- 先删页再合并。逐个清理源文件,比在合并后的 300 页文档里翻找容易得多。
- 页码最后加。编号之后再做任何页面操作,都会在页面上留下一串断掉的序号。
- 水印同样最后加。理由一样——而且这样只会给最终留下来的页面盖章。
- 压缩放在最后。压缩会把页面渲染成图片,之后再做的一切都是在处理图片而不是文字了。
速查
- 多个文件进,一个文件出 → 合并
- 一个文件进,多个文件出 → 拆分
- 一个文件进,一个更小的文件出,说"留什么"更省事 → 提取
- 一个文件进,一个更小的文件出,说"去什么"更省事 → 删除
四个操作全部在你的浏览器内运行——这一点在这里比平时更重要, 因为人们真正需要重组的文档,通常是合同、法庭案卷、病历和投标材料。文件从不离开标签页。