指南 · 4 分钟阅读 · 更新于 2026-08-09

把网页归档成 PDF

给收据、确认页,以及任何你五年后可能还要拿出来的东西。

把文件拖到这里或者从设备中选择一个文件支持格式: HTML / HTM

文件不会离开你的浏览器。

网页不是永久的。网站会改版,公司会倒闭,链接会失效,那个你以为随时能翻出来的订单确认页会消失。凡是你可能需要作为记录的东西——收据、预订、某一天的政策原文——存在你自己手里的 PDF 才是能活下来的那个版本。

先试「打印成 PDF」

每个浏览器都能做:Ctrl+P(Mac 上 Cmd+P),然后把目标选成「另存为 PDF」。对于做得好的页面,这是最快的路线,效果往往也最好,因为网站可能自带打印样式表,会替你去掉导航和广告。

但它失败的频率高到让人烦躁。常见问题:装在滚动容器里的内容被裁成只有一屏、吸顶header在每一页重复出现或盖住正文、首屏以下懒加载的图片从没加载因此打印成空白、以及 cookie 提示条被拍进内容上面。

放弃打印之前先试两件事先把页面一路滚到最底部,让懒加载的图片真的加载出来。然后用浏览器的阅读模式(Firefox 和 Safari 都有),从阅读模式里打印——它会把页面剥到只剩正文,通常能打印得很干净。

保存 HTML 再转换的路线

如果打印给你的东西没法用,那就把页面保存下来,改为转换文件。Ctrl+S 把 HTML 存到磁盘。转换那个文件,你得到的是根据标记构建出来的文档,而不是渲染视口的一张快照,这就完全绕开了吸顶header和容器裁切的问题。

下面的转换器会读取 HTML、遍历文档结构,把内容排布到 A4 页面上,文字是真实的、可选中、可搜索的。标题、段落和列表保留各自的层级。

把文件拖到这里或者从设备中选择一个文件支持格式: HTML / HTM

文件不会离开你的浏览器。

对输出应有的预期

文字和结构转换是可靠的,复杂的 CSS 版式不是:这是对内容的转换,不是对设计的像素级复现。如果你需要页面看起来和当时一模一样,整页截图才是这件事的诚实工具——代价是你失去了可选中的文字。

按你归档的目的来选。如果是收据、重点在金额和日期,基于文字的转换更好:可搜索,而且多年以后文字还能复制出来。如果需要的是「当时长什么样」的视觉凭证,那就截图。

严肃归档请把元信息也记下来一份页面的 PDF 并不能证明你是什么时候抓取的。把网址和日期记下来;凡是可能产生争议的内容,同时把页面提交到互联网档案馆——一个独立第三方的时间戳,价值远高于你自己的文件。

值得养成的几个习惯

  1. 1
    在它要紧的那一刻就抓下来看到确认页的时候就保存,不要等到需要的时候。事后去找回来,才是真正会失败的那一步。
  2. 2
    文件命名要能找得回来带上日期和内容:「2026-08-09-机票预订确认.pdf」。一个装满「文档 (3).pdf」的文件夹不叫归档。
  3. 3
    把网址留在文档里打印成 PDF 通常会自动在页脚加上。如果你转换的是保存的 HTML,自己补一条备注——知道东西从哪来,是它作为记录的一半价值。
  4. 4
    存在比你笔记本电脑活得更久的地方只存在于一台设备上的归档,离「不存在」只差一次硬件故障。

常见问题

为什么我打印出来的 PDF 少了半页?

几乎总是 CSS 滚动容器造成的:浏览器打印的是那个盒子里能放下的部分,而不是它的全部内容。保存 HTML 再转换文件可以避开这个问题,因为版式是从标记重建的,而不是从渲染视口来的。

页面里的图片会包含进来吗?

远程引用的图片在你离线转换保存的文件时可能解析不到。如果某些图片很重要,请单独保存。对基于文字的记录来说,这通常无关紧要。

PDF 能作为法律证据吗?

这完全取决于司法辖区和具体情境,而且自己生成的 PDF 单独拿出来是很弱的,因为它不携带独立的时间戳。凡是有争议的内容,请同时把页面存进第三方档案馆,并咨询专业意见。

需要登录才能看的页面怎么归档?

打印成 PDF 和保存后转换都可以,因为你的浏览器已经处于登录状态。任何在服务端去抓取那个网址的工具,根本看不到这个页面。

相关指南