指南 · 6 分钟阅读 · 更新于 2026-08-09

如何从扫描版 PDF 提取文字

如果转换器给了你一个空文件,请先读这篇。扫描件必须先做 OCR,我们的工具不会假装能做到。

把文件拖到这里或者从设备中选择一个文件支持格式: PDF

文件不会离开你的浏览器。

一句话结论我们的转换器不做 OCR,所以提不出扫描件里的文字。它会明确告诉你这一点,而不是给你一个空文件。如果你的 PDF 是扫描件,请直接跳到下面的免费 OCR 方案。

人们口中的 PDF 其实有两种完全不同的东西。一种含有真正的文字:有字体、有坐标的字符,你可以用光标选中。另一种含有文字的照片:一片恰好看起来像字的像素。在你眼里两者一模一样,在软件眼里两者毫无共同之处。

所有普通的 PDF 转换器,包括我们的,读的都是第一种。它遍历文件里已经存在的文字对象,然后写出来。当你给它第二种时,没有任何文字对象可以遍历,所以提不出任何东西。工具没坏,你的文件也没损坏:你看到的那些字,从来就没有以文字的形式存过。

五秒钟判断你手上是哪一种

用任何阅读器打开 PDF,试着用鼠标选中一行字。如果出现正常的、贴合字形的选中高亮,那是文字版 PDF,转换器能用。如果什么都选不中,或者整页被一个半透明的框一次性盖住,那是扫描件。

第二个办法:按 Ctrl+F(Mac 上是 Cmd+F),搜一个屏幕上明明白白看得见的词。文字版能搜到;扫描件搜不到,因为里面没有可搜的文字。

扫描件从哪来任何经过镜头或扫描仪玻璃板的东西:拍下来的收据、签完字再发回来的合同、旧的纸质档案、传真。只要一份文档在它的生命里有任何一刻是以图片形式流转的,它就是扫描件。

OCR 到底做了什么

OCR 是光学字符识别。它不读文件里已有的文字,而是看图像里的形状,猜那是哪个字。现代 OCR 在干净、端正、高分辨率的印刷体扫描上表现很好;遇到手写、异体字库、低分辨率、歪斜的页面、咖啡渍和密集表格时会明显变差。

这决定了你该有的预期:OCR 的结果永远需要校对。它是一份很好的初稿,不是忠实的副本。数字是最容易出问题的地方,因为认错一个数字看起来完全合理,拼写检查也抓不出来。

免费给扫描版 PDF 做 OCR 的几种办法

  1. 1
    先试试你电脑上已经有的工具Windows 上 OneNote 可以对粘贴进来的图片做 OCR(右键图片,选「复制图片中的文本」)。macOS 上 Preview 甚至快速查看都能靠内置的实时文本直接选中图片上的字——先试着选一下,别急着装别的东西。iPhone 和 Android 上,自带的相机或相册通常也能直接选中照片里的文字。
  2. 2
    用 Google Docs,它免费做 OCR把 PDF 上传到 Google Drive,右键选「打开方式 → Google 文档」。Drive 会在转换过程中跑 OCR,给你一份可编辑的文档。它能处理多页文件,且不要钱。但涉密材料不要用这个办法,因为文件要上传。
  3. 3
    涉密文档在本地跑 TesseractTesseract 是历史悠久的开源 OCR 引擎,完全在你自己的机器上运行,什么都不上传。它是命令行工具,所以是这里最不友好的选项,但对敏感文件来说是正确答案:装好之后,图片用「tesseract input.png output」,多页文件配合一个 PDF 渲染工具即可。
  4. 4
    问一下发件人有没有原始文件这一步所有人都会跳过,但它的结果远好于其他方案。扫描件通常是某个文件打印出来的纸质副本,而那个文件本来是 Word 文档、财务系统开出的发票,或者数据库导出。一句「能发我原文件吗」,就能完全省掉 OCR 的错误。
OCR 之前先提高胜率如果纸是你自己扫的:用 300 DPI 以上,选灰度而不是彩色,并且确保页面是端正的。干净的 300 DPI 扫描和歪斜的手机照片,识别率差得不是一点。

如果只有部分页面是扫描件怎么办

混合文件很常见:报告本身是文字生成的,但签字那页是拍照后附上去的。先跑我们的转换器,它会把所有真正的文字页全部提取出来,结果里的页数会告诉你有多少内容通过了。然后只对图片页做 OCR,再把两部分拼起来。这样你只需要校对那些真的靠猜的页面。

如果你的 PDF 不是扫描件

如果选中测试显示有真正的文字,那你属于简单情况,不用再想别的。我们的提取器在你的浏览器里运行,保留阅读顺序和段落分隔,并且不上传文件。

把文件拖到这里或者从设备中选择一个文件支持格式: PDF

文件不会离开你的浏览器。

常见问题

为什么转换器说我的 PDF 没有文字层?

因为它检查过,确实没有。文件里装的是页面图像而不是文字对象,也就是说它是扫描件。我们显示这条提示,而不是默默给你一个空的下载文件。

你们会加 OCR 功能吗?

在计划里,但这确实是另一个问题。OCR 需要在浏览器里跑一个识别模型,体积很大,长文档也很慢。我们宁愿把你指向今天就能用的方案,也不想上线一个让人失望的版本。

OCR 的准确度够用于法律或财务文档吗?

请把它当成必须校对的初稿,尤其是数字。金额里认错一个数字看起来完全正常,任何拼写检查都不会标记它。凡是重要的内容,都要拿输出和原件核对一遍。

OCR 能识别手写吗?

通常很差。标准 OCR 是为印刷体设计的。工整的正楷有时可以,普通连笔手写基本不行。

相关指南