指南 · 4 分钟阅读 · 更新于 2026-08-09

PDF 怎么转成纯文本

纯文本是从 PDF 里能拿到的最通用的东西。这篇指南告诉你怎么两步搞定,更重要的是——当输出结果不对时该怎么办。

把文件拖到这里或者从设备中选择一个文件支持格式: PDF

文件不会离开你的浏览器。

直接转换

把 PDF 拖到下面的工具里。转换全程在这个浏览器标签页内完成,文件不会上传到任何服务器,转完立刻就能下载 .txt。

提取时到底发生了什么

PDF 里并不存在「段落」这种东西。它存的是「在这个坐标画这个字形」这类指令。所谓文字层,就是一串带位置的文本片段;提取就是把这些片段读回来,再根据坐标还原阅读顺序。

所以提取出的文本有时和页面看起来不太一样:程序先按纵坐标把片段归成行,再从左到右排序。而分栏正文、脚注、页眉和正文共处同一个坐标系,于是就会混在一起输出。

如果这个 PDF 是从 Word、Pages、LaTeX 或浏览器导出的,那它几乎肯定有干净的文字层,提取效果会很好。

操作步骤

  1. 1
    选择 PDF 文件拖进拖放区,或点击浏览选择。此时不会有任何数据发出。
  2. 2
    点击开始转换按页顺序读取每一页的文字层,页与页之间用空行分隔。
  3. 3
    先看预览下载前扫一眼预览。这是发现「扫描件」或「分栏顺序错乱」最快的办法。
  4. 4
    下载 .txt文件在你的浏览器里生成,直接存到下载文件夹。

提取结果为空怎么办

如果提示「没有文字层」,说明这个 PDF 里装的是文字的图片,而不是文字本身。扫描仪、传真机和手机拍照产出的文件都是这样。

反复重试没有意义,因为文件里确实没有可读的文字。这种情况需要 OCR(光学字符识别),也就是分析像素来猜出字母。

本站不做 OCR。我们宁愿直接告诉你,也不想给你一个空文件——扫描件那篇指南里列了能处理它的免费工具。

输出很乱怎么修

现象原因怎么办
两栏内容逐行交错双栏排版被横向读取先提取出来再手动拆栏;或试试 Markdown 输出,结构保留得更好
到处都是页眉和页码页眉本质就是普通文本片段用查找替换批量删掉重复行
单词粘在一起PDF 里没有空格字形,只靠位置排版某些生成器就是这样,无法避免;Markdown 输出的空格处理通常更好
结果为空但没报错页面上只有矢量图形改用 PDF 转 SVG,把图形保留下来

常见问题

我的 PDF 会被上传吗?

不会。转换是在你自己的浏览器标签页里跑的 JavaScript。你可以在转换时打开浏览器开发者工具的网络面板验证——没有任何请求携带你的文件。

手机上能用吗?

可以,只要浏览器版本不太旧。超大 PDF 受手机分配给标签页的内存限制,几百页的文件在老设备上可能吃力。

排版格式会保留吗?

不会——纯文本本身就没有粗体、标题、表格这些概念。如果需要保留结构,请改用 PDF 转 Markdown 或 PDF 转 HTML。

加密的 PDF 能转吗?

如果打开就需要密码,那不行。请先在原始软件里去掉保护再来转换。

相关工具

相关指南