指南 · 4 分钟阅读 · 更新于 2026-08-09
PDF 怎么转成纯文本
纯文本是从 PDF 里能拿到的最通用的东西。这篇指南告诉你怎么两步搞定,更重要的是——当输出结果不对时该怎么办。
把文件拖到这里或者从设备中选择一个文件支持格式: PDF
文件不会离开你的浏览器。
直接转换
把 PDF 拖到下面的工具里。转换全程在这个浏览器标签页内完成,文件不会上传到任何服务器,转完立刻就能下载 .txt。
提取时到底发生了什么
PDF 里并不存在「段落」这种东西。它存的是「在这个坐标画这个字形」这类指令。所谓文字层,就是一串带位置的文本片段;提取就是把这些片段读回来,再根据坐标还原阅读顺序。
所以提取出的文本有时和页面看起来不太一样:程序先按纵坐标把片段归成行,再从左到右排序。而分栏正文、脚注、页眉和正文共处同一个坐标系,于是就会混在一起输出。
如果这个 PDF 是从 Word、Pages、LaTeX 或浏览器导出的,那它几乎肯定有干净的文字层,提取效果会很好。
操作步骤
- 1选择 PDF 文件拖进拖放区,或点击浏览选择。此时不会有任何数据发出。
- 2点击开始转换按页顺序读取每一页的文字层,页与页之间用空行分隔。
- 3先看预览下载前扫一眼预览。这是发现「扫描件」或「分栏顺序错乱」最快的办法。
- 4下载 .txt文件在你的浏览器里生成,直接存到下载文件夹。
提取结果为空怎么办
如果提示「没有文字层」,说明这个 PDF 里装的是文字的图片,而不是文字本身。扫描仪、传真机和手机拍照产出的文件都是这样。
反复重试没有意义,因为文件里确实没有可读的文字。这种情况需要 OCR(光学字符识别),也就是分析像素来猜出字母。
本站不做 OCR。我们宁愿直接告诉你,也不想给你一个空文件——扫描件那篇指南里列了能处理它的免费工具。
输出很乱怎么修
| 现象 | 原因 | 怎么办 |
|---|---|---|
| 两栏内容逐行交错 | 双栏排版被横向读取 | 先提取出来再手动拆栏;或试试 Markdown 输出,结构保留得更好 |
| 到处都是页眉和页码 | 页眉本质就是普通文本片段 | 用查找替换批量删掉重复行 |
| 单词粘在一起 | PDF 里没有空格字形,只靠位置排版 | 某些生成器就是这样,无法避免;Markdown 输出的空格处理通常更好 |
| 结果为空但没报错 | 页面上只有矢量图形 | 改用 PDF 转 SVG,把图形保留下来 |
常见问题
我的 PDF 会被上传吗?
不会。转换是在你自己的浏览器标签页里跑的 JavaScript。你可以在转换时打开浏览器开发者工具的网络面板验证——没有任何请求携带你的文件。
手机上能用吗?
可以,只要浏览器版本不太旧。超大 PDF 受手机分配给标签页的内存限制,几百页的文件在老设备上可能吃力。
排版格式会保留吗?
不会——纯文本本身就没有粗体、标题、表格这些概念。如果需要保留结构,请改用 PDF 转 Markdown 或 PDF 转 HTML。
加密的 PDF 能转吗?
如果打开就需要密码,那不行。请先在原始软件里去掉保护再来转换。