指南 · 5 分钟阅读 · 更新于 2026-08-09
PDF 怎么转成 CSV
把 PDF 里的表格弄进电子表格,是最常见也最麻烦的 PDF 任务之一。这篇讲怎么做,以及怎么判断结果可不可信。
把文件拖到这里或者从设备中选择一个文件支持格式: PDF
文件不会离开你的浏览器。
直接转换
把含表格的 PDF 拖到下面。你会得到一个 .csv,可以直接用 Excel、Numbers、Google 表格或 pandas 打开。
列是怎么被识别出来的
这部分值得理解,因为它能解释你遇到的所有怪现象。PDF 不标记表格:没有 <table> 标签,没有单元格边界,没有列信息——PDF 里的表格只是「摆得像网格」的文本,外面可能画了几条线。
所以转换器是反推的。它读出每个词及其横坐标,把纵坐标相近的词归为一行,然后对所有行的横坐标做聚类,推断列边界应该在哪。落进同一簇的词就是同一列。
实际影响:表格对齐得越规整,结果越好。财务报表这类整齐对齐的表格几乎能完美转换;用空格手敲出来的参差布局就不行。
操作步骤
- 1选择 PDF全程留在你的浏览器标签页内。
- 2开始转换逐页识别行,并对整个文档的列位置做聚类。
- 3核对行列数结果栏会显示类似「12 行 × 4 列」。列数不对的话,打开文件前就能发现。
- 4下载后用表格软件打开含逗号或引号的值会被正确转义,导入不会错位。
怎么看行列数
结果里的列数是成本最低的检查手段。如果表格明明有五列而工具说三列,说明有两对列因为靠得太近被合并了。如果说八列,则是某一列被拆开了——通常因为某个单元格里的文字换行了,或者是居中而非对齐排布的。
- 列数偏少:相邻列的值挤进同一个单元格,中间用空格隔开。
- 列数偏多:一个逻辑列被摊到好几个输出列里,留下空白。
- 列数对但行错位:表头很可能有跨列合并的单元格。
常见问题
| 现象 | 原因 | 解决 |
|---|---|---|
| 段落正文变成一堆乱行 | 正文被误判成表格 | 正文请用 PDF 转文本——CSV 只适合表格类内容 |
| 提示「没有找到表格」 | 页面上没有对齐重复的行结构 | 先确认内容真的是表格;若是扫描件,没有 OCR 的工具都读不了 |
| 数字在 Excel 里变成文本 | 小数分隔符与地区设置不匹配 | 按正确地区导入,或用「数据 → 从文本」显式指定列类型 |
| 多行单元格被拆成多行 | 换行单元格在源文件里确实是两行文字 | 导入后再合并——这个换行在原始排版里是真实存在的 |
常见问题
一个 PDF 里的多个表格能一起提取吗?
行是跨整个文档收集的,所以结构相同的多个表格会合并得很好,而列数不同的表格会互相干扰。文档内容差异很大时,建议先拆分 PDF 再转换相关页面。
扫描版表格能转吗?
不能。扫描件是图像,没有可供聚类的词坐标。必须先做 OCR,而本站不提供 OCR。
合并单元格会保留吗?
无法完整保留。CSV 没有合并单元格的概念,跨三列的表头会落在最左那一列,其余两列为空。
表格用 CSV 还是 Markdown 更好?
目标是电子表格或数据流程,就用 CSV;目标是文档或喂给大模型的提示词,就用 Markdown,因为它能让表格在正文里保持可读。