指南 · 5 分钟阅读 · 更新于 2026-08-09

PDF 怎么转成 CSV

把 PDF 里的表格弄进电子表格,是最常见也最麻烦的 PDF 任务之一。这篇讲怎么做,以及怎么判断结果可不可信。

把文件拖到这里或者从设备中选择一个文件支持格式: PDF

文件不会离开你的浏览器。

直接转换

把含表格的 PDF 拖到下面。你会得到一个 .csv,可以直接用 Excel、Numbers、Google 表格或 pandas 打开。

列是怎么被识别出来的

这部分值得理解,因为它能解释你遇到的所有怪现象。PDF 不标记表格:没有 <table> 标签,没有单元格边界,没有列信息——PDF 里的表格只是「摆得像网格」的文本,外面可能画了几条线。

所以转换器是反推的。它读出每个词及其横坐标,把纵坐标相近的词归为一行,然后对所有行的横坐标做聚类,推断列边界应该在哪。落进同一簇的词就是同一列。

实际影响:表格对齐得越规整,结果越好。财务报表这类整齐对齐的表格几乎能完美转换;用空格手敲出来的参差布局就不行。

操作步骤

  1. 1
    选择 PDF全程留在你的浏览器标签页内。
  2. 2
    开始转换逐页识别行,并对整个文档的列位置做聚类。
  3. 3
    核对行列数结果栏会显示类似「12 行 × 4 列」。列数不对的话,打开文件前就能发现。
  4. 4
    下载后用表格软件打开含逗号或引号的值会被正确转义,导入不会错位。

怎么看行列数

结果里的列数是成本最低的检查手段。如果表格明明有五列而工具说三列,说明有两对列因为靠得太近被合并了。如果说八列,则是某一列被拆开了——通常因为某个单元格里的文字换行了,或者是居中而非对齐排布的。

  • 列数偏少:相邻列的值挤进同一个单元格,中间用空格隔开。
  • 列数偏多:一个逻辑列被摊到好几个输出列里,留下空白。
  • 列数对但行错位:表头很可能有跨列合并的单元格。

常见问题

现象原因解决
段落正文变成一堆乱行正文被误判成表格正文请用 PDF 转文本——CSV 只适合表格类内容
提示「没有找到表格」页面上没有对齐重复的行结构先确认内容真的是表格;若是扫描件,没有 OCR 的工具都读不了
数字在 Excel 里变成文本小数分隔符与地区设置不匹配按正确地区导入,或用「数据 → 从文本」显式指定列类型
多行单元格被拆成多行换行单元格在源文件里确实是两行文字导入后再合并——这个换行在原始排版里是真实存在的

常见问题

一个 PDF 里的多个表格能一起提取吗?

行是跨整个文档收集的,所以结构相同的多个表格会合并得很好,而列数不同的表格会互相干扰。文档内容差异很大时,建议先拆分 PDF 再转换相关页面。

扫描版表格能转吗?

不能。扫描件是图像,没有可供聚类的词坐标。必须先做 OCR,而本站不提供 OCR。

合并单元格会保留吗?

无法完整保留。CSV 没有合并单元格的概念,跨三列的表头会落在最左那一列,其余两列为空。

表格用 CSV 还是 Markdown 更好?

目标是电子表格或数据流程,就用 CSV;目标是文档或喂给大模型的提示词,就用 Markdown,因为它能让表格在正文里保持可读。

相关工具

相关指南