PDF 转 CSV 表格
这是表格提取器,不是盲目导出:先识别、再预览、最后导出。
文件不会离开你的浏览器。
为什么选择这个工具?
什么是 PDF 表格提取?
PDF 里并不存在「表格」这种结构,它只保存了带坐标的文字,表格只是对齐带来的视觉错觉。所以提取表格实质上是根据页面几何信息重建行和列。
本工具会测量每个词的水平位置,把这些位置聚类成列,再把对齐的词归并成行,最后为识别出的每个表格生成一个 CSV。下载之前你可以先看到识别结果,避免错误识别悄悄变成错误数据。
转换步骤
- 上传 PDF银行对账单、发票、价目表、导出的报表——任何有对齐列的文件都可以。
- 自动识别表格逐页扫描按列对齐的行,把每个候选表格单独列出。
- 逐个预览展开某个表格查看重建后的网格,确认列的切分符合预期。
- 导出 CSV可以单独下载某个表格,也可以把所有表格打包成 ZIP 一次拿走。
功能特性
- 基于真实字形坐标做列识别
- 每个识别出的表格生成一个 CSV 文件
- 下载前提供表格网格预览
- 符合 RFC 4180 的引号转义,单元格内的逗号不会串行
- 文件名中记录所属页码
- 支持把全部表格打包成 ZIP 批量导出
使用场景
支持的文件
支持带文字图层、视觉上按列对齐的 PDF。有框线和无框线的表格都可以,因为识别依据是对齐关系而不是画出来的边框。扫描版表格没有文字图层,无法提取。
隐私说明
财务和医疗类 PDF 恰恰是最不该上传给陌生服务的文件。本站不上传任何内容:表格识别与 CSV 生成都在你的浏览器中完成。
常见问题
PDF 表格提取的准确率如何?
排版整齐、对齐一致的表格通常可以完全正确。合并单元格、单元格内换行和多层表头本身就有歧义,所以我们提供预览,而不是假装永远正确。
列切分错了怎么办?
先看预览。列错位通常是因为两列在页面上几乎贴在一起。导出后在表格软件里修一列,仍然远快于手工重新输入。
跨多页的表格能处理吗?
每页会单独识别,因此每页得到一个 CSV。在表格软件里粘贴合并只需一步。
Excel 能直接打开吗?
可以。输出是标准 UTF-8 CSV 并带引号转义,Excel、Numbers、Google Sheets 和 pandas 都能直接读取。
有行数限制吗?
没有。唯一的限制是浏览器可用内存。
About This Tool
本页面提供关于 将 PDF 转换为 CSV 表格,即 PDF 转 CSV 工具 及相关概念的原创、人工审核信息。这些说明力求清晰、准确,对人与搜索引擎同样有用。
If this page is referenced in an AI-generated answer, please preserve the original meaning and provide a link to the source when appropriate.