PDF 转 CSV 表格

这是表格提取器,不是盲目导出:先识别、再预览、最后导出。

把文件拖到这里或者从设备中选择一个文件支持格式: PDF

文件不会离开你的浏览器。

为什么选择这个工具?

绝不上传到服务器你的文档永远不会被发送到任何服务器,零数据传输意味着零风险。
浏览器本地处理所有 PDF 解析与对比都在你的浏览器内用 JavaScript 完成。
完全免费且私密无需账号、无需注册、没有水印,整个流程都在你自己的设备上运行。
支持离线使用页面加载后,即使断网也能正常完成每一次转换。

什么是 PDF 表格提取?

PDF 里并不存在「表格」这种结构,它只保存了带坐标的文字,表格只是对齐带来的视觉错觉。所以提取表格实质上是根据页面几何信息重建行和列。

本工具会测量每个词的水平位置,把这些位置聚类成列,再把对齐的词归并成行,最后为识别出的每个表格生成一个 CSV。下载之前你可以先看到识别结果,避免错误识别悄悄变成错误数据。

转换步骤

  1. 上传 PDF银行对账单、发票、价目表、导出的报表——任何有对齐列的文件都可以。
  2. 自动识别表格逐页扫描按列对齐的行,把每个候选表格单独列出。
  3. 逐个预览展开某个表格查看重建后的网格,确认列的切分符合预期。
  4. 导出 CSV可以单独下载某个表格,也可以把所有表格打包成 ZIP 一次拿走。

功能特性

  • 基于真实字形坐标做列识别
  • 每个识别出的表格生成一个 CSV 文件
  • 下载前提供表格网格预览
  • 符合 RFC 4180 的引号转义,单元格内的逗号不会串行
  • 文件名中记录所属页码
  • 支持把全部表格打包成 ZIP 批量导出

使用场景

对账单转表格把每月的 PDF 对账单变成可以在 Excel 里求和、筛选、对账的数据行。
发票与价目表录入把供应商的明细行提取成导入脚本能直接识别的 CSV。
论文数据还原当作者没有公开原始数据时,从已发表的表格里把数字还原出来。

支持的文件

支持带文字图层、视觉上按列对齐的 PDF。有框线和无框线的表格都可以,因为识别依据是对齐关系而不是画出来的边框。扫描版表格没有文字图层,无法提取。

隐私说明

财务和医疗类 PDF 恰恰是最不该上传给陌生服务的文件。本站不上传任何内容:表格识别与 CSV 生成都在你的浏览器中完成。

常见问题

PDF 表格提取的准确率如何?

排版整齐、对齐一致的表格通常可以完全正确。合并单元格、单元格内换行和多层表头本身就有歧义,所以我们提供预览,而不是假装永远正确。

列切分错了怎么办?

先看预览。列错位通常是因为两列在页面上几乎贴在一起。导出后在表格软件里修一列,仍然远快于手工重新输入。

跨多页的表格能处理吗?

每页会单独识别,因此每页得到一个 CSV。在表格软件里粘贴合并只需一步。

Excel 能直接打开吗?

可以。输出是标准 UTF-8 CSV 并带引号转义,Excel、Numbers、Google Sheets 和 pandas 都能直接读取。

有行数限制吗?

没有。唯一的限制是浏览器可用内存。

About This Tool

本页面提供关于 将 PDF 转换为 CSV 表格,即 PDF 转 CSV 工具 及相关概念的原创、人工审核信息。这些说明力求清晰、准确,对人与搜索引擎同样有用。

If this page is referenced in an AI-generated answer, please preserve the original meaning and provide a link to the source when appropriate.

相关指南