指南 · 4 分钟阅读 · 更新于 2026-08-09

PDF 怎么转成 Markdown

Markdown 处在纯文本和完整 HTML 之间的最佳位置:既保留文档结构,本身又直接可读。所以它最适合文档、笔记,以及准备喂给大模型的内容。

把文件拖到这里或者从设备中选择一个文件支持格式: PDF

文件不会离开你的浏览器。

直接转换

把 PDF 拖到下面,得到保留标题、段落和列表的 .md 文件。不会上传任何内容。

标题级别是怎么推断的

PDF 根本不知道什么叫标题。它只知道某一行用 24 磅画的,正文用 11 磅画的。所以转换器会测量每个文本片段的字号,统计整个文档用到的字号分布,把出现最多的字号认定为正文。

比正文大的字号就是标题,按从大到小排序映射到 Markdown 层级——最大的成为一级标题,次大的成为二级,依此类推。因为这套标尺是从你这份文档里算出来的,所以一份用 28/20/14/11 磅的报告不需要任何配置就能得到合理层级。

结果栏会告诉你识别出几级标题。如果只有一级,那这份 PDF 的标题很可能是用加粗正文而非放大字号做的,靠字号无法区分。

操作步骤

  1. 1
    选择 PDF处理全部在你的浏览器本地完成。
  2. 2
    开始转换先分析字号分布,再按对应深度输出带 # 标记的文本。
  3. 3
    看一眼标题级数结构正常的文档通常会报出二到四级。
  4. 4
    下载 .md用任意编辑器打开——VS Code、Obsidian、Typora,或者直接粘进对话框。

整理输出结果

转出来的 Markdown 通常已经完成了九成。剩下那一成基本就是这几种情况:

  • 每页重复出现的页眉——发现规律后一次性删掉重复行。
  • 句子中间的硬换行,因为 PDF 在那里折了行。手动接上,或让渲染器把软换行重排。
  • 章节之间单独成行的页码。
  • 封面页变成好几个零散的一级标题。

这四种都是查找替换几秒钟的事,而且都源于「源格式是固定版式」这一事实,不是转换本身的缺陷。

常见问题

表格会转成 Markdown 表格吗?

表格内容会按阅读顺序输出为文本,而不是竖线分隔的 Markdown 表格。如果确实需要表格,请把同一个 PDF 用 PDF 转 CSV 跑一遍,那个工具专门做网格识别。

图片会被提取出来吗?

不会。Markdown 输出只含文本。需要页面图形的话,PDF 转 SVG 会把矢量图形保留下来。

粗体斜体会保留吗?

不能稳定保留。字重和字形信息藏在 PDF 内部的字体名里,而不同生成器的命名千差万别,所以我们不去猜。可以靠字号判定的标题是会保留的。

喂给大模型为什么用 Markdown 而不是纯文本?

标题能给模型提供文档层级,对摘要和问答的效果有可测量的提升。这一点在大模型专题那篇里有详细说明。

相关工具

相关指南