Firecrawl 最近开源了 PDF Inspector 和 AnyDoc 两个项目,解决 AI Agent / RAG 场景里的一个基础问题:如何把各种文档快速、准确地转换成 AI 能理解的 Markdown。@Appinn

Firecrawl 是一个面向 AI 应用的网页抓取与数据转换平台,主要目标是:把互联网内容转换成适合 LLM(大语言模型)理解的数据。
PDF Inspector
PDF Inspector 是一个 Rust 编写的 PDF 分析库。它不会直接把所有 PDF 扔给 OCR,而是先分析 PDF 内部结构。
| 类型 | 处理方式 |
|---|---|
| 有真实文字层 | 直接解析 |
| 扫描文档 | OCR |
| 图片 PDF | OCR |
| 混合 PDF | 只 OCR 部分页面 |
例如一份 40 页文档,其中35页是真正的文本,另外5页是图片,那么它会分别处理,降低成本。
OCR 的部分使用 PP-OCRv6 本地模型,就是飞桨。
AnyDoc
https://github.com/firecrawl/anydoc
AnyDoc 也能处理 PDF,不过还可以处理 word、excel、ppt、epub、csv 等格式,最大特色是让这些文档拥有统一的输出结构。包括:
- 表格格式一致;
- 标题格式一致;
- 脚注处理一致;
- 链接处理一致;
让不同文档的这些内容(粗体、斜体、删除线、代码块、列表等)都有统一的结构。
而 PDF 支持是依靠上面的 pdf-inspector 项目。
另外拥有 Agent skill 可以让AI来操作。
纯本地项目,不需要任何 API。
只要你经常需要让AI来处理各类文档,先用它来处理一遍,可以更高效、更准确,以及更省钱。
原文:https://www.appinn.com/firecrawl-pdf-inspector-anydoc/