MinerU 对比 Marker、Docling、PaddleOCR:先说结论
MinerU、Marker、Docling、PaddleOCR 都做”文档转结构化数据”这件事,但定位分四层:MinerU 是面向 LLM、RAG、Agent 工作流的全能文档解析引擎(OpenDataLab 出品,GitHub Star 约 8 万,官方 README);Marker 主打 PDF 转 Markdown 和 JSON,针对书籍与科学论文优化(Datalab 出品);Docling 是 IBM Research 出品、MIT 许可证的通用文档转换工具箱;PaddleOCR 是百度开源的 OCR 工具箱,从文字检测识别做到文档解析。一句话选型:中文文档、表格公式密集、要接 RAG 生态选 MinerU;MIT 许可证优先选 Docling;只要 OCR 原语、要自己搭管线选 PaddleOCR;深度使用 Datalab 产品线则看 Marker。
四个工具分别是什么定位
MinerU:OpenDataLab 出品的文档解析引擎,官方在线入口 mineru.net 提供网页版、桌面客户端与 API,2026 年 4 月的 3.1.0 版起许可证从 AGPLv3 改为基于 Apache 2.0 的 MinerU Open Source License(官方 Changelog)。VLM 加 OCR 双引擎,OCR 覆盖 109 种语言,输出面向 LLM 工作流的 Markdown 与 JSON,内置 MCP Server、RAG 框架集成、REST API。复杂版面精度数据在官方 README 的部署表里(OmniDocBench v1.6:pipeline 86.47,hybrid 95.39)。完整画像见MinerU 是什么。
Marker:仓库为 datalab-to/marker(早期在创始人 Vik Paruchuri 个人账号下),定位是把 PDF 快速高精度地转成 Markdown 和 JSON,官方介绍明确说针对书籍和科学论文优化,也支持输出 HTML 与检索用 chunks。代码采用 GPL-3.0,模型权重对商用另有约束条款,具体以其仓库 LICENSE 说明为准。适合英文书籍、论文为主的个人与研究者场景。
Docling:IBM Research 的开源项目(论文 arXiv:2501.17887 自述为 MIT 许可证的轻量文档转换工具箱),官网 docling.ai 把定位写成开源文档智能,支持 PDF、DOCX、PPTX、XLSX、HTML、图片、音频等格式,另发布了 Granite-Docling-258M 端到端文档转换小模型。IBM 全家桶生态集成顺畅,许可证对商用最宽松。
PaddleOCR:百度基于飞桨框架的 OCR 工具箱,Apache 2.0 许可证,官方文档称支持 80 种以上语言,近年补齐文档解析能力并发布了 PaddleOCR-VL 0.9B 文档解析模型。粒度最细:文字检测、识别、方向分类、表格结构都可以单独调用。值得一提的是,MinerU 3.4 的 pipeline 后端 OCR 模型用的正是 PP-OCRv6(官方 Changelog),两者既是竞品也有上下游关系。
选型维度对比表
| 维度 | MinerU | Marker | Docling | PaddleOCR |
|---|---|---|---|---|
| 出品方 | OpenDataLab | Datalab | IBM Research | 百度 |
| 许可证 | 基于 Apache 2.0 的自定义许可证(3.1.0 起) | 代码 GPL-3.0,模型权重另有商用限制,以 LICENSE 为准 | MIT | Apache 2.0 |
| 部署形态 | 在线版、桌面客户端、pip、Docker、REST API | pip 安装(marker-pdf)、官方托管 API | pip 安装 | pip 安装 |
| 中文与多语言 | OCR 支持 109 种语言,OmniDocBench 中文基准(官方 README) | 以官方文档为准 | 以官方文档为准 | 官方文档称 80 种以上语言 |
| 生态集成 | MCP Server、LangChain/Dify/FastGPT 等 7 个 RAG 框架、Go/TS SDK | 以官方文档为准 | IBM 生态、LangChain 等 | 飞桨生态 |
| 国产芯片 | 官方口径支持昇腾、寒武纪等 10 家 | 以官方文档为准 | 以官方文档为准 | 飞桨硬件生态 |
| 硬件门槛 | pipeline 后端纯 CPU 可跑,GPU 模式最低 4GB 显存(官方 README) | 以官方文档为准 | 以官方文档为准 | 以官方文档为准 |
能填的都是有出处的信息,写”以官方文档为准”的维度我没有可靠数据,不猜。跨工具的精度横向对比也不要轻信任何一方的宣传数字——各家选的基准和口径不同,比如 MinerU 的 86.47 与 95.39 都是 OmniDocBench v1.6 口径(官方 README),别家未必在同基准上测过。最稳的办法是拿自己业务里的样张各跑一遍。
MinerU 的优势场景
五类场景下 MinerU 是优先项。中文文档:项目由中文团队维护,OCR 引擎(PP-OCR 系)与评测基准(OmniDocBench)都围绕中文文档打磨。表格公式密集:表格转 HTML、公式转 LaTeX、跨页表格合并这条能力链完整,转换细节见PDF 转 Markdown 实战。RAG 集成生态:MCP Server 加 LangChain、LlamaIndex、RAGFlow、RAG-Anything、Flowise、Dify、FastGPT 的原生集成矩阵,接管线几乎不用写胶水代码,具体接法见RAG 与 MCP 集成指南。国产化部署:官方口径支持昇腾、寒武纪、燧原、沐曦、摩尔线程、昆仑芯、天数智芯、海光、壁仞、平头哥十种芯片,信创环境里这条是硬门槛。许可证:从 AGPLv3 转向基于 Apache 2.0 的许可证后,商用部署的法律阻力比 GPL 系工具小。
什么时候不用 MinerU
三个场景不必上 MinerU。第一,纯文本、单栏、无表格公式的 PDF,pypdf、pdfplumber 这类轻量提取库几十毫秒一页,装解析引擎属于高射炮打蚊子。第二,深度依赖某单一生态时:技术栈全面绑定 IBM,Docling 的集成摩擦更小;已经在用 Datalab 托管服务处理英文书籍论文,Marker 顺手。第三,做 OCR 算法研究、需要拆开每个环节调参数,PaddleOCR 的模块粒度更合适。真要装 MinerU 的话,部署方式的选择见安装教程。
反过来,如果解析质量已经达标但检索效果差,问题往往不是工具不够强,而是切块策略或嵌入模型选错了,先排查下游再换工具。
许可证差异对二开与商用意味着什么
四份许可证的商业友好度排序是 MIT > Apache 2.0 系 > GPL-3.0 > AGPLv3,这是通用开源常识,具体条款以各项目 LICENSE 文件为准。MIT 几乎无约束,保留版权声明即可闭源商用。Apache 2.0 增加了专利授权条款,同样允许闭源集成,MinerU 的新许可证即以它为基础,另附附加条件。GPL-3.0 有传染性:链接或修改后的代码分发时必须以同许可证开源,闭源产品集成 GPL 组件通常被公司法务拦下。AGPLv3 最严格,把传染范围扩展到网络服务——哪怕不分发软件,只是提供在线服务也触发开源义务,这正是很多企业对 AGPL 工具一刀切禁用的原因。MinerU 3.1.0 的许可证更换,本质就是把这条最大的采用障碍拆掉了。
常见问题
mineru 和 marker 怎么选?
中文文档、表格公式密集、需要 RAG 与 MCP 集成或国产芯片部署,选 MinerU;英文书籍与论文为主、能接受 GPL 及模型权重商用限制,Marker 也够用。两者都支持 PDF 转 Markdown,建议拿同一批样张实测后再定。
PDF 解析工具对比该看哪些维度?
五个硬维度:许可证是否允许商用集成、部署形态是否匹配基础设施、中文与多语言效果、与现有 RAG 框架的集成成本、硬件要求(显存与国产芯片适配)。跨工具 benchmark 数字口径不一,以自测样张为准。
OCR 工具推荐哪个?
只要文字识别原语选 PaddleOCR(Apache 2.0、80 种以上语言);要整页文档直接转 Markdown/JSON 给大模型用,选 MinerU 这类文档解析引擎。两者不冲突,MinerU 3.4 的 pipeline 后端用的 OCR 模型就是 PP-OCRv6。