MinerU 接入 RAG 与 Agent 工作流的方式总览

MinerU 是 OpenDataLab 开源的文档解析引擎,把 PDF、DOCX、PPTX、XLSX、图片、网页转成 LLM 可用的 Markdown 和 JSON(GitHub Star 约 8 万,官方 README),对外的集成面一共五类:MCP Server 接 AI 编码工具、原生集成七个主流 RAG 框架、REST API 加 Python/Go/TypeScript SDK 供程序调用、CLI 供脚本批处理、mineru.net 在线版供无代码使用。这篇文章按接入方式拆解各自的做法与选型。工具本身的定位与安装见MinerU 是什么安装教程

为什么文档解析质量决定 RAG 上限

RAG 管线的检索切块建立在干净的文档结构上,这是通用事实:切块按标题和段落边界切,表格按行列解析,公式按语义保留,检索命中率和生成准确率才有保障。解析环节丢掉的信息,后面靠换嵌入模型、调切块参数都补不回来。

用坏解析器的典型症状有三类:PDF 表格被拍平成乱序文本,问”第三季度营收”检索到的切块里数字和年份对不上;页眉页脚页码混进每个切块,检索时稀释相关度;双栏论文按坐标直抽,句子逐行交错,嵌入向量的语义完全失真。MinerU 的对策是输出按人类阅读顺序排列的 Markdown,自动去页眉页脚,表格转 HTML、公式转 LaTeX——把这些在解析层解决掉,切块层拿到的就是干净输入。转换质量的具体表现见PDF 转 Markdown 实战

MCP Server 接入:把解析能力挂进 AI 工具

官方 README 给出 MCP Server 的三个已适配客户端:Cursor、Claude Desktop、Windsurf。接入后,编码或桌面助手里的 Agent 可以直接调用文档解析能力——让 Cursor 读一份本地 PDF 规格书再改代码,或在 Claude Desktop 里把财报解析成 Markdown 再追问细节。

MCP 配置的具体字段(服务名、启动命令、参数)以官方 MCP 文档为准,不同客户端的配置文件格式也不同,这里不抄写易过期的 JSON 片段。配置思路是通用的:在客户端的 MCP 服务器列表里登记 MinerU 服务,客户端启动时拉起进程或连上服务地址,解析工具即出现在 Agent 的工具清单里。MCP 服务器多了之后想统一管理网关,可以看AgentDock 是什么;Claude Code 里配置 MCP 的通用方法另见本站 AI Coding 分类的相关文章。

RAG 框架集成:七个框架的原生支持

官方 README 列出的原生集成框架覆盖了当前主流的 RAG 技术栈:

框架定位接入思路
LangChainPython 生态最通用的 LLM 应用框架文档加载器对接,解析结果进切分与检索链
LlamaIndex以数据索引见长的 RAG 框架Reader 对接,产出 Document/Node 索引
RAGFlow深度文档理解的 RAG 引擎解析服务对接其知识库入库流程
RAG-Anything围绕多模态文档的 RAG 方案与 MinerU 解析输出深度绑定
Flowise低代码 LLM 应用编排节点化调用解析 API
Dify低代码 LLM 应用与工作流平台ETL 环节调 REST API,或用 MinerU 预处理语料后导入知识库
FastGPT知识库问答平台预解析语料批量导入

集成细节以各框架与 MinerU 官方文档为准,表内思路供评估接入成本用。以 Dify 为例,常见做法是解析跑在 MinerU 侧、知识库归 Dify 管:用脚本批量把 PDF 转成 Markdown,再走 Dify 的导入接口建库;想让这套流程跑在自托管环境里,可参考DeepSeek 加 Dify 的本地部署。RAG-Anything 是列表里最特殊的一个,它整个方案就建立在 MinerU 的解析输出之上,多模态文档的 RAG 可以优先评估。

REST API 与 SDK 接入

程序化接入走四条通道:REST API、Python/Go/TypeScript SDK、CLI、Docker。3.0 起 MinerU 的服务端是 mineru-api,两类端点(官方 Changelog):异步任务端点 POST /tasks,提交任务、查状态、取结果三步走,适合批处理;同步解析端点 POST /file_parse,向后兼容旧插件,适合单文件即时解析。

通道适用场景要点
REST API POST /tasks批量异步解析提交后轮询状态,结果落盘后取回
REST API POST /file_parse单文件同步解析请求即返回,兼容旧插件
Python / Go / TypeScript SDK应用内嵌解析能力语言原生调用,免手写 HTTP
CLI(mineru 命令)脚本与定时任务未指定 —api-url 时自动拉起本地服务
mineru-router多机多 GPU 集群统一入口,接口与 mineru-api 兼容,自带任务负载均衡

请求参数、鉴权与返回结构以官方 API 文档为准。工程建议:批量入库一律走异步任务端点,同步端点留给交互式场景;任务规模上去后用 router 把负载摊到多卡,避免单卡排队。

三种后端在解析管线里的选型

后端选型是 RAG 管线里影响成本与质量的第一个决策(以下为工程建议,基准数字出自官方 README):

后端RAG 管线里的角色依据
pipeline批量预处理主力快而稳、无幻觉、纯 CPU 可跑;OmniDocBench v1.6 得分 86.47
hybrid-engine复杂版面兜底精度 95.39(high)/ 95.26(medium),medium 快 35%~220% 但不支持图片分析
vlm *-http-client对接已有推理服务走 vLLM、SGLang、LMDeploy 等兼容 OpenAI 的服务端,最低 2GB 显存且 CPU 可跑

经验路径是两级:全量文档先过 pipeline,扫一遍入库;对检索效果明显差的版面(多栏论文、嵌套表格多的财报)单独用 hybrid 的 medium 档重解析。vlm 后端支持 vLLM、LMDeploy、mlx 生态(官方 README),团队已有推理集群时,http-client 模式让解析节点不占训练卡的显存预算。

国产化与私有化部署

信创环境是 MinerU 的另一块主场。官方口径的国产芯片适配覆盖十家:昇腾(Ascend)、寒武纪(Cambricon)、燧原(Enflame)、沐曦(MetaX)、摩尔线程(Moore Threads)、昆仑芯(Kunlunxin)、天数智芯、海光(Hygon)、壁仞(Biren)、平头哥(T-Head),部署形态支持私有化全离线运行(官方 README)。对涉密单位、金融机构和有数据出境约束的企业,文档不出内网的解析方案加上宽松许可证,构成了完整的落地条件;具体各芯片型号的支持矩阵以官方适配文档为准。

常见问题

mineru mcp 怎么配置?

MinerU 官方提供 MCP Server,适配 Cursor、Claude Desktop、Windsurf 三个客户端(官方 README),在客户端的 MCP 配置里登记 MinerU 服务后即可在对话中调用文档解析。具体配置字段以官方 MCP 文档为准,不同客户端格式略有差异。

mineru rag 接入哪个框架最省事?

LangChain 和 LlamaIndex 适合代码管线,Dify、FastGPT、Flowise 适合低代码场景,RAG-Anything 直接以 MinerU 解析输出为底座(官方 README)。通用做法是 MinerU 批量产出 Markdown 后导入知识库,框架选择跟着现有技术栈走。

mineru api 怎么调用?

3.0 起服务端为 mineru-api:批量任务走 POST /tasks 异步端点,单文件走 POST /file_parse 同步端点(官方 Changelog),另有 Python、Go、TypeScript SDK 封装。参数与返回结构以官方 API 文档为准,CLI 用户不指定 —api-url 时会自动启动本地服务。