
1B 参数跑赢 72B VLMMinerU PDF 转 Markdown 低显存完整指南【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU把带公式和表格的 PDF 喂给 RAG最怕转出来的 Markdown 排版散架、表格丢失而大模型方案又常被显存劝退。MinerU 走的是另一条路用 1B 级小模型配合模块化流水线做 PDF 转 Markdown 文档解析最低 6G 显存、纯 CPU 也能跑单页约 0.8 秒。下面从一条命令跑通讲起顺带说清它为何能逼近 72B 大模型的效果以及显存怎么选。一条命令先把 PDF 跑通安装与环境准备MinerU 提供全平台支持Windows / Linux / macOS用 uv 安装最省事uv pip install -U mineru[core] export MINERU_MODEL_SOURCEmodelscope第二行是给国内用户的建议把模型源切到 ModelScope首次运行时会自动下载所需模型并走本地缓存后续直接用缓存。模型源机制详见 docs/zh/usage/model_source.md。解析一条命令产出三种文件mineru -p ./demo/pdfs/demo1.pdf -o ./output输入可以是单个 PDF也可以是目录。输出遵循标准化目录结构详见 docs/zh/reference/output_files.md*.md按阅读顺序排好版的 Markdown公式转 LaTeX、表格转 HTML*.json带坐标和语义信息的结构化数据方便二次开发images/从文档中提取出的图片资源示例文件可直接用仓库里的 demo/pdfs/demo1.pdf一篇典型的学术论文公式、跨页表格、图表都齐全。1B 小模型凭什么打过大模型答案不在模型更大而在分工更细。72B 视觉大模型要靠一个模型端到端硬扛所有环节而 MinerU 把解析拆成流水线每个小模型只负责自己最擅长的一段。整体架构见 mineru/backend/pipeline/模块化流水线每环节只干一件事每个环节都能单独优化、单独升级互不影响布局检测模型在 mineru/model/layout/pp_doclayoutv2.py 中区分 25 类版面元素页眉页脚、公式、表格、竖排文本、印章等先框清楚这是什么、在哪、按什么顺序读文字识别由 mineru/model/ocr/ 下的 PaddleOCR 系模型承担OCR 支持 109 种语言公式交给 mineru/model/mfr/unimernet/ 里的 Unimernet 转成 LaTeX表格走 mineru/model/table/针对无线表格的恢复准确率达 98.7%。先看检测效果再看识别结果下面这张图就是真实检测输出不同色块代表不同版面类型右上角数字是阅读顺序公式和表格被单独框出并转成 LaTeX。跑 pipeline 后端还会额外产出 span 级别的可视化文件方便排查文字丢失、行内公式识别等细节问题显存与效果拿数据对照后端怎么选显存差多少解析后端硬件要求适用场景pipeline纯 CPU 或 6G 显存 GPU通用文档解析vlm-transformers8G 显存 GPU复杂版式解析vlm-vllm10G 显存 GPU批量处理任务大多数普通用户用默认的 pipeline 后端就够了消费级显卡甚至纯 CPU 都能驱动文档量大、版式复杂时再上 VLM 后端。Docker 方式的一键部署见 docs/zh/quick_start/docker_deployment.mdLinux / WSL2 都支持。速度、公式、表格的硬指标单页 PDF 处理约 0.8 秒传统 VLM 方案约 2.3 秒/页整体快约 30 倍复杂公式保留率 99.1%传统工具约 92%跨页表格完整性 97.3%传统工具约 68%被截断的表格会自动拼接最低 6G 显存即可运行进阶玩法与生态不想敲命令起个网页界面mineru-gradio --server-port 7860启动 Gradio 可视化界面浏览器里拖文件、看结果适合先试效果再决定是否上生产更多交互方式见 docs/zh/usage/quick_usage.md。接入 RAG 与工作流解析出的 Markdown/JSON 可以直接喂给 Dify、RAGFlow、FastGPT 这类知识库框架仓库文档里按工具整理了接入步骤批量任务还可以走 vllm 后端做分布式推理张量并行突破单卡显存限制、PagedAttention 管 KV 缓存服务端实现在 mineru/cli/vlm_server.py配合 docs/zh/usage/advanced_cli_parameters.md 里的--max-num-batched-tokens等参数在速度和精度之间做取舍。换模型、改输出、多卡扩展新增 OCR 模型继承 mineru/model/utils/pytorchocr/base_ocr_v20.py 基类扩展流程参考 docs/zh/quick_start/extension_modules.md自定义输出格式改 mineru/backend/pipeline/pipeline_middle_json_mkcontent.py 这一处多卡 / 多服务部署仓库内置mineru-router接口与mineru-api兼容支持任务自动负载均衡入口在 mineru/cli/router.py延伸资料从一条命令到多卡集群MinerU 的完整解析链路都摆在上面这些路径里按自己的显存和文档量挑一个后端跑起来就行。快速上手docs/zh/usage/quick_usage.md进阶 CLI 参数docs/zh/usage/advanced_cli_parameters.mdDocker 部署docs/zh/quick_start/docker_deployment.md输出文件说明docs/zh/reference/output_files.md常见问题docs/zh/faq/index.md源码入口mineru/【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考