Tools #PDF Parser #Markdown #OCR #Local AI #Open Source

MinerU 實測:超強開源 PDF 與多格式文檔解析利器(macOS/Windows/Linux)

面臨複雜版面、掃描件或公式時,傳統 PDF 轉文字工具總是力不從心?開源框架 MinerU 結合佈局分析與視覺語言模型 (VLM),能一鍵將 PDF、圖片及 Office 檔案轉換為精準的 Markdown、表格與 LaTeX 公式。本文實測線上 Web 版與本地 CLI/API 部署流程。

8 min read/ Medium

前言:為什麼文檔解析這麼難?

在日常的開發、AI 知識庫(RAG 系統)建設或學術研究中,我們經常需要從大量的 PDF 論文、掃描文檔、報表圖像中提取內容。然而,文檔解析(Document Parsing)一直是個令人頭痛的難題,特別是面對以下痛點時:

  1. 版面結構混亂:多欄排版、圖文混排、頁首頁尾夾雜,傳統 PDF 轉文字工具(如 PyPDF、pdfplumber)往往會打亂閱讀順序。
  2. 數學公式亂碼:學術論文中大量的行內與獨立數學公式,轉換後常常變成無意義的亂碼或拼音符號。
  3. 表格與圖片丟失:報表中的表格很難以結構化(如 Markdown Table 或 HTML)完整保留,圖片也無法被自動剪裁和連結。

為了徹底解決這些問題,由 OpenDataLab 推出的 MinerU 應運而生!這是一款專為高精度文檔解析設計的開源工具,能將複雜的 PDF、圖片、DOCX、PPTX、XLSX 檔案,精準且流暢地轉換為帶有 Layout 標記、表格、數學公式的 Markdown 格式,為大型語言模型的預訓練與 RAG 應用提供高質量的語料輸入。


實測效果展示 (Live Demo)

MinerU 提供了美觀好用的線上網頁版,讓我們能在一秒之內上傳並體驗其驚人的解析實力:

網頁版實測片段說明:

  1. 多格式支援與快速處理:我們可以直接在瀏覽器中上傳 PDF、圖像甚至是 Microsoft Office 檔案(如 DOCX、PPTX 等)。
  2. 視覺化的版面特徵提取:系統會自動進行版面分析(Layout Analysis),將正文、標題、圖片、表格與公式以不同顏色的框線標示出來。
  3. 高品質的 Markdown 與 LaTeX 輸出:右側會即時渲染出轉換後的 Markdown 結果,數學公式會被完美轉換為標準的 LaTeX 語法(例如 $E=mc^2$),表格也會被整理成漂亮的 Markdown Table。

!NOTE 網頁版雖然極為便利,但對於企業內部機敏文件、個人敏感資料,或者需要進行批次自動化處理的開發者來說,建議使用本地端部署,以確保隱私安全並最大化利用本地 GPU 算力。


本地部署與執行 (Local Deployment)

在本地執行 MinerU,雖然沒有網頁版的圖形介面,但取而代之的是強大的命令列工具 (CLI) 與 API,能非常方便地整合進開發者的自動化腳本或 RAG 工作流中。

MinerU 本地 CLI 執行示意圖

本地執行就沒有 GUI 了,但開發者可以依據自己的需求開發,非常方便與彈性!

1. 硬體與環境需求

為了流暢運行 MinerU 內建的深度學習模型,建議你的設備符合以下硬體規格:

規格指標Hybrid 混合解析模式VLM 視覺語言模型模式
主要定位兼顧速度與相容性(CPU/GPU 皆可)極致精度(如複雜手寫體與特殊排版)
精準度 (OmniDocBench)85+ 分95+ 分
作業系統Linux (2019+) / Windows / macOS (14.0+)Linux (2019+) / Windows / macOS (14.0+)
純 CPU 執行✅ 支援❌ 不支援
最低顯示卡記憶體 (VRAM)4GB8GB
系統記憶體 (RAM)最少 16GB,推薦 32GB+最少 16GB,推薦 32GB+
硬碟空間需求20GB+ (推薦使用 SSD 存放模型檔)2GB+ (使用 OpenAI 相容 API 串接)
Python 版本3.10 ~ 3.13 (Windows 暫不支援 3.13)3.10 ~ 3.13

2. 安裝步驟

MinerU 提供了兩種本機安裝方式:

方式一:使用 pip 或 uv 安裝(推薦,極速簡便)

推薦使用現代化 Python 包管理器 uv,能大幅縮短安裝時間:

bash
# 確保 pip 保持最新
pip install --upgrade pip

# 安裝極速套件管理器 uv
pip install uv

# 一鍵安裝 MinerU 的完整功能版(包含所有核心模型依賴)
uv pip install -U "mineru[all]"

!TIPmineru[all] 會自動為你的 Windows、Linux 或 macOS 系統配置合適的編譯版本。如果在 Windows 上安裝後發現 CUDA 加速不可用,請參考官方的 Windows CUDA 加速指南。

方式二:從原始碼(Source Code)安裝

如果你想體驗最新開發版或進行二次開發,可以 clone 專案倉庫進行安裝:

bash
# 克隆官方倉庫
git clone https://github.com/opendatalab/MinerU.git
cd MinerU

# 使用 uv 以可編輯模式安裝
uv pip install -e .[all]

方式三:使用 Docker 部署

如果你偏好乾淨的容器化環境,避免本地 Python 環境衝突,可以使用 Docker(僅支援 Linux 以及啟用了 WSL2 的 Windows 環境,macOS 用戶請勿使用 Docker):

bash
# 官方提供預建置好的 Docker 鏡像,可直接前往官方文檔獲取 Docker 部署指令

如何使用 MinerU?

安裝完成後,你可以在終端機中透過 mineru 指令一鍵解析你的檔案:

1. GPU 加速環境(預設)

如果你的設備配備了符合規格的 Nvidia GPU 或 Apple Silicon(M系列晶片),直接執行:

bash
mineru -p <輸入文檔路徑> -o <輸出資料夾路徑>

2. 純 CPU 環境( pipeline 模式)

如果你的設備沒有獨立顯示卡,可以強制指定運行於 CPU 模式:

bash
mineru -p <輸入文檔路徑> -o <輸出資料夾路徑> -b pipeline

!NOTEmineru 指令非常聰明,輸入路徑 -p 可以是單一檔案(如 .pdf, .png, .docx, .pptx, .xlsx),也可以是整個資料夾。它會自動掃描並批次處理資料夾下的所有支援文檔!


雙解析後端機制解析:Hybrid 混合模式 vs VLM 模式

MinerU 的強大之處在於其靈活的後端架構。在實務應用中,你可以根據需求選擇:

  • Hybrid 混合模式 (預設)
    • 原理:結合了佈局分析模型(Layout Analysis)、公式識別模型與傳統的 OCR(如 PaddleOCR)。
    • 優勢:對硬體要求較低(最低 4GB VRAM),且支援純 CPU 運行。運行速度較快,非常適合批量處理常規的 PDF 書籍與論文。
  • VLM 視覺語言模型模式
    • 原理:直接調用端到端的 Multimodal 大模型(例如藉由 vLLM/LMDeploy 部署的本地大模型,或遠端 OpenAI 相容的 API 服務)。
    • 優勢:精準度高達 95+。對於手寫體、超複雜表格、老舊掃描件有著極強的識別與理解能力,是追求極致轉換品質的首選。

總結

MinerU 填補了開源文檔解析領域的空白,讓複雜文檔到 Markdown 的轉換變得不再困難。不論你是想將手邊的 PDF 論文快速轉成 Markdown 來用 GPT/Claude 進行摘要,還是要為大模型訓練準備乾淨的清洗語料,MinerU 都是目前最頂尖、最硬核的生產力工具之一。

相關連結:


本文介紹之開源專案 MinerU 採用開源授權協議,歡迎前往其 GitHub 專案頁面給予 Star 支持!