Marker 實測:比 MinerU 好上手的 PDF 轉 Markdown 工具?
我在 Apple Silicon Mac 上實測 Marker 的 fast 模式。一般文字型 PDF 轉 Markdown 已經很夠用,但公式與表格仍會失手;也整理了它和 MinerU 的實際分工。
前言
我之前用過 MinerU,對它處理複雜排版、表格和公式的效果印象很好。這次想試的是 Marker:一個同樣能把 PDF 轉成 Markdown 的開源工具,但它把日常使用的路線做得更直接。
這次跑完,我覺得如果手上的不是特別複雜的論文,而是一般文字型 PDF、文件、簡報匯出檔或報告,Marker 的 fast 模式已經夠用。我會把它轉成 Markdown 拿去閱讀、摘要或丟進自己的 AI 工作流。不過它不是「轉完就完全不用看」:公式與表格仍可能壞掉。遇到這類 PDF,我還是會優先選 MinerU;Marker 則可以先切到 balanced,用時間換一點品質。
這支影片跑了什麼?
影片裡我用的是 Transformer 論文的 PDF,讓 Marker 只處理第 3 到第 8 頁。這幾頁剛好有雙欄文字、架構圖、數學公式和兩個表格,不算最刁鑽的掃描件,但已經足夠看出它能不能處理論文。
我跑的是 fast,不是品質較高的 balanced:
time marker_single input/attention-is-all-you-need.pdf \
--page_range '2-7' \
--mode fast \
--output_dir output/video-demo-fast
Marker 的頁碼是從 0 開始算,所以 2-7 對應 PDF 的第 3 到第 8 頁。跑完後我直接打開輸出的 .md 檔,影片後半段看到的就是 fast 模式的原始結果,沒有手動修過。
我這次就是用這段指令跑 fast 模式,再直接打開輸出的 Markdown
第一次執行時,Marker 會下載 Surya 模型並啟動本機推論服務,這次大約多花了一分多鐘;模型進快取後就不用每次重抓。終端機看到的 Hugging Face HF_TOKEN warning 也不用太緊張,它只是提醒未登入的下載請求有較低的速率限制,不會降低 PDF 轉換品質。模型已經下載完之後,通常也不會造成實際影響。
fast 模式的結果,到底算不算好?
以這次輸出來說,我會給它「一般 PDF 很好用,技術論文要校稿」的評價。
我打開輸出的 Markdown 時,純文字、段落順序、標題、圖片和圖片說明大致都抓得到。六頁在我的 Apple M4 上實跑約 28 秒;對我只是想把 PDF 轉成可搜尋內容、再拿去看或丟進 LLM 的情況,這個結果已經很實用。
但我不會因此說它已經完美。這份測試中,公式有抓到卻不一定正確;其中一個 Multi-Head Attention 公式把最後應該是 W^O 的地方輸成 W^Q。表格更明顯,Table 1 和 Table 2 的欄位、數字和公式有被拆散。這種錯誤如果拿去做研究、資料庫或正式引用,不能只靠肉眼掃過一次就算了。
以這份檔案來說,我之後遇到一般文件、文字型 PDF 或內部筆記,還是會先跑 fast。但只要是公式、表格、複雜多欄或掃描頁很多的論文,我就會預設它需要人工檢查,不會把轉出來的 Markdown 當成原稿的無損副本。
fast 和 balanced 差在哪裡?
Marker 目前有 fast 和 balanced 兩種模式。這台 Apple Silicon Mac 預設跑的是 fast,它會盡量讀 PDF 原本的文字層,只在必要處動用視覺模型;balanced 則會用更多 VLM 版面分析和 OCR,連行內數學也會多處理一輪。
我在同一份六頁 PDF 上也跑過 balanced:
| 模式 | 我這台 M4 的實跑時間 | 這次看到的結果 |
|---|---|---|
fast | 約 28 秒 | 文字很實用;公式、表格有失誤 |
balanced | 約 3 分 14 秒 | 公式轉成 LaTeX 的比例更高,兩個表格也明顯比較完整,但仍有少數公式格式不自然 |
我沒有拿一堆文件去做 benchmark,這只是同一台 Mac、同一份 PDF 的結果。但這次差距很明顯:我想快速讀內容時會跑 fast;表格和公式真的重要時,我會讓它多跑幾分鐘的 balanced,再回頭對照原 PDF。
Marker 比 MinerU 好安裝嗎?
我覺得是「整體使用流程比較好上手」,但不是完全沒有門檻。
在我的 Apple Silicon Mac 上,Marker 的主要安裝就是先裝好 llama.cpp,再用 uv 安裝 Marker:
brew install llama.cpp
uv tool install --python 3.12 marker-pdf
我實際用下來,最常打的就是 marker_single 檔案路徑 --mode fast --output_dir 輸出資料夾。對本來就會開終端機、知道檔案路徑的工程師來說,這套流程很直覺,沒有太多後端要先理解。
不過一般使用者還是得跨過幾個小關卡:安裝 Homebrew、Python/uv、第一次下載模型,以及知道終端機的路徑怎麼寫。它不是手機 App 那種三下就結束的工具,只是比起要理解多種推論後端、模型和硬體配置,Marker 比較容易先跑出第一份結果。
MinerU 現在的基本安裝指令其實也不長,官方也支援 macOS、Windows 和 Linux。但它提供 pipeline、VLM、HTTP client 等不同路線,功能更完整,代表需要做選擇的地方也更多。官方文件列出的本機 pipeline 建議至少 16GB RAM、20GB 磁碟空間;VLM 又會牽涉到 GPU 或遠端模型服務。對想把 PDF 解析做成長期流程的人很有價值,但第一次上手的學習成本確實比較高。
那 Marker 和 MinerU,該選哪一個?
我自己的分工會是這樣:
| 情境 | 我會先選 |
|---|---|
| 一般數位 PDF、文章、報告,想快速變 Markdown | Marker fast |
| 想在本機快速試一份檔案,且本來就會用 CLI | Marker |
| 公式、表格、版面結構很重要的論文 | MinerU,或至少先跑 Marker balanced 再對照 |
| 掃描件、複雜排版、要盡量保留結構 | MinerU |
| 要接 API、批次流程、多格式文件處理 | MinerU 的選項較完整 |
MinerU 官方目前把 PDF、圖片、DOCX、PPTX、XLSX 都放進同一套解析流程,輸出也有 Markdown、JSON 和品質檢查用的輔助檔;Marker 同樣能處理多種文件,但這次我最有感的是它把「先用最快模式轉出一份 PDF Markdown」這件事壓得很簡單。
如果只談我看過的排版品質,我還是覺得 MinerU 更好,尤其是複雜論文和表格。這篇不是把兩者放在同一台機器、同一版本、同一設定下重跑的公平對決;MinerU 的部分是根據我之前實際使用的經驗和目前官方文件整理。Marker 的定位反而很清楚:它不一定是品質最高的那個,但它讓你很快就能開始用,普通 PDF 的結果也已經夠實用。

