MinerU: Cel mai precis parser de documente open-source

de | iulie 4, 2026

În decursul a trei luni, MinerU și-a abandonat licența AGPL, a lansat un model cu 1,2 miliarde de parametri care analizează diagramele din interiorul tabelelor și și-a restructurat infrastructura pentru a susține o scală de milioane de pagini.

Până în aprilie 2026, MinerU a fost licențiat sub AGPLv3, ceea ce impunea publicarea codului sursă derivat, o cerință pe care majoritatea echipelor corporatiste o evită. Acum este sub Licența Open Source, bazată pe Apache 2.0.

Echipa a mers mai departe: au eliminat complet din șirul de dependențe de modelele licențiate sub AGPL (DocLayout-YOLO, mfd_yolov8) și un model cu licența CC-BY-NC.

Ce este MinerU si ce s-a schimbat in 2026 ?

MinerU este un motor de analiză a documentelor dezvoltat de OpenDataLab, născut în cadrul efortului de pre-antrenare InternLM, cu scopul de a extrage text științific curat la scară mare.

Converteste fișiere PDF, imagini, DOCX, PPTX și XLSX în Markdown și JSON structurați. Versiunea curentă: v3.3.1 (11 iunie 2026).

Trei îmbunătățiri în decurs de trei luni au reconfigurat proiectul.

Modificarea sistemului de licențiere: Acum este Licența Open Source MinerU, bazată pe Apache 2.0.

Modelul a devenit mic și ascuțit:

VLM-ul principal este acum MinerU2.5-Pro, cu doar 1,2 miliarde de parametri, și gestionează analiza graficelor, unificarea tabelelor dintre pagini, combinarea paragrafelor trunchiate, precum și recunoașterea imaginilor din interiorul tabelelor.

Echipa a publicat, de asemenea, MinerU-Diffusion (arXiv 2603.22458), reexaminând OCR-ul ca o procesare inversă prin decodarea cu ajutorul difuziei, ceea ce indică direcția în care se îndreaptă cercetarea.

Infrastructura a devenit serioasă:

Analiza nativă a fișierelor DOCX/PPTX/XLSX este acum de zeci de ori mai rapidă decât vechiul proces de transformare DOCX→PDF→analiză.

Un mecanism cu fereastră alunecătoare care permite documentelor cu zeci de mii de pagini să fie analizate fără împărțire manuală.

Inferenta concurentă sigură în cadrul firului cu mineru-router pentru echilibrarea sarcinilor multi-GPU cu un singur click. Un nou parsing-strength (mediu/înalt) în backend-ul hibrid. De asemenea, SDK-uri în Python, Go și TypeScript, nu doar o interfață de linie de comandă (CLI).

Decizia de la backend: partea cea mai practică

MinerU livrează trei back-end-uri de inferență. Alegerea celui potrivit reprezintă esența eficienței, iar majoritatea articolelor care vorbesc despre acest subiect o trec cu vederea.

Logica deciziei:

  • PDF-uri născute în mediul digital, lucrări cu debit mare sau sensibile la conformitate → pipeline. În mod fizic, nu poate genera text. Atunci când un parser care generează un număr este mai rău decât să lipsească unul, această proprietate devine caracteristica sa.
  • Documente scanate, structuri complexe, scriere la mâna → hibrid engine. Păstrează textul nativ acolo unde PDF-ul îl conține, folosind doar VLM acolo unde acesta lipsește. Cele mai bune setări de bază atunci când este disponibil un GPU.
  • Nu sunt variante locale de GPU → http-client. Serviți modelul la distanță; executați clientul pe echipamente cu specificații minime.

Evaluarea modelului

La ce este cu adevărat puternic:

  • Exactitudine publicată: peste 95% pe OmniDocBench v1.6, unul dintre puținele parseuri care publică benchmark-uri de cap la cap, nu doar demonstrații selectate cu grijă.
  • Opțiunea cu halucinații zero: Backend-ul pipeline folosește procesare computerizată clasică. Nu poate genera text. Pentru analiza care necesită respectarea riguroasă a regulilor, această abilitate este rară și valoroasă.
  • Tabele între pagini: Tabele care se extind peste întreruperile de pagină — unul dintre cele mai frecvente și frustrante probleme la alte platforme este gestionat nativ.
  • Formula → LaTeX: Esențial pentru documente științifice și tehnice.
  • Infrastructura de producție: router, API asincron, memorie cu fereastră alunecătoare, echilibrare a sarcinii multi-GPU, scrieri în streaming — construită pentru volum, nu pentru demonstrații.
  • OCR în 109 limbi și integrări cu agenți (server MCP, LangChain, LlamaIndex, RAGFlow, Dify).

Unde este deficitar:

  • Scopul formatului: PDF, imagini, DOCX, PPTX, XLSX și nimic altceva. Nu sunt acceptate email-uri, EPUB, fișiere audio, HTML sau analiză sensibilă la schema (XBRL/patente/JATS). Dacă corpul de texte este în format mixt, atunci instrumentul adecvat pentru această serie este postarea companion a lui Docling.
  • Cerere mare de resurse: se recomandă 16–32 GB RAM, 20 GB spațiu pe disc și o unitate grafică pentru precizie maximă. Nu este un flux de lucru orientat în primul rând către laptop-uri.
  • Iterație rapidă, schimbări majore: v3.0 → v3.1 → v3.3 în doar trei luni. Fixare a versiunilor.
  • Nuanța licenței: o licență bazată pe Apache cu condiții suplimentare este mai bună decât AGPL, însă nu este atât de simplă precum licența MIT oferită de Docling.
  • Calitatea OCR-ului non-latin variază: sunt listate 109 limbi; precizia nu este prezenta pentru toate acestea.

Regula de decizie pe care am folosi-o: dacă precizia analizei textului în cazul PDF-urilor complexe, cum ar fi articolele științifice, rapoartele financiare, documentele de reglementare sau manualele tehnice, este un factor esențial, atunci MinerU este candidatul implicit.

Dacă corpul de text este în format mixt sau dacă implementarea trebuie să aibă o amprentă minimă, începe cu Docling. Dacă se aplică ambele cazuri, lasă ca LightRAG să orchestreze.

Diferența dintre un răspuns bun al sistemului RAG și unul greșit nu constă adesea în model, în recuperarea informației sau în prompt-ul folosit. Aceasta stă în ceea ce s-a întâmplat cu documentul înainte ca oricare dintre aceste elemente să fie aplicate.

Referințe

  1. MinerU (GitHub) v3.3.1
  2. OmniDocBench