Cos'è
NuExtract è una famiglia di modelli di intelligenza artificiale sviluppata da NuMind, specializzata nell'estrazione strutturata di informazioni da documenti. A differenza dei modelli linguistici generici, progettati per dialogare, riassumere o generare testo, NuExtract è fine-tunato per un compito preciso: trasformare un input non strutturato — testo, immagini di documenti o una combinazione dei due — in un output JSON che rispetta uno schema definito dall'utente, oppure in Markdown pulito.
La prima versione pubblica era un modello testuale basato su Phi-3-mini, addestrato su un dataset sintetico privato per l'estrazione pura: il modello restituiva testo già presente nel documento, riducendo il rischio di allucinazioni. Con il tempo la famiglia si è evoluta: le versioni successive hanno aggiunto il supporto multimodale, la capacità di astrazione, l'in-context learning e, nella release più recente, un'architettura vision-language unificata con ragionamento integrato.
A cosa serve / dove eccelle
NuExtract eccelle quando è necessario convertire documenti complessi in dati strutturati senza scrivere regole ad hoc per ogni formato. Il suo punto di forza è l'estrazione guidata da template: l'utente fornisce un JSON che descrive i campi desiderati e i loro tipi, e il modello popola i valori leggendo il documento.
Funziona particolarmente bene su:
- Documenti testuali come contratti, articoli, report tecnici, email;
- Documenti scansionati, scontrini, fatture, moduli, carte d'identità;
- PDF con layout ricchi, tabelle e immagini, che perdono informazioni se convertiti semplicemente in testo;
- Flussi multilingue, grazie al supporto per un ampio numero di lingue.
Oltre all'estrazione strutturata, il modello più recente offre anche conversione in Markdown, utile per preprocessare documenti da usare in sistemi RAG o knowledge base.
Caratteristiche e specifiche
La famiglia NuExtract include diverse varianti. Le prime versioni erano testuali, con modelli di dimensioni ridotte (intorno a 0,5-3,8 miliardi di parametri) basati su Qwen, Phi o SmolLM. La versione 2.0 ha introdotto modelli multimodali basati su Qwen VL, in taglie open weight da circa 2, 4 e 8 miliardi di parametri, oltre a una variante PRO più grande disponibile tramite API.
La versione corrente, NuExtract 3, è descritta come un modello vision-language unificato da 4 miliardi di parametri, pensato per l'estrazione strutturata e la conversione Markdown. Supporta input testuali, immagini singole o multiple, e documenti composti da entrambi. Il contesto è ampio: la documentazione tecnica riporta configurazioni fino a 131.072 token, anche se per deployment con risorse limitate si consiglia di ridurre la lunghezza massima.
Il modello accetta template JSON nei quali ogni campo è tipizzato. I tipi supportati includono:
verbatim-string: estrae il testo esattamente come appare;string: consente leggera riformulazione o astrazione;integer,number,date,date-time,time: tipi numerici e temporali;currency,country,email: tipi specifici;- enum e multi-label, rappresentati come array di opzioni;
- array di qualsiasi tipo sopra elencato.
Se un'informazione non è presente, il modello restituisce null o un array vuoto, mantenendo la struttura dell'output.
NuExtract 3 supporta due modalità di inferenza:
- Non-reasoning (
enable_thinking=false), più veloce e deterministica, adatta a documenti semplici ed estrazioni standard; - Reasoning (
enable_thinking=true), che genera un ragionamento interno prima della risposta, utile per layout complessi, campi ambigui o documenti con strutture articolate.
Punti di forza
Specializzazione sul compito. NuExtract non è un modello generico adattato all'estrazione: è stato addestrato specificamente per questo scopo. Questo si traduce in precisione superiore sui benchmark interni rispetto a modelli generalisti di dimensioni maggiori.
Supporto nativo per immagini. Grazie all'architettura vision-language, può lavorare direttamente su documenti scansionati, scatti di scontrini, planimetrie e PDF rasterizzati, senza dipendere da una pipeline OCR separata. Le immagini vengono tokenizzate a patch e processate insieme al testo.
Output strutturato controllato. Il sistema a template permette di definire con precisione quali campi estrarre e in che formato, riducendo la variabilità dell'output e facilitando l'integrazione con database o workflow a valle.
Deployment flessibile. Il modello è disponibile sia come servizio API gestito (nuextract.ai) sia come modello scaricabile e avviabile in locale tramite Hugging Face e vLLM, con un'interfaccia compatibile OpenAI. Questo lo rende adatto a ambienti cloud ma anche a deployment on-premise o in infrastrutture regolate.
Efficienza. Le varianti leggere possono girare su hardware modesto; la documentazione riporta che in produzione è possibile eseguire il modello su una singola GPU.
Quando ha senso (e quando no)
Ha senso usare NuExtract quando:
- Si ricevono grandi volumi di documenti eterogenei e si vuole estrarre dati tabellari o campi specifici senza scrivere parser custom;
- I documenti includono immagini, scansioni o PDF con layout complessi;
- Serve un output JSON coerente e validabile;
- È necessario un deployment privato o on-premise;
- Il multilingue è un requisito.
Ha meno senso, o richiede cautela, quando:
- L'estrazione richiede inferenze o calcoli non presenti nel documento: il modello è progettato per estrarre, non per ragionare su dati esterni;
- I documenti contengono scritte a mano molto complesse o degradate: in questi casi la documentazione stessa segnala che un fine-tuning specifico può migliorare i risultati;
- È richiesta una garanzia assoluta di correttezza: come tutti i modelli generativi, può commettere errori, specialmente su campi ambigui;
- Il documento supera i limiti di contesto del modello scelto: in tal caso è necessario segmentare il testo o usare un modello con finestra più ampia.
Casi d'uso concreti
- Fatturazione e contabilità: estrazione di numero fattura, data, importi, valuta, righe di dettaglio e metodo di pagamento da PDF o immagini di scontrini.
- Gestione contratti: estrazione di parti, date, importi, clausole e segnatari da accordi in formato testo o scansione.
- Elaborazione moduli e questionari: conversione di risposte cartacee o digitali in JSON strutturato.
- KYC e verifica documenti: lettura di carte d'identità, patenti e documenti di riconoscimento.
- Preprocessing per RAG: conversione di manuali, report o articoli in Markdown strutturato per alimentare sistemi di retrieval-augmented generation.
- E-commerce e logistica: estrazione di informazioni da bolle di consegna, ordini e cataloghi prodotti.
Alternative e contesto
NuExtract opera in un settore affollato. Le alternative includono:
- Modelli generici multimodali come GPT-4o, Claude o Gemini, che offrono flessibilità ma possono essere meno precisi o più costosi su compiti di estrazione ripetitivi.
- Modelli OCR specializzati come PaddleOCR, Tesseract o soluzioni come GLM-OCR, orientati principalmente al riconoscimento del testo e non all'estrazione strutturata guidata da schema.
- Piattaforme document AI commerciali come Google Document AI, Azure Document Intelligence o AWS Textract, che offrono API pronte ma spesso con minor controllo sullo schema e lock-in sul vendor.
- Framework open source come Unstructured o LayoutParser, che scompongono il documento in elementi ma richiedono più lavoro di integrazione.
Rispetto a queste, NuExtract si colloca tra specializzazione e flessibilità: non è un OCR generico né un chatbot, ma uno strumento focalizzato sull'estrazione JSON/Markdown da documenti.
In sintesi
NuExtract è una famiglia di modelli specializzata nell'estrazione strutturata di dati da documenti, con forte attenzione all'input multimodale e all'output controllato. Dalle prime versioni testuali alle versioni vision-language più recenti, il progetto ha progressivamente ampliato il supporto a immagini, ragionamento, conversione Markdown e deployment flessibile. È una scelta solida per chi cerca un modello dedicato a estrarre JSON da fatture, contratti, moduli e documenti scansionati, con la possibilità di eseguirlo sia in cloud che on-premise. Come sempre, la qualità dei risultati dipende dalla qualità del template, dalla chiarezza dei documenti e dalla verifica umana sui dati critici.
Risorse
- Sito ufficiale e API: https://nuextract.ai/
- Repository GitHub: https://github.com/numindai/nuextract
- Pagina Hugging Face: https://huggingface.co/numind
- Articolo NuExtract 2.0: https://numind.ai/blog/outclassing-frontier-llms----nuextract-2-0-takes-the-lead-in-information-extraction
- Documentazione API/SDK: https://nuextract.ai/ (piattaforma ufficiale)
