Copertina: ERNIE 4.5 (Baidu): famiglia di modelli multimodali open source

ERNIE 4.5 (Baidu): famiglia di modelli multimodali open source

Famiglia MoE multimodale cinese da 0,3 a 424 miliardi di parametri, rilasciata con licenza Apache 2.0.

20 giugno 20265 min di lettura
ERNIE 4.5BaiduMixture of Expertsmultimodaleopen sourceApache 2.0vision-language modelragionamento AI

Cos'è

ERNIE 4.5 è una famiglia di modelli fondazionali multimodali sviluppata da Baidu, l'azienda tecnologica cinese nota per il motore di ricerca omonimo e per il suo ecosistema di intelligenza artificiale. La serie include dieci varianti che coprono modelli linguistici di grandi dimensioni (LLM) e modelli visivo-linguistici (VLM), progettati per comprendere e generare testo, analizzare immagini, ragionare su contenuti visivi e interagire con input multimodali. Il nome ERNIE è l'acronimo di "Enhanced Representation through kNowledge IntEgration", a sottolineare l'attenzione storica di Baidu all'integrazione di conoscenza esplicita nei modelli di linguaggio.

A cosa serve

I modelli ERNIE 4.5 sono pensati per applicazioni enterprise e di ricerca che richiedono comprensione del linguaggio naturale, ragionamento logico-matematico, analisi di documenti, immagini e video, nonché sviluppo di agenti AI multimodali. Le varianti VLM supportano attività come il riconoscimento di oggetti, la comprensione di grafici e diagrammi, il visual grounding, il ragionamento STEM da immagini e la comprensione temporale di contenuti video. Le varianti di ragionamento ("thinking") aggiungono capacità di ragionamento a più passaggi su compiti verificabili, avvicinandosi alle prestazioni di modelli specializzati come OpenAI o1 su benchmark visivi come MathVista, MMMU e VisualPuzzle.

Come funziona

L'architettura di base è a Mixture of Experts (MoE): il modello attiva solo un sottoinsieme di parametri per ogni token, riducendo i costi computazionali pur mantenendo una grande capacità complessiva. Secondo la documentazione ufficiale, la famiglia spazia da un modello denso da 0,3 miliardi di parametri fino al modello più grande con 424 miliardi di parametri totali, di cui 47 miliardi attivi nei modelli MoE principali e 3 miliardi attivi nelle varianti compatte. La chiave dell'efficienza sta nell'attivazione selettiva: invece di usare tutti i parametri per ogni token in input, il router dell'architettura MoE dirige il calcolo verso un numero limitato di esperti specializzati, permettendo di scalare la capacità del modello senza aumentare proporzionalmente il costo di inferenza.

Baidu ha adottato una struttura MoE eterogenea che permette la condivisione di parametri tra le modalità testuali e visive, isolando al contempo alcuni esperti dedicati a ciascuna modalità per evitare che un tipo di dato interferisca con l'altro. Il technical report cita l'uso di routing isolato per modalità, loss di ortogonalità del router, loss di bilanciamento multimodale dei token, parallelismo eterogeneo ibrido, bilanciamento del carico gerarchico, addestramento FP8 a precisione mista e quantizzazione convoluzionale a 4 e 2 bit per l'inferenza. Per il post-training vengono impiegati supervised fine-tuning (SFT), direct preference optimization (DPO) e un metodo proprietario chiamato Unified Preference Optimization (UPO).

L'addestramento e l'inferenza avvengono sul framework PaddlePaddle, sviluppato internamente da Baidu. L'azienda dichiara un Model FLOPs Utilization (MFU) del 47% durante il pre-training del modello linguistico più grande, un indicatore di efficienza computazionale rilevante per chi deve addestrare o eseguire modelli di questa scala.

Varianti principali

La famiglia include varianti base pre-addestrate e varianti post-addestrate. I modelli linguistici includono ERNIE-4.5-300B-A47B-Base, con 300 miliardi di parametri totali e 47 miliardi attivi, e la versione compatta ERNIE-4.5-21B-A3B-Base, con 21 miliardi di parametri totali e 3 miliardi attivi. Nei benchmark interni, la versione a 300B supera DeepSeek-V3-671B-A37B-Base su 22 dei 28 benchmark testati, mentre la versione a 21B supera Qwen3-30B-A3B-Base su compiti di matematica e ragionamento pur avendo circa il 30% di parametri in meno.

Per la comprensione visivo-linguistica esistono modelli come ERNIE-4.5-VL-424B-A47B e la versione thinking ERNIE-4.5-VL-28B-A3B-Thinking, che attiva solo 3 miliardi di parametri ma mira a competere con modelli flagship su benchmark visivi e di ragionamento.

Licenza e dove si trova

Tutti i modelli ERNIE 4.5 sono rilasciati con licenza Apache 2.0, che consente l'uso accademico e commerciale. I pesi e il codice sono disponibili su Hugging Face nei repository ufficiali del namespace baidu/ e su GitHub. Baidu mette inoltre a disposizione ERNIEKit, un toolkit per il fine-tuning, l'adattamento LoRA e l'allineamento DPO su PaddlePaddle. Il technical report completo è pubblicato sul sito ufficiale ernie.baidu.com. I modelli sono compatibili con librerie popolari come transformers, vLLM e FastDeploy, con requisiti hardware che variano da una singola GPU da 80 GB per le varianti leggere fino a configurazioni multi-GPU per i modelli più grandi.

Perché conta per founder, PMI e agenzie italiane

Per le realtà italiane che sviluppano prodotti AI, ERNIE 4.5 rappresenta un'alternativa open source a modelli proprietari. La licenza permissiva riduce il rischio vendor lock-in e consente di eseguire i modelli on-premise o su cloud privato. L'ampia gamma di dimensioni — dalle varianti leggere a 21B-28B attivabili su singola GPU fino ai modelli flagship a 424B — permette di scegliere il compromesso tra prestazioni e costo infrastrutturale.

Per le agenzie di comunicazione e marketing italiane, ERNIE 4.5 apre scenari di automazione della produzione di contenuti multimodali: analisi di brief visivi, generazione di caption, estrazione di informazioni da presentazioni e infografiche, assistenza al customer care con allegati immagine. Per le PMI industriali, la capacità di ragionare su diagrammi tecnici, schemi elettrici e manuali d'uso può accelerare la manutenzione predittiva e la formazione interna. Per i founder di startup AI, la disponibilità di pesi open source sotto Apache 2.0 significa poter costruire prodotti verticali senza pagare per token a fornitori terzi, anche se i costi di infrastruttura GPU restano da valutare.

Tuttavia, va considerato che i materiali ufficiali sono principalmente in inglese e cinese, che le prestazioni su compiti in italiano non sono documentate in benchmark pubblici noti e che l'ecosistema PaddlePaddle è meno diffuso in Europa rispetto a PyTorch. Una valutazione pratica sui propri dataset in italiano resta indispensabile prima di adottarlo in produzione.

Sintesi

ERNIE 4.5 è una famiglia MoE multimodale rilasciata in open source da Baidu, con varianti che vanno da 0,3 a 424 miliardi di parametri e licenza Apache 2.0. Offre capacità avanzate di linguaggio, ragionamento e visione, con un'attenzione particolare all'efficienza infrastrutturale. Per imprese, agenzie e startup italiane rappresenta un'opzione concreta per self-hosting, prototipazione di agenti AI e automazione di processi su documenti e contenuti visivi, a patto di verificarne le prestazioni linguistiche sul proprio dominio.

Hai letto fino a qui

🤔 Hai domande su questo argomento?

Posso aiutarti a capire come applicarlo al tuo business. Scegli come vuoi parlarmi.

— oppure —

💬 Chat: risposta immediata · 📧 Email: risposta personale entro 24h · 🔒 Niente spam

Continua a leggere