Copertina: Llama 4 Scout (Meta): modello multimodale open a 17B attivi

Llama 4 Scout (Meta): modello multimodale open a 17B attivi

Modello di linguaggio multimodale di Meta, con architettura MoE, finestra contestuale fino a 10 milioni di token e licenza commerciale permissiva.

20 giugno 20265 min di lettura
Llama 4 ScoutMeta AImodello open weightsLLM multimodaleMixture of Expertslong contextAI per PMI italiane

Cos'è

Llama 4 Scout è un modello fondazionale di intelligenza artificiale generativa sviluppato da Meta, tra i primi della famiglia Llama a essere nativamente multimodale. La denominazione tecnica è Llama-4-Scout-17B-16E: durante ogni passo di calcolo vengono attivati circa 17 miliardi di parametri, selezionati dinamicamente tra 16 esperti specializzati, per un totale complessivo di 109 miliardi di parametri. Questa architettura a Mixture of Experts (MoE) permette di ottenere capacità di modellazione molto ampie mantenendo però il carico computazionale concentrato su una frazione dei pesi totali. Il risultato è un modello che offre prestazioni elevate pur essendo più compatto ed efficiente rispetto a molti concorrenti di dimensioni simili in termini di parametri totali.

A cosa serve

Scout è progettato per compiti di linguaggio e visione combinati. Può essere usato come assistente conversazionale multilingue, per generare e commentare codice, per descrivere e ragionare sul contenuto di immagini, per rispondere a domande su grafici, tabelle e documenti scansionati, e per produrre didascalie automatiche. La sua caratteristica più distintiva è la finestra contestuale: può elaborare contesti fino a 10 milioni di token, una capacità che lo rende adatto all'analisi di interi libri, a codebase molto estese, a report annuali o a interi archivi normativi in un'unica inferenza. Meta ha testato il modello anche con input multipli, fino a cinque immagini contemporanee, aprendo scenari come il confronto visivo tra prodotti, l'analisi di sequenze di screenshot o la comprensione di documenti multipagina arricchiti da figure.

Come funziona

Llama 4 Scout si basa su un transformer autoregressivo che utilizza l'architettura MoE. In un modello denso classico tutti i parametri partecipano a ogni passo; in Scout, invece, un meccanismo di routing indirizza ogni token verso un sottoinsieme degli esperti disponibili, riducendo il numero di operazioni attive. La multimodalità è ottenuta tramite early fusion: le informazioni visive e testuali vengono integrate fin dalle prime fasi di elaborazione, anziché affidarsi a moduli separati collegati in cascata. Questo rende il modello più coerente su compiti che richiedono di collegare parole e pixel.

Il modello è stato pre-addestrato su circa 40 trilioni di token multimodali, combinando dati pubblici, dati concessi in licenza e informazioni derivanti dai prodotti e servizi Meta. Il knowledge cutoff è ad agosto 2024. Le lingue ufficialmente supportate sono dodici: arabo, inglese, francese, tedesco, hindi, indonesiano, italiano, portoghese, spagnolo, tagalog, thai e vietnamita. Il pre-training, tuttavia, ha coinvolto circa 200 lingue, quindi è possibile adattare ulteriormente il modello tramite fine-tuning per mercati linguistici meno rappresentati.

Sul fronte della sicurezza, Meta ha integrato tecniche di allineamento per ridurre i rifiuti a richieste innocue, migliorare il tono conversazionale e aumentare la steerability tramite system prompt. Sono disponibili anche strumenti di protezione a livello di sistema come Llama Guard, Prompt Guard e Code Shield, pensati per essere abbinati al modello in ambienti di produzione.

Perché conta per founder, PMI e agenzie italiane

Per founder, PMI e agenzie italiane, Llama 4 Scout rappresenta un'opzione concreta per portare l'intelligenza artificiale generativa in-house senza dipendere esclusivamente da API closed. La presenza dell'italiano tra le lingue supportate ufficialmente riduce la barriera all'adozione e limita la necessità di addestramenti costosi per ottenere output fluentemente nella propria lingua. Questo lo rende adatto a chatbot di assistenza clienti, motori di ricerca interna su documentazione aziendale, riassunto di verbali e contratti, analisi di report finanziari, generazione di contenuti per marketing e supporto alla programmazione.

La licenza Llama 4 Community License Agreement è una licenza commerciale custom che consente uso commerciale e ricerca, a condizione di rispettare i termini specifici pubblicati da Meta. Per le aziende che operano in settori regolamentati o che trattano dati sensibili, la possibilità di scaricare i pesi e ospitare il modello on-premise o in un cloud privato può rappresentare un vantaggio importante in termini di sovranità dei dati e conformità, anche se rimane necessaria una valutazione legale caso per caso.

Dal punto di vista operativo, Scout è il modello più leggero della coppia Llama 4. Rispetto a Llama 4 Maverick — che attiva anch'esso 17 miliardi di parametri ma su 128 esperti per un totale di 400 miliardi — Scout richiede meno risorse hardware e si presta meglio a deployment su singola macchina. Meta rilascia i pesi in BF16 e fornisce codice per la quantizzazione int4, con cui è possibile far girare il modello su una singola GPU H100. Questo lo rende accessibile a team tecnici che vogliono sperimentare e portare in produzione soluzioni AI mantenendo il controllo su costi e infrastruttura.

Dove trovarlo

I pesi di Llama 4 Scout sono distribuiti come open weights attraverso i repository ufficiali su Hugging Face: meta-llama/Llama-4-Scout-17B-16E per il modello base e meta-llama/Llama-4-Scout-17B-16E-Instruct per la versione ottimizzata per istruzioni e dialogo. La documentazione, il codice e la licenza sono disponibili su GitHub nel repository meta-llama/llama-models. Per utilizzare il modello con Python è possibile ricorrere a librerie come Transformers di Hugging Face, previo rispetto dei requisiti di versione indicati da Meta.

Chi preferisce un approccio managed può accedere a Llama 4 Scout tramite API offerte da provider specializzati come Together AI e OpenRouter, oppure tramite piattaforme cloud come Oracle Cloud Infrastructure. È anche possibile trovare varianti quantizzate da parte della community, ad esempio in formato FP8, che semplificano ulteriormente il deployment su hardware specifico. Prima di qualsiasi uso commerciale è fondamentale leggere e accettare i termini della Llama 4 Community License Agreement.

Hai letto fino a qui

🤔 Hai domande su questo argomento?

Posso aiutarti a capire come applicarlo al tuo business. Scegli come vuoi parlarmi.

— oppure —

💬 Chat: risposta immediata · 📧 Email: risposta personale entro 24h · 🔒 Niente spam

Continua a leggere