Cos'è Llama 3.2 3B
Llama 3.2 3B è un large language model (LLM) sviluppato da Meta, appartenente alla famiglia Llama 3.2 annunciata nel settembre 2024. La variante da 3 miliardi di parametri (più precisamente 3,21 miliardi) rappresenta il modello di taglia intermedia della serie, posizionato tra il più piccolo Llama 3.2 1B e i modelli multimodali Llama 3.2 11B Vision e 90B Vision.
A differenza delle versioni Vision, Llama 3.2 3B è un modello testuale: accetta testo in input e produce testo in output, incluso codice. È rilasciato in due versioni principali: una base, pre-addestrata su dati generici, e una versione Instruct, sottoposta a fine-tuning supervisionato e tecniche di allineamento per rispondere a istruzioni e dialogare in modo più utile e sicuro.
A cosa serve
Llama 3.2 3B è pensato per scenari in cui è necessario un buon equilibrio tra qualità dell'output e consumo di risorse. I casi d'uso previsti includono assistenti conversazionali, riassunto di documenti, riscrittura di testi, risposta a domande su knowledge base, prompt rewriting e applicazioni leggere di agent retrieval.
Grazie alle dimensioni contenute, il modello è adatto a essere eseguito in locale su workstation, laptop con GPU consumer e, con opportune tecniche di quantizzazione, anche su dispositivi mobili di fascia alta. Questo lo rende interessante per chi vuole offrire funzionalità generative senza dipendere esclusivamente da API cloud.
La versione Instruct supporta lingue diverse dall'inglese: tra quelle ufficialmente dichiarate da Meta figurano tedesco, francese, italiano, portoghese, hindi, spagnolo e thai. L'italiano è quindi una lingua supportata, anche se le prestazioni migliori si osservano generalmente in inglese.
Come funziona
L'architettura di Llama 3.2 3B è un transformer auto-regressivo ottimizzato, simile a quella dei modelli Llama 3.1 ma ridotta in scala. Utilizza la Grouped-Query Attention (GQA), una tecnica che riduce il carico di memoria durante la generazione mantenendo prestazioni competitive. La lunghezza massima del contesto è di 128.000 token, sia per il modello base che per quello Instruct.
L'addestramento ha coinvolto fino a 9 trilioni di token provenienti da fonti pubblicamente disponibili online, con un cutoff della conoscenza fissato a dicembre 2023. I modelli 1B e 3B sono stati addestrati anche con tecniche di distillazione: i logit prodotti dai modelli più grandi Llama 3.1 8B e 70B sono stati usati come target durante l'addestramento, permettendo ai modelli più piccoli di avvicinarsi alle prestazioni di architetture più grandi.
La versione Instruct è stata ottenuta attraverso un ciclo di Supervised Fine-Tuning (SFT), Rejection Sampling (RS) e Direct Preference Optimization (DPO), utilizzato per allineare il modello alle preferenze umane in termini di utilità e sicurezza.
Sul fronte della quantizzazione, Meta ha rilasciato varianti ottimizzate con SpinQuant e QLoRA, pensate per l'esecuzione su CPU Arm tramite il framework ExecuTorch. Le versioni quantizzate riducono significativamente l'ingombro in memoria e accelerano la generazione, rendendo pratico l'uso on-device.
Sui benchmark standard, il modello Instruct ottiene punteggi come 63,4 su MMLU (5-shot), 77,7 su GSM8K per la matematica con chain-of-thought, e 78,6 su ARC-Challenge per il ragionamento. Si colloca quindi al di sotto di Llama 3.1 8B, ma al di sopra di molti modelli open source di pari dimensione.
Perché conta per founder, PMI e agenzie italiane
Per imprenditori, piccole e medie imprese e agenzie digitali italiane, Llama 3.2 3B offre un punto di ingresso pragmatico all'intelligenza artificiale generativa. Il primo vantaggio è la possibilità di eseguire il modello on-premise o su infrastrutture proprie, riducendo la dipendenza da servizi cloud esterni e migliorando il controllo sui dati sensibili, un aspetto rilevante per conformità a normative come il GDPR.
Il secondo vantaggio è il costo operativo. Un modello da 3 miliardi di parametri non richiede cluster di GPU enterprise: con una scheda video consumer o addirittura CPU quantizzate è possibile ottenere risposte utili per casi d'uso specifici. Questo abbassa la barriera per sperimentare chatbot interni, assistenti alla scrittura, motori di riassunto per documenti aziendali o strumenti di riscrittura per copy e comunicazione.
Il terzo vantaggio è la licenza. Llama 3.2 è distribuito sotto la Llama 3.2 Community License, una licenza commerciale personalizzata che consente l'uso a fini commerciali e la modifica, a patto di rispettare l'Acceptable Use Policy e di includere l'attribuzione richiesta. Esiste un limite: se i prodotti o servizi del licenziatario superano i 700 milioni di utenti attivi mensili, è necessario richiedere un'autorizzazione specifica a Meta. Per la stragrande maggioranza di PMI, startup e agenzie questo limite non rappresenta un vincolo operativo.
L'italiano supportato, sebbene non raggiunga la stessa precisione dell'inglese, permette di costruire prototipi e prodotti per il mercato locale senza dover necessariamente partire da modelli multilingue più grandi o più costosi. Per casi d'uso verticali, il modello può inoltre essere sottoposto a fine-tuning su dataset aziendali per migliorare la qualità su terminologia specifica.
Dove trovarlo
Llama 3.2 3B è disponibile in più forme e piattaforme. Il repository ufficiale si trova su Hugging Face negli spazi meta-llama/Llama-3.2-3B e meta-llama/Llama-3.2-3B-Instruct, da cui è possibile scaricare i pesi originali in BF16 o le varianti per la libreria Transformers.
Per l'esecuzione locale semplificata, il modello è presente in Ollama con il tag llama3.2:3b, che permette di provarlo da riga di comando in pochi minuti. È inoltre disponibile su piattaforme cloud come Amazon Bedrock e come NIM (NVIDIA Inference Microservice) nell'ecosistema NVIDIA.
Per quanto riguarda la documentazione ufficiale, il sito llama.meta.com e il repository GitHub meta-llama/llama-models contengono guide, licenze, accettazioni d'uso e ricette di inferenza. Chi intende usare il modello in produzione dovrebbe consultare la Llama 3.2 Community License e l'Acceptable Use Policy per garantire la conformità normativa e contrattuale.
