Copertina: Hunyuan-Large (Tencent): MoE open source a 389 miliardi di parametri

Hunyuan-Large (Tencent): MoE open source a 389 miliardi di parametri

Un modello di linguaggio MoE di Tencent che attiva 52 miliardi di parametri su 389 miliardi totali, ottimizzato per ragionamento, coding e contesti lunghi.

20 giugno 20264 min di lettura
Hunyuan-LargeTencentMixture of ExpertsLLM open sourcelarge language modelMoElong contextAI cinese

Cos'è Hunyuan-Large

Hunyuan-Large è un large language model (LLM) sviluppato da Tencent e rilasciato come modello aperti (open weights). Si tratta di un modello basato su architettura Transformer che adotta il paradigma Mixture of Experts (MoE): conta 389 miliardi di parametri totali, ma ne attiva solo 52 miliardi per ogni token in ingresso. Secondo il technical report pubblicato da Tencent, al momento della sua pubblicazione era il più grande modello MoE open source basato su Transformer disponibile nella comunità di ricerca.

Il rilascio include i pesi del modello, il codice per l'inferenza e il fine-tuning, gli script di training e un report tecnico dettagliato, rendendo Hunyuan-Large un progetto orientato sia alla sperimentazione accademica sia allo sviluppo applicativo.

A cosa serve

Hunyuan-Large è progettato per affrontare compiti complessi di linguaggio naturale su larga scala. Le sue principali aree di applicazione includono:

  • Comprensione e generazione del linguaggio naturale: chatbot, assistenti virtuali, riassunto e riscrittura di testi.
  • Ragionamento logico e matematico: risoluzione di problemi complessi, come evidenziato dai benchmark MATH e GSM8K.
  • Coding e sviluppo software: generazione, completamento e debugging di codice (benchmark HumanEval e MBPP).
  • Long-context processing: analisi di documenti lunghi, contratti, report tecnici e conversazioni estese.
  • Multilinguismo: supporto forte per il cinese e l'inglese, con buona generalizzazione su altre lingue.

I benchmark pubblicati da Tencent mostrano che Hunyuan-Large supera modelli come LLaMA 3.1 70B e rivaleggia con LLaMA 3.1 405B in diversi compiti, pur attivando una frazione molto minore di parametri.

Come funziona

L'architettura di Hunyuan-Large si fonda su alcune scelte tecniche chiave:

Mixture of Experts (MoE)

In un modello MoE, ogni token viene elaborato solo da un sottoinsieme di "esperti" della rete, anziché dall'intera architettura. Questo permette di scalare il numero totale di parametri senza aumentare in modo proporzionale il costo computazionale per token. Il risultato è un modello con elevata capacità espressiva ma costo di inferenza contenuto rispetto a un modello denso equivalente.

Dati sintetici di alta qualità

Il training di Hunyuan-Large ha fatto ampio uso di dati sintetici, generati per arricchire la rappresentazione interna del modello e migliorare la generalizzazione su dati non visti durante l'addestramento.

Compressione della KV Cache

Per ridurre l'occupazione di memoria e aumentare il throughput in inference, il modello utilizza Grouped Query Attention (GQA) e Cross-Layer Attention (CLA), tecniche che comprimono la KV cache anche del 50% rispetto alle configurazioni standard.

Learning rate specifico per esperto

Tencent ha introdotto una strategia di scaling del learning rate differenziato per ciascun esperto, in modo che ogni sotto-rete apprenda in modo efficace dal proprio sottoinsieme di dati.

Contesto lungo

La versione pretrain supporta sequenze fino a 256.000 token, mentre la versione instruct arriva a 128.000 token, posizionandosi tra i modelli più capaci nell'elaborazione di documenti estesi.

Tokenizer multilingue

Il tokenizer integra 100.000 token basati su tiktoken, ai quali sono stati aggiunti circa 29.000 token cinesi specifici per migliorare la compressione e la qualità della generazione in cinese.

Perché conta per founder, PMI e agenzie italiane

Per un fondatore, un product manager o un'agenzia che opera in Italia, Hunyuan-Large offre diversi spunti concreti:

  • Efficienza economica: grazie all'architettura MoE, è possibile ottenere prestazioni da modello molto grande con un costo di inferenza più contenuto rispetto a modelli densi di pari capacità.

  • Sovranità dei dati: essendo un modello open weights, può essere scaricato e ospitato su infrastruttura propria, riducendo la dipendenza da API esterne e migliorando il controllo sui dati sensibili.

  • Personalizzazione: gli script di fine-tuning rilasciati da Tencent permettono di addestrare versioni specializzate sui propri dati aziendali, ad esempio per assistenti interni, chatbot verticali o strumenti di copywriting.

  • Multilinguismo e mercato cinese: il forte focus sul cinese rende Hunyuan-Large interessante per aziende che operano con clienti o fornitori in Cina, o che producono contenuti multilingue.

  • Licenza permissiva ma con limiti: il modello è rilasciato sotto la Tencent Hunyuan Community License Agreement, che consente uso commerciale e sviluppo di lavori derivati. Per deployment con oltre 100 milioni di utenti attivi mensili è necessaria un'approvazione esplicita da parte di Tencent. Per la maggior parte delle PMI e delle agenzie, questo non rappresenta un ostacolo.

  • Ecosistema compatibile: il modello è compatibile con il formato Hugging Face e supporta framework come vLLM, TensorRT-LLM e DeepSpeed, facilitando l'integrazione in pipeline esistenti.

Dove trovarlo e come iniziare

Hunyuan-Large è accessibile attraverso diversi canali ufficiali:

  • Hugging Face: repository principale tencent/Tencent-Hunyuan-Large, con le varianti Pretrain, Instruct e Instruct-FP8.
  • GitHub: Tencent-Hunyuan/Tencent-Hunyuan-Large, contenente codice, script di training/inference e documentazione.
  • Demo interattiva: disponibile su Hugging Face Spaces all'indirizzo huggingface.co/spaces/tencent/Hunyuan-Large.
  • Tencent Cloud TI Platform: piattaforma di machine learning di Tencent per training e deployment gestito del modello.
  • API Hunyuan: accesso via cloud attraverso i servizi Tencent Cloud.
  • Technical report: pubblicato su arXiv con identificativo 2411.02265.

Per iniziare in locale è sufficiente scaricare i pesi da Hugging Face, installare le dipendenze indicate nel repository e utilizzare vLLM o Transformers per l'inferenza. Per il fine-tuning, Tencent fornisce un'immagine Docker preconfigurata e script DeepSpeed, anche se è necessaria un'infrastruttura GPU adeguata (tipicamente 8 GPU per il fine-tuning LoRA e 32 per il full fine-tuning).

Hai letto fino a qui

🤔 Hai domande su questo argomento?

Posso aiutarti a capire come applicarlo al tuo business. Scegli come vuoi parlarmi.

— oppure —

💬 Chat: risposta immediata · 📧 Email: risposta personale entro 24h · 🔒 Niente spam

Continua a leggere