Copertina Osservatorio

Kokoro TTS: modello open-weight di sintesi vocale da 82M parametri

Scheda tecnica su Kokoro, il text-to-speech leggero con licenza Apache 2.0, qualità elevata e bassi requisiti hardware.

15 giugno 20266 min di lettura
Kokoro TTStext-to-speechsintesi vocale AIStyleTTS2modello open source

Cos'è

Kokoro è un modello di text-to-speech (TTS) open-weight con soli 82 milioni di parametri, pubblicato sotto licenza Apache 2.0. Il nome deriva dal giapponese kokoro (cuore, spirito). Il modello è stato rilasciato inizialmente il 25 dicembre 2024 con la versione v0.19 e aggiornato alla versione v1.0 il 27 gennaio 2025. L'autore è noto come @rzvzn all'interno della community di sviluppo.

Kokoro è basato sull'architettura StyleTTS 2, con vocoder ISTFTNet, ed è progettato come decoder-only: non utilizza diffusione né rilascia un encoder separato. La particolarità del modello è di offrire una qualità di sintesi vocale comparabile a modelli molto più grandi pur mantenendo dimensioni ridotte, velocità di inferenza elevate e requisiti hardware contenuti. Il successo di Kokoro ha attirato l'attenzione di sviluppatori indipendenti e aziende, spingendo anche NVIDIA a rilasciare una versione ONNX ottimizzata per l'inferenza su CPU e GPU.

A cosa serve / dove eccelle

Kokoro trasforma testo scritto in audio parlato. Eccelle in scenari dove contano efficienza, leggerezza e libertà di licenza:

  • Sintesi vocale in tempo reale o in streaming per applicazioni interattive.
  • Deploy su hardware limitato, inclusi CPU consumer e dispositivi edge.
  • Progetti commerciali e open source che richiedono una licenza permissiva.
  • Produzione di audiolibri, podcast, contenuti accessibili e assistenti vocali.
  • Pipeline di sintesi vocale integrate in sistemi più ampi, come agenti conversazionali o piattaforme di content creation.

Il modello ha ottenuto un'elevata valutazione nella TTS Spaces Arena di Hugging Face, classificandosi tra i migliori modelli open source nonostante una dimensione nettamente inferiore rispetto a concorrenti come XTTS v2, Fish Speech o MetaVoice. Questo risultato ha sollevato discussioni nella community sulla possibilità che le leggi di scalabilità tradizionali del TTS possano essere più favorevoli di quanto si ritenesse, almeno per determinati domini applicativi.

Caratteristiche e specifiche

CaratteristicaDettaglio
Parametri82 milioni
ArchitetturaStyleTTS 2 + ISTFTNet, decoder-only
LicenzaApache 2.0 (pesi e codice di inferenza principale)
Lingue supportate (v1.0)Inglese americano, inglese britannico, spagnolo, francese, hindi, italiano, giapponese, portoghese brasiliano, cinese mandarino
Voci predefinite (v1.0)54 voci organizzate per lingua e genere
Risoluzione audio24 kHz, mono
Requisiti hardware< 2 GB VRAM, eseguibile anche su CPU
Dipendenza G2Pmisaki (con fallback su espeak-ng per alcune lingue)
Costo di training stimatocirca 1.000 USD per ~1.000 ore di A100 80 GB
Dataset di trainingalcune centinaia di ore di audio permessivo/non soggetto a copyright (v1.0)

Il modello viene distribuito tramite la libreria Python kokoro, installabile con pip install kokoro, e supporta l'output in streaming di chunk audio man mano che vengono generati. La pipeline di inferenza è composta da due passaggi principali: la conversione del testo in fonemi IPA tramite la libreria misaki e la generazione del segnale audio da parte del modello neurale. Questa separazione rende il sistema modulare e permette di aggiornare o sostituire il componente G2P senza modificare il modello di sintesi.

Punti di forza

  1. Dimensioni minime, alta qualità: con soli 82 milioni di parametri supera o eguaglia modelli da centinaia di milioni o miliardi di parametri su benchmark di qualità percepita.
  2. Costo di inferenza ridotto: gira su CPU o GPU di fascia bassa, con un footprint inferiore ai 2 GB di VRAM, rendendolo adatto a deployment on-premise e edge.
  3. Licenza permissiva: Apache 2.0 consente l'uso commerciale senza costi di licenza, a differenza di molte soluzioni proprietarie o di modelli open source con restrizioni non commerciali.
  4. Multilingue e multi-voce: la v1.0 copre nove lingue con decine di voci predefinite, maschili e femminili, organizzate con codici lingua chiari (ad esempio a per inglese americano, b per inglese britannico, i per italiano).
  5. Facilità di integrazione: API semplice via KPipeline, con possibilità di regolare velocità, voce e pattern di segmentazione del testo.
  6. Provenienza dati controllata: addestrato esclusivamente su audio di pubblico dominio, con licenze permissive o audio sintetico generato da modelli chiusi di grandi provider, riducendo i rischi legali legati ai dati di training.
  7. Efficienza economica: il costo stimato di deployment via API è inferiore a un dollaro per milione di caratteri, con costi di self-hosting molto contenuti.

Quando ha senso (e quando no)

Ha senso usarlo quando:

  • Si cerca un TTS open source con licenza commerciale permissiva.
  • Le risorse hardware sono limitate (CPU, GPU entry-level, deploy edge).
  • È necessaria bassa latenza o generazione in streaming.
  • Il contenuto è prevalentemente narrativo, didattico o informativo.
  • Si desidera evitare lock-in e costi ricorrenti di API proprietarie.

Ha meno senso quando:

  • È richiesto il voice cloning da un campione audio personalizzato: Kokoro non lo supporta nativamente, ma utilizza voci predefinite sotto forma di tensori.
  • Serve una resa altamente espressiva o drammatica, tipica del parlato emotivo o conversazionale: il training è avvenuto principalmente su letture e narrazioni di lunga durata.
  • È necessaria la massima qualità assoluta: modelli da 1 miliardo+ di parametri o grandi modelli multimodali possono offrire risultati superiori, pur con costi maggiori.
  • La dipendenza da espeak-ng per la conversione grafema-fonema può introdurre errori su parole fuori vocabolario o lingue con fonetica complessa.
  • Si lavora in ambienti dove non è possibile installare dipendenze di sistema aggiuntive come espeak-ng.

Casi d'uso concreti

  • Assistenti vocali e chatbot: risposte vocali in tempo reale con basso consumo di risorse, anche in ambienti con GPU limitata.
  • Audiolibri e narrazione: conversione di articoli, libri e documenti in audio, sfruttando le voci naturali e la capacità di generare lunghi segmenti di testo.
  • Accessibilità: lettura di contenuti web per utenti con disabilità visive o difficoltà di lettura, integrabile in screen reader o browser.
  • E-learning: narrazione di materiali didattici in più lingue, utile per piattaforme di formazione multilingue.
  • Generazione di contenuti audio: produzione di podcast, briefing vocali e annunci automatici a costi ridotti.
  • Prototipazione rapida: integrazione TTS in applicazioni senza costi di API esterne, ideale per startup e sviluppatori indipendenti.
  • IoT e dispositivi embedded: deployment su hardware leggero grazie al basso footprint e alla disponibilità di versioni ONNX.

Alternative e contesto

Kokoro si colloca nella fascia dei TTS leggeri e open source. Le principali alternative includono:

  • Piper: TTS ONNX ottimizzato per CPU, molto veloce ma generalmente meno naturale rispetto a Kokoro.
  • MeloTTS: leggero, multilingue, con buone prestazioni su CPU e licenza permissiva.
  • XTTS v2 (Coqui): offre voice cloning zero-shot, ma con licenza CPML e maggiori requisiti computazionali.
  • Fish Speech: qualità elevata e voice cloning, ma pesi sotto CC-BY-NC-SA che ne limitano l'uso commerciale.
  • ElevenLabs / Play.ht: servizi proprietari di alta qualità, ma a pagamento e con limitazioni di licenza.
  • Modelli LLM multimodali (GPT-4o, Gemini): offrono TTS di alta qualità e naturalezza, ma non sono open source né self-hostabili.

Kokoro rappresenta una scelta di equilibrio tra qualità, dimensione, velocità e libertà di licenza, posizionandosi come riferimento per chi cerca un TTS open source pratico ed economico.

In sintesi

Kokoro TTS è un modello di sintesi vocale open-weight che dimostra come un'architettura ben progettata e un dataset curato possano competere con modelli molto più grandi. Con 82 milioni di parametri, licenza Apache 2.0, supporto multilingue e requisiti hardware contenuti, è una scelta solida per sviluppatori e aziende che cercano un TTS self-hosted, economico e affidabile. Non è la soluzione ideale per voice cloning o recitazione emotiva, ma eccelle in narrazione, assistenti vocali e applicazioni in tempo reale.

Risorse

Hai letto fino a qui

🤔 Hai domande su questo argomento?

Posso aiutarti a capire come applicarlo al tuo business. Scegli come vuoi parlarmi.

— oppure —

💬 Chat: risposta immediata · 📧 Email: risposta personale entro 24h · 🔒 Niente spam

Continua a leggere