Vai al contenuto principale
IA

Kokoro-82M e Supertonic 3: perché Local TTS usa entrambi

Local TTS10 min

I benchmark ufficiali mostrano che ogni modello vince una gara diversa. Ecco i numeri dietro Local TTS e perché l’app abbina Kokoro-82M e Supertonic 3 sul dispositivo.

Local TTS include due modelli vocali neurali invece di uno. Kokoro-82M legge le sue voci in inglese americano e britannico, mentre Supertonic 3 legge la sua voce multilingue in 31 lingue. Entrambi girano interamente sul tuo iPhone o iPad.

Perché portarsi dietro due modelli, quando uno solo renderebbe l’app più piccola e semplice? Perché i benchmark pubblicati danno una risposta chiara: oggi nessun modello compatto on-device vince allo stesso tempo su naturalezza, accuratezza di lettura, velocità e copertura linguistica. Ognuno dei due vince una gara diversa, e abbinarli permette a Local TTS di usare ciascun modello esattamente dove è più forte.

Questo articolo ripercorre i risultati di valutazione ufficiali dietro quella scelta: cosa hanno misurato gli autori dei modelli, cosa hanno trovato i test indipendenti e cosa significa tutto questo per il lettore che ascolti davvero.

Fonti e immagine di copertina: la copertina è il grafico ufficiale di Supertone sull’accuratezza di lettura, riprodotto senza modifiche dal repository Supertonic. I dati di Kokoro provengono dalla scheda ufficiale del modello hexgrad/Kokoro-82M; quelli di Supertonic dal repository ufficiale di Supertone e dalla scheda del modello; il confronto diretto su CPU da un benchmark indipendente di terze parti. I numeri originali sono stati misurati dai rispettivi autori sul loro hardware, non su un iPhone.

La risposta in una frase

Kokoro-82M è primo nelle valutazioni umane di naturalezza per l’inglese; Supertonic 3 è primo per velocità su CPU e legge 31 lingue con accuratezza competitiva. Per questo Local TTS affida l’inglese a Kokoro e tutto il multilingue a Supertonic 3, sempre sul tuo dispositivo.

Come si misurano le prestazioni della sintesi vocale

Per un’app di lettura contano quattro misure, e prima di guardare i numeri aiuta sapere cosa significa ciascuna:

  1. La naturalezza la giudicano le persone. Il test pubblico più noto è un’arena alla cieca: chi ascolta sente due clip anonime e vota la più naturale, producendo una classifica in stile Elo che il marketing non può influenzare.
  2. L’accuratezza di lettura verifica se il modello ha pronunciato davvero il testo ricevuto, senza parole saltate, ripetute o storpiate. Si misura come tasso di errore sulle parole (WER) o sui caratteri (CER), ritrascrivendo in testo l’audio generato. Più basso è, meglio è.
  3. La velocità si esprime con il real-time factor (RTF): il tempo di sintesi diviso per la durata dell’audio. Un RTF di 0.3 significa che un secondo di parlato richiede 0.3 secondi per essere generato, cioè circa 3,3 volte più veloce del tempo reale. Più basso vuol dire più veloce.
  4. L’ingombro riguarda parametri, dimensione del download e memoria: la differenza tra un modello che sta in un’app per telefono e uno che richiede una GPU su server.

Una voce cloud può inseguire tutte e quattro le misure con l’hardware di un data center. Un modello on-device deve fare compromessi, ed è qui che i due modelli prendono strade diverse.

Cosa dicono i benchmark su Kokoro-82M

Il risultato di punta di Kokoro-82M è una classifica basata sulle preferenze umane. Prima della release v1.0, la scheda ufficiale del modello riportava che Kokoro v0.19 si era classificato #1 nella TTS Spaces Arena, l’arena di ascolto alla cieca su Hugging Face, con un punteggio Elo più alto di modelli molte volte più grandi, tra cui XTTS v2 (467 milioni di parametri) e MetaVoice (1,2 miliardi di parametri), pur essendo stato addestrato su poche centinaia di ore di audio.

È un risultato insolito su cui vale la pena fermarsi. In un test in cui gli ascoltatori non potevano vedere né i nomi dei modelli né il numero di parametri, un modello da 82 milioni di parametri è stato preferito a sistemi da miliardi di parametri. Per naturalezza dell’inglese in rapporto alla potenza di calcolo, Kokoro ha fissato lo standard dei modelli compatti.

Kokoro-82M v1.0
Parametri82 milioni
Valutazione umanaLa v0.19 si è classificata #1 nella TTS Spaces Arena
AudioVoce a 24 kHz
Voci54 voci pubbliche; 28 voci inglesi in Local TTS
LicenzaApache 2.0
Ruolo in Local TTSIl catalogo in inglese americano e britannico

Il compromesso è la copertura. La release pubblica di Kokoro copre otto lingue, ma il suo stesso catalogo delle voci precisa che, fuori dall’inglese, la qualità varia con i dati di addestramento. È uno specialista: eccezionale in inglese, molto più limitato altrove.

Cosa dicono i benchmark su Supertonic 3

Supertonic 3, pubblicato da Supertone il 29 aprile 2026, viene valutato nella direzione opposta: ampiezza ed efficienza. Il repository ufficiale pubblica i risultati di accuratezza di lettura sul benchmark Minimax-MLS-test, confrontando il suo modello da circa 99 milioni di parametri con sistemi TTS aperti molto più grandi come VoxCPM2, OmniVoice e Qwen3-TTS.

Ecco i tassi di errore pubblicati da Supertone per le undici lingue in cui è scritto questo sito (più basso è, meglio è; * indica il tasso di errore sui caratteri, gli altri valori sono tassi di errore sulle parole):

LinguaVoxCPM2OmniVoiceQwen3-TTSSupertonic 3
Inglese2.112.022.252.06
Coreano*4.703.224.073.26
Giapponese*3.353.813.674.61
Tedesco0.850.960.520.86
Francese4.414.743.824.89
Spagnolo1.340.990.751.13
Portoghese1.741.401.212.48
Italiano1.741.291.401.75
Olandese0.840.771.47
Polacco1.300.641.63
Turco0.882.181.00

Supertonic 3 non vince in ogni riga, e Supertone non sostiene il contrario. La conclusione ufficiale è più utile: resta nella fascia di errore competitiva di modelli molte volte più grandi, su 31 lingue, rimanendo abbastanza piccolo da girare senza alcuna GPU.

È sulla velocità che i suoi numeri spiccano. Supertone mostra Supertonic 3 in funzione su hardware molto più debole di un iPhone moderno: un e-reader Onyx Boox Go 6 in modalità aereo, con un RTF medio di 0.3× — circa tre volte più veloce del tempo reale su un e-reader — e la sintesi in tempo reale su un Raspberry Pi. Il confronto ufficiale dei tempi di esecuzione lo mostra veloce su normali CPU anche rispetto a modelli più grandi misurati su una GPU server NVIDIA A100, usando molta meno memoria.

Grafico ufficiale Supertonic che confronta velocità di inferenza su CPU e memoria con modelli più grandi misurati su una GPU A100

Fonte: grafico ufficiale sull’ingombro a runtime di Supertone, riprodotto senza modifiche.

Supertonic 3
ParametriCirca 99 milioni
Accuratezza di letturaWER/CER competitivi rispetto a modelli molto più grandi
Velocità dimostrataRTF 0.3× su un e-reader; tempo reale su Raspberry Pi
AudioVoce a 44,1 kHz
Lingue31
LicenzaOpenRAIL-M
Ruolo in Local TTSLa voce multilingue in 31 lingue

Il confronto diretto che spiega la nostra scelta

Il confronto più diretto arriva da un benchmark indipendente di terze parti che ha eseguito entrambi i modelli sulla stessa modesta CPU a 4 core, senza GPU: condizioni più vicine a un telefono che a un server AI. Due risultati contano:

  • Velocità: Supertonic 3 ha sintetizzato con RTF 0.313 all’impostazione di qualità standard — circa 3,2 volte più veloce del tempo reale — mentre Kokoro-82M ha misurato RTF 0.469–0.509, circa 2 volte il tempo reale. Entrambi sono più veloci del tempo reale su una piccola CPU; Supertonic ha il margine maggiore.
  • Naturalezza: lo stesso test ha giudicato più umano l’inglese di Kokoro, con una prosodia naturale, mentre le impostazioni più veloci di Supertonic suonavano più piatte.

In altre parole, un tester indipendente senza interessi in nessuno dei due modelli è arrivato alla stessa conclusione indicata dai numeri ufficiali: Kokoro vince sulla naturalezza dell’inglese, Supertonic 3 vince su velocità e copertura. Se dovessi scegliere un solo modello, dovresti rinunciare a qualcosa. Local TTS ha scelto di non scegliere.

Perché Local TTS collega i due modelli

Dentro Local TTS i due motori stanno dietro un unico lettore. Ogni voce dell’elenco appartiene a uno dei due modelli e, quando ne scegli una, l’app indirizza automaticamente la sintesi al motore giusto: stesso pulsante Riproduci, stessa evidenziazione, stessi controlli di velocità, stessa garanzia offline.

L’inglese va a Kokoro-82M

Il motivo sono i risultati delle preferenze umane. Quando gli ascoltatori votano stabilmente un modello da 82M sopra sistemi da miliardi di parametri per l’inglese, è quello il modello che i tuoi audiolibri, articoli e PDF in inglese meritano. Local TTS include tutte le 28 voci americane e britanniche di Kokoro e le esegue con una pipeline Core ML ottimizzata per i chip Apple, che fornisce anche i tempi delle parole per l’evidenziazione parola per parola e continua a sintetizzare durante la riproduzione in background.

Tutto il multilingue va a Supertonic 3

Il motivo sono copertura ed efficienza. Un solo modello Supertonic 3 incluso nell’app legge coreano, giapponese, tedesco, francese, spagnolo e altre 26 lingue a 44,1 kHz, con tassi di errore competitivi con sistemi molto più grandi; e il suo design pensato per la CPU rende sostenibili, anche a batteria, la lettura in background e i documenti lunghi. Dieci stili preimpostati (F1–F5, M1–M5) leggono ciascuno tutte le 31 lingue, così un documento che cambia lingua mantiene una voce coerente.

Cosa evita l’abbinamento

  • Un’app solo in inglese. Kokoro da solo lascerebbe 30 lingue senza una voce all’altezza.
  • Un’unica voce inglese più piatta. Supertonic da solo sacrificherebbe la naturalezza inglese premiata nell’arena e il catalogo di 28 voci inglesi.
  • Un ripiego sul cloud. Entrambi i modelli sono abbastanza piccoli da essere inclusi nell’app, quindi nessun testo lascia mai il dispositivo per raggiungere «il modello migliore su un server».

Questo design combinato costa un po’ di dimensione dell’app e di complessità tecnica, e lo consideriamo un buon compromesso: i benchmark qui sopra ne sono, di fatto, la specifica.

Scarica Local TTS gratis dall’App Store e confronta i due motori sui tuoi testi: tre voci inglesi Kokoro e una voce multilingue Supertonic 3 sono gratuite.

Come leggere questi numeri con onestà

I benchmark orientano una decisione, non chiudono la discussione. Tieni a mente quattro avvertenze:

  1. I numeri originali non sono stati misurati su un iPhone. Classifiche dell’arena, tabelle WER e valori RTF arrivano dall’hardware dei rispettivi autori. Le prestazioni on-device in Local TTS dipendono da dispositivo, testo e impostazioni; l’ordine tra i modelli, però, ha retto in tutti i test indipendenti su CPU che siamo riusciti a trovare.
  2. Le classifiche delle arene cambiano. Il primo posto di Kokoro è il dato ufficiale della finestra di valutazione della v0.19; ogni mese entrano in gara nuovi modelli. Ciò che quel risultato ha stabilito in modo durevole è che i modelli compatti possono vincere test di ascolto alla cieca in inglese.
  3. WER/CER si basa su una trascrizione automatica. Misura se le parole sono state pronunciate correttamente, non se la lettura era bella: quello lo misura l’arena con giudici umani, ed è per questo che vale la pena leggere le due metriche insieme.
  4. Le impostazioni di velocità sacrificano qualità. Le configurazioni più estreme di Supertonic riducono la naturalezza. Local TTS usa l’impostazione bilanciata, non quella da titolo di giornale.

Domande frequenti

Local TTS esegue davvero entrambi i modelli sul dispositivo?

Sì. Kokoro-82M e Supertonic 3 sono entrambi inclusi nell’app. Testi, documenti e audio generato vengono elaborati sul tuo iPhone o iPad, senza alcun server vocale.

Quale modello sentirò davvero?

Dipende dalla voce che scegli. Le 28 voci in inglese americano e britannico sono Kokoro-82M; i dieci stili multilingue (F1–F5, M1–M5) sono Supertonic 3. Puoi cambiare voce per ogni nota, in qualsiasi momento.

Perché non usare direttamente i vincitori più grandi dei benchmark, come VoxCPM2 o Qwen3-TTS?

Quei sistemi sono molte volte più grandi e vengono misurati su GPU server. Local TTS è costruito attorno a modelli che funzionano offline su un telefono; entro quel vincolo, questi due sono la combinazione pubblicata più forte che conosciamo.

È più veloce Kokoro o Supertonic?

Sulla stessa piccola CPU, i test indipendenti hanno misurato Supertonic 3 a circa 3 volte il tempo reale e Kokoro a circa 2 volte. Entrambi sono ampiamente abbastanza veloci per la lettura continua in Local TTS.

I due motori suonano diversi?

Sì, di proposito. Le voci Kokoro sono personalità inglesi individuali; gli stili Supertonic sono narratori multilingue coerenti. Prova qualche voce sui tuoi testi: la versione gratuita include entrambi i motori.

Serve una connessione a internet per tutto questo?

No. Entrambi i modelli generano la voce offline. La modalità aereo è il posto perfetto per verificarlo.

Ascolta i benchmark con le tue orecchie

I numeri spiegano una scelta di design; le tue orecchie la confermano. Incolla un articolo in inglese e ascolta una voce Kokoro, poi incolla un paragrafo in italiano, tedesco o spagnolo e senti Supertonic 3 prendere il testimone: stessa app, stessa privacy, nessun cloud in mezzo.

Scarica Local TTS gratis dall’App Store e ascolta perché usiamo due modelli invece di uno.

Per approfondire i due motori, leggi la nostra guida a Supertonic 3 e, in inglese, la guida a Kokoro-82M.

Trasforma qualsiasi testo in voce — offline

Local TTS legge PDF, e-book e articoli direttamente sul tuo iPhone: privato, naturale e tutto tuo.

Scarica dall'App Store