
Indice
- La risposta in una frase
- Che cos’è Kokoro-82M?
- Perché 82 milioni di parametri contano su un telefono
- Perché Local TTS usa Kokoro-82M
- Kokoro copre tutte le 31 lingue di Local TTS?
- Che cosa incide sulla qualità vocale reale?
- Kokoro è notevole, non infallibile
- Domande frequenti
- Ascolta Kokoro-82M sul tuo testo
Quando un’app di lettura vocale legge una pagina ad alta voce, i comandi che vedi sono solo una parte dell’esperienza. Il modello che sta dietro determina se una voce suona naturale, mantiene un ritmo costante, pronuncia una frase con chiarezza e risponde abbastanza in fretta da sembrare un lettore e non un’elaborazione.
Local TTS usa Kokoro-82M per le sue voci neurali in inglese americano e britannico. Il modello è abbastanza piccolo da girare su un iPhone o un iPad, ma abbastanza capace da rendere naturale l’ascolto di testi lunghi. E soprattutto, il testo e il parlato generato restano sul tuo dispositivo.
Non servono Python, un terminale, file di modello o una chiave API. Incolla del testo, importa un documento o scansiona una pagina stampata in Local TTS e premi Play.
Immagine ufficiale e fonti tecniche: la copertina è l’anteprima social ufficiale di Hugging Face per il repository del modello hexgrad/Kokoro-82M, usata senza modifiche e non un’illustrazione generata dall’IA. I dettagli su architettura, rilascio, addestramento e licenza riportati sotto sono attribuiti a quella scheda del modello; il numero di voci e i limiti di qualità sono attribuiti al file ufficiale VOICES.md.
La risposta in una frase
Kokoro-82M è un modello di sintesi vocale a pesi aperti da 82 milioni di parametri che produce parlato naturale a 24 kHz con molta meno potenza di calcolo di tanti modelli vocali più grandi, il che lo rende adatto alla lettura privata direttamente sul dispositivo.
Quell’equilibrio conta. Un modello può suonare benissimo su un server con una GPU potente ed essere comunque la scelta sbagliata per un telefono. A Local TTS servono parlato naturale, uso pratico della memoria, riproduzione reattiva e nessuna chiamata a un’API cloud. Kokoro rende possibile questa combinazione per l’inglese.
Che cos’è Kokoro-82M?
Kokoro-82M è un modello neurale di sintesi vocale creato da hexgrad. «82M» si riferisce ai suoi circa 82 milioni di parametri. La scheda ufficiale del modello Kokoro lo descrive come un modello a pesi aperti pensato per offrire una qualità paragonabile a sistemi più grandi restando più rapido ed economico.
La versione 1.0 è stata pubblicata il 27 gennaio 2025. Secondo la scheda del modello è stata addestrata su alcune centinaia di ore di audio con licenza permissiva, di pubblico dominio e sintetico. I suoi pesi usano la licenza Apache 2.0.
| Kokoro-82M v1.0 | |
|---|---|
| Parametri | 82 milioni |
| Data di rilascio | 27 gennaio 2025 |
| Uscita | parlato a 24 kHz |
| Raccolta pubblica di voci | 54 voci in 8 lingue |
| Uso in Local TTS | 28 voci inglesi americane e britanniche |
| Licenza dei pesi del modello | Apache 2.0 |
| Elaborazione in Local TTS | sul dispositivo; nessun server di sintesi necessario |
Kokoro attinge a StyleTTS 2, un sistema progettato per modellare stili di parlato espressivi, e a ISTFTNet, un vocoder neurale leggero che converte in modo efficiente l’uscita del modello in una forma d’onda audio. Il rilascio pubblico di Kokoro non è l’intero sistema di addestramento di StyleTTS 2: la sua scheda lo descrive come solo decodificatore, senza la componente di diffusione né un encoder rilasciato.
In parole semplici, Kokoro racchiude la parte necessaria per trasformare testo fonetico e uno stile vocale scelto in audio, senza portarsi dietro il peso di un modello di IA generalista molto più grande.
Perché 82 milioni di parametri contano su un telefono
Il numero di parametri non è un punteggio. Un modello più grande può cogliere più sfumature, ma di solito richiede anche più memoria, calcolo, energia e tempo. Quei costi diventano evidenti quando un’app deve leggere un capitolo invece di generare una breve frase dimostrativa.
Le dimensioni contenute di Kokoro danno a Local TTS lo spazio per costruire un’esperienza di lettura completa attorno al modello:
- Generazione sul dispositivo: il parlato è prodotto localmente invece di attendere un server remoto.
- Lettura reattiva: l’app può preparare le frasi successive mentre quella corrente viene riprodotta.
- Praticità sui testi lunghi: PDF, EPUB e articoli si possono leggere senza pagare a carattere un’API di sintesi.
- Disponibilità offline: la voce funziona anche in aereo, nel tragitto casa-lavoro o dove la connessione è inaffidabile.
- Privacy per architettura: il testo incollato e i documenti importati non devono essere caricati per generare il parlato.
Ecco perché qui «piccolo» è un vantaggio di prodotto. L’obiettivo non è vincere una gara di parametri, ma rendere disponibile parlato di qualità ogni volta che premi Play.
Perché Local TTS usa Kokoro-82M
Usare un modello dentro una vera app di lettura richiede più che infilare dei pesi nel pacchetto dell’app. Il testo va normalizzato, diviso in punti sensati, convertito in parlato prima della riproduzione, memorizzato in cache, evidenziato e mantenuto in riproduzione quando lo schermo si blocca.
1. Voci naturali in inglese americano e britannico
Kokoro v1.0 pubblica 20 voci in inglese americano e 8 in inglese britannico nel suo catalogo vocale ufficiale. Local TTS include tutte e 28 queste voci inglesi nel catalogo completo, con accenti, generi e caratteri vocali diversi.
Tre voci inglesi di alta qualità sono disponibili nella versione gratuita, così puoi ascoltare il modello sul tuo testo prima di decidere se ti serve Pro.
2. Il modello è incluso, non chiamato tramite API
Local TTS porta con sé il modello vocale. Quando inserisci del testo, l’app lo trasforma in parlato sul tuo iPhone o iPad. Non c’è un fornitore di sintesi che riceve il documento, non c’è una coda su server e non serve alcun account.
È particolarmente utile per materiale che potresti non voler incollare in un servizio online: un manoscritto inedito, un documento di lavoro, una nota personale o materiale di studio. Se usi la sincronizzazione iCloud, le note possono sincronizzarsi tramite il tuo account iCloud; la generazione del parlato continua comunque ad avvenire sul dispositivo.
3. Due percorsi ottimizzati rendono pratico l’ascolto
Local TTS usa le tecnologie Apple MLX e Metal per una generazione reattiva in primo piano. Usa inoltre un percorso Core ML ottimizzato, così il parlato può continuare a essere preparato durante la riproduzione in background e l’esportazione audio senza dipendere da un ripiego cloud.
Non devi gestire nessuno dei due percorsi. L’app sceglie il motore adatto mantenendo la stessa voce e gli stessi comandi di lettura.
4. Un modello vocale diventa un lettore completo
Kokoro genera parlato. Local TTS trasforma quella capacità in qualcosa di usabile ogni giorno:
- Incolla un articolo o scrivi una nota.
- Importa file PDF, EPUB, Word, TXT e Markdown.
- Scansiona una pagina stampata con l’OCR sul dispositivo.
- Segui l’evidenziazione parola per parola durante la riproduzione.
- Cambia voce e velocità di lettura per ogni nota.
- Continua ad ascoltare dalla schermata di blocco o dal Centro di Controllo.
- Esporta il parlato come file M4A con Pro.
Scarica Local TTS gratis dall’App Store per provare Kokoro-82M senza installare un modello né aprire un terminale.
Kokoro copre tutte le 31 lingue di Local TTS?
No, e la distinzione è importante. Kokoro alimenta il catalogo di voci inglesi americane e britanniche di Local TTS. La voce a 31 lingue dell’app è alimentata da Supertonic 3, un motore di sintesi multilingue separato che gira sul dispositivo.
La nostra guida a Supertonic 3 mostra come una singola voce di Local TTS legga offline tutte le 31 lingue supportate.
Il rilascio pubblico di Kokoro v1.0 include voci in otto lingue, ma le note vocali del progetto avvertono che il supporto non inglese può essere scarso, perché strumenti di pronuncia e dati di addestramento variano da lingua a lingua. Local TTS usa attualmente Kokoro dove la sua implementazione mobile è più solida: l’inglese. Supertonic 3 si occupa di coreano, giapponese, spagnolo, francese, tedesco e delle altre lingue supportate dall’app.
Entrambi i motori girano in locale. Scegliere un’altra lingua non ti sposta su un servizio cloud.
Che cosa incide sulla qualità vocale reale?
La stessa voce non suonerà ugualmente naturale su qualsiasi testo. Questi dettagli fanno una differenza percepibile:
- Punteggiatura: virgole, punti e interruzioni di paragrafo danno al modello indizi utili sul fraseggio.
- Nomi e termini specialistici: nomi rari, acronimi e marchi possono richiedere una grafia fonetica o una piccola modifica del testo.
- Lunghezza delle frasi: i frammenti molto brevi possono suonare bruschi, mentre le frasi lunghissime senza pause possono risultare affrettate.
- Numeri e simboli: date, numeri romani, formule e simboli insoliti possono essere ambigui una volta pronunciati.
- Scelta della voce: una voce che funziona bene per un romanzo può risultare meno adatta alla rilettura o alle note tecniche.
Local TTS normalizza i casi limite più comuni e divide i testi lunghi in unità di sintesi pratiche. Per il risultato migliore, tieni il testo di partenza ben punteggiato e prova qualche voce con il materiale che intendi davvero ascoltare.
Kokoro è notevole, non infallibile
Il catalogo vocale ufficiale segnala che la qualità delle voci varia con la quantità e la qualità dei dati di addestramento. Dice anche che le voci tendono a rendere al meglio in una fascia intermedia di circa 100–200 token: enunciati molto brevi possono risultare più deboli, quelli molto lunghi possono correre. Local TTS attenua questi estremi con una preparazione consapevole delle frasi e una suddivisione in blocchi, ma non può rendere perfetta ogni pronuncia.
Kokoro è inoltre un modello a pesi aperti, non un rilascio completo di addestramento open source. I pesi scaricabili sono sotto licenza Apache, mentre la scheda del modello indica che l’encoder e l’intero sistema di addestramento non sono stati rilasciati.
Per lavori in cui la pronuncia è critica, ascolta il risultato in anteprima e controlla nomi, abbreviazioni e linguaggio tecnico prima di esportare o pubblicare l’audio. Qualsiasi audio condiviso andrebbe inoltre identificato come parlato generato sinteticamente.
Domande frequenti
Local TTS usa davvero Kokoro-82M?
Sì. Kokoro-82M v1.0 alimenta le voci neurali inglesi americane e britanniche in Local TTS. I pesi del modello e i dati vocali sono inclusi nell’app per l’uso sul dispositivo.
Funziona senza internet?
Sì. Una volta installato Local TTS, la generazione del parlato funziona offline. Non serve alcuna connessione per trasformare il tuo testo in audio.
Quante voci Kokoro ci sono in Local TTS?
Il catalogo completo di Local TTS comprende 28 voci inglesi Kokoro: 20 americane e 8 britanniche. La versione gratuita include tre voci inglesi selezionate, più la voce multilingue dell’app.
Local TTS carica il mio PDF o il mio testo per generare il parlato?
No. File importati, testo incollato, OCR e generazione del parlato sono elaborati sul dispositivo. Non ci sono account, pubblicità né tracciamento.
Devo scaricare Kokoro separatamente?
No. Non servono Hugging Face, Python, una riga di comando o una chiave API. Local TTS racchiude insieme il modello e l’interfaccia di lettura.
Kokoro è usato per il coreano e per le altre lingue supportate?
Non in Local TTS. Kokoro è usato per il catalogo inglese; Supertonic 3 fornisce la voce a 31 lingue dell’app sul dispositivo.
Ascolta Kokoro-82M sul tuo testo
Kokoro-82M conta perché rende pratico il parlato neurale naturale al di là di una pagina dimostrativa o di un’API cloud. Local TTS porta quel modello dentro un lettore offline con importazione di documenti, OCR, evidenziazione, riproduzione in background, controlli vocali ed esportazione audio.
Incolla un paragrafo, importa quel PDF che rimandi da tempo o fotografa una pagina stampata. Poi scegli una voce inglese e ascolta: il tuo testo resta sul tuo dispositivo dall’inizio alla fine.
Scarica Local TTS gratis dall’App Store e ascolta Kokoro-82M sul tuo iPhone o iPad.
Trasforma qualsiasi testo in voce — offline
Local TTS legge PDF, e-book e articoli direttamente sul tuo iPhone: privato, naturale e tutto tuo.
Scarica dall'App Store