
Sommaire
- La réponse en une phrase
- Qu’est-ce que Kokoro-82M ?
- Pourquoi 82 millions de paramètres comptent sur un téléphone
- Pourquoi Local TTS utilise Kokoro-82M
- Kokoro fournit-il les 31 langues de Local TTS ?
- Ce qui influence la qualité réelle
- Impressionnant, mais pas infaillible
- Questions fréquentes
- Écoutez Kokoro-82M avec votre propre texte
Dans une application de lecture vocale, les commandes visibles ne représentent qu’une partie de l’expérience. Le modèle sous-jacent détermine si une voix paraît naturelle, garde un bon rythme, prononce clairement et commence assez vite pour donner l’impression d’un vrai lecteur.
Local TTS utilise Kokoro-82M pour ses voix neuronales en anglais américain et britannique. Le modèle est assez compact pour fonctionner directement sur iPhone ou iPad, tout en étant suffisamment performant pour rendre l’écoute de textes longs agréable. Le texte et la voix générée restent sur votre appareil.
Vous n’avez besoin ni de Python, ni d’un terminal, ni de fichiers de modèle ou de clé API. Collez un texte, importez un document ou photographiez une page imprimée, puis appuyez sur Lecture.
Image officielle et sources techniques : La couverture est l’aperçu social officiel fourni par Hugging Face pour le dépôt hexgrad/Kokoro-82M, repris sans modification et non généré par IA. L’architecture, la sortie, l’entraînement et la licence sont cités depuis la fiche officielle ; le nombre de voix et les limites de qualité depuis le fichier VOICES.md officiel.
La réponse en une phrase
Kokoro-82M est un modèle TTS à poids ouverts de 82 millions de paramètres qui produit une voix naturelle à 24 kHz avec bien moins de calcul que de nombreux modèles plus grands, ce qui le rend adapté à la lecture privée sur l’appareil.
Un modèle peut être excellent sur un puissant GPU distant sans convenir à un téléphone. Local TTS doit réunir qualité naturelle, mémoire raisonnable, lecture réactive et absence d’aller-retour vers une API cloud. Kokoro rend cette combinaison possible pour l’anglais.
Qu’est-ce que Kokoro-82M ?
Kokoro-82M est un modèle neuronal de synthèse vocale créé par hexgrad. « 82M » désigne ses quelque 82 millions de paramètres. La fiche officielle du modèle Kokoro le présente comme un modèle à poids ouverts visant une qualité comparable à celle de systèmes plus grands, tout en restant plus rapide et économique.
La version 1.0 a été publiée le 27 janvier 2025. Selon sa fiche, elle a été entraînée sur quelques centaines d’heures d’audio permissif, du domaine public et synthétique. Ses poids sont distribués sous licence Apache 2.0.
| Caractéristique | Kokoro-82M v1.0 |
|---|---|
| Paramètres | 82 millions |
| Publication | 27 janvier 2025 |
| Sortie | Audio vocal à 24 kHz |
| Collection publique | 54 voix dans 8 langues |
| Usage dans Local TTS | 28 voix en anglais américain et britannique |
| Licence des poids | Apache 2.0 |
| Traitement | Sur l’appareil, sans serveur TTS |
Kokoro s’appuie sur StyleTTS 2, conçu pour les styles de parole expressifs, et ISTFTNet, un vocodeur neuronal léger qui transforme efficacement la sortie du modèle en forme d’onde. La version publique de Kokoro n’est toutefois pas le système d’entraînement StyleTTS 2 complet : sa fiche la décrit comme un décodeur seul, sans composant de diffusion ni encodeur publié.
Pourquoi 82 millions de paramètres comptent sur un téléphone
Le nombre de paramètres n’est pas une note. Un modèle plus grand peut saisir davantage de nuances, mais il demande généralement plus de mémoire, de calcul, d’énergie et de temps. Ces coûts deviennent évidents lorsque l’on lit un chapitre entier plutôt qu’une courte phrase de démonstration.
La taille compacte de Kokoro permet à Local TTS de construire une expérience de lecture complète autour du modèle :
- Génération locale : la voix est produite sur l’appareil, sans attendre un serveur distant.
- Lecture réactive : l’application prépare les phrases suivantes pendant l’écoute.
- Textes longs pratiques : écoutez PDF, EPUB et articles sans facturation d’API au caractère.
- Fonctionnement hors ligne : la voix reste disponible en avion ou sans réseau fiable.
- Confidentialité par conception : vos textes et documents n’ont pas à être envoyés pour produire la voix.
Ici, la petite taille est un avantage produit. Le but n’est pas de gagner un concours de paramètres, mais de rendre une voix de qualité disponible dès que vous appuyez sur Lecture.
Pourquoi Local TTS utilise Kokoro-82M
Mettre un modèle dans une vraie application de lecture exige plus que d’ajouter ses poids. Il faut normaliser le texte, le découper aux bons endroits, préparer l’audio à l’avance, le mettre en cache, suivre la lecture et continuer lorsque l’écran est verrouillé.
1. Des voix naturelles en anglais américain et britannique
Le catalogue vocal officiel de Kokoro v1.0 comprend 20 voix américaines et 8 voix britanniques. Le catalogue complet de Local TTS propose ces 28 voix, avec différents accents, genres et caractères vocaux.
Trois voix anglaises de qualité sont disponibles gratuitement, afin d’essayer Kokoro sur votre propre texte avant de choisir Pro.
2. Un modèle intégré, pas un appel API
Local TTS embarque le modèle vocal dans l’application. Votre iPhone ou iPad transforme directement le texte en parole. Aucun fournisseur TTS ne reçoit le document, aucune file d’attente distante n’intervient et aucun compte n’est requis.
C’est particulièrement utile pour un manuscrit non publié, un document de travail, une note personnelle ou du matériel d’étude. Si vous activez la synchronisation iCloud, vos notes peuvent passer par votre propre compte iCloud ; la synthèse vocale, elle, reste locale.
3. Deux chemins optimisés selon la situation
Local TTS utilise les technologies MLX et Metal d’Apple pour une génération réactive au premier plan. Un chemin Core ML optimisé permet aussi de préparer la voix pendant la lecture en arrière-plan et l’export audio, sans basculer vers le cloud.
Vous n’avez rien à gérer : l’application choisit le moteur approprié tout en conservant la même voix et les mêmes commandes.
4. Du modèle vocal au lecteur complet
Kokoro génère la voix. Local TTS transforme cette capacité en outil quotidien :
- coller un article ou écrire une note ;
- importer PDF, EPUB, Word, TXT et Markdown ;
- photographier une page avec l’OCR sur l’appareil ;
- suivre le surlignage pendant la lecture ;
- choisir voix et vitesse pour chaque note ;
- continuer depuis l’écran verrouillé et le Centre de contrôle ;
- exporter la voix en M4A avec Pro.
Téléchargez gratuitement Local TTS sur l’App Store pour essayer Kokoro-82M sans installer de modèle ni ouvrir un terminal.
Kokoro fournit-il les 31 langues de Local TTS ?
Non, et cette distinction est importante. Kokoro alimente le catalogue anglais américain et britannique de Local TTS. La voix en 31 langues de l’application est produite par Supertonic 3, un moteur TTS multilingue distinct qui fonctionne lui aussi sur l’appareil.
Notre guide de Supertonic 3 explique comment une voix de Local TTS lit les 31 langues hors ligne.
La version publique de Kokoro v1.0 contient des voix dans huit langues, mais sa documentation avertit que la prise en charge hors anglais peut être limitée selon les outils de prononciation et les données d’entraînement. Local TTS utilise Kokoro là où son implémentation mobile est la plus solide : l’anglais. Supertonic 3 prend en charge le français, le coréen, le japonais, l’espagnol, l’allemand et les autres langues de l’application.
Les deux moteurs fonctionnent localement. Changer de langue ne vous envoie pas vers un service cloud.
Ce qui influence la qualité réelle
Une même voix ne sonne pas aussi naturellement avec tous les textes :
- Ponctuation : virgules, points et paragraphes indiquent les pauses et l’intonation.
- Noms et termes spécialisés : noms rares, acronymes et marques peuvent nécessiter une petite correction.
- Longueur des phrases : un fragment très court peut être abrupt ; une phrase interminable peut sembler précipitée.
- Nombres et symboles : dates, chiffres romains et formules ont parfois plusieurs lectures possibles.
- Choix de la voix : une voix adaptée à un roman ne l’est pas forcément à la relecture d’un texte technique.
Local TTS normalise les cas courants et divise les textes longs en unités adaptées. Pour un meilleur résultat, conservez une ponctuation claire et testez plusieurs voix avec le contenu que vous écouterez réellement.
Impressionnant, mais pas infaillible
Le catalogue officiel précise que la qualité varie avec la quantité et la qualité des données d’entraînement. Les voix fonctionnent souvent mieux autour de 100 à 200 tokens ; les énoncés très courts peuvent être moins bons et les très longs devenir rapides. Local TTS réduit ces extrêmes par une préparation et un découpage par phrases, sans pouvoir garantir chaque prononciation.
Kokoro est aussi un modèle à poids ouverts, pas une publication open source complète de l’entraînement. Les poids sont sous licence Apache, mais l’encodeur et le système d’entraînement complet ne sont pas publiés selon la fiche du modèle.
Pour les contenus où la prononciation est critique, vérifiez noms, abréviations et vocabulaire technique avant export ou publication. Tout audio partagé doit également être identifié comme voix synthétique.
Questions fréquentes
Local TTS utilise-t-il vraiment Kokoro-82M ?
Oui. Kokoro-82M v1.0 alimente les voix neuronales américaines et britanniques. Le modèle et les données vocales sont intégrés pour fonctionner sur l’appareil.
Cela fonctionne-t-il sans Internet ?
Oui. Une fois Local TTS installé, la génération vocale fonctionne hors ligne.
Combien de voix Kokoro sont disponibles ?
Le catalogue complet contient 28 voix anglaises : 20 américaines et 8 britanniques. La version gratuite inclut trois voix anglaises sélectionnées et la voix multilingue.
Mon PDF ou mon texte est-il envoyé quelque part ?
Non. Import, texte collé, OCR et génération vocale sont traités sur l’appareil. Il n’y a ni compte, ni publicité, ni suivi.
Dois-je télécharger Kokoro séparément ?
Non. Vous n’avez besoin ni de Hugging Face, ni de Python, ni de ligne de commande ou de clé API.
Kokoro est-il utilisé pour le français et les autres langues ?
Pas dans Local TTS. Kokoro alimente le catalogue anglais ; Supertonic 3 fournit la voix sur l’appareil dans 31 langues.
Écoutez Kokoro-82M avec votre propre texte
Kokoro-82M rend la voix neuronale naturelle utilisable au-delà d’une démo ou d’une API cloud. Local TTS y ajoute l’import de documents, l’OCR, le suivi de lecture, la lecture en arrière-plan, les réglages vocaux et l’export audio.
Collez un paragraphe, importez le PDF que vous vouliez lire ou photographiez une page imprimée. Choisissez une voix anglaise et écoutez : votre texte reste sur votre appareil du début à la fin.
Téléchargez gratuitement Local TTS sur l’App Store et écoutez Kokoro-82M sur votre iPhone ou iPad.
Chaque texte devient une voix — hors ligne
Local TTS lit les PDF, e-books et articles à voix haute directement sur votre iPhone — en privé, naturellement.
Télécharger sur l'App Store