
Inhoud
- Het antwoord in één zin
- Wat is Kokoro-82M?
- Waarom 82 miljoen parameters op een telefoon uitmaken
- Waarom Local TTS Kokoro-82M gebruikt
- Levert Kokoro alle 31 talen van Local TTS?
- Wat beïnvloedt de stemkwaliteit in de praktijk?
- Kokoro is indrukwekkend, niet onfeilbaar
- Veelgestelde vragen
- Hoor Kokoro-82M op je eigen tekst
Wanneer een voorleesapp een pagina hardop leest, zijn de knoppen die je ziet maar een deel van de ervaring. Het model erachter bepaalt of een stem natuurlijk klinkt, een gelijkmatig ritme houdt, een zin helder uitspreekt en snel genoeg reageert om als voorlezer aan te voelen in plaats van als renderklus.
Local TTS gebruikt Kokoro-82M voor zijn Amerikaanse en Britse Engelse neurale stemmen. Het model is klein genoeg om op een iPhone of iPad te draaien, en tegelijk sterk genoeg om lang luisteren natuurlijk te laten aanvoelen. Het belangrijkste: de tekst en de gegenereerde spraak blijven op je toestel.
Je hebt geen Python, terminal, modelbestanden of API-sleutel nodig. Plak tekst, importeer een document of scan een gedrukte pagina in Local TTS en druk op afspelen.
Officiële afbeelding en technische bronnen: de omslag is de officiële socialevoorbeeldafbeelding van Hugging Face voor de modelrepository hexgrad/Kokoro-82M, ongewijzigd gebruikt — geen door AI gegenereerde illustratie. De details hieronder over architectuur, uitgave, training en licentie zijn ontleend aan die modelkaart; het aantal stemmen en de kwaliteitsgrenzen aan het officiële VOICES.md.
Het antwoord in één zin
Kokoro-82M is een tekst-naar-spraakmodel met open gewichten en 82 miljoen parameters dat natuurlijke spraak op 24 kHz levert met veel minder rekenkracht dan veel grotere stemmodellen — en daarmee goed past bij privé voorlezen op het toestel zelf.
Die balans telt. Een model kan schitterend klinken op een server met een krachtige GPU en toch de verkeerde keuze zijn voor een telefoon. Local TTS heeft natuurlijke spraak nodig, praktisch geheugengebruik, vlot afspelen en geen gang naar een cloud-API. Kokoro maakt die combinatie mogelijk voor het Engels.
Wat is Kokoro-82M?
Kokoro-82M is een neuraal tekst-naar-spraakmodel gemaakt door hexgrad. “82M” verwijst naar de ongeveer 82 miljoen parameters. De officiële Kokoro-modelkaart beschrijft het als een model met open gewichten, ontworpen om kwaliteit te bieden die vergelijkbaar is met grotere systemen terwijl het sneller en goedkoper blijft.
Versie 1.0 verscheen op 27 januari 2025. Volgens de modelkaart is het getraind op enkele honderden uren audio met een ruime licentie, uit het publieke domein en synthetisch. De gewichten vallen onder de Apache 2.0-licentie.
| Kokoro-82M v1.0 | |
|---|---|
| Parameters | 82 miljoen |
| Uitgavedatum | 27 januari 2025 |
| Uitvoer | spraak op 24 kHz |
| Openbare stemmenverzameling | 54 stemmen in 8 talen |
| Gebruik in Local TTS | 28 Amerikaanse en Britse Engelse stemmen |
| Licentie modelgewichten | Apache 2.0 |
| Verwerking in Local TTS | op het toestel; geen spraakserver nodig |
Kokoro put uit StyleTTS 2, een systeem ontworpen om expressieve spreekstijlen te modelleren, en ISTFTNet, een lichte neurale vocoder die modeluitvoer efficiënt omzet in een audiogolfvorm. De publieke Kokoro-uitgave is niet het volledige trainingssysteem van StyleTTS 2: de modelkaart omschrijft het als alleen-decoder, zonder het diffusieonderdeel en zonder vrijgegeven encoder.
Eenvoudig gezegd bundelt Kokoro precies het deel dat nodig is om fonetische tekst en een gekozen stemstijl om te zetten in audio, zonder het gewicht van een veel groter algemeen AI-model mee te dragen.
Waarom 82 miljoen parameters op een telefoon uitmaken
Het aantal parameters is geen cijfer voor kwaliteit. Een groter model vangt misschien meer nuance, maar vraagt doorgaans ook meer geheugen, rekenkracht, energie en tijd. Die kosten worden zichtbaar zodra een app een hoofdstuk moet voorlezen in plaats van één korte demozin te genereren.
Door zijn compacte formaat laat Kokoro ruimte over voor Local TTS om er een volledige leeservaring omheen te bouwen:
- Generatie op het toestel: spraak ontstaat lokaal in plaats van te wachten op een externe server.
- Vlot voorlezen: de app kan volgende zinnen klaarzetten terwijl de huidige zin speelt.
- Bruikbaar bij lange teksten: PDF’s, EPUB’s en artikelen zijn te lezen zonder per teken te betalen aan een spraak-API.
- Offline beschikbaar: de stem werkt ook in het vliegtuig, onderweg of waar de verbinding onbetrouwbaar is.
- Privacy door architectuur: je geplakte tekst en geïmporteerde documenten hoeven niet te worden geüpload om spraak te maken.
Daarom is “klein” hier een productvoordeel. Het doel is niet een wedstrijd in parameteraantallen winnen, maar hoogwaardige spraak beschikbaar maken op het moment dat je op afspelen tikt.
Waarom Local TTS Kokoro-82M gebruikt
Een model in een echte leesapp gebruiken vraagt meer dan gewichten in het app-pakket zetten. De tekst moet worden genormaliseerd, op zinnige plekken opgedeeld, vóór het afspelen omgezet in spraak, gebufferd, gemarkeerd en doorspelend gehouden wanneer het scherm op slot gaat.
1. Natuurlijke Amerikaanse en Britse Engelse stemmen
Kokoro v1.0 publiceert 20 Amerikaans-Engelse en 8 Brits-Engelse stemmen in zijn officiële stemmencatalogus. Local TTS neemt alle 28 Engelse stemmen op in de volledige catalogus, met verschillende accenten, geslachten en stemkarakters.
Drie hoogwaardige Engelse stemmen zitten in de gratis versie, zodat je het model op je eigen tekst kunt horen voordat je beslist of je Pro nodig hebt.
2. Het model zit erin, het wordt niet via een API aangeroepen
Local TTS draagt het spraakmodel met de app mee. Wanneer je tekst invoert, zet de app die op je iPhone of iPad om in spraak. Er is geen spraakleverancier die het document ontvangt, geen serverwachtrij en geen account vereist.
Dat is vooral nuttig voor materiaal dat je liever niet in een onlinedienst plakt: een ongepubliceerd manuscript, een werkdocument, een persoonlijke notitie of studiemateriaal. Gebruik je iCloud-synchronisatie, dan kunnen je notities via je eigen iCloud-account synchroniseren; het genereren van spraak blijft op het toestel gebeuren.
3. Twee geoptimaliseerde paden houden luisteren praktisch
Local TTS gebruikt Apple’s MLX- en Metal-technologie voor vlotte generatie op de voorgrond. Daarnaast gebruikt het een geoptimaliseerd Core ML-pad, zodat spraak klaargezet kan blijven worden tijdens afspelen op de achtergrond en bij audio-export, zonder afhankelijk te zijn van een cloud-terugval.
Je hoeft geen van beide paden te beheren. De app kiest de passende engine en houdt dezelfde stem en leesbediening aan.
4. Van stemmodel naar volledige lezer
Kokoro genereert spraak. Local TTS maakt daarvan iets dat je dagelijks kunt gebruiken:
- Plak een artikel of schrijf een notitie.
- Importeer PDF-, EPUB-, Word-, TXT- en Markdown-bestanden.
- Scan een gedrukte pagina met tekstherkenning op het toestel.
- Volg de markering per woord tijdens het afspelen.
- Wijzig stem en leessnelheid per notitie.
- Luister door vanaf het toegangsscherm of het bedieningspaneel.
- Exporteer spraak als M4A-bestand met Pro.
Download Local TTS gratis in de App Store om Kokoro-82M te proberen zonder een model te installeren of een terminal te openen.
Levert Kokoro alle 31 talen van Local TTS?
Nee — en dat onderscheid is belangrijk. Kokoro verzorgt de Amerikaanse en Britse Engelse stemmencatalogus van Local TTS. De 31-talige stem van de app draait op Supertonic 3, een aparte meertalige spraakengine op het toestel.
Onze gids over Supertonic 3 laat zien hoe één stem van Local TTS alle 31 ondersteunde talen offline leest.
De publieke uitgave van Kokoro v1.0 bevat stemmen in acht talen, maar de stemnotities van het project waarschuwen dat ondersteuning buiten het Engels dun kan zijn, omdat uitspraakgereedschap en trainingsdata per taal verschillen. Local TTS zet Kokoro nu in waar de mobiele uitvoering het sterkst is: het Engels. Supertonic 3 verzorgt Koreaans, Japans, Spaans, Frans, Duits en de overige ondersteunde talen van de app.
Beide engines draaien lokaal. Een andere taal kiezen brengt je niet naar een clouddienst.
Wat beïnvloedt de stemkwaliteit in de praktijk?
Dezelfde stem klinkt niet op elke tekst even natuurlijk. Deze details maken merkbaar verschil:
- Interpunctie: komma’s, punten en alinea-einden geven het model bruikbare aanwijzingen voor de frasering.
- Namen en vaktermen: ongebruikelijke namen, afkortingen en merknamen vragen soms een fonetische spelling of een kleine tekstaanpassing.
- Zinslengte: heel korte fragmenten kunnen abrupt klinken, terwijl zeer lange doorlopende zinnen gejaagd kunnen overkomen.
- Getallen en symbolen: data, Romeinse cijfers, formules en ongewone symbolen kunnen uitgesproken meerduidig zijn.
- Stemkeuze: een stem die goed werkt voor een roman kan minder geschikt voelen voor nalezen of technische notities.
Local TTS normaliseert veelvoorkomende randgevallen en splitst lange tekst in werkbare synthesestukken. Voor het beste resultaat houd je de brontekst goed geïnterpungeerd en beluister je een paar stemmen met het materiaal dat je echt wilt horen.
Kokoro is indrukwekkend, niet onfeilbaar
De officiële stemmencatalogus vermeldt dat de stemkwaliteit varieert met de hoeveelheid en kwaliteit van de trainingsdata. Er staat ook dat stemmen doorgaans het best werken in een middenbereik van ruwweg 100–200 tokens; zeer korte uitingen kunnen zwakker zijn en zeer lange kunnen jachtig worden. Local TTS dempt die uitersten met zinsbewuste voorbereiding en opdeling, maar kan niet elke uitspraak perfect maken.
Kokoro is bovendien een model met open gewichten, geen volledige opensource-trainingsuitgave. De te downloaden gewichten vallen onder Apache, terwijl de modelkaart aangeeft dat de encoder en het volledige trainingssysteem niet zijn vrijgegeven.
Voor werk waarin uitspraak kritiek is: beluister het resultaat vooraf en controleer namen, afkortingen en vaktaal voordat je de audio exporteert of publiceert. Gedeelde audio hoort ook als synthetisch gegenereerde spraak te worden aangeduid.
Veelgestelde vragen
Gebruikt Local TTS echt Kokoro-82M?
Ja. Kokoro-82M v1.0 verzorgt de Amerikaanse en Britse Engelse neurale stemmen in Local TTS. De modelgewichten en stemdata worden meegeleverd voor gebruik op het toestel.
Werkt het zonder internet?
Ja. Zodra Local TTS is geïnstalleerd, werkt het genereren van spraak offline. Er is geen internetverbinding nodig om je tekst in audio om te zetten.
Hoeveel Kokoro-stemmen zitten er in Local TTS?
De volledige catalogus van Local TTS bevat 28 Engelse Kokoro-stemmen: 20 Amerikaanse en 8 Britse. De gratis versie bevat drie geselecteerde Engelse stemmen, plus de meertalige stem van de app.
Uploadt Local TTS mijn PDF of tekst om spraak te maken?
Nee. Geïmporteerde bestanden, geplakte tekst, tekstherkenning en spraakgeneratie worden op het toestel verwerkt. Er is geen account, geen reclame en geen tracking.
Moet ik Kokoro apart downloaden?
Nee. Je hebt geen Hugging Face, Python, opdrachtregel of API-sleutel nodig. Local TTS bundelt het model en de leesinterface.
Wordt Kokoro gebruikt voor Koreaans en de andere ondersteunde talen?
Niet in Local TTS. Kokoro wordt gebruikt voor de Engelse catalogus; Supertonic 3 levert de 31-talige stem van de app op het toestel.
Hoor Kokoro-82M op je eigen tekst
Kokoro-82M doet ertoe omdat het natuurlijke neurale spraak praktisch maakt buiten een demopagina of cloud-API. Local TTS brengt dat model in een offline lezer met documentimport, tekstherkenning, markering, afspelen op de achtergrond, stembediening en audio-export.
Plak een alinea, importeer die PDF die je al een tijd wilt lezen, of fotografeer een gedrukte pagina. Kies dan een Engelse stem en luister — je tekst blijft van begin tot eind op je toestel.
Download Local TTS gratis in de App Store en hoor Kokoro-82M op je iPhone of iPad.
Zet elke tekst om in spraak — offline
Local TTS leest pdf’s, e-books en artikelen voor op je iPhone — privé, natuurlijk en van jou.
Download in de App Store