Ga naar de hoofdinhoud
AI

Kokoro-82M vs Supertonic 3: waarom Local TTS beide draait

Local TTS9 min

Officiële benchmarks laten zien dat elk model een andere race wint. Bekijk de cijfers achter Local TTS en waarom de app Kokoro-82M en Supertonic 3 combineert op je apparaat.

Local TTS wordt geleverd met twee neurale spraakmodellen in plaats van één. Kokoro-82M verzorgt de Amerikaans- en Brits-Engelse stemmen, Supertonic 3 de meertalige stem die 31 talen leest. Beide draaien volledig op je iPhone of iPad.

Waarom zou je twee modellen inbouwen als de app met één kleiner en eenvoudiger zou zijn? Omdat de gepubliceerde benchmarks een duidelijk antwoord geven: geen enkel compact on-device model wint op dit moment tegelijk op natuurlijkheid, leesnauwkeurigheid, snelheid én taaldekking. Elk van deze twee wint een andere race, en door ze te combineren kan Local TTS elk model precies daar inzetten waar het het sterkst is.

In dit artikel lopen we de officiële evaluatieresultaten achter die keuze door: wat de makers van de modellen hebben gemeten, wat onafhankelijke tests uitwezen en wat dat betekent voor de voorlezer die je uiteindelijk hoort.

Bronnen en omslagafbeelding: de omslag is Supertone’s onbewerkte officiële grafiek van de leesnauwkeurigheid uit de Supertonic-repository. De Kokoro-cijfers komen van de officiële hexgrad/Kokoro-82M-modelkaart, de Supertonic-cijfers uit Supertone’s officiële repository en modelkaart, en de directe CPU-vergelijking uit een onafhankelijke benchmark van een derde partij. Alle cijfers zijn door hun makers op eigen hardware gemeten, niet op een iPhone.

Het antwoord in één zin

Kokoro-82M staat bovenaan bij menselijke beoordelingen van natuurlijkheid voor Engels; Supertonic 3 is het snelst op een gewone CPU en leest 31 talen met concurrerende nauwkeurigheid. Daarom stuurt Local TTS Engels naar Kokoro en al het meertalige naar Supertonic 3 — allemaal op je eigen apparaat.

Hoe je de prestaties van tekst-naar-spraak meet

Voor een voorlees-app tellen vier metingen, en het helpt om te weten wat ze betekenen voordat je naar de cijfers kijkt:

  1. Natuurlijkheid wordt door mensen beoordeeld. De bekendste openbare test is een blinde arena: luisteraars horen twee anonieme fragmenten en stemmen op het natuurlijkste, wat een Elo-achtige ranglijst oplevert waar marketing geen vat op heeft.
  2. Leesnauwkeurigheid kijkt of het model de aangeleverde tekst ook echt heeft uitgesproken — geen overgeslagen, herhaalde of verhaspelde woorden. De score heet word error rate (WER) of character error rate (CER): de gegenereerde audio wordt automatisch teruggezet naar tekst en vergeleken met het origineel. Lager is beter.
  3. Snelheid wordt uitgedrukt als de realtimefactor (RTF): de synthesetijd gedeeld door de duur van de audio. Een RTF van 0,3 betekent dat één seconde spraak 0,3 seconden kost om te genereren — ongeveer 3,3× sneller dan realtime. Lager is sneller.
  4. Omvang gaat over parameters, downloadgrootte en geheugen: het verschil tussen een model dat in een telefoon-app past en een model dat een server-GPU nodig heeft.

Een cloudstem kan met datacenterhardware op alle vier tegelijk jagen. Een model op je telefoon moet keuzes maken, en precies daar gaan de twee modellen uit elkaar.

Wat de benchmarks zeggen over Kokoro-82M

Het belangrijkste resultaat van Kokoro-82M is een ranglijst op basis van menselijke voorkeur. Vóór de release van v1.0 meldde de officiële modelkaart dat Kokoro v0.19 op nummer 1 stond in de TTS Spaces Arena, de blinde luisterarena op Hugging Face — met een hogere Elo-score dan modellen die vele malen groter zijn, waaronder XTTS v2 (467 miljoen parameters) en MetaVoice (1,2 miljard parameters), terwijl het op slechts een paar honderd uur audio is getraind.

Dat is een opvallend resultaat dat even aandacht verdient. In een test waarin luisteraars geen modelnamen of parameteraantallen te zien kregen, verkozen ze een model van 82 miljoen parameters boven systemen met miljarden parameters. Voor Engelse natuurlijkheid per eenheid rekenkracht zette Kokoro de standaard voor compacte modellen.

Kokoro-82M v1.0
Parameters82 miljoen
Menselijke evaluatiev0.19 stond op nummer 1 in de TTS Spaces Arena
UitvoerSpraak op 24 kHz
Stemmen54 publieke stemmen; 28 Engelse stemmen in Local TTS
LicentieApache 2.0
Rol in Local TTSCatalogus voor Amerikaans en Brits Engels

De keerzijde is dekking. De publieke release van Kokoro omvat acht talen, maar de eigen stemcatalogus merkt op dat de kwaliteit buiten het Engels afhangt van de beschikbare trainingsdata. Het is een specialist: uitzonderlijk goed in Engels, mager daarbuiten.

Wat de benchmarks zeggen over Supertonic 3

Supertonic 3, op 29 april 2026 uitgebracht door Supertone, wordt in de omgekeerde richting geëvalueerd: breedte en efficiëntie. De officiële repository publiceert leesnauwkeurigheidsresultaten op de Minimax-MLS-test-benchmark, waarin het model van ongeveer 99 miljoen parameters wordt vergeleken met veel grotere open TTS-systemen zoals VoxCPM2, OmniVoice en Qwen3-TTS.

Dit zijn de door Supertone gepubliceerde foutpercentages voor de elf talen waarin deze website is geschreven (lager is beter; * markeert character error rate, de rest is word error rate):

TaalVoxCPM2OmniVoiceQwen3-TTSSupertonic 3
Engels2,112,022,252,06
Koreaans*4,703,224,073,26
Japans*3,353,813,674,61
Duits0,850,960,520,86
Frans4,414,743,824,89
Spaans1,340,990,751,13
Portugees1,741,401,212,48
Italiaans1,741,291,401,75
Nederlands0,840,771,47
Pools1,300,641,63
Turks0,882,181,00

Supertonic 3 wint niet elke rij, en dat beweert Supertone ook niet. De officiële conclusie is nuttiger: het blijft binnen de concurrerende foutmarge van modellen die meerdere malen groter zijn, over 31 talen, en is tegelijk klein genoeg om zonder GPU te draaien.

Snelheid is waar de cijfers eruit springen. Supertone demonstreert Supertonic 3 op hardware die veel zwakker is dan een moderne iPhone: een Onyx Boox Go 6 e-reader in vliegtuigmodus met een gemiddelde RTF van 0,3× — ongeveer drie keer sneller dan realtime, op een e-reader — en realtime synthese op een Raspberry Pi. De officiële runtimevergelijking laat het model snel draaien op gewone CPU’s, zelfs afgezet tegen grotere modellen die op een NVIDIA A100-server-GPU zijn gemeten, en dat met aanzienlijk minder geheugen.

Officiële Supertonic-runtimegrafiek die CPU-snelheid en geheugengebruik vergelijkt met grotere modellen, gemeten op een A100-GPU

Bron: Supertone’s officiële runtimegrafiek, onbewerkt overgenomen.

Supertonic 3
ParametersOngeveer 99 miljoen
LeesnauwkeurigheidConcurrerende WER/CER t.o.v. veel grotere modellen
Gedemonstreerde snelheidRTF 0,3× op een e-reader; realtime op een Pi
UitvoerSpraak op 44,1 kHz
Talen31
LicentieOpenRAIL-M
Rol in Local TTSDe meertalige stem met 31 talen

De directe vergelijking die onze keuze verklaart

De meest directe vergelijking komt van een onafhankelijke benchmark van een derde partij die beide modellen op dezelfde bescheiden 4-core CPU zonder GPU liet draaien — omstandigheden die dichter bij een telefoon liggen dan bij een AI-server. Twee resultaten tellen:

  • Snelheid: Supertonic 3 synthetiseerde op de standaard kwaliteitsinstelling met RTF 0,313 — ongeveer 3,2× sneller dan realtime — terwijl Kokoro-82M op RTF 0,469–0,509 uitkwam, ongeveer 2× realtime. Beide zijn op een kleine CPU sneller dan realtime; Supertonic heeft de grootste marge.
  • Natuurlijkheid: dezelfde test beoordeelde de Engelse uitvoer van Kokoro als het meest menselijk, met natuurlijke intonatie, terwijl de snelste instellingen van Supertonic vlakker klonken.

Met andere woorden: een onafhankelijke tester zonder belang bij een van beide modellen kwam tot dezelfde conclusie als de officiële cijfers. Kokoro wint op Engelse natuurlijkheid, Supertonic 3 wint op snelheid en breedte. Wie één model moet kiezen, levert dus altijd iets in. Local TTS koos ervoor om niet te kiezen.

Waarom Local TTS de twee modellen combineert

Binnen Local TTS zitten beide engines achter één en dezelfde voorlezer. Elke stem in de stemmenlijst hoort bij een van de twee modellen, en zodra je een stem kiest, stuurt de app de synthese automatisch naar de juiste engine — dezelfde afspeelknop, dezelfde markering, dezelfde snelheidsregeling, dezelfde offline garantie.

Engels gaat naar Kokoro-82M

De reden zijn de menselijke voorkeursresultaten. Als luisteraars een 82M-model voor Engels consequent boven systemen met miljarden parameters plaatsen, dan is dat het model dat jouw Engelse audioboeken, artikelen en pdf’s verdienen. Local TTS bundelt alle 28 Amerikaans- en Brits-Engelse stemmen van Kokoro en draait ze via een Core ML-pijplijn die is afgestemd op Apple silicon. Die levert ook de woordtiming voor de woord-voor-woordmarkering — en blijft synthetiseren tijdens het afspelen op de achtergrond.

Al het meertalige gaat naar Supertonic 3

De reden zijn dekking en efficiëntie. Eén meegeleverd Supertonic 3-model leest Koreaans, Japans, Duits, Frans, Spaans en 26 andere talen op 44,1 kHz, met foutpercentages die kunnen wedijveren met veel grotere systemen. En omdat het model voor de CPU is ontworpen, blijven voorlezen op de achtergrond en lange documenten haalbaar op een batterij. Tien vaste stijlen (F1–F5, M1–M5) lezen elk alle 31 talen, zodat een document dat van taal wisselt één consistente stem houdt.

Wat de combinatie voorkomt

  • Een app met alleen Engels. Met alleen Kokoro zouden 30 talen zonder sterke stem zitten.
  • Eén vlakkere Engelse stem. Met alleen Supertonic zou de arena-winnende Engelse natuurlijkheid verdwijnen, samen met de catalogus van 28 Engelse stemmen.
  • Terugvallen op de cloud. Beide modellen zijn klein genoeg om mee te leveren, dus er verlaat nooit tekst je apparaat om “het betere model op een server” te bereiken.

Dit gecombineerde ontwerp kost wat opslagruimte en extra techniek, en dat vinden wij een goede ruil: de benchmarks hierboven zijn er in feite de specificatie van.

Download Local TTS gratis in de App Store en vergelijk beide engines met je eigen tekst — drie Engelse Kokoro-stemmen en één meertalige Supertonic 3-stem zijn gratis.

Hoe je deze cijfers eerlijk leest

Benchmarks onderbouwen een keuze; ze sluiten de discussie niet af. Houd vier kanttekeningen in gedachten:

  1. De originele cijfers zijn niet op een iPhone gemeten. Arena-ranglijsten, WER-tabellen en RTF-waarden komen van de hardware van hun makers. De prestaties in Local TTS hangen af van je toestel, je tekst en je instellingen; de rangorde tussen de modellen bleef echter overeind in alle onafhankelijke CPU-tests die we konden vinden.
  2. Arena-ranglijsten verschuiven. De nummer 1-notering van Kokoro is het officiële resultaat uit het evaluatievenster van v0.19; er komen elke maand nieuwe modellen bij. Wat het resultaat blijvend aantoonde, is dat compacte modellen blinde Engelse luistertests kunnen winnen.
  3. WER/CER wordt gescoord door automatische transcriptie. Het meet of woorden correct zijn uitgesproken, niet of de voordracht mooi klinkt — dat meet juist de menselijke arena. Daarom loont het om beide cijfers samen te lezen.
  4. Snelheidsinstellingen kosten kwaliteit. De allersnelste configuraties van Supertonic leveren natuurlijkheid in. Local TTS gebruikt de gebalanceerde instelling, niet de instelling die de mooiste kop oplevert.

Veelgestelde vragen

Draait Local TTS beide modellen echt op het apparaat?

Ja. Kokoro-82M en Supertonic 3 worden allebei met de app meegeleverd. Tekst, documenten en gegenereerde audio worden op je iPhone of iPad verwerkt, zonder spraakserver.

Welk model hoor ik nu eigenlijk?

Dat volgt je stemkeuze. De 28 Amerikaans- en Brits-Engelse stemmen zijn Kokoro-82M; de tien meertalige stijlen (F1–F5, M1–M5) zijn Supertonic 3. Je kunt per notitie op elk moment wisselen.

Waarom niet gewoon de grotere benchmarkwinnaars zoals VoxCPM2 of Qwen3-TTS gebruiken?

Die systemen zijn meerdere malen groter en worden gebenchmarkt op server-GPU’s. Local TTS is gebouwd rond modellen die offline op een telefoon draaien; binnen die beperking zijn deze twee de sterkste gepubliceerde combinatie die wij kennen.

Is Kokoro sneller of Supertonic?

Op dezelfde kleine CPU mat een onafhankelijke test Supertonic 3 op ruwweg 3× realtime en Kokoro op ruwweg 2× realtime. Beide zijn ruim snel genoeg om in Local TTS ononderbroken voor te lezen.

Klinken de twee engines verschillend?

Ja, bewust. Kokoro-stemmen zijn individuele Engelse persoonlijkheden; Supertonic-stijlen zijn consistente meertalige vertellers. Beluister een paar stemmen met je eigen tekst — de gratis versie bevat beide engines.

Heb ik hiervoor internet nodig?

Nee. Beide modellen genereren spraak offline. Vliegtuigmodus is een prima manier om die belofte te testen.

Beluister de benchmarks zelf

Cijfers verklaren een ontwerp; je oren bevestigen het. Plak een Engels artikel en luister naar een Kokoro-stem, plak daarna een Nederlandse, Duitse of Spaanse alinea en hoor Supertonic 3 het overnemen — dezelfde app, dezelfde privacy, geen cloud ertussen.

Download Local TTS gratis in de App Store en hoor waarom we twee modellen draaien in plaats van één.

Wil je dieper op de afzonderlijke engines ingaan, lees dan onze Kokoro-82M-gids (Engels) en onze Supertonic 3-gids.

Zet elke tekst om in spraak — offline

Local TTS leest pdf’s, e-books en artikelen voor op je iPhone — privé, natuurlijk en van jou.

Download in de App Store