KI

Kokoro-82M erklärt: Darum nutzt Local TTS das Modell lokal

Local TTS 7 min

Erfahren Sie, warum Kokoro-82M klein und natürlich klingt, wo seine Grenzen liegen und wie Local TTS englische Sprache offline auf iPhone und iPad erzeugt.

Bei einer Vorlese-App sind die sichtbaren Bedienelemente nur ein Teil des Erlebnisses. Das Modell dahinter bestimmt, ob eine Stimme natürlich klingt, ihr Rhythmus stimmt, Sätze verständlich ausgesprochen werden und die Wiedergabe ohne lange Wartezeit beginnt.

Local TTS verwendet Kokoro-82M für seine neuronalen Stimmen in amerikanischem und britischem Englisch. Das Modell ist klein genug, um direkt auf einem iPhone oder iPad zu laufen, und leistungsfähig genug für angenehm klingende längere Texte. Text und erzeugte Sprache bleiben dabei auf Ihrem Gerät.

Sie benötigen weder Python noch Terminal, Modelldateien oder API-Schlüssel. Fügen Sie Text ein, importieren Sie ein Dokument oder fotografieren Sie eine gedruckte Seite und tippen Sie auf Wiedergabe.

Offizielles Bild und technische Quellen: Das Titelbild ist Hugging Face’s unveränderte Social-Preview für das offizielle hexgrad/Kokoro-82M-Modell-Repository und keine KI-generierte Illustration. Angaben zu Architektur, Veröffentlichung, Training und Lizenz stammen aus der Modellkarte; Stimmenzahlen und Qualitätsgrenzen aus der offiziellen VOICES.md.

Die Antwort in einem Satz

Kokoro-82M ist ein Open-Weight-TTS-Modell mit 82 Millionen Parametern, das natürliche Sprache mit 24 kHz und deutlich weniger Rechenaufwand als viele größere Sprachmodelle erzeugt – ideal für privates Vorlesen direkt auf dem Gerät.

Ein Modell kann auf einem leistungsstarken Server hervorragend klingen und dennoch ungeeignet für ein Smartphone sein. Local TTS braucht natürliche Qualität, vertretbaren Speicherbedarf, schnelle Wiedergabe und keinen Umweg über eine Cloud-API. Kokoro ermöglicht diese Kombination für englische Stimmen.

Was ist Kokoro-82M?

Kokoro-82M ist ein neuronales Text-to-Speech-Modell von hexgrad. „82M“ steht für rund 82 Millionen Parameter. Die offizielle Kokoro-Modellkarte beschreibt es als Open-Weight-Modell, das eine mit größeren Systemen vergleichbare Qualität anstrebt, zugleich aber schneller und kostengünstiger ist.

Version 1.0 erschien am 27. Januar 2025. Laut Modellkarte wurde sie mit einigen Hundert Stunden zulässiger, gemeinfreier und synthetischer Audiodaten trainiert. Die Gewichte stehen unter Apache 2.0.

MerkmalKokoro-82M v1.0
Parameter82 Millionen
Veröffentlichung27. Januar 2025
AusgabeSprache mit 24 kHz
Öffentliche Stimmen54 Stimmen in 8 Sprachen
Nutzung in Local TTS28 US- und britisch-englische Stimmen
Lizenz der GewichteApache 2.0
VerarbeitungAuf dem Gerät, ohne TTS-Server

Kokoro baut auf StyleTTS 2 für ausdrucksstarke Sprechstile und ISTFTNet, einem effizienten neuronalen Vocoder zur Erzeugung der Audiowellenform, auf. Die öffentliche Version enthält jedoch nicht das vollständige StyleTTS-2-Trainingssystem. Laut Modellkarte ist sie nur der Decoder, ohne Diffusionskomponente oder veröffentlichten Encoder.

Warum 82 Millionen Parameter auf dem Smartphone zählen

Die Parameterzahl ist keine Qualitätsnote. Größere Modelle können mehr Nuancen erfassen, benötigen in der Regel aber auch mehr Speicher, Rechenleistung, Energie und Zeit. Beim Vorlesen eines Kapitels statt eines kurzen Demosatzes werden diese Kosten schnell sichtbar.

Die kompakte Größe von Kokoro lässt Local TTS eine vollständige Leseerfahrung um das Modell herum bauen:

  • Lokale Erzeugung: Sprache entsteht auf dem Gerät statt auf einem entfernten Server.
  • Schnelle Wiedergabe: Während ein Satz läuft, kann der nächste vorbereitet werden.
  • Praktisch für lange Texte: PDFs, EPUBs und Artikel ohne API-Gebühr pro Zeichen hören.
  • Offline verfügbar: Auch im Flugzeug oder ohne zuverlässige Verbindung nutzbar.
  • Privat durch die Architektur: Eingefügte Texte und Dokumente müssen nicht hochgeladen werden.

„Klein“ ist hier ein Produktvorteil. Entscheidend ist nicht der größte Parameterwert, sondern hochwertige Sprache in dem Moment, in dem Sie auf Wiedergabe tippen.

Warum Local TTS Kokoro-82M verwendet

Ein Modell in eine echte Lese-App zu integrieren, bedeutet mehr als Gewichte ins App-Paket zu legen. Text muss normalisiert, sinnvoll geteilt, vorausberechnet, zwischengespeichert und hervorgehoben werden. Die Wiedergabe soll außerdem bei gesperrtem Bildschirm weiterlaufen.

1. Natürliche Stimmen in US- und britischem Englisch

Der offizielle Stimmenkatalog von Kokoro v1.0 enthält 20 amerikanische und 8 britische Stimmen. Im vollständigen Katalog von Local TTS stehen alle 28 mit unterschiedlichen Akzenten, Geschlechtern und Stimmcharakteren bereit.

Drei ausgewählte englische Stimmen sind kostenlos enthalten. So können Sie Kokoro mit Ihrem eigenen Text testen, bevor Sie sich für Pro entscheiden.

2. Integriertes Modell statt API-Aufruf

Local TTS liefert das Sprachmodell mit der App aus. Ihr iPhone oder iPad wandelt den Text direkt in Sprache um. Es gibt keinen TTS-Anbieter, der Ihr Dokument erhält, keine Serverwarteschlange und kein erforderliches Konto.

Das ist besonders wertvoll für unveröffentlichte Manuskripte, Arbeitsunterlagen, persönliche Notizen oder Lernmaterial. Bei aktivierter iCloud-Synchronisierung können Notizen über Ihr eigenes iCloud-Konto synchronisiert werden; die Spracherzeugung findet weiterhin lokal statt.

3. Zwei optimierte Ausführungspfade

Local TTS nutzt Apples MLX- und Metal-Technologien für reaktionsschnelle Erzeugung im Vordergrund. Ein optimierter Core-ML-Pfad bereitet Sprache auch bei Hintergrundwiedergabe und Audioexport weiter vor – ohne Rückgriff auf die Cloud.

Sie müssen nichts umschalten. Die App wählt den passenden Pfad und behält dieselbe Stimme und Bedienung bei.

4. Vom Sprachmodell zum vollständigen Reader

Kokoro erzeugt Sprache. Local TTS macht daraus ein Werkzeug für den Alltag:

  • Artikel einfügen oder eigene Notizen schreiben
  • PDF, EPUB, Word, TXT und Markdown importieren
  • Gedruckte Seiten mit lokaler OCR fotografieren
  • Wörter während der Wiedergabe hervorheben
  • Stimme und Lesegeschwindigkeit pro Notiz wählen
  • Über Sperrbildschirm und Kontrollzentrum weiterhören
  • Mit Pro Sprache als M4A exportieren

Laden Sie Local TTS kostenlos im App Store und testen Sie Kokoro-82M ohne Modellinstallation oder Terminal.

Stammen alle 31 Sprachen von Kokoro?

Nein – diese Unterscheidung ist wichtig. Kokoro liefert den amerikanischen und britischen englischen Stimmenkatalog von Local TTS. Die 31-sprachige Stimme der App wird von Supertonic 3 erzeugt, einem separaten mehrsprachigen On-Device-TTS-Modell.

Unser Supertonic-3-Leitfaden zeigt, wie eine Local-TTS-Stimme alle 31 Sprachen offline liest.

Die öffentliche Kokoro-v1.0-Version enthält Stimmen in acht Sprachen. Die Projektdokumentation weist jedoch darauf hin, dass die Unterstützung außerhalb des Englischen wegen unterschiedlicher Aussprachewerkzeuge und Trainingsdaten dünn sein kann. Local TTS setzt Kokoro dort ein, wo die mobile Implementierung am stabilsten ist: im Englischen. Supertonic 3 übernimmt Deutsch, Koreanisch, Japanisch, Spanisch, Französisch und die übrigen unterstützten Sprachen.

Beide Engines laufen lokal. Ein Sprachwechsel führt nicht zu einem Cloud-Dienst.

Was beeinflusst die tatsächliche Sprachqualität?

Dieselbe Stimme klingt nicht bei jedem Text gleich natürlich:

  1. Satzzeichen: Kommas, Punkte und Absätze geben Hinweise für Pausen und Betonung.
  2. Namen und Fachbegriffe: Seltene Namen, Akronyme und Marken können eine Anpassung der Schreibweise benötigen.
  3. Satzlänge: Sehr kurze Fragmente wirken abrupt, extrem lange Sätze können gehetzt klingen.
  4. Zahlen und Symbole: Datumsangaben, römische Zahlen und Formeln sind beim Vorlesen mehrdeutig.
  5. Stimmenwahl: Eine Romanstimme ist nicht automatisch die beste zum Korrekturhören technischer Texte.

Local TTS normalisiert häufige Sonderfälle und teilt lange Texte in sinnvolle Einheiten. Verwenden Sie gut gesetzte Satzzeichen und testen Sie mehrere Stimmen mit dem Material, das Sie tatsächlich hören möchten.

Beeindruckend, aber nicht unfehlbar

Der offizielle Katalog erklärt, dass die Qualität je nach Menge und Güte der Trainingsdaten variiert. Stimmen funktionieren oft im mittleren Bereich von etwa 100–200 Token am besten; sehr kurze Äußerungen können schwächer sein, sehr lange schneller werden. Local TTS reduziert diese Extreme durch satzorientierte Vorbereitung und Aufteilung, kann aber nicht jede Aussprache perfektionieren.

Kokoro ist außerdem ein Open-Weight-Modell, keine vollständige Open-Source-Trainingsveröffentlichung. Die Gewichte sind Apache-lizenziert, Encoder und komplettes Trainingssystem laut Modellkarte jedoch nicht veröffentlicht.

Prüfen Sie bei aussprachekritischen Inhalten Namen, Abkürzungen und Fachsprache vor Export oder Veröffentlichung. Geteilte Audiodateien sollten als synthetisch erzeugte Sprache gekennzeichnet werden.

Häufig gestellte Fragen

Verwendet Local TTS wirklich Kokoro-82M?

Ja. Kokoro-82M v1.0 erzeugt die amerikanischen und britischen englischen Neuralstimmen. Modell und Stimmdaten sind für die lokale Nutzung in der App enthalten.

Funktioniert es ohne Internet?

Ja. Nach der Installation erzeugt Local TTS Sprache vollständig offline.

Wie viele Kokoro-Stimmen enthält Local TTS?

Der vollständige Katalog enthält 28 englische Stimmen: 20 amerikanische und 8 britische. Kostenlos sind drei ausgewählte englische Stimmen und die mehrsprachige Stimme enthalten.

Werden PDF oder Text hochgeladen?

Nein. Import, eingefügter Text, OCR und Spracherzeugung werden auf dem Gerät verarbeitet. Es gibt keine Konten, Werbung oder Nachverfolgung.

Muss ich Kokoro separat herunterladen?

Nein. Sie benötigen weder Hugging Face, Python, Kommandozeile noch API-Schlüssel.

Wird Kokoro auch für Deutsch und andere Sprachen verwendet?

Nicht in Local TTS. Kokoro liefert den englischen Katalog; Supertonic 3 stellt die 31-sprachige On-Device-Stimme bereit.

Hören Sie Kokoro-82M mit Ihrem eigenen Text

Kokoro-82M macht natürliche neuronale Sprache jenseits einer Demo oder Cloud-API praktisch. Local TTS ergänzt Dokumentimport, OCR, Hervorhebung, Hintergrundwiedergabe, Stimmsteuerung und Audioexport zu einem Offline-Reader.

Fügen Sie einen Absatz ein, importieren Sie das PDF, das Sie längst lesen wollten, oder fotografieren Sie eine gedruckte Seite. Wählen Sie eine englische Stimme und hören Sie zu – Ihr Text bleibt von Anfang bis Ende auf Ihrem Gerät.

Laden Sie Local TTS kostenlos im App Store und hören Sie Kokoro-82M auf Ihrem iPhone oder iPad.

Jeder Text wird Sprache — offline

Local TTS liest PDFs, E-Books und Artikel direkt auf deinem iPhone vor — privat und natürlich.

Im App Store laden