
Was wäre, wenn dieselbe natürliche Stimme einen englischen Artikel, eine deutsche PDF, eine koreanische Notiz und ein spanisches E-Book lesen könnte – ohne Sprachpaket und ohne einen Satz in die Cloud zu senden?
Genau das übernimmt Supertonic 3 in Local TTS. Die mehrsprachige Engine hinter der 31-sprachigen Stimme läuft direkt auf dem iPhone oder iPad. Text einfügen, ein Dokument importieren oder eine gedruckte Seite scannen: Local TTS erkennt die Sprache und erzeugt das Audio auf dem Gerät.
Es sind weder Modellinstallation noch Konto oder API-Schlüssel nötig. Schon die kostenlose Version enthält eine mehrsprachige Stimme für alle 31 Sprachen.
Offizielle Bildquelle: Das Titelbild ist Supertone’s unverändertes Supertonic-3-Herobild aus dem offiziellen Modell-Repository. Die darin genannten Leistungswerte sind Aussagen des Herausgebers zur Veröffentlichung.
Die Kurzantwort
Supertonic 3 ist ein kompaktes Text-to-Speech-Modell mit rund 99 Millionen Parametern. Es erzeugt über ONNX Runtime 44,1-kHz-Sprache in 31 Sprachen und macht privates mehrsprachiges Vorlesen auf einem Smartphone möglich.
Entscheidend ist neben „mehrsprachig“ das Wort On-Device. Sobald Local TTS installiert ist, müssen Absätze nicht an einen Sprachserver gesendet werden. Modell, Stimmen und Audioerzeugung sind offline verfügbar.
Was ist Supertonic 3?
Supertonic 3 ist ein mehrsprachiges Open-Weight-TTS-Modell von Supertone. Das offizielle Supertonic-Repository beschreibt eine leichtgewichtige Engine für lokale Inferenz mit ONNX Runtime – ohne Cloud-Aufruf und ohne GPU-Pflicht.
Mit Version 3 wurde die Sprachabdeckung von fünf auf 31 Sprachen erweitert. Supertone nennt außerdem weniger wiederholte oder ausgelassene Wörter und eine konsistentere Stimmidentität in den gemeinsam unterstützten Sprachen.
| Merkmal | Supertonic 3 in Local TTS |
|---|---|
| Modellgröße | Rund 99 Millionen Parameter |
| Unterstützte Sprachen | 31 |
| Audioausgabe | 44,1 kHz |
| Laufzeit | ONNX Runtime auf der CPU |
| Stimmstile | 10 Presets: F1–F5 und M1–M5 |
| Kostenlose Version | Ein Stil liest alle 31 Sprachen |
| Netzwerk zur Spracherzeugung | Nicht erforderlich |
| Lizenz der Modellgewichte | OpenRAIL-M |
Die öffentlichen ONNX-Dateien teilen die Verarbeitung unter anderem in Textencoder, Dauerprognose, Vektorschätzung und Vocoder. In Local TTS muss man diese Komponenten nicht selbst verwalten: Die App bringt alles fertig abgestimmt mit.

Quelle: Supertone’s offizieller Modellgrößenvergleich. Die Grafik ist unverändert; Modellnamen und Parameterzahlen stammen aus dem Vergleich des Herausgebers.
Welche 31 Sprachen unterstützt Local TTS?
Die Supertonic-3-Stimme in Local TTS liest den vollständigen Sprachumfang der offiziellen Modellkarte:
| Arabisch | Bulgarisch | Kroatisch | Tschechisch |
| Dänisch | Niederländisch | Englisch | Estnisch |
| Finnisch | Französisch | Deutsch | Griechisch |
| Hindi | Ungarisch | Indonesisch | Italienisch |
| Japanisch | Koreanisch | Lettisch | Litauisch |
| Polnisch | Portugiesisch | Rumänisch | Russisch |
| Slowakisch | Slowenisch | Spanisch | Schwedisch |
| Türkisch | Ukrainisch | Vietnamesisch |
Chinesisch gehört derzeit nicht zur offiziellen Liste der 31 Sprachen. Local TTS bezeichnet eine Sprache nicht als unterstützt, nur weil ein Modell dafür möglicherweise Laute erzeugen kann.
Diese Breite ist nicht nur für Übersetzungen nützlich. Eine Leseliste kann eine deutsche PDF, eine englische Studie, eine französische EPUB-Datei und koreanische Notizen enthalten. Alles bleibt in derselben App und kann mit einem vertrauten Stimmstil gehört werden.
Warum Local TTS Supertonic 3 nutzt
1. Ein Stimmstil über Sprachgrenzen hinweg
Local TTS enthält zehn Supertonic-3-Presets: fünf weibliche und fünf männliche Stile. Jeder Stil kann alle 31 Sprachen lesen. Die Stimme muss also nicht wechseln, nur weil das nächste Dokument in einer anderen Sprache geschrieben ist.
Die App erkennt die Sprache im Text. Wechselt ein Dokument zwischen Sätzen die Sprache, teilt Local TTS es an passenden Grenzen auf und verwendet jeweils die richtige Aussprache, während der Charakter der gewählten Stimme erhalten bleibt. Einzelne Namen oder Fremdwörter können mehrdeutig sein; vollständige Sätze liefern zuverlässigere Hinweise.
2. CPU-Inferenz für Hintergrundwiedergabe
Supertonic 3 läuft in Local TTS über ONNX Runtime auf der CPU. Für die Synthese ist weder eine entfernte GPU noch die iPhone-GPU erforderlich.
Dadurch kann die App auch bei gesperrtem Bildschirm oder während der Nutzung einer anderen App weiter vorlesen. Wiedergabe und Navigation funktionieren über Sperrbildschirm und Kontrollzentrum, ohne auf einen Cloud-Dienst auszuweichen.
3. Dokumente bleiben auf dem Gerät
PDF-Texte, E-Book-Kapitel, eingefügte Notizen, OCR-Ergebnisse und generiertes Audio werden auf iPhone oder iPad verarbeitet. Das ist besonders bei privaten Notizen, Lernmaterial, unveröffentlichten Texten und internen Unterlagen wichtig.
Local TTS benötigt kein Konto, zeigt keine Werbung und verwendet kein Tracking. Die optionale iCloud-Synchronisierung läuft über das eigene iCloud-Konto; die eigentliche KI-Umwandlung von Text in Sprache bleibt lokal.
4. Eine fertige Lese-App statt eines Modelldemos
Local TTS verbindet die Engine mit den Funktionen eines täglichen Readers:
- Text einfügen oder eine Notiz schreiben
- PDF, EPUB, Word, TXT und Markdown importieren
- Gedruckte Seiten mit On-Device-OCR erfassen
- Dem aktuell gesprochenen Satz folgen
- Stimme und Tempo pro Notiz wählen
- Über Sperrbildschirm und Kontrollzentrum hören
- Mit Pro die vollständige Lesung als M4A exportieren
Local TTS kostenlos im App Store laden und die Supertonic-3-Stimme mit einer der 31 Sprachen testen.
Supertonic 3 und Kokoro-82M erfüllen verschiedene Aufgaben
| Supertonic 3 | Kokoro-82M | |
|---|---|---|
| Aufgabe in Local TTS | Mehrsprachiges Vorlesen | Amerikanisches und britisches Englisch |
| Sprachumfang | 31 Sprachen | Englisch in Local TTS |
| Stimmen | 10 mehrsprachige Stile | 28 englische Stimmen |
| Ausgabe | 44,1 kHz | 24 kHz |
| Ideal für | Eine Stimme für verschiedene Sprachen | Große Auswahl englischer Stimmen |
Für mehrsprachige Inhalte ist Supertonic 3 der natürliche Ausgangspunkt. Wer hauptsächlich Englisch hört und zwischen vielen amerikanischen und britischen Stimmen wählen möchte, kann Kokoro verwenden. Pro Notiz lässt sich die Engine jederzeit wechseln.
Mehr über die englische Engine steht in unserem Kokoro-82M-Leitfaden.
Tipps für bessere mehrsprachige Aussprache
- Genug Text bereitstellen: Ein vollständiger Satz lässt sich leichter erkennen als ein einzelner Name.
- Satzzeichen pflegen: Punkte, Kommas und Absätze geben Pausen vor.
- Eine Hauptsprache pro Satz verwenden: Wortweiser Sprachwechsel ist schwieriger als getrennte Sätze.
- Namen und Abkürzungen prüfen: Konventionen unterscheiden sich je nach Sprache.
- OCR-Ergebnisse kontrollieren: Ein Erkennungsfehler wird beim Vorlesen zum Aussprachefehler.
Supertonic 3 stellt Local TTS keine exakten Zeitmarken für jedes einzelne Wort zur Verfügung. Deshalb folgt die Ansicht bei diesen Stimmen dem aktuellen Satz und verspricht keine ungenaue Wortmarkierung.
Häufig gestellte Fragen
Muss für jede Sprache ein Modell geladen werden?
Nein. Dasselbe gebündelte Supertonic-3-Modell und derselbe Stimmstil verarbeiten alle 31 Sprachen. Separate Sprachpakete gibt es nicht.
Darf ein Dokument mehrere Sprachen enthalten?
Ja. Local TTS erkennt die Sprache abschnittsweise und liest mehrsprachige Sätze mit dem gewählten Stil vor.
Funktioniert die Spracherzeugung offline?
Ja. Das Modell ist in der App enthalten und wird ohne Netzwerkverbindung auf dem Gerät ausgeführt.
Wird Chinesisch unterstützt?
Derzeit nicht. Chinesisch gehört nicht zu den offiziellen 31 Sprachen von Supertonic 3.
Kann Local TTS meine Stimme klonen?
Nein. Die App verwendet zehn vorgefertigte Supertonic-3-Stile und bietet kein individuelles Voice Cloning.
Alle 31 Sprachen auf dem eigenen Gerät hören
Supertonic 3 macht eine breite mehrsprachige Stimme ohne Sprachserver praktisch. Local TTS ergänzt Dokumentimport, OCR, Spracherkennung, Satzverfolgung, Hintergrundwiedergabe und Audioexport – und macht daraus einen Reader für den Alltag.
Local TTS kostenlos aus dem App Store laden und den ersten mehrsprachigen Text privat und offline mit Supertonic 3 anhören.
Jeder Text wird Sprache — offline
Local TTS liest PDFs, E-Books und Artikel direkt auf deinem iPhone vor — privat und natürlich.
Im App Store laden