
Spis treści
Local TTS ma na pokładzie dwa neuronowe modele mowy zamiast jednego. Kokoro-82M obsługuje głosy amerykańskiego i brytyjskiego angielskiego, a Supertonic 3 — wielojęzyczny głos czytający w 31 językach. Oba działają w całości na Twoim iPhonie lub iPadzie.
Po co dwa modele, skoro z jednym aplikacja byłaby mniejsza i prostsza? Bo opublikowane benchmarki dają jasną odpowiedź: żaden pojedynczy kompaktowy model działający na urządzeniu nie wygrywa dziś jednocześnie w naturalności, dokładności czytania, szybkości i liczbie języków. Każdy z tych dwóch wygrywa inny wyścig, a ich połączenie pozwala Local TTS używać każdego modelu dokładnie tam, gdzie jest najmocniejszy.
W tym artykule przechodzimy przez oficjalne wyniki ewaluacji, które stoją za tą decyzją — co zmierzyli twórcy modeli, co wykazały niezależne testy i jak przekłada się to na czytnik, którego naprawdę słuchasz.
Źródła i okładka: Okładka to niezmieniony oficjalny wykres dokładności czytania firmy Supertone z repozytorium Supertonic. Wyniki Kokoro cytujemy za oficjalną kartą modelu hexgrad/Kokoro-82M; wyniki Supertonic — za oficjalnym repozytorium Supertone i kartą modelu; bezpośredni test na CPU — za niezależnym zewnętrznym benchmarkiem. Liczby źródłowe zostały zmierzone przez ich wydawców na ich sprzęcie, a nie na iPhonie.
Odpowiedź w jednym zdaniu
Kokoro-82M prowadzi w ludzkich ocenach naturalności dla angielskiego, Supertonic 3 wygrywa szybkością na CPU i czyta w 31 językach z konkurencyjną dokładnością — dlatego Local TTS kieruje angielski do Kokoro, a wszystko wielojęzyczne do Supertonic 3, w całości na Twoim urządzeniu.
Jak mierzy się jakość syntezy mowy
Dla aplikacji do czytania liczą się cztery pomiary i warto wiedzieć, co każdy z nich oznacza, zanim spojrzysz na liczby:
- Naturalność oceniają ludzie. Najbardziej znany publiczny test to ślepa arena: słuchacze słyszą dwa anonimowe nagrania i głosują na to, które brzmi naturalniej. Powstaje ranking w stylu Elo, na który marketing nie ma wpływu.
- Dokładność czytania sprawdza, czy model wypowiedział dokładnie ten tekst, który dostał — bez pominiętych, powtórzonych czy zniekształconych słów. Mierzy się ją jako odsetek błędnie przeczytanych słów (WER, word error rate) lub znaków (CER, character error rate): wygenerowany dźwięk jest transkrybowany z powrotem na tekst i porównywany z oryginałem. Im niżej, tym lepiej.
- Szybkość podaje się jako współczynnik czasu rzeczywistego (RTF): czas syntezy podzielony przez długość nagrania. RTF 0,3 oznacza, że sekunda mowy powstaje w 0,3 sekundy — około 3,3 razy szybciej niż w czasie rzeczywistym. Im niżej, tym szybciej.
- Rozmiar obejmuje liczbę parametrów, wielkość pobierania i zużycie pamięci — to różnica między modelem, który mieści się w aplikacji na telefon, a takim, który potrzebuje serwerowego GPU.
Głos w chmurze może gonić wszystkie cztery cele naraz dzięki sprzętowi z centrum danych. Model działający na urządzeniu musi iść na kompromisy — i właśnie tu drogi obu modeli się rozchodzą.
Co mówią benchmarki o Kokoro-82M
Najgłośniejszy wynik Kokoro-82M to ranking preferencji słuchaczy. Przed wydaniem wersji v1.0 oficjalna karta modelu podawała, że Kokoro v0.19 zajęło 1. miejsce w TTS Spaces Arena — ślepej arenie odsłuchowej na Hugging Face — osiągając wyższy wynik Elo niż modele wielokrotnie większe, w tym XTTS v2 (467 milionów parametrów) i MetaVoice (1,2 miliarda parametrów), mimo że trenowano go na zaledwie kilkuset godzinach nagrań.
To nietypowy wynik, przy którym warto się zatrzymać. W teście, w którym słuchacze nie widzieli nazw modeli ani liczby parametrów, model z 82 milionami parametrów wygrywał z systemami liczonymi w miliardach. Pod względem naturalności angielskiego w przeliczeniu na moc obliczeniową Kokoro wyznaczyło standard dla kompaktowych modeli.
| Kokoro-82M v1.0 | |
|---|---|
| Parametry | 82 miliony |
| Ocena przez ludzi | v0.19 na 1. miejscu w TTS Spaces Arena |
| Dźwięk | Mowa 24 kHz |
| Głosy | 54 publiczne głosy; 28 głosów angielskich w Local TTS |
| Licencja | Apache 2.0 |
| Rola w Local TTS | Katalog amerykańskiego i brytyjskiego angielskiego |
Ceną jest zasięg językowy. Publiczne wydanie Kokoro obejmuje osiem języków, ale własny katalog głosów zaznacza, że jakość poza angielskim zależy od ilości danych treningowych. To specjalista: znakomity angielski, niewiele poza nim.
Co mówią benchmarki o Supertonic 3
Supertonic 3, wydany przez Supertone 29 kwietnia 2026 r., jest oceniany z przeciwnego kierunku: pod kątem zasięgu i wydajności. Oficjalne repozytorium publikuje wyniki dokładności czytania na benchmarku Minimax-MLS-test, porównując model o około 99 milionach parametrów ze znacznie większymi otwartymi systemami TTS, takimi jak VoxCPM2, OmniVoice i Qwen3-TTS.
Oto opublikowane przez Supertone współczynniki błędów dla jedenastu języków, w których dostępna jest ta strona (niżej znaczy lepiej; * oznacza współczynnik błędów znaków CER, pozostałe wartości to współczynnik błędów słów WER):
| Język | VoxCPM2 | OmniVoice | Qwen3-TTS | Supertonic 3 |
|---|---|---|---|---|
| Angielski | 2,11 | 2,02 | 2,25 | 2,06 |
| Koreański* | 4,70 | 3,22 | 4,07 | 3,26 |
| Japoński* | 3,35 | 3,81 | 3,67 | 4,61 |
| Niemiecki | 0,85 | 0,96 | 0,52 | 0,86 |
| Francuski | 4,41 | 4,74 | 3,82 | 4,89 |
| Hiszpański | 1,34 | 0,99 | 0,75 | 1,13 |
| Portugalski | 1,74 | 1,40 | 1,21 | 2,48 |
| Włoski | 1,74 | 1,29 | 1,40 | 1,75 |
| Niderlandzki | 0,84 | 0,77 | — | 1,47 |
| Polski | 1,30 | 0,64 | — | 1,63 |
| Turecki | 0,88 | 2,18 | — | 1,00 |
Supertonic 3 nie wygrywa w każdym wierszu i Supertone wcale tego nie twierdzi. Oficjalny wniosek jest bardziej praktyczny: model utrzymuje się w konkurencyjnym zakresie błędów modeli kilkukrotnie większych — w 31 językach — pozostając na tyle mały, że działa bez żadnego GPU.
To szybkość naprawdę go wyróżnia. Supertone pokazuje Supertonic 3 na sprzęcie znacznie słabszym niż współczesny iPhone: na czytniku e-booków Onyx Boox Go 6 w trybie samolotowym, ze średnim RTF 0,3× — czyli około trzy razy szybciej niż w czasie rzeczywistym na czytniku e-booków — oraz w czasie rzeczywistym na Raspberry Pi. Oficjalne porównanie środowisk uruchomieniowych pokazuje, że model działa szybko na zwykłych CPU nawet na tle większych systemów mierzonych na serwerowym GPU NVIDIA A100, zużywając przy tym znacznie mniej pamięci.

Źródło: oficjalny wykres zużycia zasobów firmy Supertone, reprodukowany bez zmian.
| Supertonic 3 | |
|---|---|
| Parametry | Około 99 milionów |
| Dokładność czytania | WER/CER konkurencyjne wobec znacznie większych modeli |
| Zademonstrowana szybkość | RTF 0,3× na czytniku e-booków; czas rzeczywisty na Raspberry Pi |
| Dźwięk | Mowa 44,1 kHz |
| Języki | 31 |
| Licencja | OpenRAIL-M |
| Rola w Local TTS | Wielojęzyczny głos dla 31 języków |
Bezpośrednie porównanie, które wyjaśnia naszą decyzję
Najbardziej bezpośrednie porównanie pochodzi z niezależnego zewnętrznego benchmarku, w którym oba modele uruchomiono na tym samym skromnym 4-rdzeniowym CPU bez GPU — w warunkach bliższych telefonowi niż serwerowi AI. Liczą się dwa wyniki:
- Szybkość: Supertonic 3 syntetyzował mowę z RTF 0,313 przy standardowym ustawieniu jakości — około 3,2 razy szybciej niż w czasie rzeczywistym — podczas gdy Kokoro-82M osiągnęło RTF 0,469–0,509, czyli około 2 razy szybciej niż czas rzeczywisty. Oba modele wyprzedzają czas rzeczywisty na małym CPU; Supertonic ma większy zapas.
- Naturalność: ten sam test uznał angielski Kokoro za brzmiący bardziej ludzko, z naturalną prozodią, podczas gdy najszybsze ustawienia Supertonic brzmiały bardziej płasko.
Innymi słowy, niezależny tester, który nie ma interesu w żadnym z modeli, doszedł do tego samego wniosku, na który wskazują oficjalne liczby: Kokoro wygrywa naturalnością angielskiego, Supertonic 3 wygrywa szybkością i zasięgiem. Wybierając jeden model, trzeba by z czegoś zrezygnować. Local TTS postanowił nie wybierać.
Dlaczego Local TTS łączy oba modele
Wewnątrz Local TTS oba silniki kryją się za jednym czytnikiem. Każdy głos na liście należy do jednego z dwóch modeli, a gdy wybierasz głos, aplikacja automatycznie kieruje syntezę do właściwego silnika — ten sam przycisk odtwarzania, to samo podświetlanie, ta sama regulacja szybkości, ta sama gwarancja działania offline.
Angielski trafia do Kokoro-82M
Powodem są wyniki ocen słuchaczy. Skoro ludzie konsekwentnie stawiają model 82M ponad systemami z miliardami parametrów w angielskim, to właśnie ten model powinny dostać Twoje angielskie audiobooki, artykuły i pliki PDF. Local TTS zawiera wszystkie 28 amerykańskich i brytyjskich głosów Kokoro i uruchamia je przez potok Core ML dostrojony pod Apple Silicon, który dostarcza też informacje o czasie wypowiadania słów — to one napędzają podświetlanie słowo po słowie — i syntetyzuje dalej podczas odtwarzania w tle.
Wszystkie pozostałe języki trafiają do Supertonic 3
Powodem są zasięg i wydajność. Jeden wbudowany model Supertonic 3 czyta po koreańsku, japońsku, niemiecku, francusku, hiszpańsku i w 26 kolejnych językach w 44,1 kHz, ze współczynnikami błędów konkurencyjnymi wobec znacznie większych systemów — a jego konstrukcja nastawiona na CPU sprawia, że czytanie w tle i długie dokumenty nie wyczerpują baterii. Dziesięć gotowych stylów (F1–F5, M1–M5) czyta we wszystkich 31 językach, więc dokument przełączający się między językami zachowuje jeden spójny głos.
Czego unikamy dzięki połączeniu
- Aplikacji tylko po angielsku. Samo Kokoro zostawiłoby 30 języków bez mocnego głosu.
- Jednego, bardziej płaskiego głosu angielskiego. Sam Supertonic oznaczałby rezygnację ze zwycięskiej w arenie naturalności angielskiego i katalogu 28 angielskich głosów.
- Awaryjnego sięgania do chmury. Oba modele są na tyle małe, że mieszczą się w aplikacji, więc żaden tekst nigdy nie opuszcza urządzenia w drodze do „lepszego modelu na serwerze”.
Takie podwójne rozwiązanie kosztuje trochę rozmiaru aplikacji i pracy inżynierskiej — i uważamy to za dobrą wymianę: powyższe benchmarki są w praktyce jego specyfikacją.
Pobierz Local TTS bezpłatnie z App Store i porównaj oba silniki na własnym tekście — trzy angielskie głosy Kokoro i jeden wielojęzyczny głos Supertonic 3 są bezpłatne.
Jak uczciwie czytać te liczby
Benchmarki pomagają podjąć decyzję, ale nie kończą dyskusji. Warto pamiętać o czterech zastrzeżeniach:
- Liczby źródłowe nie zostały zmierzone na iPhonie. Rankingi aren, tabele WER i wyniki RTF pochodzą ze sprzętu ich wydawców. Wydajność w Local TTS zależy od Twojego urządzenia, tekstu i ustawień; kolejność modeli potwierdziła się jednak we wszystkich niezależnych testach na CPU, jakie udało nam się znaleźć.
- Rankingi aren się zmieniają. Pierwsze miejsce Kokoro to oficjalny zapis z okresu ewaluacji wersji v0.19; nowe modele wchodzą do aren co miesiąc. Trwały wniosek z tego wyniku jest taki, że kompaktowe modele potrafią wygrywać ślepe testy odsłuchowe angielskiego.
- WER/CER ocenia maszynowa transkrypcja. Mierzy, czy słowa zostały wypowiedziane poprawnie, a nie czy zabrzmiały pięknie — to drugie mierzy ludzka arena, dlatego oba wskaźniki warto czytać razem.
- Najszybsze ustawienia kosztują jakość. Najszybsze konfiguracje Supertonic obniżają naturalność. Local TTS używa ustawienia zrównoważonego, a nie tego z rekordowych nagłówków.
Najczęstsze pytania
Czy Local TTS naprawdę uruchamia oba modele na urządzeniu?
Tak. Kokoro-82M i Supertonic 3 są dołączone do aplikacji. Tekst, dokumenty i wygenerowany dźwięk są przetwarzane na iPhonie lub iPadzie, bez serwera mowy.
Który model faktycznie usłyszę?
To zależy od wybranego głosu. 28 amerykańskich i brytyjskich głosów angielskich to Kokoro-82M, a dziesięć wielojęzycznych stylów (F1–F5, M1–M5) to Supertonic 3. Głos możesz zmienić dla każdej notatki w dowolnym momencie.
Dlaczego nie użyć po prostu większych zwycięzców benchmarków, jak VoxCPM2 czy Qwen3-TTS?
Te systemy są kilkukrotnie większe i testowane na serwerowych GPU. Local TTS jest zbudowany wokół modeli działających offline na telefonie; w ramach tego ograniczenia te dwa modele to najmocniejsze opublikowane połączenie, jakie znamy.
Kokoro jest szybsze czy Supertonic?
Na tym samym małym CPU niezależny test zmierzył Supertonic 3 na około 3 razy szybciej niż czas rzeczywisty, a Kokoro na około 2 razy. Oba są zupełnie wystarczająco szybkie do ciągłego czytania w Local TTS.
Czy oba silniki brzmią inaczej?
Tak, i to celowo. Głosy Kokoro to indywidualne angielskie osobowości; style Supertonic to spójni wielojęzyczni lektorzy. Przetestuj kilka głosów na własnym tekście — wersja bezpłatna zawiera oba silniki.
Czy cokolwiek z tego wymaga internetu?
Nie. Oba modele generują mowę offline. Tryb samolotowy to dobre miejsce, żeby to sprawdzić.
Usłysz benchmarki na własne uszy
Liczby tłumaczą projekt; Twoje uszy go potwierdzają. Wklej angielski artykuł i posłuchaj głosu Kokoro, a potem wklej polski, niemiecki lub hiszpański akapit i usłysz, jak czytanie przejmuje Supertonic 3 — ta sama aplikacja, ta sama prywatność, bez chmury po drodze.
Pobierz Local TTS bezpłatnie z App Store i posłuchaj, dlaczego używamy dwóch modeli zamiast jednego.
Więcej o każdym silniku znajdziesz w naszym przewodniku po Supertonic 3 oraz w przewodniku po Kokoro-82M (po angielsku).
Zamień dowolny tekst na mowę — offline
Local TTS czyta pliki PDF, e-booki i artykuły bezpośrednio na iPhonie — prywatnie i naturalnie.
Pobierz w App Store