
Spis treści
- Odpowiedź w jednym zdaniu
- Czym jest Kokoro-82M?
- Dlaczego 82 miliony parametrów mają znaczenie na telefonie
- Dlaczego Local TTS używa Kokoro-82M
- Czy Kokoro obsługuje wszystkie 31 języków Local TTS?
- Co wpływa na rzeczywistą jakość głosu?
- Kokoro robi wrażenie, ale nie jest nieomylny
- Najczęstsze pytania
- Posłuchaj Kokoro-82M na własnym tekście
Gdy aplikacja czytająca odczytuje stronę na głos, widoczne przyciski to tylko część doświadczenia. To model za nimi decyduje, czy głos brzmi naturalnie, czy trzyma równy rytm, czy wyraźnie wymawia zdanie i czy odpowiada na tyle szybko, by przypominał lektora, a nie zadanie do przetworzenia.
Local TTS wykorzystuje Kokoro-82M do swoich neuronowych głosów w angielszczyźnie amerykańskiej i brytyjskiej. Model jest na tyle mały, że działa na iPhonie czy iPadzie, a jednocześnie na tyle sprawny, by słuchanie długich tekstów było naturalne. Co najważniejsze, tekst i wygenerowana mowa pozostają na twoim urządzeniu.
Nie potrzebujesz Pythona, terminala, plików modelu ani klucza API. Wklej tekst, zaimportuj dokument albo zeskanuj wydrukowaną stronę w Local TTS i naciśnij odtwarzanie.
Oficjalna grafika i źródła techniczne: okładka to oficjalna zapowiedź społecznościowa Hugging Face dla repozytorium modelu hexgrad/Kokoro-82M, użyta bez zmian — nie jest to ilustracja wygenerowana przez SI. Poniższe informacje o architekturze, wydaniu, treningu i licencji pochodzą z tej karty modelu; liczba głosów i ograniczenia jakości — z oficjalnego pliku VOICES.md.
Odpowiedź w jednym zdaniu
Kokoro-82M to model syntezy mowy o otwartych wagach i 82 milionach parametrów, który daje naturalną mowę 24 kHz przy znacznie mniejszym zapotrzebowaniu na moc obliczeniową niż wiele większych modeli głosowych — co czyni go dobrym wyborem do prywatnego czytania bezpośrednio na urządzeniu.
Ta równowaga ma znaczenie. Model może brzmieć znakomicie na serwerze z mocnym GPU i mimo to być złym wyborem na telefon. Local TTS potrzebuje naturalnej mowy, rozsądnego zużycia pamięci, płynnego odtwarzania i braku wycieczek do chmurowego API. Kokoro umożliwia to połączenie dla angielskiego.
Czym jest Kokoro-82M?
Kokoro-82M to neuronowy model syntezy mowy stworzony przez hexgrad. „82M” odnosi się do około 82 milionów parametrów. Oficjalna karta modelu Kokoro opisuje go jako model o otwartych wagach, zaprojektowany tak, by oferować jakość porównywalną z większymi systemami, pozostając szybszym i tańszym w użyciu.
Wersja 1.0 została opublikowana 27 stycznia 2025 roku. Według karty modelu trenowano ją na kilkuset godzinach nagrań na liberalnych licencjach, z domeny publicznej i syntetycznych. Wagi objęte są licencją Apache 2.0.
| Kokoro-82M v1.0 | |
|---|---|
| Parametry | 82 miliony |
| Data wydania | 27 stycznia 2025 |
| Wyjście | mowa 24 kHz |
| Publiczny zbiór głosów | 54 głosy w 8 językach |
| Zastosowanie w Local TTS | 28 głosów angielskich amerykańskich i brytyjskich |
| Licencja wag modelu | Apache 2.0 |
| Przetwarzanie w Local TTS | na urządzeniu; serwer syntezy nie jest potrzebny |
Kokoro czerpie ze StyleTTS 2, systemu zaprojektowanego do modelowania ekspresyjnych stylów mówienia, oraz z ISTFTNet, lekkiego wokodera neuronowego, który wydajnie zamienia wyjście modelu w przebieg dźwiękowy. Publiczne wydanie Kokoro nie jest całym systemem treningowym StyleTTS 2: karta modelu opisuje je jako wyłącznie dekoder, bez komponentu dyfuzyjnego i bez udostępnionego enkodera.
Mówiąc prosto, Kokoro pakuje dokładnie tę część, która jest potrzebna, by zamienić zapis fonetyczny i wybrany styl głosu w dźwięk, bez dźwigania ciężaru znacznie większego, ogólnego modelu SI.
Dlaczego 82 miliony parametrów mają znaczenie na telefonie
Liczba parametrów nie jest oceną. Większy model może uchwycić więcej niuansów, ale zwykle wymaga też więcej pamięci, obliczeń, energii i czasu. Te koszty stają się widoczne, gdy aplikacja ma przeczytać rozdział, a nie wygenerować jedno krótkie zdanie pokazowe.
Zwarty rozmiar Kokoro daje Local TTS przestrzeń, by zbudować wokół modelu kompletne doświadczenie czytania:
- Generowanie na urządzeniu: mowa powstaje lokalnie, zamiast czekać na zdalny serwer.
- Płynne czytanie: aplikacja może przygotowywać kolejne zdania, gdy bieżące jest odtwarzane.
- Praktyczność przy długich tekstach: PDF-y, EPUB-y i artykuły można czytać bez płacenia za znak chmurowemu API.
- Dostępność offline: głos działa w samolocie, w drodze do pracy i wszędzie tam, gdzie łączność bywa zawodna.
- Prywatność z założenia: wklejony tekst i zaimportowane dokumenty nie muszą być wysyłane, by powstała mowa.
Dlatego „mały” jest tu zaletą produktu. Celem nie jest wygranie konkursu na liczbę parametrów, lecz udostępnienie dobrej jakości mowy w chwili, gdy naciskasz odtwarzanie.
Dlaczego Local TTS używa Kokoro-82M
Użycie modelu w prawdziwej aplikacji do czytania wymaga więcej niż umieszczenia wag w paczce aplikacji. Tekst trzeba znormalizować, podzielić w sensownych miejscach, zamienić na mowę przed odtwarzaniem, zbuforować, podświetlić i utrzymać w odtwarzaniu, gdy ekran się zablokuje.
1. Naturalne głosy w angielszczyźnie amerykańskiej i brytyjskiej
Kokoro v1.0 udostępnia 20 głosów amerykańskich i 8 brytyjskich w swoim oficjalnym katalogu głosów. Local TTS zawiera wszystkie 28 tych angielskich głosów w pełnym katalogu, z różnymi akcentami, płciami i charakterami brzmienia.
Trzy wysokiej jakości głosy angielskie są dostępne w wersji bezpłatnej, więc możesz usłyszeć model na własnym tekście, zanim zdecydujesz, czy potrzebujesz Pro.
2. Model jest dołączony, a nie wywoływany przez API
Local TTS niesie model mowy razem z aplikacją. Gdy wprowadzasz tekst, aplikacja zamienia go w mowę na twoim iPhonie lub iPadzie. Żaden dostawca syntezy nie otrzymuje dokumentu, nie ma kolejki na serwerze ani wymogu zakładania konta.
Jest to szczególnie przydatne przy materiałach, których wolisz nie wklejać do usługi internetowej: niepublikowanym rękopisie, dokumencie służbowym, osobistej notatce czy materiale do nauki. Jeśli korzystasz z synchronizacji iCloud, notatki mogą synchronizować się przez twoje własne konto iCloud; samo generowanie mowy nadal odbywa się na urządzeniu.
3. Dwie zoptymalizowane ścieżki utrzymują praktyczne słuchanie
Local TTS wykorzystuje technologie Apple MLX i Metal do płynnego generowania na pierwszym planie. Używa też zoptymalizowanej ścieżki Core ML, dzięki czemu mowa może być przygotowywana podczas odtwarzania w tle i przy eksporcie dźwięku, bez zależności od awaryjnego rozwiązania chmurowego.
Nie musisz zarządzać żadną z tych ścieżek. Aplikacja sama wybiera odpowiedni silnik, zachowując ten sam głos i te same ustawienia czytania.
4. Model głosowy staje się pełnym czytnikiem
Kokoro generuje mowę. Local TTS zamienia tę zdolność w coś, z czego można korzystać codziennie:
- Wklej artykuł albo napisz notatkę.
- Zaimportuj pliki PDF, EPUB, Word, TXT i Markdown.
- Zeskanuj wydrukowaną stronę dzięki rozpoznawaniu tekstu na urządzeniu.
- Śledź podświetlanie słowo po słowie podczas odtwarzania.
- Zmieniaj głos i tempo czytania dla każdej notatki.
- Słuchaj dalej z ekranu blokady lub Centrum sterowania.
- Eksportuj mowę jako plik M4A w wersji Pro.
Pobierz Local TTS bezpłatnie z App Store, aby wypróbować Kokoro-82M bez instalowania modelu i otwierania terminala.
Czy Kokoro obsługuje wszystkie 31 języków Local TTS?
Nie — i to rozróżnienie jest ważne. Kokoro zasila katalog angielskich głosów amerykańskich i brytyjskich w Local TTS. Głos obejmujący 31 języków oparty jest na Supertonic 3, osobnym wielojęzycznym silniku syntezy działającym na urządzeniu.
Nasz przewodnik po Supertonic 3 pokazuje, jak jeden głos Local TTS czyta offline wszystkie 31 obsługiwanych języków.
Publiczne wydanie Kokoro v1.0 zawiera głosy w ośmiu językach, ale notatki projektu ostrzegają, że wsparcie poza angielskim bywa ubogie, bo narzędzia wymowy i dane treningowe różnią się w zależności od języka. Local TTS używa dziś Kokoro tam, gdzie jego mobilna implementacja jest najmocniejsza: w angielskim. Supertonic 3 obsługuje koreański, japoński, hiszpański, francuski, niemiecki i pozostałe języki wspierane przez aplikację.
Oba silniki działają lokalnie. Wybór innego języka nie przenosi cię do usługi chmurowej.
Co wpływa na rzeczywistą jakość głosu?
Ten sam głos nie zabrzmi równie naturalnie na każdym tekście. Te szczegóły robią zauważalną różnicę:
- Interpunkcja: przecinki, kropki i podziały akapitów dają modelowi użyteczne wskazówki co do frazowania.
- Nazwy i terminy specjalistyczne: rzadkie nazwiska, skrótowce i nazwy marek mogą wymagać zapisu fonetycznego albo drobnej korekty tekstu.
- Długość zdań: bardzo krótkie fragmenty mogą brzmieć urywanie, a bardzo długie zdania bez pauz mogą się śpieszyć.
- Liczby i symbole: daty, cyfry rzymskie, wzory i nietypowe symbole bywają wieloznaczne po wypowiedzeniu.
- Wybór głosu: głos dobry do powieści może mniej pasować do korekty czy notatek technicznych.
Local TTS normalizuje typowe przypadki brzegowe i dzieli długi tekst na praktyczne jednostki syntezy. Najlepszy efekt uzyskasz, dbając o interpunkcję w tekście źródłowym i odsłuchując kilka głosów na materiale, którego naprawdę zamierzasz słuchać.
Kokoro robi wrażenie, ale nie jest nieomylny
Oficjalny katalog głosów zaznacza, że jakość głosów zależy od ilości i jakości danych treningowych. Wskazuje też, że głosy zwykle sprawdzają się najlepiej w środkowym zakresie mniej więcej 100–200 tokenów; bardzo krótkie wypowiedzi mogą być słabsze, a bardzo długie — pędzić. Local TTS łagodzi te skrajności dzięki przygotowaniu uwzględniającemu zdania i podziałowi na fragmenty, ale nie sprawi, że każda wymowa będzie idealna.
Kokoro jest ponadto modelem o otwartych wagach, a nie pełnym otwartoźródłowym wydaniem treningowym. Wagi do pobrania objęte są licencją Apache, natomiast karta modelu podaje, że enkoder i cały system treningowy nie zostały udostępnione.
Przy pracach, w których wymowa jest krytyczna, odsłuchaj wynik i sprawdź nazwy, skróty i język techniczny przed eksportem lub publikacją nagrania. Udostępniane nagranie należy też oznaczyć jako mowę wygenerowaną syntetycznie.
Najczęstsze pytania
Czy Local TTS naprawdę używa Kokoro-82M?
Tak. Kokoro-82M v1.0 zasila neuronowe głosy angielskie amerykańskie i brytyjskie w Local TTS. Wagi modelu i dane głosów są dołączone do aplikacji i używane na urządzeniu.
Czy działa bez internetu?
Tak. Po zainstalowaniu Local TTS generowanie mowy działa offline. Zamiana tekstu na dźwięk nie wymaga połączenia z internetem.
Ile głosów Kokoro jest w Local TTS?
Pełny katalog Local TTS obejmuje 28 angielskich głosów Kokoro: 20 amerykańskich i 8 brytyjskich. Wersja bezpłatna zawiera trzy wybrane głosy angielskie oraz wielojęzyczny głos aplikacji.
Czy Local TTS wysyła mój PDF albo tekst, żeby wygenerować mowę?
Nie. Zaimportowane pliki, wklejony tekst, rozpoznawanie tekstu i generowanie mowy są przetwarzane na urządzeniu. Nie ma konta, reklam ani śledzenia.
Czy muszę pobierać Kokoro osobno?
Nie. Nie potrzebujesz Hugging Face, Pythona, wiersza poleceń ani klucza API. Local TTS łączy model i interfejs czytania w jednej aplikacji.
Czy Kokoro obsługuje koreański i pozostałe wspierane języki?
Nie w Local TTS. Kokoro odpowiada za katalog angielski; Supertonic 3 zapewnia działający na urządzeniu głos obejmujący 31 języków.
Posłuchaj Kokoro-82M na własnym tekście
Kokoro-82M ma znaczenie, bo czyni naturalną mowę neuronową praktyczną poza stroną demonstracyjną i chmurowym API. Local TTS wnosi ten model do czytnika działającego offline, z importem dokumentów, rozpoznawaniem tekstu, podświetlaniem, odtwarzaniem w tle, sterowaniem głosem i eksportem dźwięku.
Wklej akapit, zaimportuj PDF, który od dawna chcesz przeczytać, albo sfotografuj wydrukowaną stronę. Potem wybierz angielski głos i słuchaj — twój tekst od początku do końca zostaje na twoim urządzeniu.
Pobierz Local TTS bezpłatnie z App Store i posłuchaj Kokoro-82M na swoim iPhonie lub iPadzie.
Zamień dowolny tekst na mowę — offline
Local TTS czyta pliki PDF, e-booki i artykuły bezpośrednio na iPhonie — prywatnie i naturalnie.
Pobierz w App Store