
Índice
Em um aplicativo que lê textos em voz alta, os controles visíveis são apenas parte da experiência. O modelo por trás deles determina se a voz soa natural, mantém um bom ritmo, pronuncia cada frase com clareza e responde rápido o suficiente para parecer um leitor, não uma tarefa de renderização.
O Local TTS usa o Kokoro-82M em suas vozes neurais de inglês americano e britânico. O modelo é compacto o bastante para rodar diretamente no iPhone ou iPad e capaz o suficiente para tornar natural a audição de textos longos. O texto e a voz gerada permanecem no seu dispositivo.
Você não precisa de Python, terminal, arquivos de modelo nem chave de API. Cole um texto, importe um documento ou fotografe uma página impressa e toque em Reproduzir.
Imagem oficial e fontes técnicas: A capa é a prévia social oficial que o Hugging Face fornece para o repositório hexgrad/Kokoro-82M, usada sem alterações e não gerada por IA. Os dados de arquitetura, versão, treinamento e licença vêm do card oficial; a quantidade de vozes e os limites de qualidade, do arquivo VOICES.md oficial.
A resposta em uma frase
O Kokoro-82M é um modelo TTS de pesos abertos com 82 milhões de parâmetros que produz voz natural em 24 kHz usando muito menos processamento que muitos modelos maiores, uma combinação ideal para leitura privada no dispositivo.
Um modelo pode soar excelente em um servidor com GPU potente e ainda assim não servir para um telefone. O Local TTS precisa combinar qualidade natural, uso viável de memória, reprodução ágil e nenhuma ida a uma API na nuvem. O Kokoro torna isso possível para o inglês.
O que é o Kokoro-82M?
O Kokoro-82M é um modelo neural de texto para fala criado pela hexgrad. “82M” representa seus cerca de 82 milhões de parâmetros. O card oficial do Kokoro o descreve como um modelo de pesos abertos criado para oferecer qualidade comparável à de sistemas maiores, com mais velocidade e eficiência.
A versão 1.0 foi publicada em 27 de janeiro de 2025. Segundo o card, ela foi treinada com algumas centenas de horas de áudio permissivo, em domínio público e sintético. Seus pesos usam a licença Apache 2.0.
| Característica | Kokoro-82M v1.0 |
|---|---|
| Parâmetros | 82 milhões |
| Lançamento | 27 de janeiro de 2025 |
| Saída | Voz em 24 kHz |
| Coleção pública | 54 vozes em 8 idiomas |
| Uso no Local TTS | 28 vozes de inglês americano e britânico |
| Licença dos pesos | Apache 2.0 |
| Processamento | No dispositivo, sem servidor TTS |
O Kokoro se baseia no StyleTTS 2, projetado para estilos expressivos de fala, e no ISTFTNet, um vocoder neural leve que converte com eficiência a saída do modelo em onda de áudio. A versão pública, porém, não é todo o sistema de treinamento do StyleTTS 2: o card a descreve como somente o decodificador, sem o componente de difusão e sem um codificador publicado.
Por que 82 milhões importam em um telefone
O número de parâmetros não é uma nota de qualidade. Um modelo maior pode captar mais nuances, mas normalmente exige mais memória, processamento, energia e tempo. Esses custos ficam claros ao ler um capítulo inteiro, e não apenas uma frase de demonstração.
O tamanho compacto do Kokoro permite que o Local TTS construa uma experiência completa ao redor do modelo:
- Geração local: a voz é criada no dispositivo, sem esperar por um servidor remoto.
- Leitura ágil: o app prepara as próximas frases enquanto a atual toca.
- Prático para textos longos: ouça PDFs, EPUBs e artigos sem cobrança de API por caractere.
- Disponível offline: funciona no avião, no metrô ou com conexão instável.
- Privacidade pela arquitetura: seus textos e documentos não precisam ser enviados para gerar voz.
Aqui, ser pequeno é uma vantagem do produto. O objetivo não é vencer uma competição de parâmetros, mas oferecer voz de qualidade no instante em que você toca em Reproduzir.
Por que o Local TTS usa o Kokoro-82M
Colocar um modelo em um aplicativo real de leitura exige mais do que incluir seus pesos. O texto precisa ser normalizado, dividido em limites naturais, preparado com antecedência, armazenado em cache, acompanhado na tela e mantido em reprodução quando o aparelho é bloqueado.
1. Vozes naturais em inglês americano e britânico
O catálogo oficial de vozes do Kokoro v1.0 inclui 20 vozes americanas e 8 britânicas. O catálogo completo do Local TTS oferece todas as 28, com diferentes sotaques, gêneros e características vocais.
Três vozes em inglês de alta qualidade estão disponíveis gratuitamente, para você testar o Kokoro com seu próprio texto antes de decidir se precisa do Pro.
2. Modelo integrado, não uma chamada de API
O Local TTS leva o modelo de voz dentro do aplicativo. Seu iPhone ou iPad transforma o texto diretamente em fala. Nenhum provedor TTS recebe o documento, não há fila de servidor e nenhuma conta é obrigatória.
Isso é especialmente útil para manuscritos não publicados, documentos de trabalho, notas pessoais e material de estudo. Se você ativar o iCloud, as notas podem sincronizar pela sua própria conta; a geração de voz continua acontecendo no dispositivo.
3. Dois caminhos otimizados para cada situação
O Local TTS usa MLX e Metal da Apple para gerar voz com rapidez em primeiro plano. Também usa um caminho Core ML otimizado para continuar preparando áudio durante a reprodução em segundo plano e a exportação, sem recorrer à nuvem.
Você não precisa gerenciar essa escolha. O app seleciona o mecanismo adequado e mantém a mesma voz e os mesmos controles.
4. De modelo de voz a leitor completo
O Kokoro gera a fala. O Local TTS transforma essa capacidade em uma ferramenta do dia a dia:
- cole um artigo ou escreva uma nota;
- importe PDF, EPUB, Word, TXT e Markdown;
- fotografe uma página com OCR no dispositivo;
- acompanhe o destaque durante a reprodução;
- escolha voz e velocidade para cada nota;
- continue pela Tela Bloqueada e Central de Controle;
- exporte a voz em M4A com o Pro.
Baixe o Local TTS grátis na App Store para experimentar o Kokoro-82M sem instalar um modelo nem abrir o terminal.
O Kokoro oferece os 31 idiomas do Local TTS?
Não, e essa distinção é importante. O Kokoro alimenta o catálogo de inglês americano e britânico do Local TTS. A voz do aplicativo em 31 idiomas é produzida pelo Supertonic 3, um mecanismo TTS multilíngue separado que também roda no dispositivo.
Nosso guia do Supertonic 3 mostra como uma voz do Local TTS lê os 31 idiomas offline.
A versão pública do Kokoro v1.0 inclui vozes em oito idiomas, mas a própria documentação alerta que o suporte fora do inglês pode ser limitado por diferenças nas ferramentas de pronúncia e nos dados de treinamento. O Local TTS usa o Kokoro onde sua implementação móvel é mais estável: o inglês. O Supertonic 3 cuida do português, coreano, japonês, espanhol, francês, alemão e dos demais idiomas compatíveis.
Os dois mecanismos funcionam localmente. Mudar de idioma não transfere você para um serviço na nuvem.
O que afeta a qualidade no uso real
A mesma voz não soa igualmente natural em todo texto:
- Pontuação: vírgulas, pontos e parágrafos orientam pausas e entonação.
- Nomes e termos técnicos: nomes incomuns, siglas e marcas podem exigir uma pequena edição.
- Tamanho da frase: um fragmento curto pode soar abrupto; uma frase longa demais, apressada.
- Números e símbolos: datas, números romanos e fórmulas podem ter mais de uma leitura.
- Escolha da voz: uma voz boa para romances pode não ser a melhor para revisar notas técnicas.
O Local TTS normaliza casos comuns e divide textos longos em unidades adequadas. Para obter o melhor resultado, mantenha uma pontuação clara e teste várias vozes com o conteúdo que você realmente pretende ouvir.
Impressionante, mas não infalível
O catálogo oficial explica que a qualidade varia conforme a quantidade e a qualidade dos dados de cada voz. Em geral, as vozes funcionam melhor numa faixa intermediária de cerca de 100–200 tokens; falas muito curtas podem ser mais fracas e as muito longas podem acelerar. O Local TTS reduz esses extremos com preparação e divisão por frases, mas não consegue tornar perfeita toda pronúncia.
O Kokoro também é um modelo de pesos abertos, não uma publicação completa e aberta do treinamento. Os pesos têm licença Apache, mas o card informa que o codificador e o sistema completo de treinamento não foram publicados.
Quando a pronúncia for crítica, confira nomes, abreviações e vocabulário técnico antes de exportar ou publicar. Áudios compartilhados também devem ser identificados como fala sintética.
Perguntas frequentes
O Local TTS realmente usa o Kokoro-82M?
Sim. O Kokoro-82M v1.0 alimenta as vozes neurais de inglês americano e britânico. O modelo e os dados de voz estão incluídos para uso no dispositivo.
Funciona sem internet?
Sim. Depois de instalar o Local TTS, a geração de voz funciona offline.
Quantas vozes Kokoro estão disponíveis?
O catálogo completo tem 28 vozes em inglês: 20 americanas e 8 britânicas. A versão gratuita inclui três vozes em inglês selecionadas e a voz multilíngue.
Meu PDF ou texto é enviado?
Não. Importação, texto colado, OCR e geração de voz são processados no dispositivo. Não há conta, anúncios nem rastreamento.
Preciso baixar o Kokoro separadamente?
Não. Você não precisa de Hugging Face, Python, linha de comando nem chave de API.
O Kokoro é usado para português e os demais idiomas?
Não no Local TTS. O Kokoro fornece o catálogo em inglês; o Supertonic 3 oferece a voz no dispositivo para 31 idiomas.
Ouça o Kokoro-82M com seu próprio texto
O Kokoro-82M torna a voz neural natural prática além de uma demonstração ou API na nuvem. O Local TTS acrescenta importação de documentos, OCR, acompanhamento, reprodução em segundo plano, controles de voz e exportação de áudio.
Cole um parágrafo, importe o PDF que você queria ler ou fotografe uma página impressa. Escolha uma voz em inglês e ouça: seu texto permanece no seu dispositivo do início ao fim.
Baixe o Local TTS grátis na App Store e ouça o Kokoro-82M no seu iPhone ou iPad.
Qualquer texto vira voz — offline
O Local TTS lê PDFs, e-books e artigos em voz alta direto no seu iPhone — em particular e com naturalidade.
Baixar na App Store