AI

Kokoro-82Mとは?Local TTSがオンデバイスで使う理由

Local TTS 14 min

Kokoro-82Mが小型で自然な理由、その限界、Local TTSがiPhone・iPadで英語音声をオフライン生成する仕組みを解説します。

読み上げアプリの使い心地を決めるのは、画面に見える再生ボタンや速度調整だけではありません。背後のモデルが、声の自然さ、リズム、発音、そして待たずに聴き始められるかを左右します。

Local TTSは、アメリカ英語とイギリス英語のニューラル音声にKokoro-82Mを採用しています。iPhoneやiPadで直接動かせるほど小さく、長い文章を自然に聴くための力を備えたモデルです。入力したテキストと生成音声はデバイスの外へ送られません。

Python、ターミナル、モデルファイル、APIキーは不要です。テキストを貼り付けるか、文書を読み込むか、印刷物を撮影して再生を押すだけです。

公式画像・技術情報の出典: カバーはhexgrad/Kokoro-82M公式モデルリポジトリ用にHugging Faceが提供するソーシャルプレビューを変更せず使用しており、AI生成画像ではありません。構造、公開日、学習、ライセンスは公式モデルカード、声数と品質上の注意は公式VOICES.mdを参照しています。

一文で答えると

Kokoro-82Mは、8,200万パラメータで自然な24 kHz音声を生成するオープンウェイトTTSモデルです。大型モデルより少ない計算量で動くため、プライベートなオンデバイス読み上げに適しています。

サーバー上の強力なGPUでよく聞こえるモデルでも、スマートフォンに適しているとは限りません。Local TTSには自然な音質に加えて、現実的なメモリ使用量、素早い再生準備、クラウドAPIを使わない構成が必要です。Kokoroは英語音声でそのバランスを実現します。

Kokoro-82Mとは?

Kokoro-82Mはhexgradが開発したニューラル音声合成モデルです。「82M」は約8,200万のパラメータを表します。公式のKokoroモデルカードでは、大型システムに匹敵する品質を目指しつつ、高速で費用効率の高いオープンウェイトモデルと説明されています。

v1.0は2025年1月27日に公開されました。モデルカードによると、許諾されたデータ、パブリックドメイン音声、合成音声を含む数百時間の音声で学習され、ウェイトはApache 2.0ライセンスで配布されています。

項目Kokoro-82M v1.0
パラメータ8,200万
公開日2025年1月27日
出力24 kHz音声
公開音声コレクション8言語・54音声
Local TTSでの採用範囲米国・英国英語の28音声
ウェイトのライセンスApache 2.0
Local TTSでの処理オンデバイス、TTSサーバー不要

Kokoroは、表現豊かな話し方を扱うStyleTTS 2と、モデル出力を効率よく波形へ変換する軽量ボコーダーISTFTNetを基盤としています。ただし公開版はStyleTTS 2の学習システム全体ではありません。モデルカードでは、ディフュージョン部分と公開エンコーダーを含まないデコーダーのみのモデルとされています。

スマートフォンでは「小さい」ことが強みになる

パラメータ数は品質の点数ではありません。大きなモデルは表現力が増える一方、通常はメモリ、計算量、電力、時間も多く必要とします。短いデモではなく章全体を読むと、そのコストがはっきり表れます。

Kokoroのコンパクトさにより、Local TTSはモデルの周囲に実用的な読書体験を構築できます。

  • デバイス内生成: リモートサーバーを待たず、端末上で音声を作ります。
  • 素早い読み上げ: 現在の文を再生しながら次の文を準備できます。
  • 長文にも実用的: PDF、EPUB、記事をAPIの文字単価なしで聴けます。
  • 完全オフライン: 飛行機や地下鉄、通信が不安定な場所でも動作します。
  • 設計によるプライバシー: 貼り付けた文章や文書を音声生成サーバーへ送る必要がありません。

ここでは小型であることが製品上の利点です。目的はパラメータ数の競争ではなく、再生を押したときに高品質な音声を使えることだからです。

Local TTSがKokoro-82Mを選んだ理由

実際の読み上げアプリには、ウェイトを同梱する以上の作業が必要です。テキストの正規化、自然な境界での分割、先読み生成、キャッシュ、ハイライト、画面ロック中の継続再生まで整える必要があります。

1. 自然なアメリカ英語・イギリス英語

Kokoro v1.0の公式音声カタログには、アメリカ英語20音声とイギリス英語8音声があります。Local TTSの全カタログでは、アクセント、性別、声の個性が異なる28音声を利用できます。

無料版にも厳選された英語音声が3つ含まれるため、Proを選ぶ前に自分の文章でKokoroを試せます。

2. APIではなく、アプリに組み込まれたモデル

Local TTSは音声モデルをアプリに同梱します。入力した文章はiPhoneまたはiPadで直接音声になります。文書を受け取る外部TTS業者も、サーバー待ちも、必須アカウントもありません。

未公開原稿、仕事の資料、個人メモ、学習教材など、オンラインサービスへ貼り付けたくない内容に特に有効です。iCloud同期を使う場合も、音声合成そのものはデバイス上で行われます。

3. 状況に合わせた2つの最適化経路

Local TTSは、前面での素早い生成にAppleのMLXとMetalを利用します。バックグラウンド再生や音声書き出しでもクラウドへ切り替えず生成を続けられるよう、最適化したCore ML経路も使います。

ユーザーが切り替えを管理する必要はありません。アプリが適切なエンジンを選び、同じ音声と操作を保ちます。

4. 音声モデルを完成したリーダーへ

Kokoroが音声を生成し、Local TTSが日常で使える読み上げ体験に仕上げます。

  • 記事の貼り付け、メモ作成
  • PDF、EPUB、Word、TXT、Markdownの読み込み
  • オンデバイスOCRによる印刷物の撮影
  • 再生に同期した単語ハイライト
  • ノートごとの音声と速度設定
  • ロック画面とコントロールセンターからの再生
  • ProでM4A音声を書き出し

モデルのインストールやターミナルなしで試すなら、**App StoreからLocal TTSを無料でダウンロード**してください。

31言語はすべてKokoroが読むのですか?

いいえ。この区別は重要です。KokoroはLocal TTSのアメリカ英語・イギリス英語カタログを担当します。アプリの31言語音声は、別の多言語オンデバイスTTSエンジンSupertonic 3が担当します。

1つのLocal TTS音声が31言語をオフラインで読む仕組みは、Supertonic 3ガイドで詳しく紹介しています。

公開版Kokoro v1.0には8言語の音声がありますが、公式文書も発音処理や学習データの差により、英語以外の対応が薄い場合があると説明しています。Local TTSはモバイル実装で最も安定する英語にKokoroを使い、日本語、韓国語、スペイン語、フランス語、ドイツ語などはSupertonic 3で読み上げます。

どちらのエンジンもデバイス上で動作します。言語を変えてもクラウドサービスには切り替わりません。

実際の音声品質を左右するもの

同じ声でも、すべての文章を同じように自然には読めません。

  1. 句読点: 読点、句点、段落は自然な間と抑揚の手がかりになります。
  2. 固有名詞と専門用語: 珍しい名前、略語、ブランド名は表記調整が必要な場合があります。
  3. 文の長さ: 極端に短い断片は唐突に、長い一文は早口に聞こえることがあります。
  4. 数字と記号: 日付、ローマ数字、数式、特殊記号には複数の読み方があります。
  5. 音声の選択: 小説向きの声と、校正や技術文書向きの声は異なります。

Local TTSは一般的な例外を正規化し、長文を適切な合成単位に分割します。最良の結果を得るには、句読点のある原文を使い、実際に聴く内容で複数の声を試してください。

優れたモデルですが、完璧ではありません

公式カタログでは、学習データの量と質により音声ごとの品質が異なるとされています。また、多くの声は約100〜200トークンで最も安定し、極端に短い発話は弱く、長い発話は速くなる場合があります。Local TTSは文単位の準備と分割でこの問題を抑えますが、すべての発音を完璧にはできません。

Kokoroは完全な学習コードまで公開したモデルではなく、オープンウェイトモデルです。ウェイトはApacheライセンスですが、モデルカードによるとエンコーダーと学習システム全体は公開されていません。

発音が重要な用途では、書き出しや公開の前に名前、略語、専門用語を確認してください。共有する音声には合成音声であることも明記してください。

よくある質問

Local TTSは本当にKokoro-82Mを使っていますか?

はい。Kokoro-82M v1.0がアメリカ英語・イギリス英語のニューラル音声を動かしています。モデルと音声データはオンデバイス利用のためアプリに含まれています。

インターネットなしで使えますか?

はい。Local TTSのインストール後は音声生成がオフラインで動作します。

Kokoro音声はいくつありますか?

全カタログにはアメリカ英語20、イギリス英語8の計28音声があります。無料版には選ばれた英語3音声と多言語音声が含まれます。

PDFやテキストをアップロードしますか?

いいえ。文書、貼り付けたテキスト、OCR、音声生成はデバイス上で処理されます。アカウント、広告、トラッキングもありません。

Kokoroを別にダウンロードする必要がありますか?

ありません。Hugging Face、Python、コマンドライン、APIキーは不要です。

日本語などにもKokoroを使いますか?

Local TTSでは、Kokoroは英語カタログを担当し、Supertonic 3が31言語のオンデバイス音声を提供します。

自分の文章でKokoro-82Mを聴く

Kokoro-82Mの価値は、自然なニューラル音声をデモやクラウドAPIの外でも実用にできることです。Local TTSはそこに文書読み込み、OCR、ハイライト、バックグラウンド再生、音声調整、書き出しを加えました。

段落を貼り付ける、読みたかったPDFを読み込む、印刷ページを撮影する。英語音声を選んで再生しても、文章は最初から最後まで自分のデバイスに残ります。

App StoreからLocal TTSを無料でダウンロードして、iPhoneまたはiPadでKokoro-82Mをお試しください。

どんなテキストも音声に — オフラインで

Local TTSはPDF、電子書籍、記事をiPhone上でそのまま読み上げます — プライベートに、自然に。

App Storeでダウンロード