AI

Kokoro-82M이란? Local TTS가 온디바이스로 쓰는 이유

Local TTS 18 min

Kokoro-82M이 작고 자연스러운 이유와 한계, Local TTS가 iPhone·iPad에서 영어 음성을 오프라인으로 구현한 방법을 알아보세요.

텍스트 음성 변환 앱이 글을 읽을 때 화면에 보이는 재생 버튼과 속도 조절은 경험의 일부일 뿐입니다. 그 뒤에서 작동하는 모델이 음성의 자연스러움, 리듬, 발음, 그리고 ‘기다리지 않고 바로 듣는’ 느낌을 좌우합니다.

Local TTS는 미국·영국 영어 신경망 음성에 Kokoro-82M을 사용합니다. iPhone과 iPad에서 직접 실행할 만큼 작으면서도 긴 글을 자연스럽게 들려줄 수 있는 모델입니다. 입력한 글과 만들어진 음성은 기기 밖으로 나가지 않습니다.

Python도, 터미널도, 모델 파일이나 API 키도 필요 없습니다. Local TTS에 텍스트를 붙여넣거나 문서를 가져오고, 인쇄물을 촬영한 뒤 재생만 누르면 됩니다.

공식 이미지·기술 출처: 대표 이미지는 hexgrad/Kokoro-82M 공식 모델 저장소를 위해 Hugging Face가 제공하는 소셜 미리보기를 수정 없이 사용했으며, AI 생성 이미지가 아닙니다. 아래의 구조·공개일·학습·라이선스 정보는 공식 모델 카드를, 음성 수와 품질 한계는 공식 VOICES.md를 인용했습니다.

한 문장으로 설명하면

Kokoro-82M은 8,200만 개 매개변수로 자연스러운 24kHz 음성을 만드는 오픈 웨이트 TTS 모델이며, 더 큰 음성 모델보다 적은 연산으로 실행되어 비공개 온디바이스 낭독에 잘 맞습니다.

이 균형은 모바일에서 중요합니다. 강력한 서버 GPU에서 멋지게 들리는 모델이라도 휴대폰에는 너무 무거울 수 있습니다. Local TTS에는 자연스러운 음질뿐 아니라 현실적인 메모리 사용량, 빠른 재생 준비, 클라우드를 거치지 않는 구조가 필요합니다. Kokoro는 영어 음성에서 이 조합을 가능하게 합니다.

Kokoro-82M은 어떤 모델인가요?

Kokoro-82M은 hexgrad가 만든 신경망 텍스트 음성 변환 모델입니다. 이름의 ‘82M’은 약 8,200만 개의 매개변수를 뜻합니다. 공식 Kokoro 모델 카드는 더 큰 시스템에 견줄 만한 품질을 목표로 하면서 더 빠르고 경제적으로 실행되는 오픈 웨이트 모델이라고 설명합니다.

v1.0은 2025년 1월 27일 공개됐습니다. 모델 카드에 따르면 허용 라이선스, 퍼블릭 도메인, 합성 음성을 포함한 수백 시간의 오디오로 학습했으며 모델 웨이트는 Apache 2.0 라이선스로 배포됩니다.

항목Kokoro-82M v1.0
매개변수8,200만 개
공개일2025년 1월 27일
출력24kHz 음성
공개 음성 모음8개 언어, 54개 음성
Local TTS 적용 범위미국·영국 영어 음성 28종
모델 웨이트 라이선스Apache 2.0
Local TTS 처리 방식온디바이스, TTS 서버 불필요

Kokoro는 표현력 있는 말하기 스타일을 다루는 StyleTTS 2와 모델 출력을 오디오 파형으로 효율적으로 바꾸는 경량 신경망 보코더 ISTFTNet을 기반으로 합니다. 다만 공개된 Kokoro가 StyleTTS 2 학습 시스템 전체인 것은 아닙니다. 모델 카드는 공개 버전을 디코더 전용으로 설명하며, 디퓨전 구성 요소와 인코더는 공개되지 않았다고 밝힙니다.

쉽게 말하면, 거대한 범용 AI 모델 전체를 싣지 않고도 발음 정보와 선택한 음성 스타일을 실제 오디오로 바꾸는 데 필요한 부분을 작게 구성한 모델입니다.

휴대폰에서 8,200만 개가 중요한 이유

매개변수 수가 곧 성적표는 아닙니다. 큰 모델은 더 많은 뉘앙스를 표현할 수 있지만 일반적으로 메모리, 연산량, 배터리, 처리 시간이 더 필요합니다. 짧은 데모 문장 한 줄이 아니라 책의 한 장을 읽을 때는 이 비용이 바로 드러납니다.

Kokoro의 작은 규모 덕분에 Local TTS는 모델 주변에 완성도 있는 읽기 경험을 만들 수 있습니다.

  • 온디바이스 생성: 원격 서버를 기다리지 않고 기기에서 음성을 만듭니다.
  • 빠른 낭독: 현재 문장이 재생되는 동안 다음 문장을 준비할 수 있습니다.
  • 긴 글에 적합: PDF, EPUB, 기사를 TTS API의 글자당 비용 없이 읽습니다.
  • 완전한 오프라인: 비행기, 지하철, 네트워크가 불안정한 곳에서도 동작합니다.
  • 구조적인 개인정보 보호: 붙여넣은 글과 가져온 문서를 음성 생성용 서버에 보낼 필요가 없습니다.

여기서는 ‘작다’는 것이 제품의 장점입니다. 매개변수 수 경쟁이 아니라, 재생을 누르는 순간 고품질 음성을 쓸 수 있게 하는 것이 목표이기 때문입니다.

Local TTS가 Kokoro-82M을 선택한 이유

실제 읽기 앱에 모델을 넣는 일은 웨이트 파일을 앱에 포함하는 것으로 끝나지 않습니다. 텍스트를 정리하고 자연스러운 경계에서 나누며, 재생 전에 다음 음성을 준비하고, 캐시하고, 단어를 강조하며, 화면이 잠겨도 계속 읽어야 합니다.

1. 자연스러운 미국·영국 영어 음성

Kokoro v1.0의 공식 음성 목록에는 미국 영어 20종과 영국 영어 8종이 공개돼 있습니다. Local TTS의 전체 음성 카탈로그에서는 서로 다른 억양, 성별, 개성을 가진 영어 음성 28종을 모두 사용할 수 있습니다.

무료 버전에도 품질이 좋은 영어 음성 3종이 포함됩니다. Pro를 결정하기 전에 내가 듣고 싶은 글로 Kokoro 음성을 직접 확인할 수 있습니다.

2. API 호출이 아니라 앱에 포함된 모델

Local TTS는 음성 모델을 앱과 함께 제공합니다. 텍스트를 입력하면 iPhone이나 iPad가 직접 음성으로 바꿉니다. 문서를 받는 외부 TTS 업체도, 서버 대기열도, 필수 계정도 없습니다.

출판 전 원고, 업무 문서, 개인 메모, 학습 자료처럼 온라인 서비스에 붙여넣기 부담스러운 글에 특히 유용합니다. iCloud 동기화를 켜면 노트가 내 iCloud 계정을 통해 동기화될 수 있지만, 텍스트를 음성으로 바꾸는 AI 연산은 여전히 기기에서 처리됩니다.

3. 상황에 맞춘 두 가지 최적화 경로

Local TTS는 전면 재생을 빠르게 준비하기 위해 Apple의 MLX와 Metal 기술을 활용합니다. 화면이 잠긴 백그라운드 재생과 오디오 내보내기에서도 클라우드 대체 경로 없이 음성을 계속 준비할 수 있도록 최적화된 Core ML 경로도 사용합니다.

사용자가 이 둘을 관리할 필요는 없습니다. 앱이 상황에 맞는 엔진을 선택하고, 같은 음성과 재생 조작을 유지합니다.

4. 음성 모델을 완성된 리더로

Kokoro가 음성을 만든다면, Local TTS는 그 기능을 매일 쓸 수 있는 도구로 완성합니다.

  • 기사 붙여넣기와 직접 메모 작성
  • PDF, EPUB, Word, TXT, 마크다운 가져오기
  • 온디바이스 OCR로 인쇄물 촬영
  • 재생에 맞춘 단어 단위 하이라이트
  • 노트별 음성과 읽기 속도 설정
  • 잠금 화면과 제어 센터에서 계속 듣기
  • Pro에서 M4A 오디오 파일로 내보내기

모델 설치나 터미널 없이 Kokoro-82M을 써 보고 싶다면 **App Store에서 Local TTS를 무료로 다운로드**하세요.

31개 언어를 모두 Kokoro가 읽나요?

아닙니다. 이 구분은 중요합니다. Kokoro는 Local TTS의 미국·영국 영어 음성 카탈로그를 담당합니다. 앱의 31개 언어 음성은 별도의 다국어 온디바이스 TTS 엔진인 Supertonic 3가 담당합니다.

하나의 Local TTS 음성이 31개 지원 언어를 오프라인으로 읽는 방법은 Supertonic 3 가이드에서 자세히 확인할 수 있습니다.

공개된 Kokoro v1.0에는 8개 언어의 음성이 있지만, 프로젝트의 공식 음성 문서도 언어별 발음 도구와 학습 데이터 차이 때문에 비영어 지원이 부족할 수 있다고 밝힙니다. Local TTS는 모바일 구현에서 가장 안정적인 영어에 Kokoro를 적용합니다. 한국어, 일본어, 스페인어, 프랑스어, 독일어와 나머지 지원 언어는 Supertonic 3가 처리합니다.

두 엔진 모두 기기에서 실행됩니다. 다른 언어를 선택해도 클라우드 서비스로 전환되지 않습니다.

실제 음성 품질에 영향을 주는 것

같은 음성도 모든 글을 똑같이 자연스럽게 읽지는 않습니다. 다음 요소가 결과에 큰 영향을 줍니다.

  1. 문장 부호: 쉼표, 마침표, 문단 나눔은 자연스러운 호흡과 억양을 위한 단서입니다.
  2. 이름과 전문 용어: 낯선 이름, 약어, 브랜드명은 발음대로 표기를 조금 손봐야 할 수 있습니다.
  3. 문장 길이: 지나치게 짧은 조각은 툭 끊기고, 끝없이 긴 문장은 급하게 들릴 수 있습니다.
  4. 숫자와 기호: 날짜, 로마 숫자, 수식, 특수 기호는 읽는 방법이 여러 가지일 수 있습니다.
  5. 음성 선택: 소설에 잘 어울리는 음성과 교정·기술 문서에 잘 어울리는 음성은 다를 수 있습니다.

Local TTS는 흔한 예외를 정규화하고 긴 글을 적절한 합성 단위로 나눕니다. 가장 좋은 결과를 얻으려면 원문에 문장 부호를 넣고, 실제로 들을 내용으로 여러 음성을 미리 들어 보세요.

뛰어나지만 완벽하지는 않습니다

공식 음성 목록은 학습 데이터의 양과 품질에 따라 음성별 품질이 다르다고 설명합니다. 대체로 100~200 토큰 정도의 중간 길이에서 가장 잘 동작하며, 매우 짧은 문장은 약해지고 아주 긴 문장은 빨라질 수 있다고도 밝힙니다. Local TTS는 문장 단위 준비와 청킹으로 이런 극단을 줄이지만 모든 발음을 완벽하게 만들 수는 없습니다.

또 Kokoro는 완전한 학습 코드까지 공개된 모델이 아니라 오픈 웨이트 모델입니다. 다운로드 가능한 웨이트는 Apache 라이선스지만, 모델 카드에 따르면 인코더와 전체 학습 시스템은 공개되지 않았습니다.

발음 정확도가 중요한 작업이라면 내보내거나 게시하기 전에 이름, 약어, 전문 용어를 미리 들어 보세요. 음성을 공유할 때는 합성 음성임을 명확히 표시해야 합니다.

자주 묻는 질문

Local TTS가 정말 Kokoro-82M을 사용하나요?

네. Kokoro-82M v1.0이 Local TTS의 미국·영국 영어 신경망 음성을 구동합니다. 모델 웨이트와 음성 데이터는 온디바이스 실행을 위해 앱에 포함되어 있습니다.

인터넷 없이도 되나요?

네. Local TTS를 설치한 뒤에는 텍스트 음성 변환이 오프라인으로 동작합니다. 텍스트를 오디오로 바꾸는 데 인터넷 연결이 필요하지 않습니다.

Local TTS에는 Kokoro 음성이 몇 개 있나요?

전체 카탈로그에는 미국 영어 20종, 영국 영어 8종으로 총 28종의 Kokoro 영어 음성이 있습니다. 무료 버전에는 엄선한 영어 음성 3종과 다국어 음성이 포함됩니다.

음성을 만들기 위해 PDF나 텍스트를 업로드하나요?

아니요. 가져온 파일, 붙여넣은 텍스트, OCR, 음성 생성은 기기에서 처리됩니다. 계정도, 광고도, 추적도 없습니다.

Kokoro를 따로 다운로드해야 하나요?

아니요. Hugging Face, Python, 명령줄, API 키가 필요하지 않습니다. Local TTS가 모델과 읽기 인터페이스를 한 앱에 담았습니다.

한국어와 다른 지원 언어에도 Kokoro를 사용하나요?

Local TTS에서는 사용하지 않습니다. Kokoro는 영어 카탈로그를 담당하고, Supertonic 3가 31개 언어 온디바이스 음성을 제공합니다.

내 글로 Kokoro-82M을 들어 보세요

Kokoro-82M의 진짜 가치는 데모 페이지나 클라우드 API를 넘어 자연스러운 신경망 음성을 현실적인 기기에서 쓸 수 있게 한 데 있습니다. Local TTS는 이 모델에 문서 가져오기, OCR, 하이라이트, 백그라운드 재생, 음성 조절, 오디오 내보내기를 더한 오프라인 리더입니다.

문단 하나를 붙여넣고, 미뤄 둔 PDF를 가져오거나, 인쇄된 페이지를 촬영해 보세요. 영어 음성을 선택하고 재생하는 처음부터 끝까지 내 텍스트는 내 기기에 남습니다.

App Store에서 Local TTS를 무료로 다운로드하고 iPhone 또는 iPad에서 Kokoro-82M을 직접 들어 보세요.

어떤 글이든 음성으로 — 오프라인에서

Local TTS는 PDF, 전자책, 기사를 iPhone에서 바로 읽어 줍니다 — 비공개로, 자연스럽게.

App Store에서 다운로드