본문으로 건너뛰기
AI

Kokoro-82M vs Supertonic 3: Local TTS가 둘 다 쓰는 이유

Local TTS20 min

공식 벤치마크에서 두 모델은 서로 다른 종목의 1등입니다. Local TTS가 Kokoro-82M과 Supertonic 3를 한 앱에 연결한 이유를 수치로 확인하세요.

Local TTS에는 신경망 음성 모델이 하나가 아니라 둘 들어 있습니다. 미국·영국 영어 음성은 Kokoro-82M이, 31개 언어를 읽는 다국어 음성은 Supertonic 3가 담당합니다. 두 모델 모두 iPhone과 iPad에서 직접 실행됩니다.

모델을 하나만 쓰면 앱은 더 작고 단순해집니다. 그런데 왜 둘을 실었을까요? 공개된 벤치마크가 그 답을 분명하게 보여 주기 때문입니다. 자연스러움, 낭독 정확도, 속도, 언어 범위를 동시에 석권하는 소형 온디바이스 모델은 아직 없습니다. 두 모델은 각각 다른 종목의 1등이고, 둘을 연결하면 각 모델을 가장 잘하는 자리에만 쓸 수 있습니다.

이 글에서는 그 결정의 근거가 된 공식 평가 결과를 살펴봅니다. 모델 제작사가 직접 공개한 수치, 독립적인 제3자 테스트 결과, 그리고 그것이 실제로 듣게 되는 낭독 품질로 어떻게 이어지는지 순서대로 정리했습니다.

출처와 대표 이미지: 대표 이미지는 Supertonic 공식 저장소의 낭독 정확도 차트를 수정 없이 사용했습니다. Kokoro 수치는 공식 hexgrad/Kokoro-82M 모델 카드를, Supertonic 수치는 Supertone 공식 저장소와 모델 카드를, 동일 CPU 비교는 독립적인 제3자 벤치마크를 인용했습니다. 상류(업스트림) 수치는 각 발표 주체가 자체 하드웨어에서 측정한 것으로, iPhone 실측값이 아닙니다.

한 문장으로 설명하면

영어 자연스러움 평가에서는 Kokoro-82M이, CPU 합성 속도와 31개 언어 커버리지에서는 Supertonic 3가 앞서기 때문에, Local TTS는 영어를 Kokoro에, 다국어를 Supertonic 3에 맡기고 두 모델 모두 기기 안에서 실행합니다.

TTS 성능은 어떻게 측정할까요?

낭독 앱에 중요한 지표는 네 가지입니다. 수치를 보기 전에 각 지표의 의미부터 짚고 가겠습니다.

  1. 자연스러움은 사람이 평가합니다. 가장 잘 알려진 공개 테스트는 블라인드 아레나입니다. 청취자가 익명의 음성 두 개를 듣고 더 자연스러운 쪽에 투표하며, 그 결과가 마케팅이 개입할 수 없는 Elo 방식 순위로 쌓입니다.
  2. 낭독 정확도는 모델이 주어진 텍스트를 빠뜨리거나 반복하거나 뭉개지 않고 그대로 읽었는지를 봅니다. 생성된 음성을 다시 텍스트로 받아 적어 단어 오류율(WER) 또는 문자 오류율(CER)로 채점하며, 낮을수록 좋습니다.
  3. 속도는 실시간 계수(RTF)로 표시합니다. 합성에 걸린 시간을 오디오 길이로 나눈 값으로, RTF 0.3이면 1초 분량의 음성을 0.3초에 만든다는 뜻입니다(실시간의 약 3.3배). 낮을수록 빠릅니다.
  4. 크기(풋프린트)는 매개변수 수, 다운로드 용량, 메모리 사용량입니다. 휴대폰 앱에 들어가는 모델과 서버 GPU가 필요한 모델을 가르는 기준입니다.

클라우드 음성은 데이터센터 하드웨어로 네 가지를 모두 쫓을 수 있지만, 온디바이스 모델은 반드시 무언가를 골라야 합니다. 두 모델의 길이 갈라지는 지점이 바로 여기입니다.

벤치마크가 말하는 Kokoro-82M

Kokoro-82M의 대표 성적은 사람이 매긴 선호도 순위입니다. v1.0 공개 전, 공식 모델 카드는 Kokoro v0.19가 TTS Spaces Arena 1위에 올랐다고 기록했습니다. Hugging Face의 블라인드 청취 아레나에서, 수백 시간 분량의 오디오로만 학습한 이 모델이 XTTS v2(매개변수 4억 6,700만 개), MetaVoice(12억 개)처럼 몇 배나 큰 모델보다 높은 Elo를 받은 것입니다.

잠시 곱씹어 볼 만한 결과입니다. 모델 이름도 크기도 볼 수 없는 테스트에서, 청취자들은 8,200만 매개변수 모델을 수십억 매개변수 시스템보다 더 자연스럽다고 골랐습니다. 연산량 대비 영어 자연스러움에서 Kokoro는 소형 모델의 기준점이 됐습니다.

항목Kokoro-82M v1.0
매개변수8,200만 개
사람 평가v0.19가 TTS Spaces Arena 1위
출력24kHz 음성
음성공개 54종, Local TTS에는 영어 28종 탑재
라이선스Apache 2.0
Local TTS 내 역할미국·영국 영어 음성 카탈로그

대신 커버리지를 내줬습니다. 공개된 Kokoro는 8개 언어를 다루지만, 공식 음성 카탈로그는 영어 외 언어의 품질이 학습 데이터에 따라 들쭉날쭉하다고 밝힙니다. 요컨대 영어에 특화된 스페셜리스트입니다.

벤치마크가 말하는 Supertonic 3

Supertone이 2026년 4월 29일 공개한 Supertonic 3는 정반대 방향, 즉 범위와 효율로 평가받는 모델입니다. 공식 저장소는 Minimax-MLS-test 벤치마크에서 측정한 낭독 정확도를 공개하며, 약 9,900만 매개변수의 이 모델을 VoxCPM2, OmniVoice, Qwen3-TTS 같은 훨씬 큰 오픈 TTS 시스템과 비교합니다.

이 웹사이트가 제공되는 11개 언어에 대한 Supertone의 공식 오류율은 다음과 같습니다(낮을수록 좋음, *는 문자 오류율, 나머지는 단어 오류율).

언어VoxCPM2OmniVoiceQwen3-TTSSupertonic 3
영어2.112.022.252.06
한국어*4.703.224.073.26
일본어*3.353.813.674.61
독일어0.850.960.520.86
프랑스어4.414.743.824.89
스페인어1.340.990.751.13
포르투갈어1.741.401.212.48
이탈리아어1.741.291.401.75
네덜란드어0.840.771.47
폴란드어1.300.641.63
튀르키예어0.882.181.00

Supertonic 3가 모든 행에서 1등인 것은 아니고, Supertone도 그렇게 주장하지 않습니다. 공식 결론은 더 실용적입니다. 몇 배나 큰 모델들과 경쟁 가능한 오류율 범위를 31개 언어에 걸쳐 유지하면서, GPU 없이 돌아갈 만큼 작다는 것입니다.

돋보이는 것은 속도입니다. Supertone은 최신 iPhone보다 훨씬 약한 하드웨어에서 Supertonic 3를 시연합니다. 비행기 모드의 Onyx Boox Go 6 전자책 리더에서 평균 RTF 0.3×, 즉 전자책 리더에서도 실시간의 약 3배 속도로 합성했고, Raspberry Pi에서도 실시간 합성을 보여 줬습니다. 공식 런타임 비교 차트는 NVIDIA A100 서버 GPU에서 측정된 더 큰 모델들과 견줘도 일반 CPU에서 빠르게 돌아가며 메모리도 훨씬 적게 쓴다는 것을 보여 줍니다.

A100 GPU에서 측정된 대형 모델들과 CPU 추론 속도·메모리를 비교한 Supertonic 공식 런타임 차트

출처: Supertone 공식 런타임 풋프린트 차트, 수정 없이 게재.

항목Supertonic 3
매개변수약 9,900만 개
낭독 정확도훨씬 큰 모델들과 경쟁 가능한 WER/CER
공개 시연 속도전자책 리더에서 RTF 0.3×, Pi에서 실시간
출력44.1kHz 음성
지원 언어31개
라이선스OpenRAIL-M
Local TTS 내 역할31개 언어를 읽는 다국어 음성

우리 결정을 설명해 주는 맞대결 테스트

가장 직접적인 비교는 독립적인 제3자 벤치마크에서 나왔습니다. GPU 없는 평범한 4코어 CPU, 즉 AI 서버보다 휴대폰에 가까운 조건에서 두 모델을 같이 돌린 테스트입니다. 두 가지 결과가 핵심입니다.

  • 속도: Supertonic 3는 표준 품질 설정에서 RTF 0.313, 실시간의 약 3.2배로 합성했습니다. Kokoro-82M은 RTF 0.469~0.509로 실시간의 약 2배였습니다. 작은 CPU에서 둘 다 실시간보다 빠르지만, 여유는 Supertonic 쪽이 큽니다.
  • 자연스러움: 같은 테스트에서 영어 음성은 Kokoro 쪽이 더 사람답고 운율이 자연스럽다고 평가받았습니다. Supertonic의 최고 속도 설정은 상대적으로 밋밋하게 들렸습니다.

정리하면, 어느 쪽에도 이해관계가 없는 테스터가 공식 수치와 같은 결론에 도달했습니다. 영어 자연스러움은 Kokoro, 속도와 언어 범위는 Supertonic 3. 모델을 하나만 고른다면 반드시 무언가를 포기해야 합니다. Local TTS는 고르지 않는 쪽을 골랐습니다.

Local TTS가 두 모델을 연결한 방법

Local TTS 안에서 두 엔진은 하나의 리더 뒤에 나란히 놓입니다. 음성 목록의 모든 음성은 두 모델 중 하나에 속하고, 음성을 고르면 앱이 합성 요청을 알맞은 엔진으로 자동으로 보냅니다. 재생 버튼도, 하이라이트도, 속도 조절도, 오프라인 보장도 그대로입니다.

영어는 Kokoro-82M에게

이유는 사람 평가 결과입니다. 청취자들이 블라인드 테스트에서 82M 모델을 수십억 매개변수 시스템보다 꾸준히 위에 놓았다면, 영어 오디오북과 기사, PDF는 그 모델에게 맡기는 것이 맞습니다. Local TTS는 Kokoro의 미국·영국 영어 음성 28종을 모두 싣고, Apple Silicon에 맞춰 조정한 Core ML 파이프라인으로 실행합니다. 이 경로는 단어별 하이라이트를 구동하는 단어 타이밍을 제공하고, 백그라운드 재생 중에도 합성을 이어 갑니다.

다국어는 Supertonic 3에게

이유는 커버리지와 효율입니다. 내장된 Supertonic 3 모델 하나가 한국어, 일본어, 독일어, 프랑스어, 스페인어를 포함한 31개 언어를 44.1kHz로, 훨씬 큰 시스템들과 경쟁 가능한 오류율로 읽습니다. CPU 우선 설계 덕분에 배터리로 긴 문서를 읽거나 백그라운드로 듣는 일이 현실적으로 가능합니다. 프리셋 스타일 10종(F1F5, M1M5)이 각각 31개 언어를 모두 읽기 때문에, 언어가 바뀌는 문서도 한 목소리로 이어집니다.

둘을 묶어서 피한 것들

  • 영어 전용 앱. Kokoro만 썼다면 30개 언어가 좋은 음성을 얻지 못했을 것입니다.
  • 더 밋밋한 단일 영어 음성. Supertonic만 썼다면 아레나 1위의 영어 자연스러움과 28종의 영어 음성 카탈로그를 포기해야 했을 것입니다.
  • 클라우드 폴백. 두 모델 모두 앱에 내장할 만큼 작기 때문에, “서버에 있는 더 좋은 모델”로 텍스트를 보낼 일이 없습니다.

두 엔진을 함께 싣는 만큼 앱 용량과 설계 복잡도는 늘어나지만, 우리는 그것이 남는 거래라고 판단합니다. 위의 벤치마크가 사실상 이 설계의 사양서입니다.

App Store에서 Local TTS를 무료로 다운로드하고 두 엔진을 직접 비교해 보세요. Kokoro 영어 음성 3종과 Supertonic 3 다국어 음성 1종이 무료입니다.

이 수치들을 정직하게 읽는 법

벤치마크는 결정의 근거일 뿐, 토론의 끝이 아닙니다. 네 가지를 함께 기억해 주세요.

  1. 상류 수치는 iPhone에서 측정된 것이 아닙니다. 아레나 순위, WER 표, RTF 수치는 각 발표 주체의 하드웨어에서 나왔습니다. Local TTS의 실제 체감 성능은 기기, 텍스트, 설정에 따라 달라집니다. 다만 두 모델의 상대적 순위는 우리가 찾을 수 있었던 독립 CPU 테스트들에서도 그대로 유지됐습니다.
  2. 아레나 순위는 움직입니다. Kokoro의 1위는 v0.19 평가 시점의 공식 기록이며, 아레나에는 매달 새 모델이 들어옵니다. 이 기록이 변하지 않고 증명한 것은, 소형 모델도 블라인드 영어 청취 테스트에서 이길 수 있다는 사실입니다.
  3. WER/CER은 기계 전사로 채점됩니다. 단어를 정확히 읽었는지를 재는 지표이지, 낭독이 아름다운지를 재는 지표가 아닙니다. 후자는 사람 아레나가 잽니다. 두 지표를 같이 읽어야 하는 이유입니다.
  4. 속도 설정은 품질과 맞바꿉니다. Supertonic의 극단적인 고속 설정은 자연스러움이 떨어집니다. Local TTS는 화제성 있는 최고 속도 설정이 아니라 균형 잡힌 설정을 사용합니다.

자주 묻는 질문

Local TTS가 정말 두 모델을 기기에서 실행하나요?

네. Kokoro-82M과 Supertonic 3 모두 앱에 내장되어 있습니다. 텍스트, 문서, 생성된 오디오는 iPhone·iPad 안에서 처리되며 음성 서버가 없습니다.

제가 듣게 되는 모델은 어느 쪽인가요?

음성 선택을 따라갑니다. 미국·영국 영어 음성 28종은 Kokoro-82M, 다국어 스타일 10종(F1F5, M1M5)은 Supertonic 3입니다. 노트마다 언제든 바꿀 수 있습니다.

VoxCPM2나 Qwen3-TTS처럼 벤치마크 상위의 큰 모델을 쓰면 되지 않나요?

그 시스템들은 몇 배나 크고 서버 GPU에서 벤치마크됩니다. Local TTS는 휴대폰에서 오프라인으로 도는 모델을 전제로 하며, 그 제약 안에서는 이 두 모델이 우리가 아는 가장 강력한 공개 조합입니다.

Kokoro와 Supertonic 중 어느 쪽이 빠른가요?

같은 소형 CPU에서 독립 테스트 기준 Supertonic 3는 실시간의 약 3배, Kokoro는 약 2배였습니다. 둘 다 Local TTS에서 끊김 없이 낭독하기에 충분한 속도입니다.

두 엔진의 소리가 다르게 들리나요?

네, 의도된 차이입니다. Kokoro 음성은 개성 있는 영어 목소리들이고, Supertonic 스타일은 일관된 다국어 내레이터입니다. 무료 버전에 두 엔진이 모두 포함되어 있으니 본인의 텍스트로 몇 가지 음성을 들어 보세요.

인터넷 연결이 필요한 기능이 있나요?

아니요. 두 모델 모두 오프라인으로 음성을 생성합니다. 비행기 모드에서 직접 확인해 보셔도 좋습니다.

벤치마크를 귀로 확인해 보세요

수치는 설계를 설명하고, 확인은 귀가 합니다. 영어 기사를 붙여넣고 Kokoro 음성으로 들어 본 다음, 한국어나 독일어, 스페인어 문단을 붙여넣어 Supertonic 3가 이어받는 것을 들어 보세요. 같은 앱, 같은 프라이버시, 중간에 클라우드는 없습니다.

App Store에서 Local TTS를 무료로 다운로드하고, 모델을 하나가 아니라 둘 싣는 이유를 직접 들어 보세요.

두 엔진을 더 깊이 알고 싶다면 Kokoro-82M 가이드Supertonic 3 가이드를 읽어 보세요.

어떤 글이든 인터넷 없이 음성으로

PDF, 전자책, 기사를 iPhone에서 바로 들어 보세요. 읽는 내용은 기기 안에만 보관됩니다.

App Store에서 다운로드