
하나의 자연스러운 목소리가 영어 기사, 한국어 메모, 일본어 학습지, 스페인어 전자책을 모두 읽는다면 어떨까요? 언어 팩을 따로 받거나 문장 하나를 읽을 때마다 클라우드로 보낼 필요도 없이 말입니다.
Local TTS 안에서 Supertonic 3가 바로 그 일을 합니다. 앱의 31개 언어 음성을 구동하는 다국어 엔진으로, iPhone이나 iPad에서 직접 실행됩니다. 텍스트를 붙여넣고, 문서를 가져오거나, 인쇄물을 촬영하면 Local TTS가 언어를 감지해 기기에서 음성을 만듭니다.
모델 설치, 명령줄, 계정, API 키가 필요 없습니다. 무료 버전에도 31개 언어를 모두 읽는 다국어 음성 1종이 포함되어 내 글로 바로 시험할 수 있습니다.
공식 이미지 출처: 글의 대표 이미지는 Supertonic 공식 모델 저장소가 배포한 Supertonic 3 히어로 이미지를 수정 없이 사용했습니다. 이미지 속 성능 수치는 Supertone이 공개한 원본 릴리스 기준입니다.
한 문장으로 설명하면
Supertonic 3는 약 9,900만 개 매개변수로 31개 언어의 44.1kHz 음성을 ONNX Runtime에서 생성하는 경량 TTS 모델이며, 휴대폰에서 비공개 다국어 낭독을 가능하게 합니다.
‘다국어’만큼 중요한 단어는 온디바이스입니다. Supertonic 3는 문단마다 음성 서버로 업로드할 필요가 없습니다. Local TTS를 설치하면 모델, 음성 스타일, 언어 처리, 오디오 생성이 모두 오프라인으로 준비됩니다.
Supertonic 3는 어떤 모델인가요?
Supertonic 3는 Supertone이 만든 오픈 웨이트 다국어 텍스트 음성 변환 모델입니다. 공식 Supertonic 저장소는 클라우드 호출이나 GPU 없이 ONNX Runtime으로 로컬 추론하도록 설계된 경량 시스템이라고 설명합니다.
프로젝트는 2026년 4월 29일 Supertonic 3를 공개했습니다. Supertone에 따르면 이전 Supertonic 2보다 지원 언어가 5개에서 31개로 늘었고, 단어 반복과 누락을 줄였으며, 두 버전이 공통으로 지원하는 언어에서 화자 일관성을 개선했습니다.
| 항목 | Local TTS의 Supertonic 3 |
|---|---|
| 모델 크기 | 약 9,900만 개 매개변수 |
| 지원 언어 | 31개 |
| 오디오 출력 | 44.1kHz |
| 실행 환경 | CPU 기반 ONNX Runtime |
| Local TTS 음성 스타일 | F1–F5, M1–M5 총 10종 |
| 무료 버전 | 31개 언어를 읽는 다국어 스타일 1종 |
| 음성 생성 시 네트워크 | 불필요 |
| 모델 웨이트 라이선스 | OpenRAIL-M |
공개 ONNX 에셋은 텍스트 인코더, 길이 예측기, 벡터 추정기, 보코더로 역할을 나눕니다. Local TTS에서는 이 파일을 직접 다룰 필요가 없습니다. 앱이 모델을 포함하고 모든 단계를 연결합니다.

출처: Supertone의 공식 모델 크기 비교. 원본 도표를 수정 없이 사용했으며, 모델명과 매개변수 수는 제작사가 공개한 비교 기준입니다.
Local TTS가 지원하는 31개 언어
Local TTS의 Supertonic 3 음성은 공식 모델 카드에 공개된 31개 언어를 모두 읽습니다.
| 아랍어 | 불가리아어 | 크로아티아어 | 체코어 |
| 덴마크어 | 네덜란드어 | 영어 | 에스토니아어 |
| 핀란드어 | 프랑스어 | 독일어 | 그리스어 |
| 힌디어 | 헝가리어 | 인도네시아어 | 이탈리아어 |
| 일본어 | 한국어 | 라트비아어 | 리투아니아어 |
| 폴란드어 | 포르투갈어 | 루마니아어 | 러시아어 |
| 슬로바키아어 | 슬로베니아어 | 스페인어 | 스웨덴어 |
| 터키어 | 우크라이나어 | 베트남어 |
중국어는 현재 Supertonic 3의 공식 31개 언어에 포함되지 않습니다. Local TTS는 모델이 어떤 언어에서 소리를 낼 수 있다는 이유만으로 그 언어를 ‘지원’한다고 표시하지 않습니다.
다양한 언어 지원은 번역할 때만 필요한 것이 아닙니다. 하나의 읽기 목록에 영어 논문, 한국어 메모, 프랑스어 PDF, 일본어 EPUB이 섞일 수 있습니다. 각 언어마다 다른 음성 서비스를 찾지 않고 익숙한 음성 스타일 하나로 모두 들을 수 있습니다.
Local TTS가 Supertonic 3를 선택한 이유
Supertonic 3가 다국어 오디오 엔진을 제공한다면, Local TTS는 이를 문서와 학습 자료, 일상적인 듣기에 맞는 리더로 완성합니다.
1. 한 음성 스타일로 여러 언어 읽기
Local TTS에는 여성형 5종과 남성형 5종, 총 10개의 Supertonic 3 프리셋 스타일이 들어 있습니다. 각 스타일이 31개 언어를 모두 읽으므로 문서의 언어가 바뀌어도 목소리를 바꿀 필요가 없습니다.
앱은 텍스트에서 언어를 자동 감지합니다. 문장 사이에서 언어가 바뀌면 Local TTS가 자연스러운 경계로 음성을 나누고 각 구간에 맞는 언어를 전달합니다. 발음 체계는 바뀌지만 선택한 목소리의 성격은 유지됩니다.
짧은 이름이나 외래어 하나는 어떤 자동 감지기에서도 모호할 수 있습니다. 완전한 문장은 더 강한 언어 단서를 제공하며, Local TTS는 불확실한 짧은 조각을 주변 언어와 유지해 불필요한 전환을 줄입니다.
2. CPU 추론으로 백그라운드에서도 계속 읽기
Supertonic 3는 Local TTS에서 CPU 기반 ONNX Runtime으로 실행됩니다. 음성을 만들기 위해 원격 GPU는 물론 iPhone의 GPU도 필요하지 않습니다.
덕분에 앱은 백그라운드 재생 중에도 다음 오디오를 준비할 수 있습니다. 화면을 잠그고 다른 앱으로 전환하거나 잠금 화면에서 조작해도 클라우드 대체 경로 없이 문서를 계속 들을 수 있습니다.
3. 문서는 기기 밖으로 나가지 않기
온라인 TTS 서비스는 음성을 만들기 전에 텍스트를 받아야 합니다. Local TTS는 다릅니다. PDF의 텍스트, 전자책의 장, 붙여넣은 메모, OCR 결과, 생성된 음성이 iPhone 또는 iPad에서 처리됩니다.
개인 메모, 학교 자료, 출판 전 원고, 내부 문서를 들을 때 특히 유용합니다. Local TTS 계정도, 광고도, 추적도 없습니다. 선택적인 iCloud 동기화는 내 iCloud 계정을 사용하고, 텍스트를 음성으로 바꾸는 AI 연산은 기기에 남습니다.
4. 모델 테스트가 아닌 완성된 읽기 도구
공개 Supertonic 프로젝트는 개발자용 코드를 제공합니다. Local TTS는 누구나 쓸 수 있는 리더로 모델을 구성했습니다.
- 텍스트 붙여넣기와 직접 메모 작성
- PDF, EPUB, Word, TXT, 마크다운 가져오기
- 온디바이스 OCR로 인쇄물 촬영
- 재생 중인 현재 문장 따라가기
- 노트별 음성과 읽기 속도 설정
- 잠금 화면과 제어 센터에서 듣기
- Pro에서 전체 낭독을 M4A로 내보내기
**App Store에서 Local TTS를 무료로 다운로드**하고 Supertonic 3 음성을 31개 언어 중 원하는 언어로 시험해 보세요.
Supertonic 3와 Kokoro-82M의 역할은 다릅니다
Local TTS는 하나의 모델에 모든 일을 맡기지 않고 두 가지 온디바이스 음성 제품군을 결합합니다.
| Supertonic 3 | Kokoro-82M | |
|---|---|---|
| Local TTS의 역할 | 다국어 낭독 | 프리미엄 미국·영국 영어 낭독 |
| 언어 범위 | 31개 언어 | Local TTS에서는 영어 |
| 음성 선택 | 모든 언어를 읽는 스타일 10종 | 영어 음성 28종 |
| 출력 샘플레이트 | 44.1kHz | 24kHz |
| 가장 좋은 선택 이유 | 여러 언어에서 일관된 목소리 | 다양한 영어 목소리와 개성 |
주로 여러 언어의 자료를 듣는다면 Supertonic 3가 자연스러운 시작점입니다. 영어를 주로 듣고 미국·영국 음성을 다양하게 고르고 싶다면 Kokoro가 맞습니다. 노트마다 언제든 바꿀 수 있습니다.
영어 음성 엔진이 궁금하다면 Kokoro-82M 가이드도 읽어 보세요.
다국어 낭독 품질에 영향을 주는 것
31개 언어를 지원해도 모든 입력의 언어가 명확한 것은 아닙니다. 다음 요소가 결과에 큰 영향을 줍니다.
- 언어를 판단할 충분한 텍스트: 이름 하나보다 완전한 문장이 더 정확하게 감지됩니다.
- 명확한 문장 부호: 마침표, 쉼표, 문단은 어디서 쉬어야 하는지 알려 줍니다.
- 한 문장에 하나의 주 언어: 단어마다 언어가 바뀌는 것보다 언어별 문장이 안정적입니다.
- 이름, 약어, 숫자: 국가와 언어에 따라 읽는 관습이 다를 수 있습니다.
- 원문의 품질: 흐릿한 사진에서 생긴 OCR 오류는 그대로 발음 오류가 됩니다.
여러 언어가 섞인 문서라면 가능하면 각 언어를 완전한 구절이나 문장으로 작성하세요. 중요한 오디오를 내보내기 전에는 이름과 전문 용어를 선택한 목소리로 미리 들어 보는 것이 좋습니다.
한계와 책임 있는 사용
Supertonic 3는 효율적인 로컬 TTS를 위해 설계됐지만 완벽하지 않습니다. 발음과 리듬은 언어, 글의 종류, 음성 스타일에 따라 달라집니다. 매우 짧거나 모호한 조각은 자동 언어 감지가 틀릴 수 있습니다. 중국어는 지원 언어가 아닙니다.
또 Supertonic 3는 Local TTS에 정확한 단어 단위 타이밍을 제공하지 않습니다. Supertonic 음성을 사용할 때는 모든 단어에 정확한 시점을 부여한다고 과장하지 않고 재생 중인 현재 문장을 따라갑니다.
Supertonic 3 모델 웨이트는 OpenRAIL-M 라이선스를 사용합니다. Local TTS는 라이선스 조건과 AI 생성 음성 내보내기 전 고지를 제공합니다. 다른 사람을 사칭하거나, 청자를 속이거나, 괴롭히거나, 불법 콘텐츠를 만드는 데 합성 음성을 사용해서는 안 됩니다. 생성한 오디오를 공유할 때는 AI 합성 음성임을 분명히 표시하세요.
자주 묻는 질문
Local TTS가 정말 Supertonic 3를 사용하나요?
네. Supertonic 3는 Local TTS의 다국어 음성과 31개 지원 언어를 구동하는 온디바이스 엔진입니다.
언어마다 모델을 따로 다운로드해야 하나요?
아니요. 앱에 포함된 하나의 Supertonic 3 모델과 음성 스타일이 31개 언어를 모두 처리합니다. 별도 언어 팩이 없습니다.
한 문서에 여러 언어가 있어도 되나요?
네. Local TTS가 텍스트 구간별 언어를 감지해 문장 사이에서 언어가 바뀌는 문서를 선택한 음성 스타일로 읽습니다.
Supertonic 음성은 몇 개 있나요?
F1부터 F5, M1부터 M5까지 프리셋 스타일 10종이 있습니다. 무료 버전은 다국어 스타일 1종을 제공하고 Pro에서 전체 카탈로그를 사용할 수 있습니다.
인터넷 없이도 되나요?
네. 모델이 Local TTS에 포함되어 음성 생성이 네트워크 연결 없이 기기에서 실행됩니다.
중국어도 지원하나요?
현재는 지원하지 않습니다. 중국어는 Supertonic 3의 공식 31개 지원 언어에 포함되지 않습니다.
내 목소리를 복제할 수 있나요?
아니요. Local TTS는 Supertonic 3 프리셋 음성 스타일을 사용하며 사용자 목소리 복제 기능을 제공하지 않습니다.
내 기기에서 31개 언어를 들어 보세요
Supertonic 3는 음성 서버 없이도 폭넓은 다국어 음성을 현실적으로 사용할 수 있게 합니다. Local TTS는 여기에 문서 가져오기, OCR, 언어 감지, 문장 따라가기, 백그라운드 재생, 음성 조절, 오디오 내보내기를 더해 일상적인 리더로 완성했습니다.
무료 다국어 음성으로 시작하세요. 한국어, 일본어, 스페인어, 독일어 또는 31개 지원 언어 중 하나로 문장을 붙여넣고 재생을 누르면 됩니다. 처리하는 동안에도 내 텍스트는 iPhone이나 iPad에 남습니다.
App Store에서 Local TTS를 무료로 다운로드하고 Supertonic 3로 첫 다국어 문서를 비공개·오프라인 음성으로 바꿔 보세요.
