supertonic
supertone-inc
Sehr schnelles On-Device-TTS via ONNX mit 31-Sprachen-Unterstützung, läuft auf CPU, Browser und Mobile.
Was ist supertonic?
Ein sehr schnelles On-Device-TTS, das nativ über ONNX läuft, mit einem kompakten Modell von ~99M Parametern. Es deckt 31 Sprachen ab, läuft auf der CPU ohne GPU und macht sogar Browser-Inference via WebGPU.
supertonic im Detail
Die meisten produktiven Text to Speech Lösungen hängen noch an einem Cloud Aufruf: Man schickt Text an eine API, zahlt pro Zeichen und wartet auf das Netzwerk, bevor Audio zurückkommt. Für Offline Apps, datenschutzsensible Szenarien und alles, was sofort sprechen soll, funktioniert dieses Modell schlecht. supertonic von Supertone ist eine Text to Speech Engine, die komplett auf dem Gerät läuft, das die Sprachausgabe braucht. Sie bringt ein kompaktes Modell mit rund 99 Millionen Parametern, deutlich kleiner als die Systeme mit 0,7 bis 2 Milliarden Parametern, gegen die sie sich positioniert, und deckt 31 Sprachen ab, darunter Englisch, Deutsch, Spanisch, Französisch, Japanisch, Koreanisch und Arabisch. Der Anspruch ist klar: brauchbare Sprachausgabe lokal auf einer CPU, im Browser oder auf dem Smartphone, ohne Key und ohne Netzwerk.
supertonic läuft über ONNX Runtime, und genau das erlaubt es, dasselbe Modell auf CPU, im Browser via WebGPU und auf Mobilgeräten auszuführen, ohne pro Plattform eine eigene Laufzeit zu bauen. Architektonisch kombiniert das System einen Speech Autoencoder mit einem Flow Matching Modul, das Text auf latente Repräsentationen abbildet, ein Ansatz, der das Modell klein und zugleich schnell halten soll. Das Projekt nennt einen durchschnittlichen Real Time Factor von etwa 0,3 auf bescheidener Hardware wie einem Raspberry Pi und E Readern, also schneller als die Wiedergabe, und es behauptet, eine ganze Webseite in unter einer Sekunde vertonen zu können. Die Ausgabe erfolgt als 44,1kHz 16 Bit WAV. Die Breite der mitgelieferten SDKs ist das zweite Unterscheidungsmerkmal: fertige Implementierungen gibt es für Python, Node, den Browser, Java, C++, C#, Go, Swift, iOS, Rust und Flutter.
Am besten passt supertonic überall dort, wo Latenz, Kosten pro Aufruf oder Datenschutz einen Cloud TTS Dienst ausschließen. Browser Erweiterungen, die Artikel vorlesen, E Book und E Reader Apps, Voice Chatbots mit sofortiger lokaler Antwort und Barrierefreiheits Werkzeuge profitieren alle von einer Sprachausgabe, die sofort startet und das Gerät nie verlässt. Das Projekt führt bereits reale Integrationen dieser Art auf, darunter Vorlese Erweiterungen, einen E Book Reader und Avatar Generatoren. Für Entwickler bedeutet die breite SDK Abdeckung, dass man in Python prototypen und dasselbe Modell anschließend in einer Swift iOS App, einem Rust Binary oder einem Flutter Build ausliefern kann, ohne die Engine zu wechseln. Edge und Embedded Fälle, in denen es vielleicht gar keine verlässliche Verbindung gibt, sind der Bereich, in dem sich das On Device Design am deutlichsten auszahlt.
Die ehrlichen Einschränkungen sind wichtig. Die offene Variante liefert eine feste Stimme und hat kein eingebautes Voice Cloning: eigene Stimmen erfordern Supertones separates Voice Builder Werkzeug, das Profildateien erzeugt und nicht Teil des offenen Repositorys ist. Die Lizenzierung ist geteilt, was leicht übersehen wird. Der Beispielcode steht unter MIT, die Modellgewichte aber unter OpenRAIL-M, einer Open Weight Lizenz mit Nutzungsbeschränkungen, womit das Projekt nicht vollständig OSI offen ist und kommerzielle Nutzer die Klauseln lesen müssen. Die Qualität schwankt über die 31 Sprachen: das Projekt selbst nennt für Japanisch eine Character Error Rate von 4,61 Prozent, manche Sprachen laufen also klar besser als andere. Das Repository hatte zum Zeitpunkt der Prüfung 78 offene Issues, ein normales Zeichen für ein aktives junges Projekt, aber für die Produktionsplanung beachtenswert.
Gegenüber dem kommerziellen Weg, Supertone Play und der gehosteten API, tauscht supertonic den Komfort einer verwalteten Cloud und das eingebaute Cloning gegen Kontrolle, keine Kosten pro Aufruf und vollständige On Device Privatsphäre. Setzen Sie es ein, wenn Sie Edge, Mobile oder Browser TTS bauen und Latenz oder Datenhaltung wirklich zählen, wenn Sie mit der mitgelieferten Stimme leben können oder bereit sind, Voice Builder separat zu nutzen, und wenn die OpenRAIL-M Bedingungen zu Ihrem Vorhaben passen. Zu früh ist es, wenn Sie Voice Cloning out of the box brauchen, wenn Sie in einer weniger gut unterstützten Sprache rundfunktaugliche Konsistenz erwarten oder wenn Ihre Rechtsabteilung Open Weight Beschränkungen für ein kommerzielles Produkt nicht akzeptieren kann. Für lokale, latenzkritische Sprachausgabe ist es jedoch eine starke und ungewöhnlich portable Option, die einen direkten Test wert ist.
Vor- & Nachteile
Pros
- Läuft auf der CPU: Raspberry Pi, Mobile, Browser, kein Netzwerk nötig
- Echtzeit (eine ganze Webseite in unter einer Sekunde vorgelesen)
- SDKs über Python, Node, Browser, Java, C++, Swift, iOS, Rust, Flutter hinweg
Cons
- Kein eingebautes Voice Cloning in der offenen Variante (nur feste Stimme)
- Das Modell ist OpenRAIL-M, also open weight mit Nutzungsbeschränkungen, nicht voll OSI-open
- 78 offene Issues zum Zeitpunkt des Schreibens
Lizenz
MIT (code) (Open weight, mit Auflagen) - Modell-Lizenz: OpenRAIL-M
Code MIT, Modell OpenRAIL-M (open weight, mit Bedingungen).
Wann interessant
Edge-, On-Device- oder Browser-TTS, wo Latenz und Privatsphäre zählen.
Wann zu früh
wenn du Cloning out-of-the-box brauchst oder die OpenRAIL-M-Nutzungsklauseln kommerziell vermeiden willst. Das natürliche managed Upsell ist Supertone Play/API des Anbieters selbst.
Kommerzielle Alternative & Verwandtes
- Kommerzielles Pendant: Supertone Play/API
Dieses Repo war in der Ausgabe 2026-06 des Open-Source-KI-Radars.
voicebox
jamiepine
Kostenlose, lokale Alternative zu ElevenLabs für TTS, Voice Cloning und Diktieren mit Agent-Integration.
VoxCPM
OpenBMB
Tokenizer-freies TTS-System von OpenBMB für 30 Sprachen mit Voice Design und Echtzeit-Streaming.
Chatterbox
resemble-ai
MIT-lizenziertes offenes TTS mit Zero-Shot Voice Cloning - 500M Parameter, 23+ Sprachen.