Chatterbox
resemble-ai
MIT-lizenziertes offenes TTS mit Zero-Shot Voice Cloning - 500M Parameter, 23+ Sprachen.
Was ist Chatterbox?
Chatterbox ist eine Familie offener TTS-Modelle von Resemble AI. Das neueste Multilingual V3 (500M Parameter) deckt 23+ Sprachen mit sprachübergreifendem Voice Cloning ab; Chatterbox-Turbo (350M) zielt auf Voice Agents mit niedriger Latenz. Beide unterstützen Zero-Shot Cloning aus einem Referenzclip, mit MIT auf Code und Weights.
Chatterbox im Detail
Produktionsreife Sprachsynthese mit Voice Cloning lag bisher meist hinter geschlossenen APIs, bei denen die Kosten mit der Nutzung steigen und die Gewichte unter Verschluss bleiben. Das macht Self-Hosting, On-Premise-Betrieb und intensive kommerzielle Nutzung umständlich, vor allem für Teams, die nicht jede Äußerung an einen fremden Server schicken dürfen. Chatterbox von Resemble AI schließt genau diese Lücke. Das Aushängeschild, Multilingual V3 mit rund 500 Millionen Parametern, deckt 23 oder mehr Sprachen mit sprachübergreifendem Voice Cloning ab, während eine kleinere Turbo-Variante mit 350 Millionen Parametern auf latenzarme englische Voice-Agents zielt. Entscheidend ist, dass sowohl Code als auch Modellgewichte unter der MIT-Lizenz stehen, der freizügigsten Variante unter den aktuell aufstrebenden offenen TTS-Projekten, was die rechtlichen Hürden für kommerzielle Weiterverwendung weitgehend beseitigt.
Chatterbox arbeitet aus einem kurzen Referenzclip heraus: Es extrahiert die Stimmmerkmale einer Sprecherin und überträgt sie zero-shot auf neuen Text, ganz ohne Fine-Tuning pro Stimme. Über das Klonen hinaus ist das auffälligste Merkmal eine explizite Steuerung der Emotionsübertreibung, freigelegt als Parameter exaggeration (Standard 0.5) neben einem cfg_weight, das die Sprechgeschwindigkeit beeinflusst. Resemble beschreibt dies als das erste offene TTS-Modell mit einem solchen Regler, und die Demoseite zeigt denselben Satz auf den Stufen 0.5, 1.0 und 2.0, um die Bandbreite zu demonstrieren. Die Turbo-Variante ergänzt paralinguistische Tags wie [laugh] und [cough] und nutzt Decoder-Distillation, um Generierungsschritte einzusparen. Jede Ausgabe trägt zudem ein unhörbares neuronales PerTh-Wasserzeichen, das laut Projekt MP3-Kompression mit nahezu vollständiger Erkennungsgenauigkeit übersteht.
Am natürlichsten passt das Modell zu Teams, die Voice-Agents, Conversational AI und lokalisierte Vertonung bauen und lieber selbst hosten, als jeden Aufruf gegen eine Anbieter-API abzurechnen. Turbos Fokus auf englische Niedriglatenz eignet sich für Echtzeit-Agents, die Bestellbestätigungen oder Support-Dialoge abwickeln, während Multilingual V3 Synchronisation, barrierefreie Vertonung und kreative Arbeit über Sprachen von Mandarin und Hindi bis Suaheli und Hebräisch abdeckt. Die MIT-Gewichte machen es für kommerzielle Produkte, eingebettete Deployments und datenschutzsensible Setups tauglich, bei denen Audio die eigene Infrastruktur nicht verlassen darf. Die Einzelsprach-Finetunes für Chinesisch, Hindi sowie spanische und portugiesische Varianten zielen auf dialektsensible Anwendungen. Die Installation läuft unkompliziert über pip, und das Wasserzeichen ist ein nützlicher Standard für alle, die synthetisches Audio in Moderations- oder Compliance-Abläufen kennzeichnen müssen.
Die ehrlichen Vorbehalte beginnen bei der Überprüfbarkeit. Resembles Qualitätsaussagen, etwa in direkten Vergleichen gegenüber ElevenLabs bevorzugt zu werden, sind weitgehend selbst berichtet, und obwohl einige externe Podonos-Bewertungen existieren, bleiben unabhängige Benchmarks speziell für V3 dünn. Die ungewöhnlich hohe Zahl an Sternen für ein etwa einjähriges Repository verlangt eine nüchterne Lesart, statt sie als Reifebeweis zu nehmen. Es gibt auch praktische Grenzen: Referenzclips sollten zum Sprach-Tag passen, sonst riskiert man ungewollte Akzentübertragung, Turbo ist trotz der mehrsprachigen Schlagzeile nur Englisch, und die Übertreibungssteuerung beschleunigt die Sprache mit zunehmender Intensität und braucht Feinjustierung. Das tiefere strategische Risiko liegt in der Governance. Chatterbox wird von einem VC-finanzierten Sprachunternehmen gelenkt, sodass die Roadmap zugunsten kommerzieller Prioritäten kippen könnte, auch wenn die aktuelle Lizenz wirklich offen ist.
Gegenüber ElevenLabs ist der Tausch klar. ElevenLabs bietet einen ausgereiften gehosteten Dienst, breite Stimmbibliotheken und gleichbleibende Qualität ohne Infrastrukturaufwand, was schwer zu schlagen ist, wenn man einfach Ergebnisse will und mit Abrechnung pro Zeichen sowie dem Abfluss von Daten leben kann. Chatterbox tauscht diese Bequemlichkeit gegen Eigentum: MIT-Gewichte, Self-Hosting, keine Nutzungsabrechnung und einen Emotionsregler plus Wasserzeichen, die die geschlossene Alternative hinter ihrer Plattform verriegelt. Greif zu, wenn du produktionsreife, selbst hostbare mehrsprachige TTS mit Cloning brauchst, die du kommerziell ausliefern kannst ohne Lizenzärger, und wenn du die technische Kapazität hast, Inferenz zu betreiben und zu justieren. Warte ab, wenn du auf vollständig von der Community verifizierte V3-Benchmarks angewiesen bist, schlüsselfertige Zuverlässigkeit ohne Betriebsaufwand brauchst oder dir das langfristige Open-Source-Bekenntnis eines kommerziell getriebenen Geldgebers Sorgen bereitet.
Vor- & Nachteile
Pros
- MIT auf Code und Weights - die permissivste Lizenz unter den aufstrebenden TTS-Modellen
- Aktiv gepflegt von einem gut ausgestatteten Voice-Unternehmen mit schneller Iteration
- Multilingual V3 deckt 23+ Sprachen mit sprachübergreifendem Voice Cloning ab
Cons
- Hohe Star-Zahl für ein etwa einjähriges Repo verdient etwas Vorsicht
- Die Richtung kann sich mit den kommerziellen Prioritäten des unterstützenden Unternehmens verschieben
- Qualitätsvergleiche sind selbst berichtet; unabhängige V3-Benchmarks sind begrenzt
Lizenz
MIT (OSI-open)
Wann interessant
Du benötigst MIT-lizenziertes, produktionsreifes mehrsprachiges TTS mit Voice Cloning, das du kommerziell self-hosten kannst.
Wann zu früh
Du benötigst vollständig community-verifizierte V3-Benchmarks oder machst dir Sorgen um das langfristige Open-Source-Engagement eines VC-finanzierten Unternehmens.
Kommerzielle Alternative & Verwandtes
- Kommerzielles Pendant: ElevenLabs
Dieses Repo war in der Ausgabe 2026-07 des Open-Source-KI-Radars.
voicebox
jamiepine
Kostenlose, lokale Alternative zu ElevenLabs für TTS, Voice Cloning und Diktieren mit Agent-Integration.
VoxCPM
OpenBMB
Tokenizer-freies TTS-System von OpenBMB für 30 Sprachen mit Voice Design und Echtzeit-Streaming.
supertonic
supertone-inc
Sehr schnelles On-Device-TTS via ONNX mit 31-Sprachen-Unterstützung, läuft auf CPU, Browser und Mobile.