Skip to main content
AI Tool Radar
OSI-openOffene Voice und Text-to-Speech

MOSS-TTS

OpenMOSS

Offene Sprach- und Klanggenerierungs-Familie - nano bis 8B, 31 Sprachen, Echtzeit-Streaming.

3.3k Stars(Stand 2026-06-14)Auf GitHub ansehenHomepage

Was ist MOSS-TTS?

MOSS-TTS ist eine Familie von fünf offenen Modellen von OpenMOSS/MOSI.AI: ein Flaggschiff-8B mit Zero-Shot Cloning, ein Multi-Speaker-Dialogmodell, ein Stimmendesign-aus-Text-Modell, ein Niedriglatenz-Echtzeitmodell und ein Soundeffekt-Modell. Eine ~100M-Nano-Variante zielt auf CPU-only-Deployment. Code und Weights sind Apache-2.0.

MOSS-TTS im Detail

Die meisten Teams, die synthetische Sprache brauchen, basteln am Ende mehrere Tools zusammen: ein Modell für Erzählstimmen, ein weiteres für Dialoge mit mehreren Sprechern, einen separaten Dienst fürs Voice-Cloning und noch einen für Soundeffekte oder Agents mit geringer Latenz. Jeder Baustein bringt seine eigene Lizenz, sein eigenes Deployment und seine eigenen Eigenheiten mit. MOSS-TTS vom chinesischen Labor OpenMOSS und dessen MOSI.AI-Initiative geht diese Zersplitterung an, indem es eine ganze Familie offener Sprach- und Audiomodelle in einem einzigen Apache-2.0-Repo bündelt. Sie umfasst ein 8B-Flaggschiff für Text-to-Speech mit Zero-Shot-Voice-Cloning, ein Modell für Mehrsprecher-Dialoge, ein Modell zur Stimmgestaltung aus Text, ein Echtzeit-Streaming-Modell, ein Soundeffekt-Modell und eine rund 100M große Nano-Variante für reines CPU-Deployment. Versprochen wird ein stimmiges Toolkit für den kompletten Voice-AI-Stack.

Die Familie teilt sich ein gemeinsames Fundament. Im Kern sitzt der MOSS-Audio-Tokenizer, ein Transformer-Codec, der 24kHz-Audio per Residual Vector Quantization auf eine Bildrate von 12,5Hz komprimiert, mit wählbaren Bitraten. Darauf aufbauend sagt ein von Qwen3 abgeleitetes LLM die diskreten Audio-Tokens autoregressiv voraus, nach demselben Rezept, das viele neuere neuronale TTS-Systeme nutzen. Besonders ist die Bandbreite spezialisierter Varianten auf einer Architektur, dazu eine feinkörnige Steuerung: Die Ausgabe lässt sich über Pinyin, Phoneme, Dauer-Tokens und explizite Pausenmarker wie [pause 3.2s] lenken. Das Projekt bietet zudem einen Torch-freien Inferenzpfad über ein llama.cpp-Backend mit ONNX Runtime, was das Nano-Modell auf gewöhnlichen CPUs erst praxistauglich macht. Das Labor nennt Unterstützung für 31 Sprachen und stabile Generierung über lange Passagen.

Das richtet sich an Entwickler und Produktteams, die Sprachgenerierung selbst hosten wollen, statt jede Anfrage durch eine kostenpflichtige API zu schicken. Konkrete Einsatzfälle sind Hörbuch- und Langform-Erzählung, bei der stabile mehrminütige Ausgabe zählt, Podcast- oder Dialogproduktion mit klar getrennten Sprechern und Stimmgestaltung für Spiele oder interaktive Medien, bei der man Figuren aus einer Textbeschreibung ohne Referenzaufnahme erzeugt. Das Echtzeit-Modell, das laut Projekt bei rund 180ms Time-to-First-Byte liegt, zielt auf dialogfähige Agents, während das Soundeffekt-Modell Umgebungsgeräusche für Film und Animation abdeckt. Die Nano-Variante sticht für Edge- und datenschutzsensible Szenarien heraus: Sie verspricht Echtzeit-Synthese auf vier CPU-Kernen, was Offline-Kioske, lokale Assistenten und kostensensible Batch-Jobs ermöglicht, die sich GPU-Miete oder Cloud-Gebühren pro Zeichen nicht leisten können.

Die Einschränkungen sind real. Das 8B-Flaggschiff und das 8B-Dialogmodell haben hohe Infrastrukturanforderungen, die Spitzenqualität gibt es also nicht umsonst: Für guten Betrieb braucht es leistungsfähige GPUs, auch wenn das Repo Karten ab 8GB als nutzbar nennt. Nahezu alle Qualitäts- und Latenzangaben, einschließlich der Wort- und Zeichenfehlerraten und der Behauptung, geschlossene Modelle wie Doubao und Gemini 2.5 Pro zu schlagen, stammen aus den eigenen Messungen und subjektiven Tests des Labors, unabhängige Drittbenchmarks werden bislang nicht zitiert. Als Projekt eines chinesischen Labors kann es zudem in regulierten Umgebungen Lieferketten- und Governance-Prüfung auslösen. Voice-Cloning wirft die üblichen Fragen zu Einwilligung und Missbrauch auf, und eine Familie aus sechs Modellen bedeutet mehr Fläche zum Einarbeiten, Versionieren und Warten als ein einzelner Endpunkt.

Gegenüber ElevenLabs, der naheliegenden kommerziellen Referenz, tauscht MOSS-TTS Politur und betrieblichen Komfort gegen Eigenständigkeit und Kostenkontrolle. ElevenLabs liefert eine verwaltete API, eine ausgereifte Stimmenbibliothek und planbare Qualität ohne eigene Infrastruktur, was für Teams, die einfach Ergebnisse wollen, schwer zu schlagen ist. MOSS-TTS lohnt sich, wenn Self-Hosting, Datenhoheit, die Apache-2.0-Lizenz oder das Vermeiden von Preisen pro Zeichen schwerer wiegen als dieser Komfort, und besonders dann, wenn das CPU-fähige Nano-Modell Einsatzfälle erschließt, die eine Cloud-API wirtschaftlich nicht bedienen kann. Für Experimente, interne Tools und Edge-Deployment ist es heute eine starke Wahl. Zu früh ist es, wenn du bewährte Produktionszuverlässigkeit mit unabhängigen Benchmarks, einem Supportvertrag und garantierter Verfügbarkeit brauchst. Dann bleibt die verwaltete Alternative die sicherere Wahl, bis die Familie reift.

Vor- & Nachteile

Pros

  • Deckt den gesamten Voice-AI-Stack von Soundeffekten bis zu Echtzeit-Agents in einem Apache-2.0-Repo ab
  • Nano (~100M) behauptet Echtzeit-Generierung auf 4 CPU-Kernen - zugänglich für Edge-Einsatz
  • 31-Sprachen-Unterstützung mit aktiver Entwicklung

Cons

  • Das Flaggschiff-8B-Modell hat hohe Infrastrukturanforderungen
  • Qualitäts- und Latenzwerte sind selbst berichtet
  • Herkunft aus chinesischem Labor kann in regulierten Kontexten Supply-Chain-Prüfung auslösen

Lizenz

Apache-2.0 (OSI-open)

Wann interessant

Du willst ein Apache-lizenziertes, self-hostbares Voice-Toolkit, das TTS, Dialog, Voice Design und Echtzeit abdeckt, einschließlich eines CPU-deployablen Nano-Modells.

Wann zu früh

Du benötigst bewährte Produktionszuverlässigkeit mit Benchmark-Vergleichen von Drittanbietern.

Kommerzielle Alternative & Verwandtes

Dieses Repo war in der Ausgabe 2026-07 des Open-Source-KI-Radars.