Skip to main content
AI Tool Radar
Open weight, mit AuflagenOffene Voice und Text-to-Speech

NeuTTS Air

neuphonic

On-Device-TTS mit sofortigem Voice Cloning - ~360M aktive Parameter, GGUF-Builds für Telefone, Laptops und Raspberry Pi.

6.0k Stars(Stand 2026-06-14)Auf GitHub ansehenHomepage

Was ist NeuTTS Air?

NeuTTS ist eine Sammlung von On-Device-TTS-Modellen von Neuphonic auf kleinen LLM-Backbones mit einem 50-Hz-Neural-Codec. NeuTTS-Air (~360M aktive Parameter, Apache-2.0) beherrscht Englisch mit sofortigem Cloning aus 3 Sekunden Audio; GGUF-Quantisierungen laufen auf Telefonen, Laptops und Einplatinencomputern. Nano fügt Spanisch/Deutsch/Französisch unter einer restriktiveren Lizenz hinzu.

NeuTTS Air im Detail

Hochwertige Sprachsynthese mit Voice Cloning steckt fast immer hinter einer Cloud-API. Das heißt: Jede Textzeile und jede Referenzstimme verlässt das Gerät und landet auf fremden Servern. Für eingebettete Produkte, datenschutzsensible Anwendungen und überall dort, wo die Verbindung unzuverlässig ist, ist das ein echtes Problem. NeuTTS Air vom britischen Start-up Neuphonic will genau diese Lücke schließen. Es ist ein On-Device-TTS-Modell auf Basis eines kleinen LLM-Backbones mit rund 360 Millionen aktiven Parametern, kombiniert mit einem neuronalen Audio-Codec. Es spricht Englisch und kann eine Stimme aus wenigen Sekunden Referenz-Audio klonen, ganz ohne Trainingsschritt. Ausgeliefert wird es in Formaten, die auf Smartphones, Laptops und Einplatinenrechnern laufen, nicht auf Rechenzentrums-GPUs.

NeuTTS Air behandelt Sprachgenerierung als Sprachmodellierungsproblem. Ein kompaktes LLM-Backbone in der 0,5B-Parameterklasse sagt Tokens voraus, die ein neuronaler Codec namens NeuCodec bei 50Hz und niedriger Bitrate wieder in Audio verwandelt. Das Kontextfenster von etwa 2048 Tokens deckt grob 30 Sekunden Sprache ab. Praxistauglich am Edge wird es durch die Verpackung: Die Gewichte kommen im GGUF-Format mit Q4- und Q8-Quantisierungen und laufen so über llama.cpp auf gängiger Hardware, wahlweise mit einem ONNX-Codec-Decoder zur Latenzsenkung. Das Voice Cloning ist referenzbasiert statt trainiert: Man liefert 3 bis 15 Sekunden sauberes Mono-Audio plus Transkript, und das Modell konditioniert auf diesen Stil. Standardmäßig tragen die Ausgaben ein Perth-Wasserzeichen, das die Erkennung synthetischer Sprache unterstützt.

Die naheliegende Zielgruppe sind alle, die Sprache in ein Produkt einbauen, bei dem das Senden von Audio an eine API unpraktisch oder unzulässig ist. Dazu gehören eingebettete Sprach-Agenten, sprechendes Spielzeug, Barrierefreiheits-Tools zum Vorlesen, Kioske und Assistenten auf Android- oder Raspberry-Pi-Hardware. Das Projekt nennt echtzeitfähigen Durchsatz auf Mittelklasse-Geräten, etwa rund 20 Tokens pro Sekunde auf einem Galaxy A25 mit Q4 und deutlich höhere Werte auf Desktop-CPUs und GPUs. Interaktive Nutzung auf dem Smartphone ist damit plausibel, nicht nur Wunschdenken. Auch für compliance-sensible Bereiche passt es, etwa Gesundheit, Recht oder interne Tools, wo das Verbleiben der Sprachdaten auf dem Gerät die Datenschutzfrage vereinfacht. Lokale Inferenz und sofortiges Klonen in dieser Gewichtsklasse sind zusammen wirklich selten.

Die ehrlichen Einschränkungen beginnen bei Sprache und Lizenz. Die Apache-2.0-Gewichte von Air können nur Englisch. Wer Spanisch, Deutsch oder Französisch braucht, wechselt zu den NeuTTS-Nano-Varianten, die unter der NeuTTS Open License v1.0 stehen: kostenlos für Forschung und begrenzte kommerzielle Nutzung, aber mit Zahlpflicht oberhalb einer Umsatzschwelle. Mehrsprachig und vollständig offen überschneiden sich hier also derzeit nicht. Die Qualität ist durch das kleine Backbone begrenzt: Neuphonic selbst weist darauf hin, dass Prosodie und Natürlichkeit nicht an größere serverbasierte Modelle heranreichen, und unabhängige, peer-reviewte Benchmarks fehlen bislang. Das Klonen birgt zudem ein offensichtliches Missbrauchsrisiko, das das Wasserzeichen abschwächt, aber nicht beseitigt. Schließlich ist das Start-up jung, und es sind Nachahmer-Webseiten mit ähnlichen Namen aufgetaucht, weshalb die Quellenprüfung wichtig ist.

Gemessen an ElevenLabs, der naheliegenden kommerziellen Alternative, will NeuTTS Air nicht über reine Klangtreue oder die Breite an Stimmen und Sprachen gewinnen. ElevenLabs bietet eine höhere Qualitätsobergrenze, mehr Sprachen und einen verwalteten Dienst ohne Hardware-Sorgen. NeuTTS Air punktet auf einer anderen Achse: Es läuft offline, hält Audio auf dem Gerät, und die Air-Gewichte sind wirklich offen für kommerzielle Nutzung. Setzen Sie es ein, wenn Edge-Deployment, Datenschutz oder Kosten pro Anfrage eine Cloud-API ausschließen und Englisch genügt. Verzichten Sie vorerst, wenn Sie mehrsprachige Ausgabe unter einer vollständig freien Lizenz, studioreife Prosodie oder belegte Qualitätszahlen vor einer Entscheidung brauchen. Für den passenden eingebetteten oder compliance-getriebenen Anwendungsfall ist es jedoch eine glaubwürdige offene Basis, mit der sich ein Prototyp lohnt.

Vor- & Nachteile

Pros

  • GGUF-first-Design läuft out of the box auf Raspberry Pi und Android
  • NeuTTS-Air-Weights sind Apache-2.0 - genuinely offen für kommerzielle Nutzung
  • Sofortiges Voice Cloning aus 3 Sekunden in On-Device-Größenordnung ist in dieser Gewichtsklasse selten

Cons

  • Multilingual-Nano-Weights erfordern eine kostenpflichtige kommerzielle Nutzung oberhalb einer Umsatzschwelle
  • Das Apache-lizenzierte Air-Modell ist nur Englisch; mehrsprachig benötigt das eingeschränkte Nano
  • Kleines Startup; Nachahmungs-Sites sind aufgetaucht - Quelle verifizieren

Lizenz

Apache-2.0 (Air weights) (Open weight, mit Auflagen) - Modell-Lizenz: NeuTTS Open License v1.0 (Nano)

NeuTTS-Air-Weights sind Apache-2.0; die mehrsprachigen NeuTTS-Nano-Weights nutzen die NeuTTS Open License v1.0 (kostenlos für Forschung/begrenzte kommerzielle Nutzung, kostenpflichtig oberhalb einer Umsatzschwelle). Nur via neuphonic.com und diesem GitHub verifizieren - Nachahmungs-Sites existieren.

Wann interessant

Du benötigst genuinely edge-deploybares TTS mit Cloning für eingebettete, mobile oder compliance-sensitive Anwendungen, bei denen das Senden von Audio an eine API nicht akzeptabel ist.

Wann zu früh

Du benötigst mehrsprachige Unterstützung unter einer vollständig offenen Lizenz oder unabhängig verifizierte Qualitäts-Benchmarks.

Kommerzielle Alternative & Verwandtes

Dieses Repo war in der Ausgabe 2026-07 des Open-Source-KI-Radars.