Tel-Agent
dpro-at
Selbst gehostetes Gateway, das Telefonleitungen und 24+ Messaging-Kanäle mit einem KI-Agent verbindet, mit eigenen API-Keys.
Was ist Tel-Agent?
Ein selbst gehostetes Gateway, das eingehende Anrufe per SIP entgegennimmt und regelbasiert an Menschen weiterleitet, blockiert oder an einen KI-Agenten übergibt. Der Agent führt Echtzeitgespräche, kann Tools aufrufen (Anruftransfer, Nachrichten hinterlassen, Kalender prüfen, HTTP-Endpunkte), und alle Interaktionen werden aufgezeichnet und transkribiert. Derselbe Agent bedient über 24 Kanäle, darunter Telefon, Web-Chat, SMS, E-Mail, WhatsApp, Telegram, Messenger, Instagram, Discord und Slack, mit deinen eigenen Zugangsdaten.
| Merkmal | Wert |
|---|---|
| Maintainer | dpro-at |
| GitHub-Stars | 1.009 (Stand 2026-09-23) |
| Forks | 202 |
| Lizenz | AGPL-3.0 |
| Lizenztyp | OSI-open |
| Kategorie | Offene Voice und Text-to-Speech |
| Status | Aufsteigend |
| Edition | 2026-09 |
| Zuletzt geprüft | 2026-09-23 |
Tel-Agent im Detail
Geschlossene Voice-Agent- und Omnichannel-Plattformen haben es einfach gemacht, einen KI-Agenten an eine Telefonnummer anzuschließen, auf Kosten davon, jeden Anruf und jeden API-Key durch fremde Infrastruktur zu schicken. Tel-Agent, gebaut von der Dpro GmbH in Wien, bietet eine selbst gehostete Alternative: jede Telefonleitung mit jedem KI-Modell verbinden, mit eigenen Keys, auf eigener Hardware. Eingehende Anrufe kommen per SIP an und werden regelbasiert weitergeleitet, an einen Menschen, geblockt, oder an einen KI-Agenten übergeben, der Anrufe transferieren, Nachrichten hinterlassen, Kalender prüfen und beliebige HTTP-Endpunkte aufrufen kann, wobei jede Interaktion aufgezeichnet und transkribiert wird.
Das Besondere ist die Breite der Kanal-Abdeckung, nicht nur Telefonie. Dieselbe Agent-Konfiguration bedient Telefonanrufe plus mehr als 24 weitere Kanäle, darunter Web-Chat, SMS, E-Mail, WhatsApp, Telegram, Messenger, Instagram, Discord und Slack, alle mit selbst bereitgestellten Zugangsdaten. Der Stack ist eine echte Multi-Service-Anwendung: eine Voice-Pipeline aus Python und LiveKit Agents, ein FastAPI-Backend, ein Next.js- und React-Frontend, SQLite oder PostgreSQL zur Speicherung, Redis für Caching und Queues, und Caddy als Reverse Proxy, verbunden mit Anbietern wie Deepgram für Spracherkennung und ElevenLabs für Sprachsynthese. Das Projekt zielt auf unter 800 Millisekunden vom Ende der Anrufer-Sprache bis zur ersten Audio-Antwort.
Am besten passt es zu Organisationen, die eine KI-Rezeption oder einen Omnichannel-Support-Agenten wollen, aber Kundenanrufe und -nachrichten nicht durch eine fremde SaaS-Plattform leiten wollen, sei es aus Gründen der Datenresidenz, der Compliance oder der Kosten. Weil Tel-Agent von einer eingetragenen Firma getragen wird, der Dpro GmbH (FN 631492s, Wien), statt von einem anonymen Repository, hat es mehr institutionelles Gewicht als ein typisches Nebenprojekt, und es liefert Docker-Images sowie fünf Interface-Sprachen für echten Einsatz statt nur einen Demo-Build.
Die Einschränkungen betreffen Reife und Lizenz. Das Projekt trägt ein explizites Alpha-Badge, und bisher existieren nur zwei Pre-Releases, v0.1.0 und v0.1.1, beide aus derselben Woche im September 2026. Die Lizenz ist AGPL-3.0, was bedeutet, dass eine modifizierte Version als Netzwerk-Dienst zu betreiben verpflichtet, diese Änderungen zu veröffentlichen, eine echte Einschränkung für alle, die darauf ein geschlossenes kommerzielles Produkt bauen wollen, wobei die Dpro GmbH genau für diesen Fall eine separate kommerzielle Lizenz verkauft. Die Unter-800-Millisekunden-Angabe ist eine eigene Zielvorgabe des Projekts für seine Pipeline, keine unabhängig gemessene Garantie unter realen Netzwerkbedingungen.
Das Fazit: Tel-Agent ist eine glaubwürdige, aktiv entwickelte Antwort auf eine konkrete Lücke, eine selbst gehostete Alternative mit eigenen Keys zu geschlossenen Voice-und-Chat-Agent-Plattformen, zusätzlich glaubwürdig durch eine echte Firma im Hintergrund und ein funktionierendes Dual-Lizenz-Modell. Greif zu, wenn du einen selbst gehosteten Omnichannel-KI-Agenten pilotieren willst und mit Alpha-Software sowie den AGPL-Netzwerk-Pflichten leben kannst, oder bereit bist, die kommerzielle Lizenz zu kaufen. Warte ab, wenn du eine fertige v1.0, geschlossene kommerzielle Weiterverteilung ohne bezahlte Lizenz, oder Latenzgarantien über die eigene Zielangabe des Projekts hinaus brauchst.
Vor- & Nachteile
Pros
- Gestützt von einer eingetragenen Firma (Dpro GmbH, Wien, Österreich) mit echtem Dual-Lizenz-Modell, kein anonymes Nebenprojekt
- Breite Kanal-Abdeckung (Telefon via SIP plus 24+ Messaging-Plattformen) hinter einem Agenten, mit echten Integrationen statt Platzhaltern
- Docker-Images, fünf Interface-Sprachen, und ein aktiver, gelabelter Issue-Tracker mit laufender Kanal-Arbeit (Viber, Signal, Matrix, IRC in Arbeit)
Cons
- Alpha-Status laut eigenem Badge des Projekts; bisher nur zwei Pre-Releases (v0.1.0, v0.1.1)
- AGPL-3.0 verlangt, Änderungen bei jedem Netzwerk-Service-Einsatz zu veröffentlichen, kommerzielle oder geschlossene Nutzung braucht Dpros kostenpflichtige Lizenz
- Das Unter-800ms-Latenzziel ist eine eigene Zielangabe des Projekts für seine Pipeline, keine unabhängig gemessene Garantie
Lizenz
AGPL-3.0 (OSI-open)
AGPL-3.0: Netzwerk-Nutzung zählt als Verteilung, eine modifizierte Version, die als Dienst läuft, muss also ebenfalls unter AGPL veröffentlicht werden, außer du kaufst Dpro GmbHs kommerzielle Lizenz.
Wann interessant
Teams, die eine selbst gehostete Alternative mit eigenen Keys zu geschlossenen Voice-Agent-Plattformen wollen, über Telefonie und Chat-Kanäle hinweg.
Wann zu früh
produktive Einsätze, die eine fertige v1.0 brauchen, oder jede geschlossene/kommerzielle Weiterverteilung ohne die Dpro-Lizenz zu kaufen.
Kommerzielle Alternative & Verwandtes
- Kommerzielles Pendant: Vapi / Retell
Dieses Repo war in der Ausgabe 2026-09 des Open-Source-KI-Radars.
voicebox
jamiepine
Kostenlose, lokale Alternative zu ElevenLabs für TTS, Voice Cloning und Diktieren mit Agent-Integration.
VoxCPM
OpenBMB
Tokenizer-freies TTS-System von OpenBMB für 30 Sprachen mit Voice Design und Echtzeit-Streaming.
Chatterbox
resemble-ai
MIT-lizenziertes offenes TTS mit Zero-Shot Voice Cloning - 500M Parameter, 23+ Sprachen.