Skip to main content
AI Tool Radar
OSI-openAgent-Memory und Code-Wissen

VoiceMem

xzf-thu

Streaming-Dual-Brain-Memory für Voice-Agents in Echtzeit, trennt faktisches Erinnern von emotionalem und Persönlichkeits-Zustand.

2.2k Stars(Stand 2026-09-23)Auf GitHub ansehenHomepage

Was ist VoiceMem?

Ein Python-Framework, das Voice-Agents ein persistentes Gedächtnis gibt: ein 'linkes Gehirn' organisiert Fakten über Schemas und Entitäten für präzisen Abruf, ein 'rechtes Gehirn' verwaltet Emotionen, Persönlichkeit und Beziehungen über eigene und entitätsübergreifende Knoten. Eine Streaming-Pipeline verarbeitet Audio-Segmentierung, Transkription und Memory-Extraktion während das Gespräch noch läuft, und injiziert nur die relevantesten Erinnerungen in den Modell-Kontext.

VoiceMem auf einen Blick
MerkmalWert
Maintainerxzf-thu
GitHub-Stars2.201 (Stand 2026-09-23)
Forks146
LizenzApache-2.0
LizenztypOSI-open
KategorieAgent-Memory und Code-Wissen
StatusAufsteigend
Edition2026-09
Zuletzt geprüft2026-09-23

VoiceMem im Detail

Die meisten Memory-Schichten für LLM-Agents wurden für Text-Chat entworfen und erst nachträglich für Sprache angepasst, was sich in Latenz und einem flachen, rein faktenbasierten Verständnis dessen zeigt, was erinnernswert ist. VoiceMem vom Forscher xzf-thu setzt stattdessen direkt bei Sprache an. Die eigene Formulierung des Projekts ist unumwunden: Es will Voice-Agents die letzte fehlende Komponente geben, so etwas wie eine Seele, damit sie einen Nutzer über die Zeit besser verstehen. Das Projekt untermauert diesen Anspruch mit einem technischen Report auf arXiv und einer wirklich streamenden Architektur statt einer batch-verarbeiteten Memory-Schicht, die nachträglich an eine bestehende Voice-Pipeline geschraubt wurde.

Die Kernidee ist eine Dual-Brain-Aufteilung. Ein 'linkes Gehirn' organisiert faktische Information über Schemas und Entitäten für präzisen Abruf, während ein 'rechtes Gehirn' unabhängig davon Emotionen, Persönlichkeitsmerkmale und Beziehungen über eigene und entitätsübergreifende Knoten verfolgt. Eine Streaming-Pipeline übernimmt Audio-Segmentierung, Transkription und Memory-Extraktion, während das Gespräch noch läuft, statt erst nach dessen Ende, und nutzt FunASR oder sherpa-onnx für Spracherkennung, 3D-Speaker für Sprecherverifikation und multilingual-e5-Embeddings. Zum Abfragezeitpunkt routet, rankt und injiziert das System nur die am höchsten bewerteten Erinnerungen in den Modell-Kontext, was den Token-Verbrauch niedrig hält.

Die natürliche Zielgruppe sind Teams, die Echtzeit-Voice-Agents bauen, Assistenten, Begleiter oder Support-Bots, die sich sowohl an Fakten (Vorlieben, frühere Anfragen eines Nutzers) als auch an emotionalen Kontext (wie sich eine Beziehung entwickelt hat) über Sessions hinweg erinnern müssen, ohne die Niedriglatenz-Anforderung zu brechen, die Sprachinteraktion verlangt. Das Repository liefert eine vollständige Evaluations-Suite gegen etablierte Benchmarks, LoCoMo und PersonaMem, plus eine Web-Demo, was es als Forschungs-Startpunkt nutzbar macht und nicht nur als Begleitcode zu einem Paper.

Die Einschränkungen spiegeln ein noch sehr junges Projekt wider. Das erste Release v0.0.1 und das aktuelle v0.0.2 erschienen beide am selben Tag, dem 1. September 2026, es gibt also praktisch noch keine Erfolgsbilanz über Releases hinweg. Die Schlagzeilen-Vergleiche gegen Mem0, ein LoCoMo-Wert von 91,2% gegenüber 61,68%, eine Antwortzeit von 134 Millisekunden gegenüber 1.440 Millisekunden, und rund 430 Memory-Tokens gegenüber 6.956, sind eigene Benchmark-Ergebnisse des Projekts und wurden nicht unabhängig reproduziert. Offene Issues melden zudem, dass Emotions-Labels und Persönlichkeitsmerkmale standardmäßig auf Chinesisch fallen, selbst bei englischsprachigen Nutzern, eine konkrete Lokalisierungslücke.

Das Fazit: VoiceMem ist ein ernsthaftes, gut dokumentiertes Forschungsprojekt für eine echte Lücke, Gedächtnis, das sowohl Fakten als auch emotionalen Kontext für Voice-Agents versteht, gestützt auf ein Paper und eine reproduzierbare Evaluations-Suite statt nur auf Marketing. Greif zu, wenn du Voice-Agents baust oder erforschst und einen Vorsprung bei emotionsbewusstem, latenzarmem Gedächtnis willst, im Bewusstsein, dass dies Software aus der ersten Woche ist. Zu früh ist es für produktive Voice-Produkte, oder für alles, was verifiziertes Verhalten außerhalb des Chinesisch-Defaults und unabhängig bestätigte Benchmark-Zahlen braucht.

Vor- & Nachteile

Pros

  • Apache-2.0, echte Streaming-Pipeline (ASR, Sprecherverifikation, Memory-Extraktion) statt nur ein Prompt-Wrapper
  • Gestützt durch einen technischen Report auf arXiv und eine reproduzierbare Evaluations-Suite im Repo (LoCoMo, PersonaMem)
  • Gezielt für Sprache gebaut, nicht nachträglich von Text-Chat-Memory auf Audio übertragen, trennt faktisches und emotionales Gedächtnis explizit

Cons

  • Sehr jung: erstes Release v0.0.1 am 1. September 2026, insgesamt zwei Releases
  • Die Schlagzeilen-Vergleiche gegen Mem0 (91,2% vs. 61,68% auf LoCoMo, 134ms vs. 1.440ms Antwortzeit) sind eigene Benchmarks des Projekts, nicht unabhängig verifiziert
  • Offene Issues melden, dass Emotions-Labels und Persönlichkeitsmerkmale standardmäßig auf Chinesisch fallen, selbst bei englischsprachigen Nutzern, eine echte Lokalisierungslücke vor Einsätzen außerhalb Chinas

Lizenz

Apache-2.0 (OSI-open)

Wann interessant

Voice-Agent-Entwickler, die persistentes, emotionsbewusstes Gedächtnis über Sessions hinweg brauchen und mit einem Projekt im Forschungsstadium leben können.

Wann zu früh

produktive Voice-Produkte, die stabile APIs oder verifiziertes Verhalten außerhalb von Chinesisch/Englisch brauchen.

Kommerzielle Alternative & Verwandtes

  • Kommerzielles Pendant: Mem0

Dieses Repo war in der Ausgabe 2026-09 des Open-Source-KI-Radars.