Lemmalog
JordyZomer
Datalog-Engine für LLM-Agent-Memory, stratifizierte Regeln, provenienzverfolgte Fakten und inkrementelle Ableitung statt Vektor-Ähnlichkeit.
Was ist Lemmalog?
Lemmalog wettet darauf, dass das Gedächtnis eines Agenten eine deduktive Datenbank sein sollte: Grundfakten werden an der Extraktionsgrenze festgehalten, und eine Rust-Datalog-Engine leitet daraus stratifiziert Abschlüsse, zeitliche Projektionen und Widerspruchskandidaten ab, jeder Fakt trägt seine Provenienz zurück zur Ursprungs-Episode. Ein MCP-Server mit zwölf Tools bindet die Engine in Claude Code oder Kimi CLI ein, why()-Aufrufe liefern Beweisbäume statt Blackbox-Scores, und eine hybride Retrieval-Schicht kombiniert BM25 mit Entity-Graph-Boosting für budgetierten Kontext.
| Merkmal | Wert |
|---|---|
| Maintainer | JordyZomer |
| GitHub-Stars | 317 (Stand 2026-09-23) |
| Forks | 30 |
| Lizenz | MIT |
| Lizenztyp | OSI-open |
| Kategorie | Agent-Memory und Code-Wissen |
| Status | Aufsteigend |
| Edition | 2026-09 |
| Zuletzt geprüft | 2026-09-23 |
Lemmalog im Detail
Die meisten Agent-Memory-Tools setzen auf 'besser erinnern': größere Embeddings, klügeres Chunking, eine Graphdatenbank obendrauf. lemmalog vom Sicherheitsforscher Jordy Zomer, veröffentlicht im August 2026, setzt auf eine ganz andere Wette: Das Gedächtnis eines Agenten sollte eine deduktive Datenbank sein. Grundfakten werden an der Extraktionsgrenze festgehalten (ein LLM verwandelt Konversation in Tripel), und von dort leitet eine Rust-Datalog-Engine mechanisch Abschlüsse, zeitliche Projektionen und Widerspruchskandidaten ab; das Schlussfolgern passiert in einer nachprüfbaren Logik-Engine, nicht durch erneutes Lesen einer Zusammenfassung in der Hoffnung, dass das Modell die Reihenfolge richtig hinbekommt.
Die Engine ist ein stratifizierter Datalog-Interpreter mit seminaiver Auswertung, bitemporalen Fakten (valid_from/valid_to), Konfidenz und Provenienz als Semiring-Annotationen und einem why()-Aufruf, der einen Beweisbaum bis zum ursprünglichen Gesprächsabschnitt zurückliefert statt eines Blackbox-Scores. Ein MCP-Server stellt zwölf Tools für Claude Code oder Kimi CLI bereit (darunter lemmalog_observe, lemmalog_query, lemmalog_why, lemmalog_what_if), sodass das Host-Modell die Konversation liest und Fakten festhält, während lemmalog alles Nachgelagerte deterministisch ableitet. Eine hybride Retrieval-Schicht kombiniert BM25-Stichwortsuche mit Entity-Graph-Boosting, um einen budgetierten Kontext zusammenzustellen, statt bei jedem Prompt den gesamten Faktenspeicher hineinzukippen.
Es passt zu langlaufender, strukturierter Arbeit, bei der du hinterfragen willst, was der Agent glaubt und warum, Ermittlungen, Audits, Multi-Session-Debugging, mehr als zu offenem Chat-Gedächtnis. Die why()-Beweisbäume und die explizite Hypothesen-Funktion what_if (einen Fakt gegen den Store testen und ihn dann bytegleich wiederherstellen) sind genau die Art Feature, die zählt, wenn du eine abgeleitete Antwort prüfen und ihr vertrauen musst, statt nur eine plausibel klingende abzurufen. Es passt zu Teams, die es bereits gewohnt sind, einen MCP-Server in ihren Agent einzubinden, nicht zu jemandem, der null Konfiguration will.
Das Projekt ist drei Wochen alt und hat noch kein getaggtes Release, die Installation bedeutet cargo build aus einem Checkout, nicht aus einem Paketmanager. Alle berichteten Zahlen (LongMemEval, LoCoMo, die synthetische Langzeit-Evaluation) stammen aus ein- oder dreifach wiederholten Läufen, die das Projekt selbst gefahren hat, und das README ist ungewöhnlich offen über Messrauschen: Bei einem Benchmark 'kippte eine Antwort zwischen zwei gleich konfigurierten Läufen von 1,00 auf 0,00', weil das verwendete Modell einen Temperature-Parameter ablehnt. Die Faktenextraktion hängt weiterhin vollständig von einem externen LLM-Aufruf ab, um Prosa in Tripel zu verwandeln, die Datalog-Engine schlussfolgert über Fakten, sie liest kein Englisch selbst, die Extraktionsqualität ist also eine harte Obergrenze für alles Nachgelagerte.
lemmalog lohnt Beobachtung, wenn deterministisches, provenienzverfolgtes Schlussfolgern über Agent-Memory, statt einer weiteren Vektor-Ähnlichkeits-Schicht, das ist, was du wirklich brauchst, und wenn du damit leben kannst, Pre-Release-Rust aus dem Quellcode zu bauen. Die technische Sorgfalt (differenzielles Testen gegen ein Brute-Force-Orakel, ehrliches Berichten über zurückgenommene Experimente) liegt deutlich über dem, was ein drei Wochen altes Repo normalerweise zeigt. Aber es gibt kein paketiertes Release, eine kleine Contributor-Basis, und jede Benchmark-Zahl ist eine projekteigene Messung aus wenigen Läufen; behandle es als ernstzunehmenden Forschungsprototyp, den man im Blick behalten sollte, noch nicht als Produktionsabhängigkeit.
Vor- & Nachteile
Pros
- Eine wirklich andere architektonische Wette: Fakten werden festgehalten, Regeln leiten Abschlüsse, zeitliche Projektionen und Widerspruchskandidaten deterministisch ab, mit why()-Beweisbäumen zurück zu den Quell-Episoden statt Ähnlichkeitssuche
- Ungewöhnlich rigorose Validierung für ein drei Wochen altes Projekt: 450 zufällige Programme gegen ein Brute-Force-Orakel geprüft, Äquivalenzchecks zwischen inkrementeller und Einzelschuss-Auswertung, 2.000 Parser-Fuzzing-Fälle
- Eigene Läufe auf zwei standardisierten öffentlichen Leaderboards (ProsusAI MemEvals LongMemEval-Split und LoCoMo) mit ehrlich berichtetem 2.-von-10-Platz und Mittelfeld-Platzierungen, nicht nur zitierten Siegen
Cons
- Sehr früh: erstellt am 27.08.2026, noch kein getaggtes Release, und das eigene README dokumentiert Engine-Bugs, die während der Entwicklung gefunden und behoben wurden
- Die Faktenextraktion hängt weiterhin vollständig von einem externen LLM-Aufruf ab, um Prosa in Tripel zu verwandeln; die Datalog-Engine selbst versteht kein Englisch, die Extraktionsqualität ist also eine harte Obergrenze für alles Nachgelagerte
- Bislang kleines Team (5 Contributor, überwiegend Jordy Zomer solo mit gelegentlichen externen Pull Requests) und noch kein sichtbarer CI-Badge oder Release-Prozess
Lizenz
MIT (OSI-open)
Wann interessant
Agent-Memory-Setups, bei denen deterministisches, nachvollziehbares Schlussfolgern über Fakten (zeitliche Reihenfolge, Widerspruchserkennung, Multi-Hop-Abfragen) wichtiger ist als semantisches Recall.
Wann zu früh
produktiver Einsatz vor einem ersten getaggten Release, oder wenn du ein Memory-System ohne LLM-Extraktionsschritt brauchst.
Dieses Repo war in der Ausgabe 2026-09 des Open-Source-KI-Radars.
claude-mem
thedotmack
Persistente Memory-Schicht über Agent-Sessions hinweg mit automatischen semantischen Zusammenfassungen und Token-Kosten-Transparenz.
graphify
safishamsi
KI-Coding-Skill, der einen Ordner aus Code, Docs und Bildern in einen abfragbaren Knowledge Graph verwandelt, über rund 20 Agents hinweg.
memU
NevaMind-AI
Memory-Framework für proaktive KI-Agents - typisierter Memory-Graph aus Chats, Dokumenten und Medien.