Skip to main content
AI Tool Radar
OSI-openAgent-Frameworks und Runtimes

reef

human-agent-society

Continual-Learning-Infrastruktur, die Agents aus echter Nutzung lernen lässt, über einen Serve-Observe-Grow-Commit-Zyklus.

4.2k Stars(Stand 2026-09-23)Auf GitHub ansehenHomepage

Was ist reef?

Eine Open-Source-Infrastruktur-Plattform, die Agent-Inference, Feedback-Sammlung, Modell-Training und versionierte Artefakt-Auslieferung verbindet, damit Agents sich kontinuierlich verbessern, ohne manuelle Retraining-Zyklen. Sie durchläuft einen vierstufigen Zyklus (Serve, Observe, Grow, Commit), unterstützt sowohl Modell-Weight-Training als auch reine Harness-Optimierung (das GPU-freie Reefine-Rezept) und bindet sich an bestehendes vLLM- oder SGLang-Inference an.

reef auf einen Blick
MerkmalWert
Maintainerhuman-agent-society
GitHub-Stars4.191 (Stand 2026-09-23)
Forks347
LizenzApache-2.0
LizenztypOSI-open
KategorieAgent-Frameworks und Runtimes
StatusAufsteigend
Edition2026-09
Zuletzt geprüft2026-09-23

reef im Detail

Agents, die einmal ausgeliefert werden und sich nie mehr ändern, sind längst die Norm, Agents, die aus der echten Nutzung heraus kontinuierlich besser werden, sind dagegen meist noch ein Forschungsproblem, gelöst mit einem selbstgebauten Fine-Tuning-Skript, das an den jeweils schon laufenden Inference-Server angeflanscht wird. reef, von der Human Agent Society (einer Forschungskooperation, deren Contributor auf der Homepage Zugehörigkeiten zu MIT, Stanford, Berkeley, CMU, Google DeepMind, Meta und ByteDance nennen), versucht, aus dieser Schleife wiederverwendbare Infrastruktur statt eines Einzelprojekts zu machen. Statt einen Agent von Hand neu zu trainieren, sobald er sich falsch verhält, verdrahtet reef Inference, Nutzer-Feedback und Training in eine durchgehende Pipeline, sodass die nächste Version eines Agents ein natürliches Ergebnis der echten Nutzung der letzten wird.

Die Architektur ist ein Vierstufen-Zyklus: Serve bedient echte Agent-Anfragen und zeichnet die Interaktion auf, Observe ordnet eingehendes Nutzer-Feedback der Interaktion zu, zu der es gehört, Grow erzeugt Kandidaten-Updates aus den Trainingsdaten, die sich angesammelt haben und dafür qualifiziert sind, und Commit wendet eine Auswahl-Policy an, bevor ein akzeptiertes Update in eine versionierte Artefakt-Historie über Git LFS veröffentlicht wird. Updates können direkt die Modell-Weights über Frameworks wie Slime, veRL oder AReaL angehen, oder GPU-Training komplett überspringen über das Reefine-Rezept, das stattdessen den Harness und das Prompting des Agents optimiert. Inference bindet sich an bestehende vLLM- oder SGLang-Deployments an, statt einen neuen Serving-Stack zu verlangen.

reef richtet sich klar an Teams, die schon einen Agent in Produktion betreiben und es leid sind, Feedback von Hand zu kuratieren und Fine-Tuning-Jobs manuell erneut anzustossen. Weil Reefine ohne GPU auskommt, ist es auch für Teams erreichbar, die die Continual-Improvement-Schleife wollen, aber noch keinen Trainings-Cluster rechtfertigen können - sie können damit starten, Harness und Prompts des Agents aus echten Nutzungsdaten weiterzuentwickeln, und später Weight-Training ergänzen. Die vLLM/SGLang-Integration bedeutet, dass es sich natürlich in einen Stack einfügt, der Modelle schon so bedient, statt dich zu zwingen, die Inference-Schicht zu ersetzen, um es zu übernehmen.

Die Vorbehalte beginnen beim Alter: Das reef-Repository wurde am 31.08.2026 erstellt, und das erste getaggte Release, v0.1.0, erschien am selben Tag, an dem dieser Check geschrieben wurde, es gibt also trotz schnell wachsender Sternezahl noch keine langfristige Erfolgsbilanz. Die Copyright-Zeile im LICENSE-File nennt 'Copyright 2025 Zhipu AI' statt der Organisation Human Agent Society, die das Projekt veröffentlicht, eine Inkonsistenz, die du vor kommerzieller Nutzung klären solltest, auch wenn die Apache-2.0-Bedingungen selbst eindeutig sind. Die Benchmark-Ergebnisse, die das Projekt zitiert, gegen AIME 2025, IMOAnswerBench, CEO-Bench und Terminal-Bench, sind eigene gemeldete Zahlen und wurden nicht unabhängig reproduziert, behandle sie also als Ausgangspunkt, nicht als Garantie.

Das Fazit: reef ist einen Blick wert, wenn du Agents baust, die aus Produktions-Feedback lernen müssen, und die Verkabelung zwischen Serving, Feedback-Erfassung, Training und Versionierung nicht selbst bauen willst, der GPU-freie Reefine-Pfad senkt zudem die Einstiegshürde. Sieh es als frühe Infrastruktur-Wette, nicht als reife Abhängigkeit - die Commit-Aktivität und die Streuung der Contributor sind echt, aber drei Wochen Historie und eine ungeklärte Lizenz-Inkonsistenz bedeuten, dass es zu früh ist für alles, was du dir nicht leisten kannst, später zu überarbeiten oder zu ersetzen.

Vor- & Nachteile

Pros

  • Vollständige Vierstufen-Pipeline (Serve, Observe, Grow, Commit) statt eines einzelnen Trainings-Skripts, mit einem GPU-freien Harness-Optimierungsmodus (Reefine) neben vollem Weight-Training
  • Echte Engineering-Signale: über 10 aktive Contributor, Commits bis zum Tag dieses Checks, veröffentlichte Benchmarks gegen AIME 2025, Terminal-Bench und weitere Suiten (eigene Projektangaben)
  • Apache-2.0 auf dem Code, bindet sich an bestehendes vLLM/SGLang-Serving an, statt einen neuen Inference-Stack zu verlangen

Cons

  • Sehr jung: Repo am 31.08.2026 erstellt, das erste getaggte Release (v0.1.0) erschien am selben Tag, an dem dieser Check lief, also noch keine Erfolgsbilanz trotz schnell wachsender Sternezahl
  • Der Copyright-Inhaber im LICENSE-File (Zhipu AI) passt nicht zur Organisation human-agent-society, die das Projekt veröffentlicht, das solltest du vor kommerzieller Nutzung klären
  • Benchmark-Ergebnisse (AIME 2025, IMOAnswerBench, CEO-Bench, Terminal-Bench) sind eigene, nicht unabhängig reproduzierte Projektangaben

Lizenz

Apache-2.0 (OSI-open)

Apache-2.0 laut Repo-Badges und README, aber die Copyright-Zeile im LICENSE-File nennt 'Copyright 2025 Zhipu AI', nicht die Organisation human-agent-society, eine Inkonsistenz, die trotz eindeutiger Apache-2.0-Bedingungen auffällt.

Wann interessant

Teams, die Agents bauen, die aus Produktions-Feedback lernen sollen, ohne die Verkabelung zwischen Serving, Feedback und Training selbst zu bauen.

Wann zu früh

produktive Nutzung, bevor die Lizenz-Anomalie geklärt ist, oder wenn du ein Projekt mit mehr als drei Wochen Historie brauchst.

Dieses Repo war in der Ausgabe 2026-09 des Open-Source-KI-Radars.