Skip to main content
AI Tool Radar
OSI-openComputer-Use und autonome Agents

LongHorizon-Harness

AMAP-ML

Loop-Engineering-Schicht, die Claude Code, Codex oder andere Coding-Agenten stundenlang an einem Ziel über Desktop-Apps und CLI hinweg arbeiten lässt.

1.6k Stars(Stand 2026-09-23)Auf GitHub ansehenHomepage

Was ist LongHorizon-Harness?

Ein 'Loop Engineering'-System vom AMap-ML-Team bei Alibaba, das einen bestehenden Coding-Agenten (Claude Code, Codex, OpenCode oder DeepSeek Harness) in eine Plan-Act-Verify-Checkpoint-Schleife einbettet: Es stellt Ziel und verifizierten Zustand jede Runde neu her, führt einen einzelnen begrenzten nächsten Schritt mit frischem Kontextfenster aus, prüft das reale Ergebnis auf dem Desktop oder im Terminal, und sichert den Fortschritt als Checkpoint oder speist Fehlerbelege in die nächste Runde ein. Es zielt sowohl auf grafische Desktop-Apps als auch das Terminal und berichtet Ergebnisse auf benannten, öffentlichen Benchmarks (WeaveBench, OSWorld 2.0, Terminal-Bench 2.1), gestützt durch ein begleitendes arXiv-Paper.

LongHorizon-Harness auf einen Blick
MerkmalWert
MaintainerAMAP-ML
GitHub-Stars1.617 (Stand 2026-09-23)
Forks177
LizenzMIT
LizenztypOSI-open
KategorieComputer-Use und autonome Agents
StatusAufsteigend
Edition2026-09
Zuletzt geprüft2026-09-23

LongHorizon-Harness im Detail

Coding-Agenten sind gut bei begrenzten Aufgaben, verlieren aber leicht die Orientierung, den Zustand oder schlicht den Kontext, sobald etwas Stunden statt Minuten dauert, besonders bei Arbeit, die sowohl Desktop-Apps mit grafischer Oberfläche als auch ein Terminal umfasst. LongHorizon-Harness vom AMap-ML-Team bei Alibaba wurde gezielt gegen genau dieses Fehlerbild gebaut, statt ein weiterer Agent zu sein. Es trainiert kein neues Modell und ersetzt nicht Claude Code, Codex, OpenCode oder DeepSeek Harness, sondern umschließt, was du davon schon nutzt, mit einer Schicht, die das Projekt Loop Engineering nennt und die den Agenten über eine lange laufende Desktop-und-CLI-Aufgabe hinweg auf ein Ziel ausgerichtet hält.

Die Schleife folgt einem festen Zyklus: Ziel und letzten verifizierten Zustand wiederherstellen, einen einzelnen, begrenzten nächsten Schritt planen, ihn mit einem frischen Kontextfenster statt einer immer länger werdenden Konversation ausführen, prüfen, ob das reale Ergebnis auf dem Desktop oder im Terminal tatsächlich dem Erwarteten entspricht, und dann entweder den Fortschritt als Checkpoint sichern oder die Fehlerbelege in die nächste Runde einspeisen. Weil die Verifikation gegen den echten Computerzustand erfolgt und nicht gegen die eigene Erfolgsmeldung des Modells, wird ein Schritt, der still fehlgeschlagen ist, nicht als erledigt gewertet. Der Harness berichtet seine Ergebnisse auf benannten, öffentlichen Benchmarks, darunter WeaveBench, OSWorld 2.0 und Terminal-Bench 2.1, und dokumentiert den Ansatz in einem begleitenden arXiv-Paper.

Das passt zu Teams und Einzelpersonen, die Claude Code, Codex, OpenCode oder DeepSeek Harness bereits für echte Arbeit nutzen und wollen, dass genau diese Agenten unbeaufsichtigt über Dutzende Stunden an Aufgaben weiterlaufen, die Desktop-Anwendungen mit Kommandozeilen-Schritten mischen, etwa eine mehrstufige Datenmigration, ein langer Recherche-Durchlauf oder ein durchgängiger App-Workflow, den ein einzelner Agenten-Turn nicht abschließen kann. Weil es Backend-agnostisch ist, müssen Teams, die sich schon auf einen Coding-Agenten festgelegt haben, für die längere Schleife nicht das Werkzeug wechseln, sie installieren LongHorizon-Harness einfach über das, was sie heute schon einsetzen.

Der Start des Projekts war intensiv (acht Releases und Dutzende gemergte Pull-Requests zwischen dem 4. und 20. August 2026), aber seit dem 20. August gab es keinen Commit und kein Release mehr, mehr als einen Monat vor dieser Auswertung, trotz 40 offener, unbearbeiteter Issues. Die berichteten Gewinne auf WeaveBench, OSWorld 2.0 und Terminal-Bench 2.1 sind eigene Projektangaben, nicht unabhängig reproduziert. Weil LongHorizon-Harness einen bestehenden Agenten nur orchestriert statt sein Urteilsvermögen zu ersetzen, bleibt die Qualität jedes einzelnen Schritts an das jeweilige Backend-Modell gebunden, und ein systematisch falscher Verifikationsschritt könnte schlechten Fortschritt fälschlich als Checkpoint absegnen.

LongHorizon-Harness adressiert eine reale und konkrete Lücke, Agenten, die bei langen Desktop-plus-CLI-Aufgaben die Orientierung oder den Zustand verlieren, mit einem glaubwürdigen, benchmark-gestützten Ansatz von einem echten Engineering-Team statt einem Solo-Nebenprojekt. Einen Einsatz wert ist es, wenn du bereits Claude Code, Codex oder einen ähnlichen Agenten betreibst und ihn über viele Stunden echter Arbeit mit Checkpoint-Wiederherstellung laufen lassen willst. Zu früh ist es für alles Geschäftskritische, angesichts der mehr als einmonatigen Stille seit dem letzten Push. Behandle den intensiven Start über drei Wochen als vielversprechend und beobachte, ob die Entwicklung wieder aufgenommen wird, bevor du produktiv darauf setzt.

Vor- & Nachteile

Pros

  • Getragen von einem etablierten Team (Alibabas AMap-ML) mit arXiv-Paper und Ergebnissen auf benannten, öffentlichen Benchmarks statt einem privaten
  • Backend-agnostisch angelegt: funktioniert mit Claude Code, Codex, OpenCode und DeepSeek Harness, statt dich an einen Agenten zu binden
  • 9 echte Contributor und 8 Releases (v0.1.2 bis v0.1.7) in den ersten drei Wochen zeigen einen echten Entwicklungsschub, keinen einzelnen Commit-Dump

Cons

  • Seit dem 20.08.2026 kein Commit und kein Release mehr, zum Zeitpunkt dieser Auswertung über einen Monat still, trotz 40 unbearbeiteter offener Issues
  • Die berichteten Gewinne auf WeaveBench, OSWorld 2.0 und Terminal-Bench 2.1 sind eigene Projektangaben, nicht unabhängig reproduziert
  • Es orchestriert einen bestehenden Agenten, statt sein Urteilsvermögen zu ersetzen, die Qualität jedes Schritts bleibt also an das jeweilige Backend-Modell gebunden

Lizenz

MIT (OSI-open)

Wann interessant

Du nutzt bereits Claude Code, Codex oder OpenCode und willst sie über viele Stunden an langen Desktop-plus-CLI-Aufgaben mit Checkpoint-Wiederherstellung weiterlaufen lassen.

Wann zu früh

Du brauchst durchgängig gepflegtes Tooling, die über einen Monat lange Stille seit dem letzten Push ist ein echter Vorbehalt gegenüber dem starken Anfangsschub.

Dieses Repo war in der Ausgabe 2026-09 des Open-Source-KI-Radars.