typesafe-computer-use
awlevin
Mac-Computer-Use-Agent, der jeden Bildschirm mit einem günstigen Entscheidungsmodell klassifiziert statt mit einem vollen Vision-LLM-Aufruf.
Was ist typesafe-computer-use?
Ein Computer-Use-Agent, der den Bildschirm deterministisch über OCR und den Accessibility-Baum ausliest und dann TypeSafes kleinen Klassifikator nach der nächsten Aktion fragt, statt ein Spitzen-Vision-Modell zu bemühen. Ein Writer-Modell (standardmäßig Claude, sonst jeder OpenAI-/Anthropic-kompatible Endpoint) wird nur aufgerufen, wenn ein Schritt wirklich freien Text oder eine abschließende Lektüre des Bildschirms braucht. Es steuert echte Maus und Tastatur auf macOS, mit experimenteller Windows-Unterstützung über UI Automation.
| Merkmal | Wert |
|---|---|
| Maintainer | awlevin |
| GitHub-Stars | 853 (Stand 2026-09-23) |
| Forks | 67 |
| Lizenz | MIT |
| Lizenztyp | OSI-open |
| Kategorie | Computer-Use und autonome Agents |
| Status | Aufsteigend |
| Edition | 2026-09 |
| Zuletzt geprüft | 2026-09-23 |
typesafe-computer-use im Detail
Vision-Modelle der Spitzenklasse sind der Standardweg für Computer-Use, aber sie sind langsam und teuer: ein Screenshot geht an ein Modell, das Modell überlegt, und nach ein paar Sekunden kommt ein Plan zurück. Die meisten dieser Entscheidungen brauchen gar kein Nachdenken, sie brauchen nur eine Wahl aus einer kurzen Liste sichtbarer Aktionen. Genau darauf baut typesafe-computer-use auf. Statt bei jedem Schritt ein allgemeines Vision-Modell zu fragen, was zu klicken ist, liest es den Bildschirm deterministisch über OCR und den macOS-Accessibility-Baum aus und fragt dann einen kleinen, zweckgebauten Klassifikator, welche der sichtbaren Optionen der nächste Schritt ist. Ein vollwertiges Sprachmodell kommt nur zum Einsatz, wenn ein Schritt wirklich freien Text oder eine abschließende geschriebene Antwort braucht.
Die Pipeline trennt drei Rollen. Eine Capture-Schicht führt OCR-Text und den Accessibility-Baum zu einer Liste klickbarer Elemente pro Bildschirm zusammen und scannt zwischen den Schritten nur die Kacheln neu, die sich geändert haben, um die Latenz niedrig zu halten. Diese Liste geht an TypeSafes Modell namens jev, ein Entscheidungsmodell, das über bis zu 255 Optionen eine vollständige Wahrscheinlichkeitsverteilung und eine kalibrierte Konfidenz liefert, in wenigen hundert Millisekunden und laut Projektangabe für einen Bruchteil eines Cents pro Entscheidung. Ein separates Writer-Modell, standardmäßig Anthropic-kompatibel, aber gegen jeden OpenAI-kompatiblen Endpoint austauschbar, auch lokale wie LM Studio oder Ollama, wird nur aufgerufen, um freien Text zu tippen, eine URL vorzuschlagen oder zu antworten, sobald der Klassifikator gestoppt hat und der Bildschirm gelesen werden muss.
Die natürliche Zielgruppe sind Entwickler, die repetitive Desktop-Workflows, Browser-Käufe, Formulare oder App-Tests auf einem Mac automatisieren und einen Agenten wollen, der bei Routine-Schritten schnell und günstig handelt und nur dann für die Überlegung eines Spitzenmodells zahlt, wenn ein Schritt es wirklich braucht. Weil das Writer-Modell voll austauschbar ist, können Teams, die bereits ein lokales oder selbst gehostetes LLM betreiben, die teuren Aufrufe an Spitzenmodelle komplett aus der Schleife halten, mit Ausnahme von TypeSafes eigenem Klassifikator, der für jeden Schritt eine erforderliche externe Abhängigkeit bleibt. Das Tool passt zu allen, die damit leben können, dass es echte Maus und Tastatur gegen produktive Apps steuert, idealerweise beginnend mit einem Trockenlauf.
Das Projekt ist zum Zeitpunkt des Schreibens eine Woche alt, mit v0.2.0 getaggt und ausdrücklich als Beta markiert, erwarte also schnelle, möglicherweise brechende Änderungen. Die plakativen Effizienzzahlen, etwa rund 155-mal günstiger und bis zu 40-mal schneller pro Entscheidung als ein blanker Screenshot-Aufruf an Claude Opus 5, sind die eigene Benchmark-Tabelle des Projekts, kein unabhängig reproduziertes Ergebnis, und sie gelten nur, weil der Klassifikator-Schritt an TypeSafes kostenpflichtige API ausgelagert wird statt lokal zu laufen. Windows-Unterstützung existiert, ist aber ausdrücklich experimentell und in der CI ungetestet. Wer sich für unbeaufsichtigte Automation darauf verlässt, sollte zudem bedenken, dass Computer-Use-Tools eine echte Maus und Tastatur steuern, mit dem entsprechenden Risiko eines Fehlklicks oder einer durch Prompt-Injection manipulierten Seite.
typesafe-computer-use ist eine wirklich durchdachte Antwort auf das Kostenproblem von Computer-Use-Agenten, kein dünner Wrapper: eine echte Capture-Pipeline, eine dokumentierte Testsuite mit Dutzenden skriptierten Szenarien und ein austauschbares Writer-Modell machen es substanzieller, als das einwöchige Alter vermuten lässt. Einen Versuch wert ist es, wenn dir die TypeSafe-Abhängigkeit und ihre Kosten pro Entscheidung akzeptabel sind und du eine schnelllebige 0.x-Beta tolerierst. Zu früh ist es, wenn du ein vollständig eigenständiges Open-Source-Tool ohne externe API brauchst, wenn du auf Windows unterwegs bist und Zuverlässigkeit brauchst, oder wenn du erprobte Stabilität willst statt eines Projekts, das eine Woche nach dem ersten Commit noch seine Form sucht.
Vor- & Nachteile
Pros
- Echte Architektur statt Wrapper: OCR plus Accessibility-Baum füttern einen schnellen Klassifikator, ein Writer-Modell wird nur bei Bedarf für freien Text aufgerufen
- MIT-lizenziert, täglich weiterentwickelt, mit echter CI-Pipeline und szenariobasierter Testsuite (40+ skriptierte Szenarien)
- Jeder OpenAI- oder Anthropic-kompatible Endpoint kann als Writer-Modell dienen, auch lokale wie LM Studio, Ollama oder vLLM
Cons
- Der zentrale Kosten- und Geschwindigkeitsvorteil hängt an einer kostenpflichtigen externen API (TypeSafes Klassifikator), das Open-Source-Repo allein liefert die genannten Einsparungen nicht
- Zum Zeitpunkt des Schreibens eine Woche alt (erstellt am 16.09.2026), 0.x-Beta mit schnellen, potenziell instabilen täglichen Änderungen
- Die Kosten-/Geschwindigkeits-Vergleichstabelle gegen Claude Opus 5 ist die eigene Benchmark-Angabe des Projekts, nicht unabhängig verifiziert
Lizenz
MIT (OSI-open)
Wann interessant
Du willst einen günstigen, schnellen, von OpenAI/Anthropic unabhängigen Computer-Use-Loop auf macOS und bist bereit, für den TypeSafe-Klassifikator zu zahlen.
Wann zu früh
Du brauchst ein vollständig selbst gehostetes Tool ohne externe Abhängigkeit, oder Stabilität jenseits einer eine Woche alten 0.x-Beta.
Dieses Repo war in der Ausgabe 2026-09 des Open-Source-KI-Radars.
UI-TARS-desktop
bytedance
Native Desktop-App für einen GUI-/Computer-Use-Agent, angetrieben vom open-weight-Modell UI-TARS.
strix
usestrix
Framework autonomer 'KI-Hacker'-Agents für dynamische Anwendungssicherheitstests.
Page Agent
alibaba
In-Page-JavaScript-GUI-Agent - jede Webseite mit natürlicher Sprache steuern, kein headless-Browser oder Extension.