shimmy
Michael-A-Kuykendall
Lokale Inference-Engine in reinem Rust mit OpenAI-kompatibler API, als eine Binary.
Was ist shimmy?
Eine reine Rust-Inference-Engine mit einem OpenAI-API-kompatiblen Endpoint, ausgeliefert als einzelne Binary: kein Python, kein llama.cpp. Sie läuft auf Vulkan, D3D12 und Metal, CUDA ist also nicht erforderlich, und entdeckt Modelle automatisch aus HuggingFace, Ollama und LM Studio.
shimmy im Detail
Lokale Sprachmodelle haben eine wiederkehrende Steuer: die Toolchain. Die meisten Wege zu einem lokalen OpenAI-artigen Endpoint führen über Python-Umgebungen, llama.cpp-Builds oder einen CUDA-Stack, der dich an NVIDIA-Hardware bindet. shimmy greift genau diese Reibung an. Es ist eine reine Rust-Inference-Engine mit einem OpenAI-API-kompatiblen Endpoint, ausgeliefert als einzelne Binary, ohne Python-Runtime und ohne llama.cpp-Abhängigkeit zum Kompilieren.
Die Designentscheidungen folgen aus diesem Ziel. Weil es Vulkan, D3D12 und Metal statt nur CUDA anspricht, läuft shimmy auf einer viel breiteren Palette an GPUs, inklusive AMD- und Apple-Hardware, die das CUDA-First-Ökosystem zweitklassig behandelt. Es erkennt zudem automatisch Modelle, die schon auf deiner Maschine liegen, aus HuggingFace, Ollama und LM Studio, du zeigst also auf das, was du hast, statt Gewichte erneut in das Verzeichnislayout eines weiteren Tools zu laden. Für alle, die schlicht einen Drop-in-`/v1/chat/completions`-Endpoint mit lokalen Gewichten wollen, ist das ein wirklich kurzer Weg.
Die natürliche Zielgruppe sind Entwickler oder Homelab-Nutzer, die einen gehosteten OpenAI-Aufruf gegen einen lokalen tauschen wollen, ohne ihren Stack neu zu bauen: Desktops mit gemischten GPUs, Maschinen ohne NVIDIA-Karte oder Setups, in denen eine Python-Umgebung unerwünscht ist. Weil die API OpenAI-kompatibel ist, funktioniert bestehender Client-Code samt SDKs weiter, indem nur die Base-URL geändert wird, und genau das macht lokale Inference in einem bestehenden Projekt überhaupt adoptierbar.
Die Vorbehalte sind real und gehören klar benannt. Der Airframe-GPU-Core kann von der Öffentlichkeit nicht aus dem Quellcode gebaut werden, ein gewichtiges Sternchen am Wort "offen" für ein Projekt, das mit Offenheit wirbt. Die Lizenz ist widersprüchlich zwischen den Apache-2.0-Badges und einem README, das MIT nennt, etwas, das du vor kommerzieller Nutzung klären solltest. Es bedient ein Modell pro Instanz ohne Multi-Model-Support, Mixture-of-Experts ist noch nicht implementiert, und die plakativen Performance-Behauptungen (etwa Startup unter 100 ms gegenüber Ollama) sind unverifizierte Projektangaben, keine unabhängig gemessenen Ergebnisse.
Das Fazit: shimmy überzeugt, wenn deine Priorität ein reibungsloser OpenAI-kompatibler Endpoint auf Nicht-CUDA- oder gemischter GPU-Hardware ist und du mit Single-Model-Serving leben kannst. Sieh es als frühe, aber vielversprechende Alternative zu Ollama und LM Studio für genau diese Nische. Wenn du den GPU-Core selbst auditieren oder kompilieren, mehrere Modelle bedienen oder dich auf garantierte Performance-Zahlen verlassen musst, ist es zu früh, und die etablierteren lokalen Runtimes bleiben vorerst die sicherere Wahl.
Vor- & Nachteile
Pros
- Einzelne Binary, kein Python- oder C++-Toolchain
- Breite GPU-Abdeckung ohne CUDA-Abhängigkeit
- Drop-in-OpenAI-API für lokale Modelle
Cons
- Der Airframe-GPU-Core kann von der Öffentlichkeit nicht aus dem Quellcode gebaut werden, ein echter Vorbehalt für ein 'offenes' Tool
- Ein Modell pro Server-Instanz, kein Multi-Model
- MoE noch nicht implementiert; Performance-Behauptungen (Startup <100ms vs. Ollama) sind unverifizierte Projektangaben
Lizenz
Apache-2.0 (OSI-open)
Apache-2.0 laut den Badges (der README-Text sagt MIT, eine echte Inkonsistenz, die du prüfen solltest, bevor du dich darauf verlässt).
Wann interessant
OpenAI-API-Drop-in auf gemischter GPU-Hardware ohne Python.
Wann zu früh
wenn du den GPU-Core selbst auditieren oder bauen willst, oder Multi-Model-Serving brauchst.
Dieses Repo war in der Ausgabe 2026-06 des Open-Source-KI-Radars.
oMLX
jundot
macOS-nativer LLM-Inference-Server für Apple Silicon mit Continuous Batching und SSD-gestütztem KV-Cache.
apfel
Arthur-Ficial
Das On-Device-Apple-Intelligence-Modell auf macOS 26 als Zero-Setup-OpenAI-kompatible lokale API verfügbar machen.
claude-code-local
nicedreamzapp
MLX-nativer Proxy, der das Claude-Code-CLI gegen lokale Modelle auf Apple Silicon laufen lässt, voll offline.