Skip to main content
AI Tool Radar
OSI-openLokale Inference und "was läuft auf meiner Maschine"

Slotstream

carloslfu

Lässt ein 105-GB-MoE-Modell mit 125B Parametern auf einem 48-GB-Apple-Silicon-Mac laufen, indem es Experten von der SSD streamt.

391 Stars(Stand 2026-09-23)Auf GitHub ansehenHomepage

Was ist Slotstream?

Eine native Swift-Engine auf Apples MLX und Metal, die Qwen3.8-Flash-Next (ein 125B-Parameter-MoE-Modell mit 105 GB) auf Macs mit nur 16 bis 64 GB RAM lauffähig macht. Geteilte Gewichte bleiben im Speicher, benötigte Experten werden von der SSD in einen Slot-basierten Cache gelesen, mit automatischer Speicherplanung und Expert-Lookahead-Vorhersage. Sie bietet OpenAI- und Ollama-kompatible APIs, läuft offline, ohne Python und ohne Cloud-Konto.

Slotstream auf einen Blick
MerkmalWert
Maintainercarloslfu
GitHub-Stars391 (Stand 2026-09-23)
Forks25
LizenzMIT
LizenztypOSI-open
Modell-LizenzQwen community license
KategorieLokale Inference und "was läuft auf meiner Maschine"
StatusAufsteigend
Edition2026-09
Zuletzt geprüft2026-09-23

Slotstream im Detail

Mixture-of-Experts-Modelle werden so groß, dass selbst ein gut ausgestatteter Mac sie nicht mehr vollständig im RAM halten kann, und ein 105-GB-Modell mit 125 Milliarden Parametern wie Qwen3.8-Flash-Next ist dafür ein klares Beispiel. Slotstream, gebaut von Carlos Galarza, zielt genau auf diese Lücke: Macs mit 16 bis 64 GB Unified Memory, die weit von dem entfernt sind, was das Modell bräuchte, wenn es komplett geladen würde. Das README ist direkt: ein 105-GB-Modell auf einem 48-GB-Mac laufen lassen, indem der Großteil auf der SSD bleibt und nur die benötigten Teile geladen werden. Es ist ein natives Swift-Programm auf Apples MLX und Metal, ohne Python-Runtime irgendwo im Stack.

Der technische Ansatz stützt sich auf die Mixture-of-Experts-Struktur des Modells selbst. Geteilte Gewichte bleiben im Speicher, während die Experten, die ein bestimmtes Token tatsächlich braucht, von der SSD in einen Slot-basierten Cache gelesen werden, mit automatischer Speicherplanung und Expert-Lookahead-Vorhersage, die versucht, die richtigen Experten vorab statt erst bei Bedarf zu holen. Das Projekt bietet sowohl OpenAI- als auch Ollama-kompatible APIs, sodass bestehendes Tooling mit minimalen Änderungen darauf zeigen kann, und es läuft vollständig offline, ohne Python-Abhängigkeit und ohne Cloud-Konto. Besonders ist, dass das Projekt seine Zahlen mit veröffentlichten Mess- und Hardware-Kompatibilitätsdokumenten statt nur einer einzelnen Schlagzeilen-Zahl belegt.

Die Zielgruppe ist eng, aber real: Besitzer von Apple-Silicon-Geräten im Bereich 16 bis 64 GB, die große Mixture-of-Experts-Modelle laufen lassen wollen, die sonst weit mehr Speicher bräuchten, als sie haben. Weil es die Ollama- und OpenAI-Protokolle spricht, fügt es sich in bestehendes lokales LLM-Tooling ein, statt einen neuen Client zu verlangen. Die von der Community beigesteuerten Hardware-Berichte im Repository, von kleineren MacBooks bis zu einem M5 Pro mit 48 GB, geben Interessenten eine Möglichkeit, vorab zu prüfen, ob ihre konkrete Maschine wahrscheinlich funktioniert.

Die ehrlichen Einschränkungen beginnen bei Plattform und Reife. Slotstream läuft nur auf Apple Silicon, und die anvisierten Modellgewichte tragen Qwens eigene Community-Lizenz, getrennt von der MIT-Codelizenz des Projekts. Die Versionierung liegt noch im Bereich 0.2.x, und der Issue-Tracker enthält einen echten Bericht, dass lange Re-Prefills den Server nach 15 oder mehr Minuten stillschweigend beenden können, genau die Art von Fehler, die bei unbeaufsichtigtem Betrieb zählt. Erwähnenswert ist auch: Derselbe Autor listet auf der Projekt-Homepage eine kommerzielle Mac-App namens Sevra, es lohnt sich also zu beobachten, ob sich offene Engine und bezahltes Produkt auseinanderentwickeln, während die App reift.

Das Fazit: Slotstream ist eine ernsthafte, gut dokumentierte Engine für ein spezifisches und wachsendes Problem, große MoE-Modelle auf speicherbegrenztem Apple Silicon laufen zu lassen, gestützt auf echte Messarbeit statt nur Marketing-Behauptungen. Greif zu, wenn du einen Mac mit 16 bis 64 GB hast und ein Modell ausprobieren willst, das sonst nicht passen würde, und du mit Software im Stadium 0.2.x leben kannst. Warte ab, wenn du Nicht-Apple-Hardware brauchst, garantierte Verfügbarkeit für lange Prefills brauchst, oder abwarten willst, bis das Verhältnis zwischen dem offenen Projekt und der kommerziellen Schwester-App klarer ist.

Vor- & Nachteile

Pros

  • Detaillierte, reproduzierbare Hardware-Messungen (MEASUREMENTS.md, HARDWARE.md) statt nur Schlagzeilen-Zahlen
  • MIT auf dem Code; natives Swift/MLX/Metal ohne Python-Runtime, OpenAI- und Ollama-kompatible Endpoints
  • Aktive tägliche Entwicklung mit einem echten Issue-Tracker (Hardware-Berichte, Bugfixes, Feature-Wünsche)

Cons

  • Nur Apple Silicon / macOS 14+
  • Die Modellgewichte (Qwen3.8-Flash-Next) tragen die separate Qwen-Community-Lizenz, nicht MIT
  • Dasselbe Team baut auf dieser Engine eine kommerzielle Mac-App (Sevra, auf sevrahq.com), es lohnt sich zu beobachten, wie sich offene Engine und bezahlte App auseinanderentwickeln
  • Pre-1.0 (v0.2.x), und ein gemeldetes Issue beschreibt, dass lange Re-Prefills den Server stillschweigend beenden können

Lizenz

MIT (OSI-open) - Modell-Lizenz: Qwen community license

Code ist MIT; die anvisierten Qwen3.8-Flash-Next-Modellgewichte tragen die separate Qwen-Community-Lizenz.

Wann interessant

Apple-Silicon-Nutzer mit 16-64 GB RAM, die ein großes MoE-Modell wollen, das sonst nicht passen würde.

Wann zu früh

Nicht-Apple-Hardware, oder Produktionszuverlässigkeit angesichts der noch frühen 0.2.x-Version und gemeldeter Stabilitätsprobleme.

Kommerzielle Alternative & Verwandtes

  • Kommerzielles Pendant: LM Studio

Dieses Repo war in der Ausgabe 2026-09 des Open-Source-KI-Radars.