TurboFieldfare
drumih
Streamt die Experten eines 26B-Parameter-MoE-Modells von der SSD, um Gemma 4 auf einem 8-GB-Apple-Silicon-Mac laufen zu lassen.
Was ist TurboFieldfare?
Eine native Swift/Metal-Inference-Engine für Apple Silicon, die nur die gerade benötigten Experten-Gewichte von Gemma 4 26B von der SSD streamt, statt das komplette 14,3-GB-Modell zu laden. Ein 1,35-GB-Kern und der FP16-KV-Cache bleiben im Speicher, während Experten mit begrenzter paralleler Lesegeschwindigkeit nachgeladen werden. Der Installer streamt die Modellgewichte direkt von Hugging Face.
| Merkmal | Wert |
|---|---|
| Maintainer | drumih |
| GitHub-Stars | 6.804 (Stand 2026-09-23) |
| Forks | 430 |
| Lizenz | Apache-2.0 |
| Lizenztyp | OSI-open |
| Kategorie | Lokale Inference und "was läuft auf meiner Maschine" |
| Status | Aufsteigend |
| Edition | 2026-09 |
| Zuletzt geprüft | 2026-09-23 |
TurboFieldfare im Detail
Ein Mixture-of-Experts-Modell mit 26 Milliarden Parametern wie Gemma 4 laufen zu lassen, setzt normalerweise eine Maschine mit zig Gigabyte freiem Speicher voraus, was die meisten Consumer-Macs ausschließt. TurboFieldfare, ein natives Swift- und Metal-Projekt des Entwicklers Andrey Mikhaylov (drumih), greift genau diese Annahme an. Statt den kompletten 14,3-GB-Checkpoint in den RAM zu laden, hält es nur einen 1,35-GB-Kern plus den FP16-KV-Cache im Speicher und streamt die gerouteten Mixture-of-Experts-Gewichte bei Bedarf von der SSD. Die eigene Beschreibung des Projekts ist unumwunden: Speicher wurde teuer, also bekam ein 26B-Modell ein Budget von rund 2 GB. Für alle, die schon einmal erlebt haben, wie ein großes Modell auf einem 8-GB-Laptop schlicht nicht lädt, ist dieses Versprechen sofort verständlich.
Die Mechanik ist spezifisch für Apples Plattform. TurboFieldfare nutzt eine MLX-artige affine 4-Bit-Quantisierung zusammen mit eigenen Metal-4-Kernen, und das Prefill läuft in 128-Token-Blöcken, um beim Streaming einen vernünftigen Durchsatz zu halten. Weil nur die für das aktuelle Token gerouteten Experten von der Platte geholt werden, und zwar über begrenzt parallele I/O statt Gewicht für Gewicht, wird die SSD zu einer Erweiterung des RAM statt zu einem harten Flaschenhals. Der Installer selbst streamt Modellgewichte direkt von Hugging Face, ohne je einen vollständigen lokalen Checkpoint zu materialisieren, wodurch der Speicherbedarf nah am tatsächlich Benötigten bleibt, statt zuerst das komplette Modell herunterzuladen.
Die natürliche Zielgruppe sind Besitzer von Apple-Silicon-Geräten, besonders mit 8 oder 16 GB RAM, die ein wirklich großes Modell wie Gemma 4 26B lokal laufen lassen wollen, ohne neue Hardware zu kaufen. Es kommt als CLI, als OpenAI-kompatibler Server und als native Mac-App, passt also sowohl zu skriptbasierten Workflows als auch zu Nutzern, die einen lokalen Chat-Client zum Anklicken wollen. Das Projekt ist rein arm64 und braucht macOS 26, richtet sich also klar an Nutzer mit aktueller Apple-Hardware statt an eine plattformübergreifende Runtime.
Die Einschränkungen liegen vor allem im Umfang und in der Beleglage, nicht in der Codequalität. Es funktioniert nur auf Apple Silicon und macOS 26, ohne Weg zu Linux, Windows oder Intel-Macs. Das Projekt ist Pre-1.0 (aktuell v0.9.0) und bringt etwa alle paar Tage ein Release, was aktive Entwicklung signalisiert, aber auch eine noch nicht ausgereifte API. Die gestreamten Modellgewichte selbst unterliegen Googles eigener Gemma-Lizenz, getrennt von der Apache-2.0-Codelizenz des Projekts, die Weiterverteilungsbedingungen unterscheiden sich also von der Runtime selbst. Und die Schlagzeilen-Durchsatzzahlen, rund 5 bis 6 Tokens pro Sekunde auf einem 8-GB-M2-MacBook-Air und 31 bis 35 Tokens pro Sekunde auf einem 24-GB-M5-Pro, sind eigene Messungen des Projekts, keine unabhängig reproduzierten Benchmarks.
Das Fazit: TurboFieldfare ist eine glaubwürdige, aktiv gepflegte Antwort auf ein echtes Problem, ein 26B-Modell in rund 2 GB Speicher auf Apple Silicon laufen zu lassen, getragen von einer echten Metal-Kernel-Implementierung statt einem dünnen Wrapper. Greif zu, wenn du einen Apple-Silicon-Mac mit 8 bis 24 GB besitzt und Gemma 4 heute schon lokal laufen lassen willst, im Bewusstsein, dass du auf einem Pre-1.0-Release unterwegs bist. Zu früh ist es, wenn du plattformübergreifende Unterstützung, eine eingefrorene API oder Performance-Zahlen brauchst, die außerhalb der eigenen Tests des Projekts verifiziert wurden.
Vor- & Nachteile
Pros
- Native Swift/Metal-Implementierung mit echter Streaming-Runtime, kein Python-Wrapper
- Apache-2.0 auf dem Code, tägliche Commits und ein schnelles Release-Tempo (0.4 bis 0.9 in rund einem Monat)
- Liefert CLI, einen OpenAI-kompatiblen Server und eine native Mac-App
Cons
- Nur arm64 / Apple Silicon und macOS 26+, kein Linux, Windows oder Intel-Mac
- Pre-1.0 (v0.9.0); die gestreamten Modellgewichte folgen Googles eigener Gemma-Lizenz, getrennt vom Apache-2.0-Code
- Durchsatz-Angaben (5-6 Tok/s auf einem 8-GB-M2, 31-35 Tok/s auf einem 24-GB-M5-Pro) sind eigene Messungen des Projekts, nicht unabhängig reproduziert
Lizenz
Apache-2.0 (OSI-open)
Wann interessant
Apple-Silicon-Besitzer mit knappem RAM, die ein 26B-Gemma-Modell laufen lassen wollen, ohne einen größeren Mac zu kaufen.
Wann zu früh
jede Nicht-Apple-Hardware, oder wenn du eine fertige v1.0 mit stabiler API brauchst.
Kommerzielle Alternative & Verwandtes
- Kommerzielles Pendant: LM Studio
Dieses Repo war in der Ausgabe 2026-09 des Open-Source-KI-Radars.
oMLX
jundot
macOS-nativer LLM-Inference-Server für Apple Silicon mit Continuous Batching und SSD-gestütztem KV-Cache.
apfel
Arthur-Ficial
Das On-Device-Apple-Intelligence-Modell auf macOS 26 als Zero-Setup-OpenAI-kompatible lokale API verfügbar machen.
shimmy
Michael-A-Kuykendall
Lokale Inference-Engine in reinem Rust mit OpenAI-kompatibler API, als eine Binary.