Meta Muse Glimmer Release (Bild © Meta)
Speicheroptimierung durch Destillation
Der Standardbetrieb eines Modells mit 30 Milliarden Parametern bei fp16-Genauigkeit erfordert allein für die Gewichte etwa 60 GB Speicher. Um diese Hardware-Barriere zu umgehen, setzte Meta die Destillation aus einem größeren Modell namens „Muse Spark“ ein. Durch diesen Prozess konnten die Speicheranforderungen auf 20 GB reduziert werden. Zusammen mit den 2 GB bis 4 GB, die für den KV-Cache benötigt werden, liegt der gesamte Speicherbedarf innerhalb der Grenzen von Grafikkarten für Endverbraucher mit 24 GB oder 32 GB VRAM. Meta berichtet, dass diese Komprimierungsmethode zu keinem spürbaren Leistungsverlust führt.
Geschwindigkeit der Token-Generierung und Entwurf
Das Modell nutzt ein Begleitsystem, das als „DFlash-Drafter-Modell“ bekannt ist, um die Latenz der Antworten zu reduzieren. Dieses kleinere Modell sagt Textabschnitte voraus, die „Muse Glimmer“ anschließend in einem einzigen Durchlauf verifiziert. Da die Verifizierung einer Antwort schneller ist als die Generierung einer Antwort von Grund auf, erhöht diese Architektur die Ausgabegeschwindigkeit.
Auf einer GeForce RTX 5090 (Test) Grafikkarte sind die Antworten 3,1-mal schneller. Auch bei Apple-Hardware zeigten sich Verbesserungen; der M5 Max und der M4 Max verzeichneten Geschwindigkeitssteigerungen um das 1,8-Fache bzw. das 1,5-Fache.
Globaler Marktkontext und Nutzungstrends
Der Zeitpunkt dieser Veröffentlichung fällt mit einer Phase bedeutenden Wachstums für chinesische KI-Modelle zusammen. Daten von OpenRouter zeigen, dass chinesische Architekturen seit fünfzehn Wochen in Folge die weltweite Token-Zahl anführen.
In der Woche ab dem 3. August erreichte die weltweite Gesamtnutzung von KI-Modellen 69 Billionen Token, was einem wöchentlichen Anstieg von 21,48 Prozent entspricht. Davon entfielen 34,25 Billionen Token auf chinesische Modelle, während US-amerikanische Modelle 9,17 Billionen beitrugen. Insbesondere verzeichnete DeepSeek V4 Flash eine Wachstumsrate von 570 Prozent im Wochenvergleich.
