Zurück zum Glossar

Begriff

Mixtral 8x7B

Mixtral 8x7B (Dezember 2023) ist Mistral AIs offenes Sparse-MoE-Modell mit 8 Experten — 46,7 Mrd. Parameter, 12,9 Mrd. aktiv pro Token, 32K-Kontext, Apache-2.0-Lizenz.

Mixtral 8x7B — ausführlicher erklärt

Mistral AI veröffentlichte Mixtral 8x7B am 11. Dezember 2023 als quelloffenes Modell unter der Apache-2.0-Lizenz. Es ist ein Sparse-Mixture-of-Experts-Modell (SMoE) mit acht Experten-Netzwerken: Ein gelernter Router wählt pro Token in jeder Schicht zwei der acht Experten aus und kombiniert deren Ausgaben. Das Modell hat 46,7 Mrd. Gesamtparameter, von denen pro Forward-Pass nur rund 12,9 Mrd. aktiviert werden — daher die hohe Effizienz. Das Kontextfenster umfasst 32.768 Token.

Beispiel / Praxisbezug

Mixtral 8x7B übertraf zum Release Llama 2 70B auf den meisten Benchmarks bei rund sechsfach schnellerer Inferenz und erreichte oder überbot GPT-3.5 auf gängigen Standard-Benchmarks. Weil nur ein Bruchteil der Parameter pro Token aktiv ist, liefert das Modell die Qualität eines deutlich größeren Modells zu den Rechenkosten eines kleineren. Als Apache-2.0-Modell mit offenen Gewichten lässt es sich frei herunterladen, anpassen und selbst hosten — ein wichtiger Baustein der frühen Open-Weight-Welle.

Abgrenzung

Mixtral steht innerhalb der Mistral-Familie für die MoE-Architektur — im Unterschied zum dichten Basismodell Mistral 7B, bei dem alle Parameter aktiv sind. Gegenüber späteren, größeren Modellen (etwa Mistral Large) ist Mixtral 8x7B das frühe, effizienzorientierte MoE-Modell. Der Name „8x7B” verweist auf die acht Experten auf Basis der 7B-Architektur, ergibt aber wegen geteilter Komponenten nicht 56 Mrd., sondern 46,7 Mrd. Gesamtparameter.

Alle Beiträge im Überblick:Mistral