Qwen3.8-27B
Das meistgeladene offene Modell dieser Größenklasse. 27,8 Milliarden Parameter passen quantisiert auf eine einzelne Karte, die Apache-Lizenz erlaubt den kommerziellen Betrieb ohne Rücksprache.
Wer ein Sprachmodell im eigenen Serverraum betreiben will, entscheidet sich zuerst für eine Größe. Diese Übersicht führt sechs offene Modelle mit Parameterzahl, Lizenz und dem Speicher, den sie belegen. Jede Angabe verlinkt auf die Modellkarte, aus der sie stammt.
Parameterzahl, Lizenz und Architektur sind Angaben der jeweiligen Modellkarte auf Hugging Face, abgerufen am 16. September 2026. Sie sind nachprüfbar: Jede Zeile verlinkt ihre Karte.
Der Speicherbedarf steht auf keiner Modellkarte. Er ist unten aus der Parameterzahl gerechnet, und die Rechnung steht offen daneben. Eine gerechnete Zahl ist keine gemessene. Woran sich der Unterschied im Betrieb zeigt und was wir selbst dazu erheben, steht weiter unten unter „Was wir selbst messen“.
Die Grenze liegt bei rund 96 GB VRAM, der größten Hardwareklasse, die wir für den Eigenbetrieb einrichten. Alles darunter läuft auf einer Maschine.
| Modell | Parameter | Lizenz | 4 Bit | 8 Bit | BF16 |
|---|---|---|---|---|---|
| Qwen3.8-27B Qwen (Alibaba) | 27,8 Mrd. | Apache-2.0 | 17 GB | 33 GB | 67 GB |
| Edge0-35B-A3B Edge0 | 34,7 Mrd. davon 3 Mrd. aktiv | Apache-2.0 | 21 GB | 42 GB | 83 GB |
| MiniCPM5-2B OpenBMB | 2,5 Mrd. | Apache-2.0 | 2 GB | 3 GB | 6 GB |
Die drei rechten Spalten sind gerechnet, nicht gemessen: Parameterzahl mal 0,5 Byte (4 Bit), 1 Byte (8 Bit) oder 2 Byte (BF16), zuzüglich 20 Prozent für den KV-Cache. Der Aufschlag ist eine Annahme; der tatsächliche Bedarf hängt an Kontextlänge, Batchgröße und Inferenzserver.
Das meistgeladene offene Modell dieser Größenklasse. 27,8 Milliarden Parameter passen quantisiert auf eine einzelne Karte, die Apache-Lizenz erlaubt den kommerziellen Betrieb ohne Rücksprache.
Mixture-of-Experts: Von 34,7 Milliarden Parametern rechnen je Token nur rund 3 Milliarden. Das senkt die Rechenlast, nicht den Speicherbedarf, denn im Speicher liegen müssen alle. Als Vorschau gekennzeichnet.
Die kleinste hier geführte Größe. Läuft auf einer gewöhnlichen Arbeitsplatzkarte und laut Karte auch auf Endgeräten. Die Karte weist Englisch und Chinesisch als Sprachen aus, Deutsch nicht.
Diese drei Modelle stehen als Maßstab in der Übersicht. Sie brauchen einen Verbund mehrerer Karten und kommen für einen einzelnen Serverraum nicht in Frage.
180 Mrd. Parameter, Lizenz other
180 Milliarden Parameter sprengen jede Einzelmaschine dieser Klasse. Dazu kommt eine Lizenz, die Hugging Face nur als „other“ führt: Vor einem kommerziellen Einsatz ist der Lizenztext zu lesen, nicht das Etikett.
396,8 Mrd. Parameter, Lizenz Apache-2.0
Apache-Lizenz und trotzdem kein Kandidat für den Serverraum: 396,8 Milliarden Parameter brauchen auch quantisiert einen Verbund mehrerer Karten. Eine freie Lizenz sagt nichts darüber, ob ein Modell betreibbar ist.
763,2 Mrd. Parameter, Lizenz MIT
Das größte Modell dieser Übersicht und das mit der freiesten Lizenz. Es steht hier als Maßstab dafür, wo der Eigenbetrieb endet und der Betrieb über einen Anbieter beginnt.
Die Zahlen oben stehen jedem offen. Interessant wird es bei den Fragen, die eine Modellkarte nicht beantwortet: Wie viel Speicher ein Modell auf einer konkreten Maschine bei 32.768 Token Kontext wirklich belegt, und wie gut es eine deutschsprachige Rechnung, ein Angebot oder einen Werkvertrag liest.
Gemessen wird im Haus auf einer NVIDIA DGX Spark mit 128 GB gemeinsamem Speicher, mit Ollama als Laufzeitumgebung und einem Kontext von 32.768 Token. Jedes Modell läuft in jeder Quantisierung, die auf dieses Gerät passt. Die Dokumente sind anonymisierte eigene Vorlagen aus drei Klassen: Rechnung, Vertrag und Angebot.
Zu jedem Dokument gibt es fünf feste Fragen mit Referenzantwort, geschrieben, bevor ein Modell das Dokument gesehen hat. Eine davon fragt nach etwas, das im Dokument nicht steht; wer dort eine Antwort erfindet, bekommt null Punkte. Zwei Personen bewerten jede Antwort unabhängig voneinander mit null bis zwei Punkten und sehen dabei nicht, welches Modell sie gegeben hat. Daneben halten wir den belegten Speicher und die erzeugten Token je Sekunde fest.
Die Messung ist geplant und noch nicht gelaufen. Bis Ergebnisse vorliegen, steht hier nichts, und das ist Absicht: Eine Tabelle aus fremden Angaben als eigene Messung auszugeben, wäre der bequemere und der falsche Weg.
Wir evaluieren Modelle auf Ihren echten Unterlagen, nicht auf einem Standardtest. Am Ende steht eine Empfehlung mit Hardwareklasse und Kostenrahmen.
Oder schreiben Sie uns direkt: [email protected] | +43 660 31 96 763
Zuletzt aktualisiert: