Alibaba hat mit Qwen3.8-27B, einem 27-Milliarden-Parameter-Modell, die Gewichte für ein leistungsfähiges KI-Sprachmodell veröffentlicht und es läuft bereits auf Mittelklasse-Hardware wie der RTX 5060 Ti. Mit einer Multi-Token-Prediction erreicht das Modell hier 47,6 Token pro Sekunde, was selbst Benchmarks von Hochleistungs-Grafikkarten wie AMDs Radeon-Karten übertrifft. Die Kombination aus effizienter Architektur und Quantisierung macht Qwen3.8-27B besonders für Entwickler interessant, die auf kostengünstiger Hardware arbeiten wollen.
Qwen3.8-27B: Alibabas neues Sprachmodell mit 27 Mrd. Parametern und warum es besser als seine Vorgänger ist
Alibaba hat die Gewichte seines Modells Qwen3.8-27B veröffentlicht, das 27 Milliarden Parameter umfasst. Die Variante Qwen3.8-Max (2,4 Billionen Parameter) war zuvor nur als Qwen3.8-2.4T-A95B mit 95 Milliarden aktiven Parametern nutzbar. Im Vergleich zu Vorgängermodellen wie Qwen3.6, das als beste selbst betreibbare Alternative zu OpenAI/Anthropic galt, überzeugt Qwen3.8-27B laut Alibaba besonders beim Programmieren und der Zusammenarbeit mit KI-Agenten.
Die Gewichte wurden zunächst als volle Variante Qwen3.8-2.4T-A95B auf Huggingface bereitgestellt, gefolgt von der kompakteren Variante Qwen3.8-27B am Wochenende.
Rekord-Leistung: 47 Token/Sekunde auf einer RTX 5060 Ti, wie das geht
Ein Community-Test brachte Qwen3.8-27B auf eine einzelne Geforce RTX 5060 Ti (16 GiB VRAM) und erreichte 47,6 Token pro Sekunde. Die Testkonfiguration nutzte ein quantisiertes Modellformat (IQ4_XS-GGUF, ≈14,6 GiB), einen Kontext von 32.000 Tokens, einen quantisierten KV-Cache und Flash Attention. Ohne die Multi-Token-Prediction (MTP) lag die Geschwindigkeit bei 25,7 Token/Sekunde; mit MTP stieg sie auf 47,4–47,6 Token pro Sekunde.
Ein entscheidender Faktor ist die Architektur: Nur 16 von 64 Layers nutzen volle Attention, der Rest setzt auf Hybrid-Attention, um Rechenaufwand zu sparen. AMDs Benchmarks schreiben solche Leistungen erst für Radeon-Karten mit mindestens 24 GiB VRAM voraus; die RTX 5060 Ti (16 GiB) übertrifft diese Referenz deutlich.
Hardware-Anforderungen und Quantisierung: Wie viel Speicher braucht Qwen3.8-27B?
Die Herabstufung der Gewichtsblöcke von Q8_0 auf Q4_K spart nur etwa 25 MiB, die Dateigröße bleibt bei ≈14,6 GiB. Laut dem Tool Unsloth benötigt eine 4-Bit-Quantisierung 17–19 GiB Arbeits- und Grafikspeicher; der Testlauf bestätigte dies mit exakt 15,7 GB (≈14,6 GiB).
Offiziell empfiehlt Alibaba folgende VRAM-Anforderungen:
- BF16: 56 GB (für eine 80-GiB-Karte)
- FP8: 28 GB (für eine 48-GiB-Karte)
- 4-Bit: 14–17 GB (für eine 24-GiB-Karte) plus Speicher für den KV-Cache
Auf einer Radeon AI Pro R9700 (32 GiB) misst AMD 51,8 Token/Sekunde; auf einem AMD Ryzen AI Max+ 395 (CPU-basiert) sind es 24,5 Token pro Sekunde.
Veröffentlichung und Benchmarks: Was kann Qwen3.8-27B und wo findet man es?
Die Gewichte von Qwen3.8-27B wurden unter Apache 2.0-Lizenz am 13.–14. August 2026 auf Huggingface veröffentlicht. Alibaba hatte das Modell bereits am 3. August angekündigt und hielt die geplante Frist von einer Woche ein.
Die Model Card verzeichnet folgende Eigenschaften:
- Native Kontextlänge: 262.144 Token (extensibel auf bis zu 1 Million)
- Benchmark-Ergebnis: 61,7 Punkte im SWE-bench Pro
4. KI im Handwerk: Stand der Nutzung und Zukunftsperspektiven
Qwen3.8-27B kombiniert eine dichte Architektur mit Hybrid-Attention, einen Vision Encoder und ist als Open-Weight-Modell verfügbar unter https://huggingface.co/Qwen/Qwen3.8-27B.


