Alibabas Qwen-Team stellt mit Qwen3.8-Flash-Next ein multimodales Mixture-of-Experts-Modell vor, das als Architektur-Vorschau auf Qwen4 dient. Es soll bei einem Bruchteil der Trainingskosten mit deutlich größeren Modellen mithalten.
Das Modell umfasst 125 Milliarden Parameter im Hauptmodell, aktiviert pro Token jedoch nur 6 Milliarden Parameter. Hinzu kommen 51 Milliarden Parameter in einer neuartigen N-gram-Embedding-Schicht, eine der Architektur-Neuerungen, die in Qwen4 übernommen werden sollen. Sie speichert häufige Wortgruppen als eigenständige Einträge in einer Art "Phrasenlexikon" und kann im regulären Arbeitsspeicher statt auf der GPU abgelegt werden, ohne nennenswerten Rechenaufwand pro Token zu verursachen.
Die N-gram-Embedding-Schicht (unten, violett) speist am Anfang des Netzwerks zusätzliche Phraseninformationen ein, die 51 Milliarden Parameter umfassen, aber im Arbeitsspeicher statt auf der GPU abgelegt werden. | Bild: Alibaba / QwenDas Modell unterstützt nativ 262.144 Token Kontext und ist mit YaRN auf eine Million Token erweiterbar. Weitere technische Details finden sich im technischen Bericht auf GitHub. Die Gewichte stehen auf Hugging Face und ModelScope zur Verfügung. Die Produktionsversion wird als Qwen3.8-Flash über QwenCloud bereitgestellt und soll 0,16 USD pro Million Input-Tokens und 0,47 USD pro Million Output-Tokens kosten. Die API soll in Kürze freigeschaltet werden.
Ein Neuntel der Trainingskosten bei überlegener Leistung
Qwen3.8-Flash-Next soll bei nur etwa einem Neuntel der Trainingskosten von Qwen3.7-Plus bessere Ergebnisse liefern, insbesondere bei Coding- und Office-Aufgaben. Qwen3.7-Plus verfügt über 397 Milliarden Parameter mit 17 Milliarden aktivierten Parametern pro Token, also fast das Dreifache der aktivierten Parameter von Flash-Next.
Alibaba vergleicht das Modell laut den veröffentlichten Benchmarks mit DeepSeek-V4-Flash (284 Milliarden Parameter, 13 Milliarden aktiviert) und Anthropics Claude-Opus-4.6 (Max), also mit deutlich größeren oder teureren Modellen. Flash-Next führt dabei in der Mehrheit der getesteten Aufgaben.
Positiv sind besonders die Ergebnisse bei agentischen Coding-Aufgaben, also Tests, bei denen ein KI-Modell selbstständig Fehler in echten Software-Projekten finden und beheben muss: Mit 58,7 Punkten auf DeepSWE und 62,5 auf SWE-bench Pro übertrifft es sowohl DeepSeek-V4-Flash als auch Claude Opus 4.6.
Bei Büro- und Produktivitätsaufgaben ist der Abstand noch deutlicher: Auf CoWorkBench erreicht Flash-Next 73,9 Punkte, DeepSeek-V4-Flash nur 45,1. Bei JobBench, einem Test für professionelle Arbeitsabläufe, liegt Flash-Next mit 55,7 fast doppelt so hoch wie Qwen3.7-Plus mit 27,6. Bei wissenschaftlichem Schlussfolgern (GPQA Diamond: 91,7) und Wettbewerbs-Programmierung (LiveCodeBench v6: 91,9) liegen die Modelle dagegen eng beieinander.
| Parameter (gesamt) | 125B | 27B | 397B | 284B | -- |
| Aktivierte Parameter | 6B | 27B | 17B | 13B | -- |
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Agents' Last Exam (Score) | 51.2 | 42.9 | 33.6 | -- | -- |
| Toolathlon Verified (Pass@1) | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Claude Opus 4.6 hat nur bei Humanity's Last Exam, einem Test für besonders schwierige multidisziplinäre Aufgaben, die Nase vorn, ist aber auch schon ein "älteres" Anthropic-Modell aus dem Februar 2026. Und wie immer gilt, dass sich Benchmark-Resultate und die reale Leistung unterscheiden können.
Bruchteil des Flaggschiff-Preises bei konkurrenzfähiger Leistung
Erst Anfang August hatte Alibaba mit Qwen3.8-Max sein aktuelles Flaggschiff-Modell vorgestellt, das mit Modellen wie Claude Opus 4.8, Gemini 3.1 Pro und GPT5.6 Sol konkurriert. Der Preisunterschied zwischen Flaggschiff- und Flash-Variante liegt bei etwa Faktor 12 für Input- und Output-Tokens.
| Input (pro 1M Tokens) | 2,00 USD | 0,16 USD |
| Output (pro 1M Tokens) | 6,00 USD | 0,47 USD |
Flash-Next positioniert sich damit als kosteneffiziente Alternative, die leistungsmäßig knapp unterhalb des Flaggschiffs liegt, aber nur rund ein Zwölftel davon kostet. Zugleich erhöht es den Preisdruck auf OpenAI und Anthropic weiter. Besonders beliebt ist derzeit auch Qwen3.8-27B, das sich lokal betreiben lässt und dafür gute Leistung für fast kein Geld bietet, vorausgesetzt, man hat die nötige Hardware.
Unter anderem OpenAI reagierte zuletzt mit deutlichen Rabatten auf die neue Modellreihe GPT-5.6. Das ist gut für die Nutzer, aber schlecht für das schnelle Umsatzwachstum der Anbieter und damit für das wesentliche Narrativ, das die KI-Investitionen antreibt.
KI-News ohne Hype – von Menschen kuratiert
Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.



