Nvidia veröffentlicht mit Nemotron 3.5 Lightning ein kompaktes Open-Weights-Modell, das bei einem Viertel der Parameter ähnlich intelligent wie OpenAIs gpt-oss-120b und besonders schnell sein soll.
Nvidia hat mit Nemotron 3.5 Lightning das erste Modell seiner neuen Nemotron-3.5-Reihe veröffentlicht. Das Modell ist der direkte Nachfolger des Nemotron 3 Nano 30B A3B und behält dessen hybride Mamba-Transformer-Architektur bei: 31,6 Milliarden Gesamtparameter, von denen 3,6 Milliarden aktiv sind.
Laut der unabhängigen Benchmarking-Plattform Artificial Analysis erreicht das Modell einen Intelligence Index von 24, ein Sprung von neun Punkten gegenüber dem Vorgänger (15). Damit liegt Lightning auf dem Niveau von OpenAIs gpt-oss-120b (24) und knapp hinter Nvidias eigenem Nemotron 3 Super (26), das etwa viermal so groß ist. Die intelligentesten kleinen Modelle derselben Größenklasse wie Qwen3.6 35B A3B (32) oder Metas neues Muse Glimmer (35) bleiben deutlich vorn.
Nemotron 3.5 Lightning erreicht im Artificial Analysis Intelligence Index einen Score von 24 und liegt damit gleichauf mit gpt-oss-120b. | Bild: Artificial AnalysisNvidia zielt mit Lightning auf einen anderen Punkt der Effizienzgrenze: In Vorabtests mit den finalen NVFP4-Gewichten erreicht das Modell fast 670 Token pro Sekunde. Das ist der höchste gemessene Wert unter den verglichenen Modellen und fast doppelt so schnell wie Googles Gemini 3.5 Flash-Lite (386 Token/s). Eine Aufgabe aus dem Intelligence Index dauert damit etwa 0,5 Minuten, während Qwen3.6 35B A3B rund 3,5 Minuten und Gemma 4 31B etwa 5,8 Minuten benötigen.
Mit 669 Token pro Sekunde ist Lightning das schnellste Modell im Vergleich. Trotz ähnlicher Token-Anzahl pro Aufgabe wie der Vorgänger Nemotron 3 Nano liefert es deutlich bessere Ergebnisse. | Bild: Artificial AnalysisProprietäre Modelle dominieren allerdings weiterhin die Gesamteffizienzgrenze: Gemini 3.5 Flash-Lite erreicht einen Intelligence Index von 37 bei ähnlicher Zeit pro Aufgabe, GPT-5.6 Luna (max) kommt auf 52 Punkte bei unter zwei Minuten.
Agentische Fähigkeiten zeigen den größten Fortschritt
Die deutlichsten Verbesserungen zeigen sich laut Artificial Analysis bei agentischen Benchmarks. Im GDPval-AA v2 erreicht Lightning einen Elo-Wert von 824, ein Zugewinn von 334 Punkten gegenüber Nemotron 3 Nano. Damit übertrifft es sowohl gpt-oss-120b (800) als auch das größere Nemotron 3 Super (698). Im Terminal-Bench v2.1 steigt der Score von 7 auf 24,3 Prozent, fast auf dem Niveau von gpt-oss-120b (26,2 Prozent).
In agentischen Benchmarks überholt Lightning mit einem Elo-Wert von 824 sowohl gpt-oss-120b als auch das größere Nemotron 3 Super. | Bild: Artificial AnalysisMit der permissiven OpenMDW-1.1-Lizenz positioniert Nvidia das Modell als effizientes Arbeitstier für agentenbasierte Pipelines mit hohem Durchsatz. Laut Artificial Analysis hat Nvidia mit Partnern wie CodeRabbit und Harvey am Post-Training gearbeitet, um die Leistung in spezifischen Domänen zu verbessern.
Verfügbarkeit
Nvidia liefert das Modell in BF16- und NVFP4-Gewichten aus. Die NVFP4-Variante erreicht laut Artificial Analysis ebenfalls 24 im Intelligence Index, mit minimaler Degradation gegenüber der höherpräzisen Version. Das Reasoning-Modell verarbeitet ausschließlich Text und verfügt über ein Kontextfenster von einer Million Token. Die Gewichte stehen ab sofort zur Verfügung, Serverless-Inference bieten unter anderem DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius und Crusoe an.
KI-News ohne Hype – von Menschen kuratiert
Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.



