Alibabas Qwen-Image-3.0 rendert ganze Infografik-Raster und lesbaren Zehn-Pixel-Text in einem Durchgang

1 month ago 8

Qwen-Image-3.0 soll mehrteilige Infografiken in einem Durchgang rendern, Text bis zu zehn Pixel lesbar wiedergeben und zwölf Sprachen nativ darstellen. Ob KI-generierte Paper und Zeitungsseiten aber tatsächlich ein Problem lösen, bleibt offen.

Das Qwen-Team von Alibaba hat mit Qwen-Image-3.0 die dritte Generation seines Bildgenerators vorgestellt. Während die erste Version laut Anbieter auf "Präzision" ausgerichtet war und die zweite auf "Präzision, Vielfalt, Vollständigkeit, Schönheit und Authentizität", fasst das Team den Fokus der neuen Version in einem Wort zusammen: "Real". Konkret soll das Modell nicht mehr nur ansehnliche Bilder liefern, sondern in Produktivszenarien wie Zeitungslayouts, Storyboards oder Prüfungsbögen einsetzbar sein.

Prompts mit bis zu 4500 Token für komplexe Layouts

Die auffälligste Neuerung betrifft die zulässige Prompt-Länge. Qwen-Image-3.0 akzeptiert laut dem Team Eingaben von bis zu 4.500 Token. Das soll es ermöglichen, informationsdichte Layouts in einem einzigen Durchgang zu rendern, statt sie aus mehreren Bildern zusammenzusetzen.

Das 3 × 3-Raster kombiniert neun eigenständige Infografiken in einem einzigen Bild, jede mit eigenem Text, Formeln und Illustrationen: eine Comicsequenz zum Sicherheitsabstand vor Tunneln, eine geometrische Herleitung zu rechtwinkligen Geraden, ein konfuzianisches Lehrstück zu Emotion und Vernunft, eine physikalische Herleitung der Abwurfgeschwindigkeit an einem rotierenden Zylinder, ein biologischer Comic zum Lebenszyklus des Leberegels, eine medizinische Übersicht zu rechtsseitigen Brustschmerzen, eine Darstellung der Sylow-Sätze für Gruppen der Ordnung 72, eine Grafik zu internen Kontrollen im Bankwesen und ein Vergleich tierischer und pflanzlicher Zellen samt DNA-Markierungen.

Neunteiliges Raster mit Infografiken zu Tunnel­sicherheit, Geometrie, konfuzianischer Ethik, Physik, Medizin, Mathematik, Bankkontrolle und Zell-DNA.Mit dem 3 × 3-Grid wird demonstriert, wie text- und formelreiche Inhalte aus Ingenieurwesen, Philosophie, Physik, Medizin, Mathematik, Wirtschaft und Zellbiologie in einem durchgängigen Layout klar strukturiert dargestellt werden können. | Bild: Alibaba

Neben dieser horizontalen Ausdehnung demonstriert das Team auch verschachtelte Bildkompositionen, etwa eine VSCode-Oberfläche, in der eine Qwen-Chat-Oberfläche geöffnet ist, die wiederum WeChat und schließlich ein Kaffee-Poster enthält.

VSCode-Fenster mit geöffneter Bilddatei nested_mockup.png, die eine Qwen-Chat-Oberfläche zeigt, in der wiederum ein WeChat-Chatverlauf mit einem vierstufigen Poster zur Handfilterkaffee-Zubereitung steckt.Vier ineinander verschachtelte Oberflächen in einem einzigen Bild: Editor, Qwen-Chat, Messenger-Verlauf und darin ein Kaffee-Poster. | Bild: Alibaba

Zehn Pixel kleiner Text und LaTeX-Formeln

Der zweite Schwerpunkt liegt auf der Detailtreue. Qwen-Image-3.0 soll Text bis zu einer Größe von zehn Pixeln lesbar wiedergeben. Das Team zeigt eine Walhai-Infografik mit dichten Textblöcken sowie eine ganze Seite eines algebraisch-geometrischen Fachartikels, in der mehrzeilige LaTeX-Herleitungen mit Sub- und Superskripten, geschweiften Klammern und Bruchstrichen erscheinen. Auch eine simulierte Zeitungsseite und rote handschriftliche Anmerkungen im Stil von Schulnotizen gehören zu den Beispielen.

Zweispaltige Seite eines simulierten mathematischen Fachartikels mit der Kopfzeile "Qwen-Image 3.0 Fake PDF", mehrzeiligen LaTeX-Formeln zu Čech-Kohomologie sowie Sätzen und Beweisen zu simplizialen Abbildungen.An dieser fiktiven Paper-Seite demonstriert das Team die Wiedergabe mehrzeiliger Formeln mit Sub- und Superskripten, Summen- und Produktzeichen. | Bild: Alibaba

Bei Porträts und Objekten soll das Modell Hauttexturen, Poren und Haarsträhnen nahe an fotografischer Qualität wiedergeben. In einem Editing-Beispiel restauriert das Modell ein beschädigtes traditionelles Tuschebild eines Adlerkampfes und ergänzt fehlende Bildteile unter Erhalt der ursprünglichen Pinselführung und Tuscheverläufe.

Nahaufnahme einer jungen Frau im Sonnenlicht mit Blütenschatten auf der Wange, einer rosa Nelke im Haar und mehreren Ohrringen; einzelne Haarsträhnen und Hautporen sind erkennbar.Bei Porträts zielt das Modell auf fotografische Nähe, sichtbar an Hauttextur, Härchen im Gegenlicht und den weichen Schattenkanten. | Bild: Alibaba

Zwölf Sprachen und simulierte Benutzeroberflächen

Als dritte Dimension nennt das Team "tiefes Wissen". Qwen-Image-3.0 rendere zwölf Sprachen nativ, darunter Japanisch, Koreanisch und Spanisch. Über die Textwiedergabe hinaus simuliert das Modell laut den Beispielen Benutzeroberflächen von Webseiten, Spielen und Livestreams. In einem Editing-Beispiel wird ein Insektenfoto in eine Infografik mit taxonomischen Angaben, morphologischen Beschriftungen, vergrößerten Detailansichten und Maßstabsleiste umgewandelt.

Bestimmungstafel zur Kleinlibelle Ischnura senegalensis mit Makrofoto eines Tandempaars auf einem Blatt, taxonomischer Klassifikation, beschrifteten Merkmalslinien, vier vergrößerten Detailkreisen und Maßstabsleisten.Aus einem Insektenfoto wird per Editing eine vollständige Bestimmungstafel samt Beschriftungen, Detailausschnitten und Maßstab. | Bild: Alibaba

Das Modell kann laut Qwen auch auf aktuelle Internetdaten zugreifen und generiert auf dieser Basis etwa eine Wettervorhersage für Hangzhou. In einem weiteren Beispiel treten der chinesische Tuschemaler Qi Baishi und Vincent van Gogh gemeinsam in einem simulierten Livestream-Studio auf.

Erst im Mai hatte Alibaba mit Qwen-Image-2.0 den direkten Vorgänger vorgestellt. Der technische Bericht beschrieb vor allem Effizienzgewinne bei Training und Inferenz, darunter eine schnellere Variante mit nur vier statt 40 Rechenschritten pro Bild. In Tests auf Alibabas hauseigener Arena-Plattform landete Qwen-Image-2.0 knapp hinter OpenAIs GPT-Image-2 und Googles Nano Banana Pro.

Vorerst scheint Qwen-Image-3.0 nur auf Einladung per API verfügbar zu sein, in den First-Party-Apps wie Qwen Chat soll das Modell bald folgen. Unwahrscheinlich ist, dass die Modellgewichte wie beim ersten Qwen-Image unter einer offenen Lizenz erscheinen werden.

Technisch möglich, praktisch fraglich

Offen bleibt, welchen praktischen Nutzen viele der gezeigten Beispiele haben. Ein KI-generiertes wissenschaftliches Paper mit LaTeX-Formeln löst kein reales Problem, weil Forschende ihre Texte selbst schreiben und in LaTeX setzen, nicht als Bild rendern lassen.

Ähnliches gilt für Zeitungsseiten oder komplexe Infografiken: Zwar erlauben moderne Bildmodelle inzwischen gezielte Änderungen an einzelnen Textstellen, doch bleibt die Frage, warum solche Inhalte überhaupt als Pixelbild statt in einem Format vorliegen sollten, das sich frei bearbeiten, durchsuchen und weiterverwenden lässt. Die Fortschritte beim Textrendering zeigen aber, was technisch geht.

KI-News ohne Hype – von Menschen kuratiert

Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.

Jetzt abonnieren

Read Entire Article