Deepseek bringt experimentelles Vision-Modell für multimodale Agenten auf den Markt

2 days ago 8

Das chinesische KI-Unternehmen Deepseek veröffentlicht mit V4-Flash-Vision-Exp ein experimentelles multimodales Modell, das Bildverständnis mit Textfähigkeiten kombiniert und laut eigenen Angaben bei Agenten-Benchmarks nahe an Opus-4.8 heranreicht.

Das Modell Deepseek-V4-Flash-Vision-Exp erweitert Deepseek-V4-Flash um Bildverarbeitung und soll laut Deepseek dessen Textleistung bei Reasoning und Weltwissen beibehalten. In internen multimodalen Agenten-Benchmarks erreiche die Vision-Variante fast das Niveau von Opus-4.8. Unabhängige Messungen stehen noch aus.

Fokus auf visuelle Agenten-Workflows

Deepseek positioniert das Modell für agentenbasierte Anwendungen. Es soll mit verschiedenen Agent-Frameworks zusammenarbeiten und visuelles Verständnis mit unterschiedlichen Tools kombinieren.

Konkret kann es etwa Bilder beschreiben, Text aus Screenshots extrahieren und Diagramme analysieren. Unterstützt werden JPEG, PNG, GIF und WebP, wobei das Format laut API-Dokumentation anhand des tatsächlichen Dateiinhalts erkannt wird, nicht anhand des Dateinamens oder des deklarierten MIME-Typs.

Dank der Vision-Fähigkeit kann das neue Deepseek-Modell in Agenten-Benchmarks auf Opus 4.8 aufschließen oder teils übertreffen. | Bild: Deepseek

Das Modell ist kompatibel mit dem OpenAI-Chat-Completions-Format, dem Anthropic-Messages-Endpoint sowie der Responses-API. Deepseek hat zudem Version 0.1.1 seines Harness-Frameworks veröffentlicht, das das neue Modell direkt unterstützt.

Maximal 384 Token pro Bild

Entwickler können Bilder per Base64-Kodierung direkt einbetten, über öffentlich zugängliche URLs bereitstellen (maximal 32 MiB) oder die neue, kostenlose Files-API nutzen. Letztere erlaubt einmaliges Hochladen und mehrfache Referenzierung per ID bei Dateigrößen bis 64 MiB.

Ein optionales "detail"-Feld erlaubt es zudem, Bilder auf 512 × 512 Pixel herunterzuskalieren, was Token spart, wenn feine visuelle Details nicht relevant sind. Bilder werden vor der Verarbeitung automatisch auf etwa 800 × 800 Pixel normalisiert. Der maximale Verbrauch liegt bei 384 Token pro Bild, unabhängig von der ursprünglichen Auflösung. Die Abrechnung erfolgt zu V4-Flash-Preisen.

Pro Request sind maximal 600 Bilder erlaubt. Die maximale Kantenlänge beträgt 8.192 Pixel pro Seite, sinkt aber ab 15 Bildern auf 4.096 Pixel. Bilder dürfen ausschließlich in User-Nachrichten eingebettet werden.

KI-News ohne Hype – von Menschen kuratiert

Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.

Jetzt abonnieren

Read Entire Article