Anthropics Claude Opus 5 ist laut Artificial Analysis das derzeit intelligenteste KI-Modell und unterbietet Fable 5 teils deutlich beim Preis.
Es erreicht einen Wert von 61 auf dem Artificial Analysis Intelligence Index, einem Gesamtindex, der neun verschiedene Tests zusammenfasst, darunter Wissensarbeit, Coding, wissenschaftliches Denken und Faktenwissen. Damit liegt es knapp vor Claude Fable 5 (60), GPT-5.6 Sol (59), Kimi K3 (57) und Claude Opus 4.8 (56). Artificial Analysis hat das Modell vor der Veröffentlichung gemeinsam mit Anthropic getestet.
Beim Coding teilt sich Claude Opus 5 (xhigh) mit Claude Code den ersten Platz im Artificial Analysis Coding Index. Dieser misst, wie gut KI-Modelle eigenständig Programmieraufgaben lösen können, etwa Fehler in Software finden und beheben. Bei Terminal-Bench v2.1, einem Test für die Nutzung von Kommandozeilen-Werkzeugen, erreicht es 89 Prozent bei maximaler Leistung, auf dem Niveau des bisherigen Spitzenreiters GPT-5.6 Sol.
Oben: Intelligence Index – Claude Opus 5 (max) führt mit 61 Punkten. Unten: Coding Agent Index – Opus 5 mit Claude Code und GPT-5.6 Sol mit Codex teilen sich mit je 67 Punkten die Spitze. | Bild: Artificial AnalysisBei wissenschaftlichem Denken erreicht Opus 5 auf Humanity's Last Exam, einem besonders schwierigen Wissenstest mit Fragen aus vielen Fachgebieten, 53 Prozent, gleichauf mit Fable 5. Auf CritPt, einem Physik-Benchmark von Forschern der Argonne National Laboratory und der UIUC, liegt es ebenfalls auf Fable-5-Niveau, aber hinter GPT-5.6 Sol, GPT-5.5 Pro und GPT-5.6 Terra.
Eine Schwäche bleibt laut Artificial Analysis das Faktenwissen: Auf AA-Omniscience, einem Test für die Genauigkeit von Wissensaussagen, verbessert sich Opus 5 zwar um 7 Punkte gegenüber Opus 4.8, liegt aber weiterhin unter Fable 5. Problematisch ist, dass das Modell häufiger antwortet, wenn es unsicher ist. Die Halluzinationsrate, also der Anteil falscher Antworten, steigt um 14 Punkte auf 50 Prozent.
Auch Epoch AI hat Claude Opus 5 bewertet. Laut dem Forschungsinstitut erreicht Opus 5 einen Gesamt-ECI (Epoch Capability Index) von 159, knapp unter Fable 5 mit 161. Betrachtet man allerdings nur die Software-Engineering-Benchmarks (SWE-ECI), liegt Opus 5 mit 161 gleichauf mit Fable 5 und übertrifft damit GPT-5.6 Terra und Claude Opus 4.8. GPT-5.6 Sol führt in beiden Kategorien.
Bild: Epoch AIInsgesamt ist das Rennen unter den Frontier-Modellen also knapp, niemand kann sich wirklich absetzen oder hat ein Alleinstellungsmerkmal. Wasser auf die Mühlen jener, die sagen, dass KI-Modelle über kurz oder lang Standardware werden.
Halber Fable-Preis auf den niedrigeren Reasoning-Stufen
Die Kosten pro Aufgabe im Intelligence Index liegen bei durchschnittlich 2,03 Dollar, unter Claude Fable 5 mit Fallback (2,75 Dollar), aber über Opus 4.8 (1,80 Dollar) und Sonnet 5 (1,53 Dollar). Bei den Leistungsstufen "high" und "xhigh" kann Opus 5 allerdings sowohl Opus 4.8 als auch Sonnet 5 bei niedrigeren Kosten übertreffen.
Die Tokenpreise bleiben bei 5 Dollar pro Million Input-Tokens und 25 Dollar pro Million Output-Tokens. Cache-Schreibvorgänge kosten 6,25 Dollar pro Million Tokens mit einer Lebensdauer von fünf Minuten, Cache-Treffer nur 0,50 Dollar pro Million Tokens.
Opus 5 legt speziell bei der Wissensarbeit vor
Besonders stark schneidet Opus 5 auf dem Benchmark AA-Briefcase ab. Dieser Test misst, wie gut KI-Modelle typische Büroaufgaben erledigen: Forschungsberichte schreiben, Präsentationen erstellen und Tabellen auswerten, basierend auf tausenden Eingabedateien. Die Leistung wird über Korrektheit, analytische Qualität und Präsentationsqualität bewertet und zu einem Elo-Wert zusammengefasst, ähnlich wie bei Schach-Ranglisten.
Opus 5 erreicht bei maximaler Leistungsstufe einen Elo-Wert von 1720, 146 Punkte vor Claude Fable 5 (1574). Die drei höchsten Leistungsstufen (max, xhigh, high) belegen die ersten drei Plätze des Rankings. Zusammen mit Fable 5, Sonnet 5 und Opus 4.8 hält Anthropic nun die große Mehrheit der Top-10-Positionen.
Oben: GDPval-AA v2 – Opus 5 (max) erreicht 1861 Elo, weit vor der menschlichen Baseline von 1000. Unten: AA-Briefcase – Opus 5 belegt mit seinen drei höchsten Leistungsstufen die ersten drei Plätze. | Bild: Artificial AnalysisDie Kosten pro Aufgabe sinken um 20 Prozent auf 17,79 Dollar gegenüber 22,30 Dollar bei Fable 5. Die Variante "xhigh" kostet 14,26 Dollar, "high" nur 10,41 Dollar, beide übertreffen trotzdem Fable 5 im Elo-Ranking. Bei mittlerer Leistungsstufe erreicht Opus 5 einen Elo-Wert von 1470, knapp hinter GPT-5.6 Sol (max, 1505). Auf niedriger Stufe liegt es mit 1223 Elo knapp unter GLM-5.2 (max, 1254).
Kosten pro Aufgabe im AA-Briefcase-Benchmark: Opus 5 (max) liegt bei 17,79 Dollar, die "high"-Variante bei 10,41 Dollar, weniger als die Hälfte von Fable 5 (22,30 Dollar). | Bild: Artificial Analysis
Leistung vs. Token-Verbrauch: Claude Opus 5 erzielt die höchsten GDPval-AA-v2-Werte, benötigt dafür aber deutlich mehr Tokens als die meisten Konkurrenten. Bei niedrigeren Leistungsstufen rückt es in die effizientere Zone. | Bild: Artificial AnalysisDie Stärken von Opus 5 liegen laut Artificial Analysis primär bei analytischer Qualität und objektiven Kriterien. Bei maximaler Leistung erreicht es einen Analytical Quality Elo von 2016, fast 300 Punkte vor Fable 5. Die Rubric Pass Rate, also wie oft das Modell vorgegebene Qualitätskriterien erfüllt, liegt bei 58 Prozent (max), 57,2 Prozent (xhigh) und 56 Prozent (high). Bei der Präsentationsqualität, also wie ansprechend die Ergebnisse aufbereitet sind, fällt der Vorsprung geringer aus: Der Presentation Elo liegt bei 1628, rund 40 Punkte hinter GPT-5.6 Sol (max, 1666).
Die hohe Leistung kostet allerdings Zeit: Bei maximaler Stufe benötigt Opus 5 über 36 Minuten pro Aufgabe und durchschnittlich 103 Durchläufe, rund 50 Prozent länger als Opus 4.8 mit 24 Minuten und 55 Durchläufen.
KI-News ohne Hype – von Menschen kuratiert
Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.



