OpenAI sagt, dass es auch gut ARC-AGI-3 kann. Nachdem Anthropics Claude Opus 5 den Bestwert auf dem Logik-Benchmark vervierfacht hatte, zeigt OpenAI nun, dass GPT-5.6 Sol mit zwei API-Einstellungen auf 38,3 Prozent kommt und damit Opus 5 (30,2 Prozent) übertrifft.
OpenAIDer Haken: OpenAI nutzt dafür nicht die offizielle Test-Umgebung, sondern die eigene Responses-API mit "Retained Reasoning" (Beibehaltung des Denkprozesses) und "Compaction" (intelligente Zusammenfassung statt Abschneiden alter Kontexte). In der offiziellen Umgebung erreichte GPT-5.6 Sol nur 7,8 Prozent, weil dort nach jeder Aktion das interne Denken verworfen wird.
OpenAI argumentiert, dass Benchmarks nie nur Modelle messen, sondern auch die technische Umgebung. Das ist korrekt: ARC-AGI-3 wertet daher bewusst nur die reine Modellleistung ohne externe Hilfen, weil künftige AGI-Systeme eigenständig arbeiten sollten. Opus 5 erreichte seine 30-Prozent-Leistung auf diese Weise, und würde etwa in Claude Code wahrscheinlich auch eine noch bessere Leistung erzielen. Die Puzzlespiele kann jeder selbst ausprobieren.
KI-News ohne Hype – von Menschen kuratiert
Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.



