Neuer Benchmark vergleicht Such-APIs für KI-Agenten

5 days ago 10

Artificial Analysis hat den "Search Index" veröffentlicht, einen Benchmark, der Such-API-Anbieter für KI-Agenten nach Qualität, Kosten und Geschwindigkeit bewertet.

Getestet werden zum Start sieben Anbieter: Parallel, Exa, Firecrawl, You.com, Tavily, Keenable und Brave. Alle Anbieter werden mit demselben Modell (GPT-5.6 Luna) in einem standardisierten Agenten-Setup verglichen, bei dem nur der Suchanbieter wechselt. Der Agent läuft in Stirrup, einem Open-Source-Framework von Artificial Analysis. Pro Aufgabe stehen dem Agenten 25 Durchläufe zur Verfügung, in denen er suchen und Webseiten abrufen kann.

Der Index setzt sich aus drei gleichgewichteten Benchmarks zusammen: DeepSearchQA mit 900 Recherchefragen, die viele Suchanfragen erfordern, einer BrowseComp-Teilmenge mit 200 schwierigen Fakten, die mehrstufiges Browsen verlangen, und AA-Omniscience mit 600 Fragen aus sechs Wissensbereichen. Als Vergleichswert dient eine Baseline, bei der das Modell ohne Werkzeuge antwortet.

Ohne Suchzugang erreicht das Modell nur 33 Punkte, mit Suche zwischen 65 und 75. Parallel, Exa und Firecrawl erzielen mit Werten von 75, 74 und 73 die besten Ergebnisse. | Bild: Anthropic

Der Benchmark zeigt auch: Bessere Suchergebnisse senken die Gesamtkosten, weil das Modell weniger Tokens verbraucht. Bei Parallel Search (advanced) etwa sinkt der Token-Verbrauch um über 40 Prozent im Vergleich zur Basic-Variante. Die Suchkosten pro Aufgabe sind zwar höher, die Gesamtkosten aber niedriger (0,084 vs. 0,11 Dollar).

Schnellere Suchanfragen führen hingegen nicht automatisch zu schnelleren Ergebnissen insgesamt: Parallel Search (turbo) hat zwar die kürzeste Antwortzeit pro Suchanfrage (0,51s vs. 1,03s bei Basic), liefert aber schlechtere Qualität (67 vs. 73), sodass der Agent mehr Durchläufe benötigt und die Gesamtzeit pro Aufgabe ähnlich ausfällt.

Parallel, Firecrawl und Parallel (turbo) bilden laut Artificial Analysis die beste Kosten-Leistungs-Grenze. Weitere Anbieter können sich für die Aufnahme in den Benchmark melden. Die vollständige Methodik ist öffentlich einsehbar.

KI-News ohne Hype – von Menschen kuratiert

Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.

Jetzt abonnieren

Read Entire Article