Anthropic hat Claude Sonnet 5.5 veröffentlicht – und diesmal ist nicht der absolute Spitzenwert die spannendste Nachricht.
Interessanter ist, wie nah das günstigere Sonnet inzwischen an Anthropic selbsts teuerstes Modell herankommt.
Anthropic hat Claude Sonnet 5.5 veröffentlicht – und diesmal ist nicht der absolute Spitzenwert die spannendste Nachricht.
Interessanter ist, wie nah das günstigere Sonnet inzwischen an Anthropic selbsts teuerstes Modell herankommt.
Claude Sonnet 5.5 kostet weiterhin 2 Dollar pro Million Input-Tokens und 10 Dollar pro Million Output-Tokens. Claude Opus 5.5 liegt bei 4 beziehungsweise 20 Dollar. Trotzdem liegen beide Modelle bei einigen der von Anthropic veröffentlichten Benchmarks erstaunlich dicht beieinander.
Damit verschiebt sich der KI-Wettbewerb weiter. Es geht längst nicht mehr nur darum, welches Unternehmen das stärkste Modell veröffentlicht. Entscheidend wird zunehmend, wie viel Leistung Nutzer für einen Dollar tatsächlich bekommen.
Laut Anthropic erzeugt Claude Sonnet 5.5 Antworten mehr als 30 Prozent schneller als Claude Sonnet 5.
Gleichzeitig soll das Modell für dieselbe Aufgabe deutlich weniger Tokens benötigen. Dadurch bleiben zwar die offiziellen Tokenpreise unverändert, die tatsächlichen Kosten pro erledigter Aufgabe sollen nach Anthropic-Angaben aber um bis zu 30 Prozent sinken.
Der Unterschied ist wichtig. API-Kosten hängen nicht nur vom Preis pro Million Tokens ab. Wenn ein Modell eine Aufgabe mit weniger Schritten, weniger Tool-Aufrufen und weniger Output erledigt, sinken die realen Kosten ebenfalls.
Genau hier scheint Anthropic Sonnet 5.5 optimiert zu haben.
Beim GDPval-AA-Benchmark, der reale Wissensarbeit aus verschiedenen Berufen simuliert, erreicht Sonnet 5.5 laut Anthropic 1844 Punkte.
Claude Opus 5.5 erreicht 1846 Punkte.
Der Abstand beträgt damit gerade einmal zwei Punkte.
Beim CursorBench 4.0 erreicht Sonnet 5.5 einen Wert von 55,5 Prozent. Opus 5.5 kommt auf 57,8 Prozent.
Auch beim Computer-Benchmark OSWorld liegen beide Modelle dicht zusammen: Sonnet 5.5 erreicht 80,1 Prozent, Opus 5.5 81,8 Prozent.
Diese Zahlen stammen aus den von Anthropic veröffentlichten Evaluationen und sollten entsprechend als Herstellerangaben betrachtet werden. Anthropic selbst betont außerdem, dass Opus 5.5 bei komplexen, offenen Aufgaben weiterhin klar stärker sei.
Besonders auffällig ist Terminal-Bench 4.0.
Dort erreicht Claude Sonnet 5.5 laut Anthropic 70,6 Prozent. Claude Opus 5.5 liegt bei 66,4 Prozent.
Der Vorgänger Sonnet 5 kommt dagegen lediglich auf 10,3 Prozent.
Das ist ein ungewöhnlich großer Sprung innerhalb einer Modellgeneration.
Auch bei FrontierCode erreicht Sonnet 5.5 mit maximalem Effort 46,2 Prozent. Opus 5.5 liegt dort mit 54,4 Prozent weiterhin vorne.
Anthropic vergleicht Sonnet außerdem direkt mit GPT-6 Sol. Nach Angaben des Unternehmens erreicht Sonnet 5.5 bei hohem Effort dessen besten FrontierCode-Wert zu ungefähr einem Fünftel der Kosten pro Aufgabe.
Auch hier gilt: Das ist eine Aussage von Anthropic auf Basis eigener Kosten- und Benchmark-Auswertungen.
Noch interessanter als einzelne Benchmarkwerte ist deshalb die Kostenkurve.
Anthropic zeigt mehrere Tests, bei denen Sonnet 5.5 bereits mit niedrigem oder mittlerem Effort die besten Ergebnisse des Vorgängers Sonnet 5 übertrifft – teilweise zu ungefähr einem Zehntel der Kosten pro Aufgabe.
Das ist wahrscheinlich der wichtigere Fortschritt dieser Modellgeneration.
Ein Modell muss nicht in jedem Benchmark das stärkste Modell der Welt sein. Für Unternehmen, Entwickler und automatisierte Agentensysteme ist häufig entscheidender, wie teuer eine erfolgreich erledigte Aufgabe tatsächlich ist.
Wenn ein Modell weniger Tokens benötigt, weniger Tool-Aufrufe produziert und Aufgaben schneller abschließt, verändert das die Wirtschaftlichkeit großer KI-Workflows erheblich.
Anthropic selbst beschreibt die Rollen der beiden Modelle ziemlich klar.
Opus 5.5 soll weiterhin für komplexe Aufgaben eingesetzt werden, bei denen lange Planung und schwierige Entscheidungen notwendig sind.
Sonnet 5.5 ist dagegen für klar umrissene Alltagsaufgaben gedacht: Programmieren, Fehler beheben, Dokumente erstellen, Präsentationen bauen oder Tabellen bearbeiten.
Das klingt zunächst nach klassischer Produktsegmentierung.
Die veröffentlichten Ergebnisse zeigen allerdings, dass die technische Trennung zwischen Mittelklasse und Spitzenmodell zunehmend kleiner wird.
Gerade bei Agentensystemen spielt dieser Unterschied eine große Rolle.
Ein einzelner Chat mit einem teuren Modell kostet wenig. Ein Agent, der täglich Tausende Aufgaben erledigt, Dateien liest, Programme startet, Suchanfragen durchführt und mehrere Modelle kombiniert, produziert dagegen schnell erhebliche Kosten.
Hier kann ein Modell wie Sonnet 5.5 interessant werden.
Anthropic berichtet beispielsweise, dass Testnutzer weniger Tool-Aufrufe und weniger Shell-Ausführungen beobachtet hätten. Einige Unternehmen berichten außerdem von deutlich weniger benötigten Tokens gegenüber Sonnet 5.
Wenn sich solche Effizienzgewinne außerhalb kontrollierter Tests bestätigen, könnte Sonnet für viele produktive Agenten das interessantere Modell als Opus sein.
Vor wenigen Tagen ging es noch darum, welche neuen Spitzenmodelle Anthropic und OpenAI veröffentlichen.
Mit Claude Sonnet 5.5 wird sichtbar, dass der wichtigere Wettbewerb möglicherweise eine Ebene darunter stattfindet.
Nicht das teuerste Modell entscheidet zwangsläufig über den Markt.
Entscheidend könnte werden, welches Modell genügend Spitzenleistung so günstig anbietet, dass Unternehmen es millionenfach einsetzen können.
Anthropic halbiert mit Sonnet 5.5 gegenüber Opus zwar schlicht den Tokenpreis. Der größere Unterschied entsteht aber möglicherweise dadurch, dass das Modell gleichzeitig schneller arbeitet und weniger Tokens benötigt.
Damit wird aus einem Modell-Release vor allem eines: ein weiterer Schritt im Preiskampf um produktive KI.
Und der dürfte langfristig wichtiger sein als der nächste einzelne Benchmark-Rekord.
Kategorie
KI
Künstliche Intelligenz, große Sprachmodelle, Bildgeneratoren und was sie wirklich können – und was nicht.