Startseite / KI
KI

Claude Sonnet 5.5 macht Spitzenleistung zur Mittelklasse

Claude Sonnet 5.5 macht Spitzenleistung zur Mittelklasse
← Alle Beiträge

Anthropic hat Claude Sonnet 5.5 veröffentlicht – und diesmal ist nicht der absolute Spitzenwert die spannendste Nachricht.

Interessanter ist, wie nah das günstigere Sonnet inzwischen an Anthropic selbsts teuerstes Modell herankommt.

Claude Sonnet 5.5 kostet weiterhin 2 Dollar pro Million Input-Tokens und 10 Dollar pro Million Output-Tokens. Claude Opus 5.5 liegt bei 4 beziehungsweise 20 Dollar. Trotzdem liegen beide Modelle bei einigen der von Anthropic veröffentlichten Benchmarks erstaunlich dicht beieinander.

Damit verschiebt sich der KI-Wettbewerb weiter. Es geht längst nicht mehr nur darum, welches Unternehmen das stärkste Modell veröffentlicht. Entscheidend wird zunehmend, wie viel Leistung Nutzer für einen Dollar tatsächlich bekommen.

Sonnet 5.5 ist mehr als 30 Prozent schneller

Laut Anthropic erzeugt Claude Sonnet 5.5 Antworten mehr als 30 Prozent schneller als Claude Sonnet 5.

Gleichzeitig soll das Modell für dieselbe Aufgabe deutlich weniger Tokens benötigen. Dadurch bleiben zwar die offiziellen Tokenpreise unverändert, die tatsächlichen Kosten pro erledigter Aufgabe sollen nach Anthropic-Angaben aber um bis zu 30 Prozent sinken.

Der Unterschied ist wichtig. API-Kosten hängen nicht nur vom Preis pro Million Tokens ab. Wenn ein Modell eine Aufgabe mit weniger Schritten, weniger Tool-Aufrufen und weniger Output erledigt, sinken die realen Kosten ebenfalls.

Genau hier scheint Anthropic Sonnet 5.5 optimiert zu haben.

Fast Opus-Leistung zum halben Tokenpreis

Beim GDPval-AA-Benchmark, der reale Wissensarbeit aus verschiedenen Berufen simuliert, erreicht Sonnet 5.5 laut Anthropic 1844 Punkte.

Claude Opus 5.5 erreicht 1846 Punkte.

Der Abstand beträgt damit gerade einmal zwei Punkte.

Beim CursorBench 4.0 erreicht Sonnet 5.5 einen Wert von 55,5 Prozent. Opus 5.5 kommt auf 57,8 Prozent.

Auch beim Computer-Benchmark OSWorld liegen beide Modelle dicht zusammen: Sonnet 5.5 erreicht 80,1 Prozent, Opus 5.5 81,8 Prozent.

Diese Zahlen stammen aus den von Anthropic veröffentlichten Evaluationen und sollten entsprechend als Herstellerangaben betrachtet werden. Anthropic selbst betont außerdem, dass Opus 5.5 bei komplexen, offenen Aufgaben weiterhin klar stärker sei.

Beim Coding schlägt Sonnet teilweise sogar Opus

Besonders auffällig ist Terminal-Bench 4.0.

Dort erreicht Claude Sonnet 5.5 laut Anthropic 70,6 Prozent. Claude Opus 5.5 liegt bei 66,4 Prozent.

Der Vorgänger Sonnet 5 kommt dagegen lediglich auf 10,3 Prozent.

Das ist ein ungewöhnlich großer Sprung innerhalb einer Modellgeneration.

Auch bei FrontierCode erreicht Sonnet 5.5 mit maximalem Effort 46,2 Prozent. Opus 5.5 liegt dort mit 54,4 Prozent weiterhin vorne.

Anthropic vergleicht Sonnet außerdem direkt mit GPT-6 Sol. Nach Angaben des Unternehmens erreicht Sonnet 5.5 bei hohem Effort dessen besten FrontierCode-Wert zu ungefähr einem Fünftel der Kosten pro Aufgabe.

Auch hier gilt: Das ist eine Aussage von Anthropic auf Basis eigener Kosten- und Benchmark-Auswertungen.

Das eigentliche Produkt ist Effizienz

Noch interessanter als einzelne Benchmarkwerte ist deshalb die Kostenkurve.

Anthropic zeigt mehrere Tests, bei denen Sonnet 5.5 bereits mit niedrigem oder mittlerem Effort die besten Ergebnisse des Vorgängers Sonnet 5 übertrifft – teilweise zu ungefähr einem Zehntel der Kosten pro Aufgabe.

Das ist wahrscheinlich der wichtigere Fortschritt dieser Modellgeneration.

Ein Modell muss nicht in jedem Benchmark das stärkste Modell der Welt sein. Für Unternehmen, Entwickler und automatisierte Agentensysteme ist häufig entscheidender, wie teuer eine erfolgreich erledigte Aufgabe tatsächlich ist.

Wenn ein Modell weniger Tokens benötigt, weniger Tool-Aufrufe produziert und Aufgaben schneller abschließt, verändert das die Wirtschaftlichkeit großer KI-Workflows erheblich.

Anthropic positioniert Sonnet bewusst unter Opus

Anthropic selbst beschreibt die Rollen der beiden Modelle ziemlich klar.

Opus 5.5 soll weiterhin für komplexe Aufgaben eingesetzt werden, bei denen lange Planung und schwierige Entscheidungen notwendig sind.

Sonnet 5.5 ist dagegen für klar umrissene Alltagsaufgaben gedacht: Programmieren, Fehler beheben, Dokumente erstellen, Präsentationen bauen oder Tabellen bearbeiten.

Das klingt zunächst nach klassischer Produktsegmentierung.

Die veröffentlichten Ergebnisse zeigen allerdings, dass die technische Trennung zwischen Mittelklasse und Spitzenmodell zunehmend kleiner wird.

Das könnte für KI-Agenten entscheidend sein

Gerade bei Agentensystemen spielt dieser Unterschied eine große Rolle.

Ein einzelner Chat mit einem teuren Modell kostet wenig. Ein Agent, der täglich Tausende Aufgaben erledigt, Dateien liest, Programme startet, Suchanfragen durchführt und mehrere Modelle kombiniert, produziert dagegen schnell erhebliche Kosten.

Hier kann ein Modell wie Sonnet 5.5 interessant werden.

Anthropic berichtet beispielsweise, dass Testnutzer weniger Tool-Aufrufe und weniger Shell-Ausführungen beobachtet hätten. Einige Unternehmen berichten außerdem von deutlich weniger benötigten Tokens gegenüber Sonnet 5.

Wenn sich solche Effizienzgewinne außerhalb kontrollierter Tests bestätigen, könnte Sonnet für viele produktive Agenten das interessantere Modell als Opus sein.

Der KI-Preiskampf verändert sich

Vor wenigen Tagen ging es noch darum, welche neuen Spitzenmodelle Anthropic und OpenAI veröffentlichen.

Mit Claude Sonnet 5.5 wird sichtbar, dass der wichtigere Wettbewerb möglicherweise eine Ebene darunter stattfindet.

Nicht das teuerste Modell entscheidet zwangsläufig über den Markt.

Entscheidend könnte werden, welches Modell genügend Spitzenleistung so günstig anbietet, dass Unternehmen es millionenfach einsetzen können.

Anthropic halbiert mit Sonnet 5.5 gegenüber Opus zwar schlicht den Tokenpreis. Der größere Unterschied entsteht aber möglicherweise dadurch, dass das Modell gleichzeitig schneller arbeitet und weniger Tokens benötigt.

Damit wird aus einem Modell-Release vor allem eines: ein weiterer Schritt im Preiskampf um produktive KI.

Und der dürfte langfristig wichtiger sein als der nächste einzelne Benchmark-Rekord.

J

Über den Autor

Jens Könnig

Jens analysiert seit Jahren digitale Märkte, Preisbewegungen und Plattform-Strategien. Als Betreiber mehrerer datengetriebener Systeme wertet er täglich große Mengen an Produkt- und Trenddaten aus. Sein Fokus liegt auf Einordnung statt Hype: Was bedeutet eine Entwicklung wirklich für Nutzer, Preise und Märkte?

Alle Artikel von Jens Könnig →