Claude Opus 5.5 kostet weniger als Opus 5
Die erste sichtbare Veränderung betrifft die API-Preise. Eine Million Input-Tokens kostet bei Claude Opus 5.5 4 US-Dollar, eine Million Output-Tokens 20 Dollar. Bei Opus 5 lagen die Preise noch bei 5 beziehungsweise 25 Dollar.
Noch deutlicher fällt die Senkung beim Prompt-Caching aus. Cache-Reads kosten bei Opus 5.5 nur noch 0,20 Dollar pro Million Tokens. Bei Opus 5 waren es 0,50 Dollar. Cache-Writes sinken von 6,25 auf 5 Dollar pro Million Tokens.
Gerade bei Coding-Agenten und anderen länger laufenden Agentensystemen ist das relevant. Dort werden große Teile eines bereits vorhandenen Kontexts immer wieder benötigt. Anthropic bezeichnet Cache-Reads sogar als einen der größten Kostenfaktoren bei agentischen und Coding-Workloads.
Zusätzlich gibt es einen Fast Mode. Er soll bis zu 2,5-mal schneller sein und kostet 8 Dollar pro Million Input-Tokens sowie 40 Dollar pro Million Output-Tokens.
Der eigentliche Fortschritt steckt in weniger Arbeitsschritten
Interessanter als der reine Tokenpreis ist allerdings, wie viele Tokens das Modell überhaupt benötigt. Anthropic zufolge erledigt Opus 5.5 komplexe Aufgaben mit deutlich weniger Arbeitsschritten als sein Vorgänger.
In einem frühen Test wurde eine Codebasis mit rund 200.000 Zeilen analysiert und repariert. Opus 5.5 benötigte dafür weniger als drei Stunden. Opus 5 brauchte laut Anthropic mehr als 20 Stunden und verbrauchte dabei etwa 2,5-mal so viele Tokens.
Ein weiterer Tester ließ das Modell eine Migration über rund 680.000 Codezeilen durchführen. Die Aufgabe wurde innerhalb eines Tages abgeschlossen. Anthropic nennt diesen Test als Beispiel dafür, dass das Modell zunehmend komplette Entwicklungsaufgaben übernehmen kann, anstatt nur einzelne Codefragmente zu erzeugen.
Auch frühe Nutzer berichten davon, dass Opus 5.5 Kontext seltener erneut einsammelt, vollständigere Änderungen vornimmt und weniger oft in Wiederholungsschleifen gerät. Kiro beobachtete bei einem Test ungefähr 40 Prozent weniger Tool-Aufrufe und etwa halb so viele Tokens wie bei Opus 5.
Warum weniger Tool-Aufrufe so wichtig sind
Bei klassischen Chatbots lässt sich der Preis noch relativ einfach anhand der verwendeten Tokens abschätzen. Bei autonomen Agenten sieht das anders aus.
Ein Agent durchsucht Dateien, ruft Webseiten auf, startet Terminal-Befehle, verändert Code, überprüft das Ergebnis und korrigiert anschließend mögliche Fehler. Jeder dieser Schritte kostet erneut Zeit und Tokens.
Ein Modell kann deshalb einen höheren Preis pro Token haben und trotzdem günstiger sein, wenn es eine Aufgabe mit deutlich weniger Zwischenschritten erledigt.
Genau hier versucht Anthropic Opus 5.5 zu positionieren. Das Modell soll nicht einfach nur bessere Antworten liefern, sondern schneller erkennen, welche Informationen benötigt werden, und anschließend möglichst vollständig arbeiten.
Opus 5.5 gegen GPT-6 Astra und GPT-5.6 Sol
Anthropic veröffentlicht mit Opus 5.5 auch direkte Benchmark-Vergleiche mit aktuellen OpenAI-Modellen. Die Ergebnisse zeigen allerdings kein Modell, das in jeder Disziplin vorne liegt.
Auf Terminal-Bench 4.0, einem Benchmark für komplexe Aufgaben innerhalb einer Kommandozeilenumgebung, erreicht Opus 5.5 laut Anthropic 66,4 Prozent. GPT-6 Astra kommt auf 57,9 Prozent, Claude Fable 5.1 auf 55,8 Prozent, Opus 5 auf 52,3 Prozent und GPT-5.6 Sol auf 37,3 Prozent.
Beim FrontierCode v1.1 erreicht Opus 5.5 in der maximalen Einstellung 54,4 Prozent. GPT-6 Astra liegt bei 53,3 Prozent. Interessant ist hier vor allem die Standardkonfiguration: Bei mittlerem Effort nennt Anthropic für Opus 5.5 54,6 Prozent und gibt an, dafür ungefähr ein Fünftel der Kosten pro Aufgabe von Astra zu benötigen.
Bei AutomationBench sieht das Ergebnis anders aus. Dort erreicht GPT-6 Astra 41,4 Prozent und Opus 5.5 40,0 Prozent. Auch beim wissenschaftlichen Terminal-Bench-Science liegt Astra mit 64,6 Prozent vor Opus 5.5 mit 58,7 Prozent.
Die Zahlen sollten deshalb nicht als allgemeine Rangliste verstanden werden. Anthropic weist selbst darauf hin, dass kleinere Benchmark-Unterschiede bei heutigen Spitzenmodellen zunehmend weniger darüber aussagen, welches Modell bei einer konkreten Aufgabe tatsächlich besser funktioniert.
Coding bleibt eine der größten Stärken
Besonders stark positioniert Anthropic Opus 5.5 weiterhin beim Programmieren. Bei CursorBench 4.0 erreicht das Modell in der maximalen Einstellung 57,8 Prozent. GPT-5.6 Sol wird mit 41,7 Prozent angegeben.
Bei einer internen Aufgabe ließ Anthropic Opus 5.5 und Fable 5.1 den weit verbreiteten Load-Balancer HAProxy von C nach Rust übertragen. Beide Implementierungen bestanden nahezu alle vorhandenen Regressionstests. Opus 5.5 benötigte dafür 9,5 Stunden, Fable 5.1 zwölf Stunden. Gleichzeitig seien die Kosten von Opus 5.5 rund 51 Prozent niedriger gewesen.
Solche Tests zeigen auch, wohin sich Coding-Agenten entwickeln. Statt einzelne Funktionen oder kurze Skripte zu erzeugen, sollen Modelle zunehmend komplette Migrationen, Audits und Änderungen über große Codebasen hinweg durchführen.
Claude soll weniger nach Claude klingen
Anthropic hat nach eigenen Angaben außerdem am Kommunikationsstil gearbeitet. Opus 5.5 soll wichtige Informationen früher nennen, klarer schreiben und Vorgaben zum Schreibstil zuverlässiger berücksichtigen.
Das klingt zunächst nach einer kleineren Änderung, kann bei langen Arbeitssitzungen aber einen erheblichen Unterschied machen. Gerade bei komplexen Coding-, Recherche- oder Analyseaufgaben entstehen schnell sehr lange Antworten, obwohl häufig nur einige zentrale Informationen wichtig sind.
Anthropic berichtet, dass frühe Tester die Antworten von Opus 5.5 als klarer und leichter nachvollziehbar empfanden. Das Modell soll außerdem kürzere und nützlichere Kommentare in Code erzeugen.
Mehr Sicherheit für autonome Agenten
Mit zunehmender Autonomie von KI-Agenten wird auch die Frage wichtiger, welche Aktionen ein Modell tatsächlich ausführen darf. Opus 5.5 verfügt laut Anthropic über einen zusätzlichen Klassifikator, der Aktionen überprüft, bevor sie ausgeführt werden.
Außerdem soll das Modell widerstandsfähiger gegen Prompt-Injection-Angriffe sein. Anthropic zufolge erreicht Opus 5.5 in den eigenen Tests mindestens das Niveau von Opus 5 bei Coding, Tool-Nutzung, Computersteuerung und Webzugriff.
Für Unternehmen ist das besonders relevant, wenn Agenten über Stunden unbeaufsichtigt arbeiten und Zugriff auf interne Systeme oder externe Werkzeuge besitzen.
Auch Wissensarbeit soll effizienter werden
Anthropic positioniert Opus 5.5 nicht ausschließlich als Coding-Modell. Bei GDPval-AA v2.1, einem Benchmark mit Aufgaben aus 44 verschiedenen Berufsfeldern, erreicht Opus 5.5 einen Elo-Wert von 1846. Fable 5.1 kommt auf 1735, Opus 5 auf 1708.
In einem internen Test sollten mehrere Claude-Modelle aus schwer auffindbaren Unternehmensinformationen einen Bericht über Quartalsergebnisse erstellen. Jede Zahl und jedes Zitat wurde anschließend automatisiert überprüft. 16 von 18 mit Opus 5.5 erstellten Berichten erfüllten laut Anthropic die Qualitätsanforderungen. Ein erfundener Wert hätte bereits zum Durchfallen geführt.
Auch bei einer simulierten Unternehmensübernahme wurde das neue Modell getestet. Opus 5.5 und Opus 5 mussten dafür ein Finanzmodell in Excel erstellen und anschließend eine Präsentation für das Management erzeugen. Beide Modelle kamen zum gleichen Ergebnis, Opus 5.5 erledigte die Aufgabe jedoch in 63 statt 93 Minuten und verursachte laut Anthropic etwa halb so hohe Kosten.
Der Wettbewerb verschiebt sich von Tokens zu fertigen Aufgaben
Claude Opus 5.5 zeigt damit eine interessante Entwicklung im Wettbewerb der KI-Anbieter. Lange wurden Modelle vor allem anhand ihrer Größe, Kontextfenster und Benchmarkwerte verglichen. Bei Agenten reicht diese Betrachtung zunehmend nicht mehr aus.
Entscheidend wird, wie teuer eine fertig erledigte Aufgabe ist.
Ein Modell, das eine Million Tokens günstiger anbietet, bringt wenig, wenn es für dasselbe Ergebnis doppelt so viele Schritte benötigt. Umgekehrt kann ein nominell teureres Modell wirtschaftlicher sein, wenn es weniger Tokens verbraucht, weniger Tools aufruft und weniger menschliche Nacharbeit benötigt.
Genau auf diesen Punkt zielt Anthropic mit Opus 5.5. Niedrigere Tokenpreise sind dabei nur ein Teil der Geschichte. Die größere Veränderung könnte darin liegen, dass leistungsfähige Modelle beginnen, komplexe Aufgaben zunehmend in einem zusammenhängenden Arbeitsgang zu erledigen.
Anthropic hat außerdem bereits angekündigt, dass Claude Sonnet 5.5 und Claude Haiku 5.5 in den kommenden Wochen folgen sollen. Viele der Verbesserungen bei Leistung, Effizienz und Sicherheit sollen auch in diese Modelle einfließen.
Quelle: Anthropic – Claude Opus 5.5