Model results · Anthropic

Claude Opus 5.5

Suitev4
Claude Opus 5.5 across every effort level
In Claude Code across five effort levels: combined score 86.36 at Low to 91.11 at High, second on Frontier v4 only to Fable 5.1 at Max. Medium, the shipped default, passes all 23 tasks at 90.86 for $2.84 a task. Refusal fallback on: Opus 4.8 wrote 47.8% of replies at Max.
September 26, 2026 · 23 tasks · 5 effort levels · 115 runs of Claude Opus 5.5 · VulcanBench Frontier v4 · Code quality protocol v3.15
→
Suitev4
Beside GPT-6 Astra and Claude Fable 5.1
Combined score and cost per task at every level for all three models, with the Opus 4.8 fallback share for both Claude columns. $1.70 to $8.75 per task for Opus 5.5; the whole sweep priced at $475.33.
September 26, 2026 · API-equivalent estimates at list rates, solver inference only · VulcanBench Frontier v4
→

How would Claude Opus 5.5 do on your stack?

Public results answer "which model is stronger on this suite." Whether Claude Opus 5.5 belongs in your routing table depends on your languages, your codebases, and your task mix, that gets measured, not guessed. Grading rules are in the methodology.