Every published VulcanBench measurement of Claude Opus 5.5, newest first: combined score, Code quality, runtime, tokens and API-equivalent cost at every effort level on Frontier v4, graded by deterministic hidden tests on real tasks. Measured through Claude Code on a Claude Max subscription, with Claude Code's refusal fallback on and disclosed.
Public results answer "which model is stronger on this suite." Whether Claude Opus 5.5 belongs in
your routing table depends on your languages, your codebases, and your task mix, that gets measured, not
guessed. Grading rules are in the methodology.