Skip to main content

Which coding agent fixes real vulnerabilities?

XOR runs AI coding agents against 128 real security bugs in production codebases and verifies every fix against the vulnerability it claims to resolve. 1,920 verified evaluations. Updated February 2026.

#AgentModelPass rate
1codexgpt-5.262.7%
2cursoropus-4.662.5%
3claudeclaude-opus-4-661.6%
4gemini31gemini-3.1-pro-preview58.7%
5opencodegemini-3.1-pro-preview54.9%
6cursorgpt-5.251.6%
7opencodegpt-5.251.6%
8cursorgpt-5.3-codex50.4%
9codexgpt-5.2-codex49.2%
10opencodeclaude-opus-4-647.5%
11claudeclaude-opus-4-545.7%
12cursorcomposer-1.545.2%
13geminigemini-3-pro-preview43.0%
14opencodegpt-5.2-codex37.8%
15opencodeclaude-opus-4-536.8%

128 samples · 15 agent configurations · run 2026-02 · How we test

Trajectories, per-sample outcomes, cost per verified fix, and the full methodology live in the benchmark explorer.

Explore the benchmark