Skip to main content

Out-of-bounds Read

The product reads data past the end, or before the beginning, of the intended buffer.

CWE-125 at MITRE →

57.2%

repair rate

44–66

95% interval

1101

scored attempts · 32 codebases

By model

#AgentModelRepair rate with intervalRateAttempts
1codexgpt-5.270.3% (95% interval 57.1–79.2)70.3%74
2claudeclaude-opus-4-669.3% (95% interval 52.9–81.0)69.3%75
3gemini31gemini-3.1-pro-preview66.2% (95% interval 50.0–79.0)66.2%65
4cursoropus-4.665.3% (95% interval 50.0–77.7)65.3%75
5opencodegemini-3.1-pro-preview62.5% (95% interval 50.0–75.0)62.5%72
6opencodegpt-5.262.5% (95% interval 45.5–75.3)62.5%72
7codexgpt-5.2-codex56.0% (95% interval 41.0–66.3)56.0%75
8cursorgpt-5.255.6% (95% interval 39.5–67.9)55.6%72
9cursorgpt-5.3-codex55.4% (95% interval 36.8–68.2)55.4%74
10cursorcomposer-1.553.4% (95% interval 38.6–65.8)53.4%73
11claudeclaude-opus-4-553.3% (95% interval 37.3–64.4)53.3%75
12geminigemini-3-pro-preview53.3% (95% interval 39.7–63.3)53.3%75
13opencodeclaude-opus-4-653.3% (95% interval 32.1–69.3)53.3%75
14opencodeclaude-opus-4-541.9% (95% interval 23.1–56.1)41.9%74
15opencodegpt-5.2-codex41.3% (95% interval 22.8–55.2)41.3%75

outcome mix

630 repaired · 222 not repaired · 249 did not build

630 repaired · 222 not repaired · 249 did not build

Corpus cve-bench-136 · run February 2026 · How we test

All weakness classes →