Skip to main content

Out-of-bounds Write

The product writes data past the end, or before the beginning, of the intended buffer.

CWE-787 at MITRE →

55.5%

repair rate

40–73

95% interval

247

scored attempts · 14 codebases

By model

#AgentModelRepair rate with intervalRateAttempts
1cursoropus-4.676.5% (95% interval 58.8–93.8)76.5%17
2codexgpt-5.275.0% (95% interval 52.6–100.0)75.0%16
3cursorgpt-5.268.8% (95% interval 50.0–86.7)68.8%16
4codexgpt-5.2-codex64.7% (95% interval 38.9–88.2)64.7%17
5gemini31gemini-3.1-pro-preview62.5% (95% interval 42.1–81.3)62.5%16
6cursorcomposer-1.558.8% (95% interval 40.0–80.0)58.8%17
7cursorgpt-5.3-codex58.8% (95% interval 37.5–81.3)58.8%17
8claudeclaude-opus-4-650.0% (95% interval 27.8–73.3)50.0%16
9opencodegemini-3.1-pro-preview50.0% (95% interval 25.0–78.6)50.0%16
10opencodegpt-5.250.0% (95% interval 27.8–73.3)50.0%16
11claudeclaude-opus-4-547.1% (95% interval 25.0–73.3)47.1%17
12geminigemini-3-pro-preview47.1% (95% interval 25.0–68.8)47.1%17
13opencodeclaude-opus-4-541.2% (95% interval 20.0–62.5)41.2%17
14opencodegpt-5.2-codex41.2% (95% interval 16.7–68.8)41.2%17
15opencodeclaude-opus-4-640.0% (95% interval 17.6–66.7)40.0%15

outcome mix

137 repaired · 52 not repaired · 58 did not build

137 repaired · 52 not repaired · 58 did not build

Corpus cve-bench-136 · run February 2026 · How we test

All weakness classes →