CursorBench 4.0

We evaluate agents on ambiguous, multi-file tasks from real Cherri Code sessions. Higher scores are better.

More about CursorBench
A scatter and line chart comparing Fable 5.1, Opus 5.5, Opus 5, Grok 4.7, Grok 4.6, GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Sonnet 5.5, Sonnet 5, Gemini 3.8 Flash, Muse Spark 1.3, GLM 5.3, GLM 5.3 Flash, and Composer 2.5 scores against average cost per task.60%CursorBench 4.0 score55%50%45%40%35%30%25%20%$18$15$12$9$6$3$0Average cost per taskOpus 5.5Fable 5.1Sonnet 5.5Gemini 3.8 FlashGPT-5.6 SolGrok 4.7
Model
1Opus 5.5 Max57.8%$13.43218,363185
2Opus 5.5 Extra High56.0%$6.98101,083109
3Opus 5.5 High56.0%$3.9753,07868
4Sonnet 5.5 Max55.5%$9.67271,920170
5Sonnet 5.5 Extra High53.1%$3.88100,15878
6Opus 5.5 Medium52.5%$2.9137,95454
7Fable 5.1 Max51.8%$17.28117,236128
8Fable 5.1 Extra High51.6%$13.0187,294101
9Fable 5.1 High49.2%$9.0858,43877
10Sonnet 5.5 High47.8%$1.6737,39141
11Fable 5.1 Medium46.8%$7.0545,41163
12Opus 5 Max46.6%$11.9585,384106
13Grok 4.7 Extra High46.3%$6.0170,14188
14Opus 5 Extra High46.1%$11.4380,094103
15Fable 5.1 Low45.1%$5.4434,79551
16Opus 5 High44.7%$9.0061,40586
17Grok 4.7 High43.9%$4.6956,38271
18Opus 5.5 Low43.7%$1.1715,81128
19Opus 5 Medium43.3%$6.9445,27272
20GLM 5.3 Max42.6%$5.0596,387166
21GPT-5.6 Sol Max41.7%$8.2342,94499
22Grok 4.7 Medium41.6%$3.4936,68360
23Muse Spark 1.3 Max41.6%$2.6452,00598
24Grok 4.6 Extra High41.4%$6.1049,81456
25GPT-5.6 Terra Max41.3%$5.1460,814107
26Opus 5 Low40.7%$4.8731,99557
27Grok 4.6 High40.4%$5.2041,38748
28Gemini 3.8 Flash High39.6%$4.70162,565324
29Sonnet 5.5 Medium39.2%$0.7016,03622
30GLM 5.3 High38.0%$3.2460,031114
31GPT-5.6 Sol Extra High37.7%$4.4024,72955
32Muse Spark 1.3 Extra High37.5%$2.1040,89183
33Gemini 3.8 Flash Medium37.3%$4.06128,364290
34GLM 5.3 Flash Max36.8%$0.3956,410118
35Grok 4.6 Medium36.1%$3.4824,89340
36GPT-5.6 Luna Max35.9%$1.0387,284208
37Sonnet 5.5 Low35.8%$0.5011,66818
38GPT-5.6 Sol High35.7%$2.8516,17441
39Sonnet 5 Max34.1%$7.17149,257140
40GPT-5.6 Terra Extra High33.6%$1.8123,43643
41Grok 4.6 Low33.4%$2.2516,30732
42Muse Spark 1.3 High33.4%$1.6630,65469
43GLM 5.3 Low33.3%$2.0431,98381
44Grok 4.7 Low33.1%$1.5815,67740
45GPT-5.6 Luna Extra High33.0%$0.4440,59898
46Muse Spark 1.3 Medium32.6%$1.4927,25564
47Sonnet 5 Extra High32.0%$4.5583,373102
48GPT-5.6 Sol Medium31.1%$1.7710,11132
49GLM 5.3 Flash High31.1%$0.2535,10484
50Sonnet 5 High30.8%$3.4861,14685
51GPT-5.6 Terra High30.7%$1.1113,16233
52GPT-5.6 Luna High29.4%$0.2523,36864
53Muse Spark 1.3 Low29.3%$0.9317,48347
54Sonnet 5 Medium28.0%$2.3139,11465
55Composer 2.527.7%$0.6817,34741
56GPT-5.6 Terra Medium27.6%$0.647,30725
57GLM 5.3 Flash Low26.9%$0.1517,83158
58GPT-5.6 Terra Low25.2%$0.525,91423
59GPT-5.6 Sol Low24.6%$0.874,88521
60Muse Spark 1.3 Minimal24.3%$0.5610,62034
61Sonnet 5 Low24.1%$1.3923,77246
62GPT-5.6 Luna Medium22.2%$0.087,64232
63GPT-5.6 Luna Low16.0%$0.033,28818

更新日志

Tasks

  • CursorBench 4.0
    • Introduced new long-horizon problems focused on edit, refactor, investigation, intent understanding, managing jobs, and design adherence.

Reporting

  • Updated Sonnet 5 results to account for adjusted pricing.

Reporting

  • Updated GPT-5.6 Terra and Luna results to account for adjusted pricing.

Reporting

  • Updated GPT-5.6 Sol, Terra, and Luna results to account for cache write costs.

Tasks

  • CursorBench 3.2
    • Introduced instruction following and advanced tool use problems.

Tasks

  • CursorBench 3.1
    • Introduced problems focused on codebase understanding, bugfinding, planning, and code review.
    • Improved grading criteria for some edit tasks.

Tasks

  • CursorBench 3.0
    • Initial set of tasks focused on edit, refactor, and bugfix problems.

Avg cost / task is computed by applying each model's published per-million-token pricing (input, cache read, cache write, and output) to the tokens it used on each task. Results are subject to variance; small differences in scores may not be statistically meaningful.