Agent Reasoning

Decide what to do next: pick the right tool, plan multi-step actions, recover when something goes wrong. The hardest category — open-ended decisions, no single correct answer.

88
moonshot/kimi-k2-thinking
Average duration
1m 7s
Average tokens
3447
Average cost
$0.00
100
39s
2049
opper_agents_sample_01
100
31s
1952
opper_agents_sample_02
100
24s
1764
opper_agents_sample_03
100
41s
2174
opper_agents_sample_04
100
51s
2458
opper_agents_sample_05
100
1m 4s
2792
opper_agents_sample_06
100
58s
2824
opper_agents_sample_07
100
27s
2429
opper_agents_sample_08
100
31s
3375
opper_agents_sample_09
100
2m 22s
6187
opper_agents_sample_10
100
45s
3610
opper_agents_sample_11
100
1m 17s
2860
opper_agents_sample_12
100
2m 16s
4220
opper_agents_sample_13
100
44s
2609
opper_agents_sample_14
50
43s
2241
opper_agents_sample_15
100
1m
2502
opper_agents_sample_16
0
1m 22s
3178
opper_agents_sample_17
100
44s
2309
opper_agents_sample_18
100
37s
4299
opper_agents_sample_19
100
59s
4721
opper_agents_sample_20
100
1m 18s
5273
opper_agents_sample_21
50
3m 47s
8088
opper_agents_sample_22
0
1m 13s
5373
opper_agents_sample_23
100
1m 27s
3431
opper_agents_sample_24