2048 - the sliding-tile game
Run of , staffed by a mixed roster (deepseek + x-ai). Combines Grok (primary) with minority vendors for cost savings - composite 63.24.
The verdict.
62.32 composite · rubric v15
- duration
- 242 min
- requests
- 13228
- failed requests
- 1471 (11.12%)
- cost
- $407.75
Scores come from the open scoring pipeline - methodology and leaderboards at Favur Evals ↗
Per-subject scores.
| subject | score |
|---|---|
| code quality | 41.49 |
| cost efficiency | 50.45 |
| deliverables | 70.44 |
| effort efficiency | 62.67 |
| process discipline | 88.6 |
| test quality | 75.07 |
| tool discipline | 64.95 |
| velocity | 54.76 |
Who staffed it.
| role | model |
|---|---|
| code | x-ai/grok-4.5 |
| spec | deepseek/deepseek-v4-flash |
| test | x-ai/grok-4.5 |
| build | x-ai/grok-4.5 |
| scout | x-ai/grok-4.5 |
| develop | deepseek/deepseek-v4-flash |
| director | deepseek/deepseek-v4-flash |
| platform | x-ai/grok-4.5 |
| architect | deepseek/deepseek-v4-flash |
| concierge | x-ai/grok-4.5 |
| pseudocode | x-ai/grok-4.5 |
| code-review | deepseek/deepseek-v4-flash |
| sprint-plan | deepseek/deepseek-v4-flash |
| orchestrator | deepseek/deepseek-v4-flash |
| sprint-review | deepseek/deepseek-v4-flash |
What shipped.
- tests
- 265/266 passing
- source
- 3338 lines
- test code
- 4114 lines
- coverage
- 88.14%