Evolution Arena - an evolutionary simulation
Run of , staffed by a mixed roster (google + meta + openai). Combines Muse Spark (primary) with minority vendors for cost savings - composite 69.99.
The verdict.
69.99 composite · rubric v15
- duration
- 193 min
- requests
- 13838
- failed requests
- 96 (0.69%)
- cost
- $724.01
Scores come from the open scoring pipeline - methodology and leaderboards at Favur Evals ↗
Per-subject scores.
| subject | score |
|---|---|
| code quality | 34.62 |
| cost efficiency | 71.81 |
| deliverables | 87.16 |
| test quality | 61.48 |
| tool discipline | 84.34 |
| velocity | 76.82 |
| effort efficiency | 52.18 |
| process discipline | 54.98 |
Who staffed it.
| role | model |
|---|---|
| code | meta/muse-spark-1.2 |
| spec | meta/muse-spark-1.2 |
| test | openai/gpt-5.6-luna |
| build | openai/gpt-5.6-luna |
| scout | meta/muse-spark-1.2 |
| develop | google/gemini-3.6-flash |
| director | meta/muse-spark-1.2 |
| architect | meta/muse-spark-1.2 |
| concierge | openai/gpt-5.6-luna |
| pseudocode | meta/muse-spark-1.2 |
| code-review | meta/muse-spark-1.2 |
| sprint-plan | meta/muse-spark-1.2 |
| orchestrator | google/gemini-3.6-flash |
| sprint-review | meta/muse-spark-1.2 |
What shipped.
- tests
- 535/536 passing
- source
- 7011 lines
- test code
- 7217 lines
- coverage
- 78.56%