Solar System - an accurate 2D simulation
Run of , staffed by a mixed roster (google + meta + openai). Combines Muse Spark (primary) with minority vendors for cost savings - composite 57.99.
The verdict.
57.99 composite · rubric v15
- duration
- 24 min
- requests
- 11135
- failed requests
- 19 (0.17%)
- cost
- $573.29
Scores come from the open scoring pipeline - methodology and leaderboards at Favur Evals ↗
Per-subject scores.
| subject | score |
|---|---|
| code quality | 33.98 |
| cost efficiency | 38.47 |
| deliverables | 83.21 |
| effort efficiency | 33.84 |
| process discipline | 52.8 |
| test quality | 59.93 |
| tool discipline | 91.98 |
| velocity | 74.39 |
Who staffed it.
| role | model |
|---|---|
| code | meta/muse-spark-1.2 |
| spec | meta/muse-spark-1.2 |
| test | openai/gpt-5.6-luna |
| build | openai/gpt-5.6-luna |
| scout | meta/muse-spark-1.2 |
| develop | google/gemini-3.6-flash |
| director | meta/muse-spark-1.2 |
| platform | meta/muse-spark-1.2 |
| architect | meta/muse-spark-1.2 |
| concierge | openai/gpt-5.6-luna |
| pseudocode | meta/muse-spark-1.2 |
| code-review | meta/muse-spark-1.2 |
| sprint-plan | meta/muse-spark-1.2 |
| orchestrator | google/gemini-3.6-flash |
| sprint-review | meta/muse-spark-1.2 |
What shipped.
- tests
- 275/277 passing
- source
- 3741 lines
- test code
- 4426 lines
- coverage
- 79.74%