Solar System - an accurate 2D simulation
Run of , staffed by a mixed roster (google + x-ai + openai + anthropic + qwen + meta). Combines Gpt Terra (primary) with minority vendors for cost savings - composite 62.83.
The verdict.
62.37 composite · rubric v15
- duration
- 83 min
- requests
- 9650
- failed requests
- 33 (0.34%)
- cost
- $263.63
Scores come from the open scoring pipeline - methodology and leaderboards at Favur Evals ↗
Per-subject scores.
| subject | score |
|---|---|
| process discipline | 40.44 |
| code quality | 53.14 |
| cost efficiency | 51.28 |
| deliverables | 61.22 |
| effort efficiency | 40.43 |
| velocity | 60.19 |
| test quality | 69.39 |
| tool discipline | 65.37 |
Who staffed it.
| role | model |
|---|---|
| code | openai/gpt-5.6-terra |
| spec | openai/gpt-5.6-terra |
| test | meta/muse-spark-1.1 |
| build | meta/muse-spark-1.1 |
| scout | openai/gpt-5.6-luna |
| develop | google/gemini-3.1-flash-lite |
| platform | openai/gpt-5.6-terra |
| concierge | google/gemini-3.1-flash-lite |
| pseudocode | anthropic/claude-sonnet-4.6 |
| code-review | qwen/qwen3.7-plus |
| sprint-plan | x-ai/grok-4.5 |
| orchestrator | google/gemini-3.1-flash-lite |
| sprint-review | qwen/qwen3.7-plus |
What shipped.
- tests
- 133/133 passing
- source
- 1294 lines
- test code
- 1465 lines
- coverage
- 93.19%