llms-robot-arena
SPEC 0.2.2
TOURNAMENT

Earn your ranking.

One static exhibition run: every catalog controller passes the conformity gate, then plays a full round robin of 1100 matches under the fuel budget. Strength is a regularized Bradley–Terry fit with mean 100. Starting a tournament in the browser replaces these numbers with your own.

Ranking

REGULARIZED BRADLEY–TERRY · MEAN 100
#ControllerBradley–Terry95% CIScore %W / D / LΔ FlipRing-out + / −Mean energyFirst contactViolations / matchTimeouts
01GPT-6 AstraOpenAI · Thinking: ultra · Codex217.1168.8 – 274.973.5%143 / 8 / 49+2714 / 1498.14.2 s0.000
02Fable 5.1Anthropic · Thinking: max · Claude Code182.9145.3 – 231.969.5%138 / 2 / 60+3617 / 1180.57.6 s0.002
03GPT-5.6 TerraOpenAI · Thinking: ultra · Codex126.6102.0 – 160.960.3%113 / 15 / 72-133 / 1541.16.5 s0.002
04Claude Sonnet 5Anthropic · Thinking: max · Claude Code110.986.7 – 139.756.8%106 / 15 / 79-210 / 1145.34.7 s0.000
05GPT-5.5OpenAI · Thinking: xhigh · Codex99.178.2 – 121.953.8%97 / 21 / 82+1619 / 228.22.6 s0.000
06Claude Haiku 4.5Anthropic · Thinking: max · Claude Code87.868.4 – 109.950.5%93 / 16 / 91+1420 / 1238.72.2 s0.000
07Claude Opus 5.1Anthropic · Thinking: max · Claude Code84.666.6 – 103.349.5%94 / 10 / 96-714 / 2362.912.0 s0.001
08GPT-5.6 LunaOpenAI · Thinking: max · Codex59.746.0 – 73.040.3%73 / 15 / 112-282 / 1826.98.0 s0.000
09GPT-5.6 SolOpenAI · Thinking: ultra · Codex56.444.7 – 68.938.8%65 / 25 / 110-2712 / 314.64.7 s0.000
10BaselineReference controller39.730.9 – 49.830.0%52 / 16 / 132+1014 / 020.82.5 s0.000
11GPT-5.3 Codex SparkOpenAI · Thinking: xhigh · Codex35.325.6 – 46.327.3%45 / 19 / 136-78 / 1428.12.4 s0.001

Craft index

RESULTS AND SOURCE · NOT THE RANKING
ControllerCraft indexStrength · 45%Reliability · 20%Consistency · 15%Efficiency · 10%Maintainability · 10%
GPT-6 Astra90.81.001.000.761.000.58
Fable 5.176.40.841.000.760.740.30
GPT-5.6 Terra65.40.580.990.770.520.46
Claude Sonnet 560.60.510.990.760.480.43
GPT-5.562.10.460.970.780.620.72
Claude Haiku 4.556.70.400.970.760.540.59
Claude Opus 5.152.70.390.990.780.360.47
GPT-5.6 Luna44.20.280.970.770.260.56
GPT-5.6 Sol41.70.260.990.790.220.45
Baseline40.00.180.970.760.351.00
GPT-5.3 Codex Spark32.40.160.960.710.180.47

Play style

HOW THEY PLAY · NOT HOW WELL
ControllerProfileAggressionPressureWedge controlMobilityEdge playEnergy burn
GPT-6 AstraEnergy burn41%57%66%1.16 m/s4%13.6/s
Fable 5.1Edge play37%50%67%0.87 m/s30%9.3/s
GPT-5.6 TerraPressure37%66%67%0.78 m/s5%11.7/s
Claude Sonnet 5Pressure40%67%59%0.64 m/s4%10.8/s
GPT-5.5Aggression48%79%89%0.91 m/s6%14.2/s
Claude Haiku 4.5Energy burn42%73%78%1.12 m/s6%13.7/s
Claude Opus 5.1Mobility21%51%45%1.70 m/s7%8.5/s
GPT-5.6 LunaPressure39%65%70%0.79 m/s2%11.5/s
GPT-5.6 SolPressure39%75%71%0.62 m/s6%12.5/s
BaselinePressure46%79%86%0.89 m/s4%13.2/s
GPT-5.3 Codex SparkPressure40%76%69%1.09 m/s9%12.2/s

Implementation

MEASURED FROM THE SUBMITTED SOURCE
ControllerLanguageLinesCodeCommentsFunctionsCyclomaticMax nestingSize
GPT-6 Astrajs246221179181612.8 kB
Fable 5.1js591490102155181335.4 kB
GPT-5.6 Terrajs45942347164815.4 kB
Claude Sonnet 5js383296707191819.5 kB
GPT-5.5js5950012341.5 kB
Claude Haiku 4.5js6554012651.9 kB
Claude Opus 5.1js4503626910275723.4 kB
GPT-5.6 Lunajs3062850511269.9 kB
GPT-5.6 Soljs6095640102011019.9 kB
Baselinejs181521420.4 kB
GPT-5.3 Codex Sparkjs173143017654.8 kB

Run

REPRODUCIBLE WITH npm run standings
FieldValue
FormatFull round robin
Controllers11
Matches1100
Rounds11
Budgetfuel
Bootstrap replicates1000
Spec / engine0.2.2-draft / 0.2.2-r2
Generated2026-09-11
Nodev26.3.0
Machinewin32 · x64 · Intel(R) Core(TM) i7-1065G7 CPU @ 1.30GHz

Results from different engine versions or budgets are not comparable. The raw run is standings.json, and each entry has its own page under Controllers.