OpenClaw model benchmark results
No model is called a winner until the exact model, hardware, runtime, OpenClaw version, scoring method, and raw runs are published together.
No scored result has been published
The dataset and validation contract are live, but the result array remains empty. This prevents qualitative recommendations from being presented as measured benchmark winners.
- Dataset status
- Awaiting first run
- Minimum runs
- 20 per task class
- Updated
- 2026-08-09