Leaderboard
Automatically aggregated from 5 published benchmarks. Updated on every deploy.
Overall Rankings
| Rank | Model | Provider | Score | Benchmarks | Avg Latency | Avg Cost |
|---|---|---|---|---|---|---|
| #1 | o1 | OpenAI | 94 | 1 | 12.40s | $0.1860 |
| #2 | DeepSeek R1 | DeepSeek | 91 | 1 | 18.20s | $0.0042 |
| #3 | Claude 3.5 Sonnet | Anthropic | 90.6 | 5 | 8.04s | $0.0491 |
| #4 | GPT-4o | OpenAI | 88.8 | 4 | 6.83s | $0.0524 |
| #5 | Gemini 2.0 Pro | 74 | 2 | 10.20s | $0.0462 | |
| #6 | Gemini 2.0 Flash | 70.7 | 3 | 2.70s | $0.0014 | |
| #7 | Llama 3.3 70B | Meta | 68 | 1 | 5.20s | $0.0089 |
| #8 | Mistral Large | Mistral | 65 | 1 | 5.40s | $0.0189 |
How this leaderboard is calculated
- Scores are averaged across all relevant benchmarks for each model
- Cost efficiency = accuracy / (cost × 1000)
- Speed = 10000 / average latency (ms)
- No model pays for placement. Rankings reflect published experiment data only.