Skip to content

Leaderboard

Automatically aggregated from 5 published benchmarks. Updated on every deploy.

Overall Rankings

Rank Model Provider Score Benchmarks Avg Latency Avg Cost
#1 o1 OpenAI 94 1 12.40s $0.1860
#2 DeepSeek R1 DeepSeek 91 1 18.20s $0.0042
#3 Claude 3.5 Sonnet Anthropic 90.6 5 8.04s $0.0491
#4 GPT-4o OpenAI 88.8 4 6.83s $0.0524
#5 Gemini 2.0 Pro Google 74 2 10.20s $0.0462
#6 Gemini 2.0 Flash Google 70.7 3 2.70s $0.0014
#7 Llama 3.3 70B Meta 68 1 5.20s $0.0089
#8 Mistral Large Mistral 65 1 5.40s $0.0189

How this leaderboard is calculated

  • Scores are averaged across all relevant benchmarks for each model
  • Cost efficiency = accuracy / (cost × 1000)
  • Speed = 10000 / average latency (ms)
  • No model pays for placement. Rankings reflect published experiment data only.