Benchmark

Skor model terkemuka pada rangkaian tugas terstandarisasi, beserta biaya rata-rata per tugas dengan harga LokaRouter.

2.456.682
evaluasi tugas
5
rangkaian benchmark
2026-09-05
terakhir dijalankan

τ²-Bench Airline Agen

12 model · 11.582 tugas · terakhir dijalankan 2026-09-03

Multi-turn service agents making tool calls under strict policy constraints.

PeringkatModelAkurasiRata-rata biaya / tugas
1OpenAI: GPT-5.2
82.1%
$0.34
2Anthropic: Claude Opus 5
79.4%
$0.51
3Anthropic: Claude Sonnet 4.6
75.2%
$0.18
4Google: Gemini 3 Pro
73.9%
$0.22
5OpenAI: GPT-5.1
70.8%
$0.16
6xAI: Grok 4.6
68.1%
$0.19
7Qwen: Qwen3 Max
64.4%
$0.09
8DeepSeek: V4
61.7%
$0.05

GPQA Diamond Penalaran

15 model · 24.300 tugas · terakhir dijalankan 2026-09-05

Graduate-level science questions that resist retrieval and reward careful reasoning.

PeringkatModelAkurasiRata-rata biaya / tugas
1OpenAI: GPT-5.2 Pro
91.7%
$1.42
2OpenAI: GPT-5.2
89.3%
$0.38
3Anthropic: Claude Opus 5
88.1%
$0.55
4Google: Gemini 3 Pro
87.4%
$0.24
5MoonshotAI: Kimi K3
86.2%
$0.11
6xAI: Grok 4.2
85.5%
$0.21
7DeepSeek: R2
84.8%
$0.07
8Anthropic: Claude Sonnet 4.6
83.6%
$0.19
9Qwen: Qwen3.8 Max
82.9%
$0.10
10OpenAI: o3
81.7%
$0.29

BrowseComp Pencarian

8 model · 16.896 tugas · terakhir dijalankan 2026-08-18

Hard-to-locate facts on the live web, scored on persistent multi-step research.

PeringkatModelAkurasiRata-rata biaya / tugas
1Perplexity: Sonar Deep Research
64.2%
$0.86
2Google: Gemini 3 Deep Research
61.7%
$0.74
3OpenAI: GPT-5.2 Pro
57.3%
$1.51
4Anthropic: Claude Opus 5
52.8%
$0.62
5Google: Gemini 3 Pro
48.1%
$0.28
6OpenAI: GPT-5.2
45.2%
$0.41

DeepSearchQA Pencarian

9 model · 8.940 tugas · terakhir dijalankan 2026-08-20

Questions whose answers are lists, scored for exhaustive retrieval with no padding.

PeringkatModelAkurasiRata-rata biaya / tugas
1Google: Gemini 3 Deep Research
70.8%
$0.69
2Perplexity: Sonar Deep Research
68.4%
$0.81
3OpenAI: GPT-5.2
57.1%
$0.43
4Anthropic: Claude Opus 5
54.9%
$0.58
5xAI: Grok 4.2
51.2%
$0.24
6Google: Gemini 3 Pro
49.7%
$0.27

WideSearch Pencarian

7 model · 4.112 tugas · terakhir dijalankan 2026-08-25

Fill an entire table; answer-item accuracy scores partial matches.

PeringkatModelAkurasiRata-rata biaya / tugas
1Google: Gemini 3 Deep Research
66.1%
$0.77
2Perplexity: Sonar Deep Research
63.9%
$0.90
3OpenAI: GPT-5.2 Pro
59.8%
$1.48
4Anthropic: Claude Opus 5
54.4%
$0.60
5OpenAI: GPT-5.2
50.2%
$0.40

Data contoh untuk demonstrasi — hasil bersifat ilustratif, bukan evaluasi langsung.

Semua model di atas dapat diakses melalui LokaRouter dengan harga per token yang tercantum.