OABench

Avaliamos modelos de IA nas 3 provas mais recentes da 1a fase da OAB para medir acurácia em múltiplas estratégias de resposta. Todos os modelos passariam no exame. Acesse o paper aqui.

Julho 2026 · Protocolo direto · 240 questões · 23 modelos

23

Modelos avaliados

de 5 provedores

99.6%

Melhor acurácia

GPT 5.6 Sol

240

Questões por modelo

3 edições (43o, 44o, 45o)

Ranking por Acurácia

Última atualização: 27/07/2026

GPT 5.6 Solreasoning: native
99.6%
Gemini 3.6 Flashreasoning: native
98.8%
Claude Opus 5reasoning: native
98.8%
GPT 5.6 Terrareasoning: native
97.5%
Gemini 3 Flash
96.7%
Grok 4.5reasoning: native
95.8%
GPT 5.2reasoning: medium
95.4%
Gemini 3.1 Pro
94.6%
GPT 5.6 Lunareasoning: native
94.6%
Claude Opus 4.6
91.7%
Gemini 3.1 Flash Lite
87.5%
Claude Sonnet 4.6
86.7%
Gemini 3.5 Flash Lite
86.7%
Claude Sonnet 5
85.8%
Grok 4.1 Fast
85%
DeepSeek V4 Flash
82.1%
GPT 5.4 Mini
81.3%
DeepSeek V4 Proreasoning: native
78.8%
GPT-5 Mini
78.3%
Claude Haiku 4.5
76.3%
Gemini 2.5 Flash Lite
75.8%
DeepSeek V3.2
73.3%
GPT 5.4 Nano
59.2%
GoogleOpenAIAnthropicxAIDeepSeekLinha tracejada = 50% (nota de corte OAB)

Leaderboard Completo

Última atualização: 27/07/2026

#Modelo43o Exame44o Exame45o ExameTotalCustoLatência
1GPT 5.6 Solreasoning: native80/8079/8080/80239/240 (99.6%)$0.712.3s
2Gemini 3.6 Flashreasoning: native78/8080/8079/80237/240 (98.8%)$0.963.5s
3Claude Opus 5reasoning: native78/8079/8080/80237/240 (98.8%)$1.264.8s
4GPT 5.6 Terrareasoning: native79/8078/8077/80234/240 (97.5%)$0.482.6s
5Gemini 3 Flash79/8075/8078/80232/240 (96.7%)$0.053.3s
6Grok 4.5reasoning: native79/8075/8076/80230/240 (95.8%)$1.1315.5s
7GPT 5.2reasoning: medium78/8076/8075/80229/240 (95.4%)$1.036.9s
8Gemini 3.1 Pro72/8077/8078/80227/240 (94.6%)$1.5712.5s
9GPT 5.6 Lunareasoning: native76/8075/8076/80227/240 (94.6%)$0.151.8s
10Claude Opus 4.675/8073/8072/80220/240 (91.7%)$0.582.0s
11Gemini 3.1 Flash Lite68/8070/8072/80210/240 (87.5%)$0.022.2s
12Claude Sonnet 4.675/8067/8066/80208/240 (86.7%)$0.351.4s
13Gemini 3.5 Flash Lite67/8070/8071/80208/240 (86.7%)$0.030.9s
14Claude Sonnet 572/8067/8067/80206/240 (85.8%)$0.302.6s
15Grok 4.1 Fast70/8066/8068/80204/240 (85%)$0.1817.6s
16DeepSeek V4 Flash65/8068/8064/80197/240 (82.1%)$0.058.6s
17GPT 5.4 Mini71/8063/8061/80195/240 (81.3%)$0.070.8s
18DeepSeek V4 Proreasoning: native67/8067/8055/80189/240 (78.8%)$0.1923.4s
19GPT-5 Mini63/8061/8064/80188/240 (78.3%)$0.4417.0s
20Claude Haiku 4.566/8062/8055/80183/240 (76.3%)$0.121.5s
21Gemini 2.5 Flash Lite63/8059/8060/80182/240 (75.8%)$0.011.0s
22DeepSeek V3.263/8052/8061/80176/240 (73.3%)$0.059.8s
23GPT 5.4 Nano54/8043/8045/80142/240 (59.2%)$0.020.7s

Custo estimado via OpenRouter. Latência média por questão. Todos os modelos usaram protocolo direto (resposta = apenas a letra) com temperatura 0.


Metodologia

A metodologia completa pode ser encontrada em nosso paper.

Escopo

Questões objetivas das últimas 3 edições da 1a fase da OAB.

Métrica principal

Taxa de acerto = questões corretas / total de questões.

Como o benchmark é calculado

  1. Rodamos cada modelo nas 3 provas, para cada combinação da matriz.
  2. Extraímos a alternativa final (A, B, C ou D) por questão.
  3. Comparamos com o gabarito oficial da OAB.
  4. Agregamos os acertos por prova, cenário e modelo.

Detalhes operacionais completos em BENCHMARK_PIPELINE.md.