Escopo
Questões objetivas das últimas 3 edições da 1a fase da OAB.
Avaliamos modelos de IA nas 3 provas mais recentes da 1a fase da OAB para medir acurácia em múltiplas estratégias de resposta. Todos os modelos passariam no exame. Acesse o paper aqui.
Julho 2026 · Protocolo direto · 240 questões · 23 modelos
23
Modelos avaliados
de 5 provedores
99.6%
Melhor acurácia
GPT 5.6 Sol
240
Questões por modelo
3 edições (43o, 44o, 45o)
Última atualização: 27/07/2026
Última atualização: 27/07/2026
| # | Modelo | 43o Exame | 44o Exame | 45o Exame | Total | Custo | Latência |
|---|---|---|---|---|---|---|---|
| 1 | GPT 5.6 Solreasoning: native | 80/80 | 79/80 | 80/80 | 239/240 (99.6%) | $0.71 | 2.3s |
| 2 | Gemini 3.6 Flashreasoning: native | 78/80 | 80/80 | 79/80 | 237/240 (98.8%) | $0.96 | 3.5s |
| 3 | Claude Opus 5reasoning: native | 78/80 | 79/80 | 80/80 | 237/240 (98.8%) | $1.26 | 4.8s |
| 4 | GPT 5.6 Terrareasoning: native | 79/80 | 78/80 | 77/80 | 234/240 (97.5%) | $0.48 | 2.6s |
| 5 | Gemini 3 Flash | 79/80 | 75/80 | 78/80 | 232/240 (96.7%) | $0.05 | 3.3s |
| 6 | Grok 4.5reasoning: native | 79/80 | 75/80 | 76/80 | 230/240 (95.8%) | $1.13 | 15.5s |
| 7 | GPT 5.2reasoning: medium | 78/80 | 76/80 | 75/80 | 229/240 (95.4%) | $1.03 | 6.9s |
| 8 | Gemini 3.1 Pro | 72/80 | 77/80 | 78/80 | 227/240 (94.6%) | $1.57 | 12.5s |
| 9 | GPT 5.6 Lunareasoning: native | 76/80 | 75/80 | 76/80 | 227/240 (94.6%) | $0.15 | 1.8s |
| 10 | Claude Opus 4.6 | 75/80 | 73/80 | 72/80 | 220/240 (91.7%) | $0.58 | 2.0s |
| 11 | Gemini 3.1 Flash Lite | 68/80 | 70/80 | 72/80 | 210/240 (87.5%) | $0.02 | 2.2s |
| 12 | Claude Sonnet 4.6 | 75/80 | 67/80 | 66/80 | 208/240 (86.7%) | $0.35 | 1.4s |
| 13 | Gemini 3.5 Flash Lite | 67/80 | 70/80 | 71/80 | 208/240 (86.7%) | $0.03 | 0.9s |
| 14 | Claude Sonnet 5 | 72/80 | 67/80 | 67/80 | 206/240 (85.8%) | $0.30 | 2.6s |
| 15 | Grok 4.1 Fast | 70/80 | 66/80 | 68/80 | 204/240 (85%) | $0.18 | 17.6s |
| 16 | DeepSeek V4 Flash | 65/80 | 68/80 | 64/80 | 197/240 (82.1%) | $0.05 | 8.6s |
| 17 | GPT 5.4 Mini | 71/80 | 63/80 | 61/80 | 195/240 (81.3%) | $0.07 | 0.8s |
| 18 | DeepSeek V4 Proreasoning: native | 67/80 | 67/80 | 55/80 | 189/240 (78.8%) | $0.19 | 23.4s |
| 19 | GPT-5 Mini | 63/80 | 61/80 | 64/80 | 188/240 (78.3%) | $0.44 | 17.0s |
| 20 | Claude Haiku 4.5 | 66/80 | 62/80 | 55/80 | 183/240 (76.3%) | $0.12 | 1.5s |
| 21 | Gemini 2.5 Flash Lite | 63/80 | 59/80 | 60/80 | 182/240 (75.8%) | $0.01 | 1.0s |
| 22 | DeepSeek V3.2 | 63/80 | 52/80 | 61/80 | 176/240 (73.3%) | $0.05 | 9.8s |
| 23 | GPT 5.4 Nano | 54/80 | 43/80 | 45/80 | 142/240 (59.2%) | $0.02 | 0.7s |
Custo estimado via OpenRouter. Latência média por questão. Todos os modelos usaram protocolo direto (resposta = apenas a letra) com temperatura 0.
A metodologia completa pode ser encontrada em nosso paper.
Questões objetivas das últimas 3 edições da 1a fase da OAB.
Taxa de acerto = questões corretas / total de questões.
Detalhes operacionais completos em BENCHMARK_PIPELINE.md.