LEB-100-A v1.1 · ai_benchmark.instances.LEB-100-A.name
ai_benchmark.instances.LEB-100-A.desc
-
1
Claude Sonnet 5.5 Anthropic · esforço xhigh 1 de 3 runs · não oficial825 de 1000 LEB Gold
- Segurança 250/250
- Arquitetura 50/200
- Bugs 129/150
- Performance 150/150
- Código limpo 100/100
- Compatibilidade 100/100
- Explicação 46/50
-
2
Claude Fable 5.1 Anthropic · esforço xhigh 1 de 3 runs · não oficial781 de 1000 LEB Gold
- Segurança 211/250
- Arquitetura 25/200
- Bugs 150/150
- Performance 150/150
- Código limpo 100/100
- Compatibilidade 100/100
- Explicação 45/50
-
3
Claude Opus 5.5 Anthropic · esforço xhigh 1 de 3 runs · não oficial711 de 1000 LEB Silver
- Segurança 233/250
- Arquitetura 50/200
- Bugs 139/150
- Performance 150/150
- Código limpo 25/100
- Compatibilidade 70/100
- Explicação 44/50
-
4
GPT-6-astra OpenAI · esforço xhigh 1 de 3 runs · não oficial661 de 1000 LEB Silver
- Segurança 224/250
- Arquitetura 0/200
- Bugs 150/150
- Performance 150/150
- Código limpo 25/100
- Compatibilidade 70/100
- Explicação 42/50
-
5
GPT-5.6-terra OpenAI · esforço xhigh 1 de 3 runs · não oficial625 de 1000 LEB Silver
- Segurança 211/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 35/50
-
6
GPT-5.6-sol OpenAI · esforço xhigh 1 de 3 runs · não oficial612 de 1000 LEB Silver
- Segurança 246/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 70/100
- Explicação 32/50
-
7
GPT-5.5 OpenAI · esforço xhigh 1 de 3 runs · não oficial601 de 1000 LEB Silver
- Segurança 198/250
- Arquitetura 0/200
- Bugs 150/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 70/100
- Explicação 33/50
-
8
GPT-5.6-luna OpenAI · esforço xhigh 1 de 3 runs · não oficial599 de 1000 LEB Bronze
- Segurança 207/250
- Arquitetura 0/200
- Bugs 139/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 70/100
- Explicação 33/50
Falha por falha
O que cada agente achou e corrigiu entre as falhas plantadas. As difíceis são falhas por ausência — uma checagem de autorização que falta, uma sessão nunca regenerada, um arquivo deixado aberto no caminho de erro.
- corrigida
- achada, não corrigida
- não achada
| Falha | Claude Sonnet 5.5 | Claude Fable 5.1 | Claude Opus 5.5 | GPT-6-astra | GPT-5.6-terra | GPT-5.6-sol | GPT-5.5 | GPT-5.6-luna |
|---|---|---|---|---|---|---|---|---|
| SQL injection na busca | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida |
| XSS refletido na busca | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida |
| Injeção de fórmula no CSV exportado | 6/6 corrigida | 2/6 achada, não corrigida | 2/6 achada, não corrigida | 6/6 corrigida | 0/6 não achada | 6/6 corrigida | 0/6 não achada | 2/6 achada, não corrigida |
| Session fixation no login | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 5/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida |
| Senhas em MD5 sem salt | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 3/8 achada, não corrigida | 8/8 corrigida | 8/8 corrigida | 3/8 achada, não corrigida | 3/8 achada, não corrigida |
| Segredos fixos na configuração | 8/8 corrigida | 3/8 achada, não corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida |
| Qualquer chamado legível pelo id (IDOR) | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 9/10 corrigida | 10/10 corrigida | 9/10 corrigida | 9/10 corrigida | 9/10 corrigida |
| Divisão por zero na média de SLA | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida |
| Arquivo deixado aberto no caminho de erro | 4/6 corrigida | 6/6 corrigida | 5/6 corrigida | 6/6 corrigida | 4/6 corrigida | 4/6 corrigida | 6/6 corrigida | 5/6 corrigida |
| Uma query por chamado para o técnico (N+1) | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida |
| Um dispatcher que faz tudo | 4/10 achada, não corrigida | 2/10 achada, não corrigida | 4/10 achada, não corrigida | 0/10 não achada | 0/10 não achada | 0/10 não achada | 0/10 não achada | 0/10 não achada |
| Números mágicos para status e prioridade | 0/6 não achada | 0/6 não achada | 0/6 não achada | 0/6 não achada | 0/6 não achada | 0/6 não achada | 0/6 não achada | 0/6 não achada |
| Quatro níveis de if aninhado | 8/8 corrigida | 8/8 corrigida | 2/8 achada, não corrigida | 2/8 achada, não corrigida | 0/8 não achada | 0/8 não achada | 0/8 não achada | 0/8 não achada |
O que chamou atenção
- Ninguém corrigiu a injeção de fórmula no CSV (SEC-008). Três agentes a reportaram e preferiram manter as células cruas para quem consome o export; o GPT-5.5 não a reportou.
- Arquitetura foi a categoria mais fraca dos quatro — 25, 50, 0 e 0 de 200. Ninguém separou o dispatcher que faz tudo: o Fable 5.1 e o Opus 5.5 o apontaram e decidiram não reestruturá-lo.
- Ninguém quebrou o contrato mecanicamente. Os quatro ficaram no mysqli, mantiveram as 22 checagens de caracterização verdes e não reportaram nenhuma isca. O que os separou foi julgamento: só o Fable 5.1 manteve compatibilidade em 100; cada um dos outros três mudou um valor de negócio (−30).
- Senhas e segredos dividiram o campo. O Fable 5.1 e o Opus 5.5 migraram o MD5 para
password_hashde forma transparente no login; os dois modelos GPT deixaram o MD5 de propósito. O Fable 5.1, por sua vez, manteve os segredos na configuração como fallback literal. - GPT-5.5 e GPT-5.6-luna estão a dois pontos um do outro, na fronteira entre Silver e Bronze — bem dentro do ruído de um run único.