LEB-100-A v1.1 · Painel de chamados de um provedor de internet
O painel de chamados de suporte de um provedor de internet, escrito em PHP estilo 2013: funções de acesso a dados e um index.php que roteia, autoriza e monta o HTML. Cerca de 300 linhas em PHP 8, mysqli e MySQL 8, com 13 falhas plantadas e 2 iscas.
-
1
Claude Sonnet 5.5 Anthropic · esforço xhigh 3 de 3 runs (825 · 809 · 724)809 de 1000 LEB Gold
- Segurança 250/250
- Arquitetura 25/200
- Bugs 139/150
- Performance 150/150
- Código limpo 100/100
- Compatibilidade 100/100
- Explicação 45/50
Comentário e ficha
O resultado mais completo de um agente só: segurança em 250 de 250 nos dois primeiros runs, desempenho com nota máxima, compatibilidade intacta e a injeção de fórmula no CSV corrigida como o gabarito espera. O terceiro run encontrou três falhas de segurança sem corrigi-las e caiu para 724; como todos os agentes, deixou o dispatcher inteiro.
- Nota máxima
- Segurança, Performance, Código limpo, Compatibilidade
- Nunca corrigiu, em nenhum run
- Um dispatcher que faz tudo; Números mágicos para status e prioridade
Run a run
- Run 1 · 825 11 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 19min US$ 3.60 Scorecard
- Run 2 · 809 11 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 23min US$ 2.96 Scorecard
- Run 3 · 724 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 23min US$ 2.91 Scorecard
-
2
Claude Sonnet 5.5 Anthropic · esforço max 3 de 3 runs (807 · 773 · 820)807 de 1000 LEB Gold
- Segurança 250/250
- Arquitetura 12/200
- Bugs 150/150
- Performance 150/150
- Código limpo 100/100
- Compatibilidade 100/100
- Explicação 45/50
Comentário e ficha
O mais regular entre os três primeiros: de 773 a 820 em três runs, bugs e desempenho com nota máxima em todos, nenhum falso positivo e nenhum contrato quebrado. Mais esforço que o xhigh não trouxe ganho mensurável, a cerca de uma vez e meia o custo.
- Nota máxima
- Segurança, Bugs, Performance, Código limpo, Compatibilidade
- Nunca corrigiu, em nenhum run
- Um dispatcher que faz tudo; Números mágicos para status e prioridade
Run a run
- Run 1 · 807 11 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 27min US$ 3.86 Scorecard
- Run 2 · 773 10 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 29min US$ 4.75 Scorecard
- Run 3 · 820 11 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 41min US$ 6.65 Scorecard
-
3
Claude Sonnet 5.5 Anthropic · esforço max (ultracode) 3 de 3 runs (774 · 820 · 759)774 de 1000 LEB Gold
- Segurança 250/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 100/100
- Compatibilidade 100/100
- Explicação 45/50
Comentário e ficha
O modo multiagente do Claude Code: de 68 a 145 subagentes e de 2h a 7h 55min por run, a US$ 119 a 233 cada, para 774, 820 e 759. No melhor caso empatou com o mesmo modelo trabalhando sozinho em meia hora, com o relatório mais bem calibrado entre os agentes Claude e a mesma arquitetura intocada.
- Nota máxima
- Segurança, Performance, Código limpo, Compatibilidade
- Zero
- Arquitetura
- Nunca corrigiu, em nenhum run
- Um dispatcher que faz tudo; Números mágicos para status e prioridade
Run a run
- Run 1 · 774 11 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 7h 55min US$ 233.08 Scorecard
- Run 2 · 820 11 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 2h US$ 171.18 Scorecard
- Run 3 · 759 10 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 3h 34min US$ 119.07 Scorecard
-
4
Claude Fable 5.1 Anthropic · esforço xhigh 2 de 3 runs (781 · 764) · não oficial764 de 1000 LEB Gold
- Segurança 233/250
- Arquitetura 0/200
- Bugs 139/150
- Performance 150/150
- Código limpo 100/100
- Compatibilidade 100/100
- Explicação 42/50
Comentário e ficha
Encontra tanto quanto o Sonnet (11 ou 12 das 13 falhas) e corrige menos: explicou a injeção de fórmula no CSV e a deixou no lugar de propósito, para proteger quem consome o arquivo. Dois runs até agora; o cliente trocou de modelo no meio de uma terceira tentativa, que foi anulada.
- Nota máxima
- Performance, Código limpo, Compatibilidade
- Zero
- Arquitetura
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Um dispatcher que faz tudo; Números mágicos para status e prioridade
Run a run
-
5
Claude Opus 5.5 Anthropic · esforço xhigh 3 de 3 runs (711 · 717 · 805)717 de 1000 LEB Silver
- Segurança 233/250
- Arquitetura 50/200
- Bugs 139/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 45/50
Comentário e ficha
A maior nota de arquitetura num run oficial (50 de 200), e a maior variação entre os modelos Claude: 711 e 717, depois 805. Corrigiu 9 falhas em todos os runs e, no run que conta, não achatou os ifs aninhados; é daí que vem a distância para o Sonnet.
- Nota máxima
- Performance, Compatibilidade
- Zero
- Código limpo
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Um dispatcher que faz tudo; Números mágicos para status e prioridade
Run a run
- Run 1 · 711 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 16min Scorecard
- Run 2 · 717 9 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 18min US$ 3.01 Scorecard
- Run 3 · 805 9 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 15min US$ 2.71 Scorecard
-
6
GPT-6-astra OpenAI · esforço ultra 3 de 3 runs (668 · 666 · 651)666 de 1000 LEB Silver
- Segurança 224/250
- Arquitetura 25/200
- Bugs 129/150
- Performance 150/150
- Código limpo 25/100
- Compatibilidade 70/100
- Explicação 43/50
Comentário e ficha
O agente GPT mais forte, com dois ou três subagentes em 10 a 15 minutos por run e três runs a menos de 17 pontos um do outro. Mudou um valor de negócio em todos os runs (−30 cada), e seus relatórios estão entre os mais bem calibrados daqui (Brier 0,000).
- Nota máxima
- Performance
- Nunca corrigiu, em nenhum run
- Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 668 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 11min Scorecard
- Run 2 · 666 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 15min Scorecard
- Run 3 · 651 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 10min Scorecard
-
7
GPT-6.1-sol OpenAI · esforço xhigh 3 de 3 runs (666 · 653 · 661)661 de 1000 LEB Silver
- Segurança 246/250
- Arquitetura 25/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 70/100
- Explicação 41/50
Comentário e ficha
Segurança em 246 de 250, a melhor fora do Claude, com a injeção de fórmula no CSV e o MD5 corrigidos no run oficial. O que o deixa abaixo dos modelos Claude é um valor de negócio alterado em cada run (−30) e os ifs aninhados mantidos como estavam.
- Nota máxima
- Performance
- Zero
- Código limpo
- Nunca corrigiu, em nenhum run
- Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 666 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 27min Scorecard
- Run 2 · 653 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 26min Scorecard
- Run 3 · 661 10 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 24min Scorecard
-
8
GPT-6.1-sol pro OpenAI · esforço xhigh 1 de 3 runs · não oficial sem corte ou lançamento anterior publicado654 de 1000 LEB Silver
- Segurança 228/250
- Arquitetura 0/200
- Bugs 139/150
- Performance 150/150
- Código limpo 25/100
- Compatibilidade 70/100
- Explicação 42/50
Comentário e ficha
Um run até agora, pelo opencode, a US$ 1,01: 654, perto do GPT-6.1-sol no Codex CLI. Deixou a injeção de fórmula no CSV no lugar e alterou um valor de negócio (−30).
- Nota máxima
- Performance
- Zero
- Arquitetura
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 654 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 16min US$ 1.01 Scorecard
-
9
Grok 4.7 xAI · esforço high 3 de 3 runs (638 · 663 · 607)638 de 1000 LEB Silver
- Segurança 207/250
- Arquitetura 0/200
- Bugs 139/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 42/50
Comentário e ficha
O modelo mais forte de fora da Anthropic e da OpenAI, com compatibilidade em 100 em dois dos três runs e relatórios em 42 de 50. Manteve as senhas em MD5 sem salt em todos os runs; no primeiro foi o único agente a consultar a web, a página do manual do PHP sobre fputcsv.
- Nota máxima
- Performance, Compatibilidade
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Senhas em MD5 sem salt; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 638 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 29min US$ 2.43 Scorecard
- Run 2 · 663 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 24min US$ 2.88 Scorecard
- Run 3 · 607 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 26min US$ 2.57 Scorecard
-
10
Grok 4.6 xAI · esforço high 3 de 3 runs (633 · 640 · 620) sem corte ou lançamento anterior publicado633 de 1000 LEB Silver
- Segurança 194/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 25/100
- Compatibilidade 100/100
- Explicação 35/50
Comentário e ficha
Quase a nota do Grok 4.7 por cerca de um oitavo do custo (US$ 0,28 a 0,31 por run), e estável: de 620 a 640, 9 falhas encontradas em cada run, nenhum contrato quebrado. Nunca mexeu no MD5 nem na injeção de fórmula no CSV.
- Nota máxima
- Performance, Compatibilidade
- Zero
- Arquitetura
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 633 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 6min US$ 0.31 Scorecard
- Run 2 · 640 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 5min US$ 0.31 Scorecard
- Run 3 · 620 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 6min US$ 0.28 Scorecard
-
11
Grok 4.7 xAI · esforço xhigh 3 de 3 runs (640 · 617 · 631)631 de 1000 LEB Silver
- Segurança 185/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 25/100
- Compatibilidade 100/100
- Explicação 42/50
Comentário e ficha
Mais esforço rendeu um pouco menos que o Grok 4.7 em high, a um custo maior: corrigiu 7 ou 8 falhas por run e deixou o MD5 e os segredos no código em todos. Os relatórios, de 42 a 44 de 50, são as melhores explicações de fora da Anthropic e da OpenAI.
- Nota máxima
- Performance, Compatibilidade
- Zero
- Arquitetura
- Nunca corrigiu, em nenhum run
- Senhas em MD5 sem salt; Segredos fixos na configuração; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 640 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 37min US$ 3.82 Scorecard
- Run 2 · 617 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 29min US$ 3.59 Scorecard
- Run 3 · 631 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 33min US$ 3.31 Scorecard
-
12
Kimi K3 Moonshot AI · esforço high 3 de 3 runs (629 · 634 · 574) sem corte ou lançamento anterior publicado629 de 1000 LEB Silver
- Segurança 198/250
- Arquitetura 0/200
- Bugs 150/150
- Performance 150/150
- Código limpo 25/100
- Compatibilidade 70/100
- Explicação 36/50
Comentário e ficha
O Kimi mais forte, com folga, com bugs e desempenho em nota máxima no run oficial, por US$ 0,41 a 1,02 por run. Todos os runs alteraram um valor de negócio (−30), e nenhum corrigiu a injeção de fórmula no CSV.
- Nota máxima
- Bugs, Performance
- Zero
- Arquitetura
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 629 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 7min US$ 0.41 Scorecard
- Run 2 · 634 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 21min US$ 1.02 Scorecard
- Run 3 · 574 7 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 15min US$ 0.81 Scorecard
-
13
GPT-6-astra OpenAI · esforço xhigh 3 de 3 runs (661 · 596 · 628)628 de 1000 LEB Silver
- Segurança 228/250
- Arquitetura 0/200
- Bugs 139/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 70/100
- Explicação 41/50
Comentário e ficha
O GPT-6-astra como agente único, 38 pontos abaixo do ajuste ultra. Os runs discordam sobre o que corrigir: o primeiro corrigiu a injeção de fórmula no CSV e manteve o MD5; o oficial migrou o MD5 para password_hash e deixou a injeção.
- Nota máxima
- Performance
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 661 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 17min Scorecard
- Run 2 · 596 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 12min Scorecard
- Run 3 · 628 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 14min Scorecard
-
14
GLM-5.3 Prime Z.AI · esforço high 3 de 3 runs (635 · 628 · 541) sem corte ou lançamento anterior publicado628 de 1000 LEB Silver
- Segurança 211/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 38/50
Comentário e ficha
O GLM mais forte, a cerca de US$ 2 por run. O primeiro run corrigiu as quatro falhas cobertas pelas sondas, a injeção de fórmula no CSV entre elas; o terceiro alterou dois valores de negócio e caiu para 541.
- Nota máxima
- Performance, Compatibilidade
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Senhas em MD5 sem salt; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 635 9 de 13 falhas corrigidas 1 falso positivo contrato mantido 22/22 checagens 15min US$ 1.69 Scorecard
- Run 2 · 628 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 26min US$ 2.13 Scorecard
- Run 3 · 541 7 de 13 falhas corrigidas nenhum falso positivo 2 valores de negócio alterados 22/22 checagens 17min US$ 1.77 Scorecard
-
15
GPT-5.6-terra OpenAI · esforço xhigh 3 de 3 runs (625 · 611 · 645)625 de 1000 LEB Silver
- Segurança 211/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 35/50
Comentário e ficha
Relata menos falhas do que corrige: o primeiro run listou 7 e corrigiu 9, o resto feito de passagem, sem uma palavra no relatório. A compatibilidade se manteve em dois dos três runs, o que o deixa em 15º apesar do relatório curto.
- Nota máxima
- Performance, Compatibilidade
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 625 9 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 8min Scorecard
- Run 2 · 611 10 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 8min Scorecard
- Run 3 · 645 10 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 7min Scorecard
-
16
GLM-5.3-Flash Z.AI · esforço high 1 de 3 runs · não oficial sem corte ou lançamento anterior publicado624 de 1000 LEB Silver
- Segurança 211/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 34/50
Comentário e ficha
Um run até agora: 624 por US$ 0,08, cerca de um décimo do custo do GLM-5.3 para uma nota um pouco maior. Deixou a injeção de fórmula no CSV e os segredos no código.
- Nota máxima
- Performance, Compatibilidade
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Segredos fixos na configuração; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 624 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 15min US$ 0.08 Scorecard
-
17
GLM-5.3 Z.AI · esforço high 3 de 3 runs (629 · 621 · 604) sem corte ou lançamento anterior publicado621 de 1000 LEB Silver
- Segurança 203/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 39/50
Comentário e ficha
Estável (de 604 a 629) e barato (US$ 0,47 a 0,73 por run), com compatibilidade em 100 nos três runs. Nunca corrigiu o MD5 nem a injeção de fórmula no CSV.
- Nota máxima
- Performance, Compatibilidade
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 629 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 17min US$ 0.73 Scorecard
- Run 2 · 621 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 15min US$ 0.51 Scorecard
- Run 3 · 604 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 13min US$ 0.47 Scorecard
-
18
DeepSeek V4 Flash DeepSeek · esforço xhigh 1 de 3 runs · não oficial sem corte ou lançamento anterior publicado617 de 1000 LEB Silver
- Segurança 207/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 31/50
Comentário e ficha
Um run até agora, pela Novita: 617 por US$ 0,18, contra 282 do mesmo modelo em high. Corrigiu 7 falhas e deixou no lugar a injeção no CSV, o MD5 e os segredos no código.
- Nota máxima
- Performance, Compatibilidade
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Segredos fixos na configuração; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 617 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 28min US$ 0.18 Scorecard
-
19
GPT-6.1-sol OpenAI · esforço ultra 3 de 3 runs (597 · 656 · 616)616 de 1000 LEB Silver
- Segurança 228/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 70/100
- Explicação 39/50
Comentário e ficha
O esforço ultra ficou 45 pontos abaixo do GPT-6.1-sol em xhigh, com runs de 597 a 656. Com três subagentes, o primeiro run manteve o MD5; com dois, o segundo corrigiu 10 falhas, a injeção de fórmula no CSV e o MD5 entre elas.
- Nota máxima
- Performance
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 597 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 24min Scorecard
- Run 2 · 656 10 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 13min Scorecard
- Run 3 · 616 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 11min Scorecard
-
20
GPT-5.6-sol OpenAI · esforço xhigh 3 de 3 runs (612 · 612 · 608)612 de 1000 LEB Silver
- Segurança 246/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 70/100
- Explicação 32/50
Comentário e ficha
Segurança em 246 de 250 e a injeção de fórmula no CSV corrigida, mas a correção também transformou o '-' de um chamado sem técnico em "'-", um bug novo, e todo run alterou um valor de negócio (−30). O GPT mais repetível: de 608 a 612.
- Nota máxima
- Performance
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 612 10 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 7min Scorecard
- Run 2 · 612 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 15min Scorecard
- Run 3 · 608 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 15min Scorecard
-
21
DeepSeek V4.1 Flash DeepSeek · esforço high 3 de 3 runs (625 · 612 · 597) sem corte ou lançamento anterior publicado612 de 1000 LEB Silver
- Segurança 203/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 30/50
Comentário e ficha
O agente mais barato daqui, US$ 0,01 a 0,04 por run, dois deles em menos de dois minutos, para 597 a 625. A compatibilidade se manteve nos três; a menor nota de explicação entre os agentes acima de 600 (30 de 50).
- Nota máxima
- Performance, Compatibilidade
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Senhas em MD5 sem salt; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 625 9 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 9min US$ 0.04 Scorecard
- Run 2 · 612 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 1min US$ 0.01 Scorecard
- Run 3 · 597 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 1min US$ 0.02 Scorecard
-
22
GPT-5.6-luna OpenAI · esforço xhigh 3 de 3 runs (599 · 601 · 624)601 de 1000 LEB Silver
- Segurança 220/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 70/100
- Explicação 32/50
Comentário e ficha
O menor GPT-5.6, a até 24 pontos do terra e do sol, com runs de 599 a 624. Alterou um valor de negócio em cada run (−30).
- Nota máxima
- Performance
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 599 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 12min Scorecard
- Run 2 · 601 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 10min Scorecard
- Run 3 · 624 10 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 14min Scorecard
-
23
GLM-5.3-FlashX Z.AI · esforço high 1 de 3 runs · não oficial sem corte ou lançamento anterior publicado597 de 1000 LEB Bronze
- Segurança 185/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 33/50
Comentário e ficha
Um run até agora: 597 por US$ 0,10, 27 pontos abaixo do GLM-5.3-Flash. Corrigiu 7 falhas e deixou a injeção no CSV, o MD5 e os segredos no código.
- Nota máxima
- Performance, Compatibilidade
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Segredos fixos na configuração; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 597 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 9min US$ 0.10 Scorecard
-
24
Gemini 3.8 Flash Google · esforço high 3 de 3 runs (687 · 588 · 100) sem corte ou lançamento anterior publicado588 de 1000 LEB Bronze
- Segurança 181/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 28/50
Comentário e ficha
Três runs muito diferentes: 687 (que o colocaria em 6º), 588, e 100 de um run que parou após dez minutos, num servidor de banco que ele mesmo subiu. Os dois runs completos mantiveram o MD5 e os dois segredos e deixaram a exportação CSV servindo qualquer cliente.
- Nota máxima
- Performance, Compatibilidade
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Segredos fixos na configuração; Um dispatcher que faz tudo; Números mágicos para status e prioridade
Run a run
- Run 1 · 687 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 13min US$ 1.00 Scorecard
- Run 2 · 588 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 25min US$ 0.85 Scorecard
- Run 3 · 100 0 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 10min US$ 0.28 Scorecard
-
25
Gemini 3.7 Flash Google · esforço high 3 de 3 runs (587 · 587 · 556) sem corte ou lançamento anterior publicado587 de 1000 LEB Bronze
- Segurança 181/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 27/50
Comentário e ficha
A geração anterior ao Gemini 3.8 Flash, um ponto atrás dele e bem mais estável (de 556 a 587). O primeiro run é o único fora do Claude a achatar os ifs aninhados; o segundo procurou o gabarito na VM, que não está lá.
- Nota máxima
- Performance, Compatibilidade
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Segredos fixos na configuração; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 587 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 12min US$ 0.72 Scorecard
- Run 2 · 587 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 16min US$ 0.60 Scorecard
- Run 3 · 556 7 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 7min US$ 0.49 Scorecard
-
26
GPT-5.5 OpenAI · esforço xhigh 3 de 3 runs (558 · 568 · 536)558 de 1000 LEB Bronze
- Segurança 177/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 70/100
- Explicação 32/50
Comentário e ficha
A geração anterior do GPT, de 43 a 108 pontos abaixo dos modelos GPT-5.6 e GPT-6: 8 falhas encontradas e 7 corrigidas em todos os runs, com o MD5 e a injeção de fórmula no CSV sempre no lugar.
- Nota máxima
- Performance
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 2 · 558 7 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 6min Scorecard
- Run 3 · 568 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 5min Scorecard
- Run 4 · 536 7 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 5min Scorecard
-
27
Gemini 3.8 Flash Google · esforço medium 1 de 3 runs · não oficial sem corte ou lançamento anterior publicado550 de 1000 LEB Bronze
- Segurança 147/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 24/50
Comentário e ficha
Um run até agora, em 4min 34s por US$ 0,19: 550. Corrigiu 6 falhas e apontou injeção de SQL em duas funções que só recebem inteiros.
- Nota máxima
- Performance, Compatibilidade
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Session fixation no login; Senhas em MD5 sem salt; Segredos fixos na configuração; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 550 6 de 13 falhas corrigidas 2 falsos positivos contrato mantido 22/22 checagens 5min US$ 0.19 Scorecard
-
28
Qwen3 Coder Next Alibaba (Qwen team) · esforço padrão (não configurável) 1 de 3 runs · não oficial507 de 1000 LEB Bronze
- Segurança 125/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 150/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 18/50
Comentário e ficha
A explicação mais fraca (18 de 50) e a pior calibração daqui: três falhas que não existem relatadas com confiança 100, e nenhum teste executado. Por outro lado, é o único dos nove últimos que corrigiu a consulta N+1.
- Nota máxima
- Performance, Compatibilidade
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- XSS refletido na busca; Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Segredos fixos na configuração; Qualquer chamado legível pelo id (IDOR); Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 507 5 de 13 falhas corrigidas 3 falsos positivos contrato mantido 22/22 checagens 16min US$ 1.53 Scorecard
-
29
DeepSeek V4 Pro DeepSeek · esforço high 3 de 3 runs (604 · 496 · 432) sem corte ou lançamento anterior publicado496 de 1000 LEB Bronze
- Segurança 181/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 56/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 30/50
Comentário e ficha
O DeepSeek maior: os três runs (604, 496 e 432) ficam abaixo dos 612 oficiais do DeepSeek V4.1 Flash. O primeiro apontou injeção de SQL com confiança 100 em duas funções que só recebem inteiros; os outros dois deixaram a consulta N+1 no lugar.
- Nota máxima
- Compatibilidade
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 604 8 de 13 falhas corrigidas 2 falsos positivos contrato mantido 22/22 checagens 8min US$ 0.03 Scorecard
- Run 2 · 496 6 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 23min US$ 0.42 Scorecard
- Run 3 · 432 6 de 13 falhas corrigidas 1 falso positivo contrato mantido 22/22 checagens 12min US$ 0.04 Scorecard
-
30
MiniMax-M3 MiniMax · esforço thinking 3 de 3 runs (462 · 616 · 434)462 de 1000 LEB Bronze
- Segurança 220/250
- Arquitetura 0/200
- Bugs 150/150
- Performance 0/150
- Código limpo 25/100
- Compatibilidade 40/100
- Explicação 27/50
Comentário e ficha
Corrigiu 8 falhas em todos os runs, com bugs em nota máxima, mas alterou valores de negócio (compatibilidade em 40 no run oficial) e deixou a consulta N+1. O segundo run fez 616; o terceiro quebrou quatro das 22 checagens de caracterização.
- Nota máxima
- Bugs
- Zero
- Arquitetura, Performance
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Um dispatcher que faz tudo; Números mágicos para status e prioridade
Run a run
- Run 1 · 462 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 4min US$ 0.12 Scorecard
- Run 2 · 616 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 6min US$ 0.10 Scorecard
- Run 3 · 434 8 de 13 falhas corrigidas 1 falso positivo 1 valor de negócio alterado 18/22 checagens 5min US$ 0.13 Scorecard
-
31
Kimi K2.7 Code Moonshot AI · esforço padrão (não configurável) 3 de 3 runs (415 · 415 · 512)415 de 1000 LEB Bronze
- Segurança 203/250
- Arquitetura 0/200
- Bugs 86/150
- Performance 0/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 26/50
Comentário e ficha
Deixou a consulta N+1 em todos os runs e relatou falhas inexistentes nos três, injeção de SQL em funções que só recebem inteiros entre elas. O terceiro run, 512, corrigiu uma falha a mais que os outros dois.
- Nota máxima
- Compatibilidade
- Zero
- Arquitetura, Performance, Código limpo
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Uma query por chamado para o técnico (N+1); Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 415 6 de 13 falhas corrigidas 2 falsos positivos contrato mantido 22/22 checagens 14min US$ 0.48 Scorecard
- Run 2 · 415 6 de 13 falhas corrigidas 1 falso positivo contrato mantido 22/22 checagens 4min US$ 0.25 Scorecard
- Run 3 · 512 7 de 13 falhas corrigidas 2 falsos positivos contrato mantido 22/22 checagens 15min US$ 0.81 Scorecard
-
32
GPT-5.3-Codex OpenAI · esforço xhigh 1 de 3 runs · não oficial403 de 1000 LEB Bronze
- Segurança 147/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 0/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 27/50
Comentário e ficha
Um run até agora, pelo opencode: 403, o GPT mais baixo. Encontrou 6 falhas e corrigiu 5, deixando no lugar a consulta N+1, a fixação de sessão no login e o MD5, sem nenhum falso positivo.
- Nota máxima
- Compatibilidade
- Zero
- Arquitetura, Performance, Código limpo
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Session fixation no login; Senhas em MD5 sem salt; Segredos fixos na configuração; Uma query por chamado para o técnico (N+1); Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 403 5 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 7min US$ 0.54 Scorecard
-
33
Kimi K2.7 Code (highspeed) Moonshot AI · esforço padrão (não configurável) 3 de 3 runs (402 · 363 · 402) sem corte ou lançamento anterior publicado402 de 1000 LEB Bronze
- Segurança 155/250
- Arquitetura 0/200
- Bugs 129/150
- Performance 0/150
- Código limpo 25/100
- Compatibilidade 70/100
- Explicação 23/50
Comentário e ficha
A variante rápida do Kimi K2.7 Code, 13 pontos abaixo dele: 5 falhas corrigidas em todos os runs, duas falhas inexistentes relatadas em cada um, e a consulta N+1 sempre no lugar.
- Zero
- Arquitetura, Performance
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Session fixation no login; Senhas em MD5 sem salt; Segredos fixos na configuração; Uma query por chamado para o técnico (N+1); Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 402 5 de 13 falhas corrigidas 2 falsos positivos 1 valor de negócio alterado 22/22 checagens 2min US$ 0.38 Scorecard
- Run 2 · 363 5 de 13 falhas corrigidas 2 falsos positivos 1 valor de negócio alterado 22/22 checagens 7min US$ 0.68 Scorecard
- Run 3 · 402 5 de 13 falhas corrigidas 2 falsos positivos contrato mantido 22/22 checagens 10min US$ 1.16 Scorecard
-
34
GLM-5.2 Z.AI · esforço high 1 de 3 runs · não oficial388 de 1000 Reprovada
- Segurança 172/250
- Arquitetura 0/200
- Bugs 86/150
- Performance 0/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 30/50
Comentário e ficha
Um run até agora: 388, abaixo da linha de aprovação e 233 pontos sob o GLM-5.3. Deixou no lugar a consulta N+1, o arquivo não fechado e a fixação de sessão; o que relatou estava certo, sem falso positivo.
- Nota máxima
- Compatibilidade
- Zero
- Arquitetura, Performance, Código limpo
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Session fixation no login; Senhas em MD5 sem salt; Arquivo deixado aberto no caminho de erro; Uma query por chamado para o técnico (N+1); Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 388 5 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 6min US$ 0.35 Scorecard
-
35
Nex N2.5 Pro Nex AGI · esforço high 2 de 3 runs (317 · 428) · não oficial sem corte ou lançamento anterior publicado317 de 1000 Reprovada
- Segurança 194/250
- Arquitetura 0/200
- Bugs 107/150
- Performance 75/150
- Código limpo 0/100
- Compatibilidade 70/100
- Explicação 31/50
Comentário e ficha
Lento demais para fechar três runs: 10h 03min e 19h 35min, e um terceiro anulado depois de mais de 21 horas, quando a conexão do operador caiu; fica com dois e publica o menor. Os dois runs foram fortes em segurança e os dois quebraram o contrato: o primeiro fez toda função não devolver nada sem usuário logado (8 checagens, −160, 317), o segundo fez a exportação CSV lançar exceção para quem já imprimiu saída (3 checagens, 428).
- Zero
- Arquitetura, Código limpo
- Nunca corrigiu, em nenhum run
- Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
-
36
Claude Haiku 4.5 Anthropic · esforço padrão (não configurável) 3 de 3 runs (317 · 369 · 232)317 de 1000 Reprovada
- Segurança 138/250
- Arquitetura 0/200
- Bugs 86/150
- Performance 0/150
- Código limpo 0/100
- Compatibilidade 70/100
- Explicação 23/50
Comentário e ficha
O Claude pequeno, a US$ 0,21 a 0,40 por run, abaixo da linha de aprovação nos três. A correção de visibilidade do primeiro run esconde os chamados do próprio cliente, ao comparar um inteiro com a string que o mysqli devolve; o terceiro quebrou três checagens de caracterização.
- Zero
- Arquitetura, Performance, Código limpo
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Session fixation no login; Senhas em MD5 sem salt; Arquivo deixado aberto no caminho de erro; Uma query por chamado para o técnico (N+1); Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
- Run 1 · 317 4 de 13 falhas corrigidas 2 falsos positivos 1 valor de negócio alterado 22/22 checagens 3min US$ 0.21 Scorecard
- Run 2 · 369 5 de 13 falhas corrigidas 2 falsos positivos contrato mantido 22/22 checagens 7min US$ 0.40 Scorecard
- Run 3 · 232 5 de 13 falhas corrigidas 1 falso positivo 1 valor de negócio alterado 19/22 checagens 10min US$ 0.27 Scorecard
-
37
DeepSeek V4 Flash DeepSeek · esforço high 2 de 3 runs (612 · 282) · não oficial sem corte ou lançamento anterior publicado282 de 1000 Reprovada
- Segurança 99/250
- Arquitetura 0/200
- Bugs 96/150
- Performance 0/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 22/50
Comentário e ficha
Dois runs que mal poderiam ser mais diferentes: o primeiro corrigiu 9 falhas e fez 612; a correção de injeção de SQL do segundo quebra toda busca e o CSV do cliente sai numa linha só, 282. Publica o menor; não é certo quais pesos os provedores serviram com esse nome.
- Nota máxima
- Compatibilidade
- Zero
- Arquitetura, Performance, Código limpo
- Nunca corrigiu, em nenhum run
- Injeção de fórmula no CSV exportado; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
Run a run
Falha por falha
O que cada agente achou e corrigiu entre as falhas plantadas. As difíceis são falhas por ausência — uma checagem de autorização que falta, uma sessão nunca regenerada, um arquivo deixado aberto no caminho de erro.
A tabela mostra os 10 primeiros de 37 agentes. O resultado de cada agente, falha por falha, está no scorecard dele.
- corrigida
- achada, não corrigida
- não achada
| Falha | Claude Sonnet 5.5 · xhigh | Claude Sonnet 5.5 · max | Claude Sonnet 5.5 · max (ultracode) | Claude Fable 5.1 | Claude Opus 5.5 | GPT-6-astra · ultra | GPT-6.1-sol · xhigh | GPT-6.1-sol pro | Grok 4.7 · high | Grok 4.6 |
|---|---|---|---|---|---|---|---|---|---|---|
| SQL injection na busca | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida |
| XSS refletido na busca | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida |
| Injeção de fórmula no CSV exportado | 6/6 corrigida | 6/6 corrigida | 6/6 corrigida | 2/6 achada, não corrigida | 2/6 achada, não corrigida | 6/6 corrigida | 6/6 corrigida | 2/6 achada, não corrigida | 6/6 corrigida | 0/6 não achada |
| Session fixation no login | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida |
| Senhas em MD5 sem salt | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 3/8 achada, não corrigida | 8/8 corrigida | 8/8 corrigida | 3/8 achada, não corrigida | 3/8 achada, não corrigida |
| Segredos fixos na configuração | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 3/8 achada, não corrigida | 6/8 achada, não corrigida |
| Qualquer chamado legível pelo id (IDOR) | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 10/10 corrigida | 9/10 corrigida | 9/10 corrigida | 9/10 corrigida | 10/10 corrigida | 10/10 corrigida |
| Divisão por zero na média de SLA | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida |
| Arquivo deixado aberto no caminho de erro | 5/6 corrigida | 6/6 corrigida | 4/6 corrigida | 5/6 corrigida | 5/6 corrigida | 4/6 corrigida | 4/6 corrigida | 5/6 corrigida | 5/6 corrigida | 4/6 corrigida |
| Uma query por chamado para o técnico (N+1) | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida |
| Um dispatcher que faz tudo | 2/10 achada, não corrigida | 1/10 achada, não corrigida | 0/10 não achada | 0/10 não achada | 4/10 achada, não corrigida | 2/10 achada, não corrigida | 2/10 achada, não corrigida | 0/10 não achada | 0/10 não achada | 0/10 não achada |
| Números mágicos para status e prioridade | 0/6 não achada | 0/6 não achada | 0/6 não achada | 0/6 não achada | 0/6 não achada | 0/6 não achada | 0/6 não achada | 0/6 não achada | 0/6 não achada | 0/6 não achada |
| Quatro níveis de if aninhado | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 8/8 corrigida | 0/8 não achada | 2/8 achada, não corrigida | 0/8 não achada | 2/8 achada, não corrigida | 0/8 não achada | 2/8 achada, não corrigida |
O que chamou atenção
- Seis agentes corrigiram a injeção de fórmula no CSV (SEC-008) — o Sonnet 5.5 nas três configurações, GPT-6.1-sol, GPT-5.6-sol e Grok 4.7 — com a correção que o gabarito espera; o Sonnet 5.5 é o único modelo com segurança em 250 de 250, nas três configurações. O GPT-5.6-sol também transformou o
-de um chamado sem técnico em'-, um bug novo (−15). - Arquitetura foi a categoria mais fraca de todos: 50 de 200 para o Opus 5.5, 25 para o Sonnet 5.5 em xhigh e para o GPT-6.1-sol, 12 para o Sonnet 5.5 em max, e 0 para os outros vinte e oito. Ninguém separou o dispatcher que faz tudo; esses três o apontaram e decidiram não reestruturá-lo.
- Dois runs publicados quebraram o contrato mecanicamente. Os trinta e sete ficaram no mysqli e não reportaram nenhuma isca, e trinta e cinco mantiveram as 22 checagens de caracterização verdes; o DeepSeek V4 Flash publica um run cuja busca lança exceção, e o Nex N2.5 Pro um cujas funções não devolvem nada sem um usuário logado (8 checagens quebradas, −160). O que separou os demais foi julgamento: vinte e quatro mantiveram compatibilidade em 100, e cada um dos outros treze mudou ao menos um valor de negócio (−30 cada), quase sempre a média de SLA, recortada por cliente.
- Vinte e seis notas são oficiais: o Claude Sonnet 5.5 em xhigh, 809 (runs de 825, 809 e 724), o Claude Sonnet 5.5 em max, 807 (807, 773 e 820), o Claude Sonnet 5.5 em max no modo multiagente, 774 (774, 820 e 759), o Claude Opus 5.5, 717 (711, 717 e 805), o GPT-6.1-sol, 661 (666, 653 e 661), o GPT-6.1-sol em ultra, 616 (597, 656 e 616), o Grok 4.7, 638 (638, 663 e 607), o Grok 4.6, 633 (633, 640 e 620), o Grok 4.7 em xhigh, 631 (640, 617 e 631), o GPT-6-astra em ultra, 666 (668, 666 e 651), o Kimi K3 em high, 629 (629, 634 e 574), o GPT-6-astra, 628 (661, 596 e 628), o GPT-5.6-terra, 625 (625, 611 e 645), o GLM-5.3 Prime, 628 (635, 628 e 541), o GLM-5.3, 621 (629, 621 e 604), o DeepSeek V4.1 Flash, 612 (625, 612 e 597), o GPT-5.6-sol, 612 (612, 612 e 608), o GPT-5.6-luna, 601 (599, 601 e 624), o Gemini 3.8 Flash em high, 588 (687, 588 e 100), o GPT-5.5, 558 (558, 568 e 536), o DeepSeek V4 Pro, 496 (604, 496 e 432), o MiniMax-M3 com a variante thinking, 462 (462, 616 e 434), o Kimi K2.7 Code, 415 (415, 415 e 512), o Kimi K2.7 Code highspeed, 402 (402, 363 e 402), o Gemini 3.7 Flash em high, 587 (587, 587 e 556), e o Claude Haiku 4.5, 317 (317, 369 e 232), cada uma a mediana de três runs. Um run sozinho pode ficar mais de 100 pontos longe da mediana: o terceiro do Opus fez 805, o terceiro do Sonnet 724, o primeiro do DeepSeek V4 Pro 604, o terceiro do Gemini 3.8 Flash, que parou após dez minutos, 100, e o primeiro do astra, 661, o tinha posto em 5º, por decisões como quais falhas deixar sem correção. O Claude Fable 5.1 tem dois runs, 781 e 764, e publica o menor, em 4º
- O Gemini 3.8 Flash em high é oficial com 588, em 24º, Bronze, a mediana de três runs muito diferentes (687, 588 e 100). O Gemini 3.7 Flash, a geração anterior, é oficial com 587 (587, 587 e 556), em 25º. O primeiro run, em 6º, corrigiu 8 das 13 falhas plantadas e é o único fora dos Claude a achatar os ifs aninhados (CLN-007); o segundo corrigiu 7 e procurou o gabarito na VM, pelo nome e pelo hash citado na tarefa. O gabarito não está na VM, e a busca não trouxe nada que o run já não tivesse. O terceiro parou após dez minutos, num servidor de banco que ele mesmo subiu e que impediu o próprio comando de retornar: sem relatório, com o código intacto, pontuado como entregue. Os dois runs completos mantiveram o MD5 e os dois segredos e deixaram o export CSV entregando a tabela toda a qualquer cliente. Em esforço medium o mesmo modelo fez 550 (27º) em 4min 34s: corrigiu 6 falhas e apontou injeção de SQL em duas funções que só recebem inteiros.
- O GPT-6-astra em ultra é o agente GPT mais forte aqui, oficial com 666 (runs de 668, 666 e 651), em 6º, com dois ou três subagentes em 10 a 15 minutos. O GPT-6.1-sol vem a seguir, oficial com 661 (666, 653 e 661), em 7º, e o GPT-6.1-sol pro com 654, em 8º, com um run. O GPT-6-astra em xhigh, oficial com 628, está em 13º. O primeiro run dele corrigiu a injeção no CSV e manteve o MD5; o run oficial fez o contrário, migrou o MD5 para
password_hashe deixou a injeção no CSV como estava; o run oficial do GPT-6.1-sol corrigiu as duas - O trabalho multiagente, no melhor caso, empatou com um agente só, por muitas vezes o custo. O Claude Sonnet 5.5 no modo multiagente do Claude Code, em esforço max, fez 774 no primeiro run (7 workflows, 68 subagentes, 7h 55min, US$ 233), 820 no segundo (2 workflows, 105 subagentes, 2h, US$ 171) e 759 no terceiro (3 workflows, 145 subagentes, 3h 34min, US$ 119). É oficial com 774, em 3º, Gold. O mesmo modelo no mesmo esforço max, como agente único, levou cerca de meia hora por run e é oficial com 807 (runs de 807, 773 e 820), em 2º; em xhigh é oficial com 809. O terceiro relatório foi avaliado em 47 de 50, a melhor explicação aqui, e nenhum run mexeu na arquitetura. Em cada run alguns subagentes (nove, oito, depois sete) caíram para um Sonnet anterior depois que um classificador de segurança os interrompeu; nada de nenhuma das entregas veio deles.
- O GPT-6.1-sol em ultra é oficial 45 pontos abaixo dele mesmo em xhigh (616 contra 661), a mediana de três runs espalhados por 59 pontos (597, 656 e 616). Com três subagentes, o primeiro achou 9 das 13 falhas plantadas, manteve o MD5 e não nomeou o dispatcher; com dois, o segundo corrigiu 10, entre elas a injeção no CSV e o MD5. Cada um levou menos de meia hora, não as 8 horas do Sonnet multiagente.
- O Grok 4.7 é o modelo mais forte aqui fora da Anthropic e da OpenAI (638, 9º, Silver, oficial em três runs de 638, 663 e 607), com explicação no nível dos melhores relatórios GPT (42 de 50). No primeiro run, é também o único agente que usou a web, para ler a página do manual do PHP sobre fputcsv; a VM bloqueia o GitHub, não a web. Em xhigh, o Grok 4.7 é oficial com 631 (640, 617 e 631), em 11º, abaixo do próprio esforço high, com relatórios avaliados de 42 a 44 de 50, as melhores explicações fora da Anthropic e da OpenAI. O Grok 4.6 vem em seguida, oficial com 633 (10º; runs de 633, 640 e 620), por cerca de um oitavo do custo (US$ 0,31 contra 2,43).
- O GLM-5.3 Prime é o modelo GLM mais forte (628, 14º, Silver), oficial em três runs por dois provedores (635, 628 e 541): o primeiro corrigiu as quatro falhas cobertas por probe, a injeção no CSV entre elas, por US$ 1,69; o segundo deixou a injeção como estava. O GLM-5.3 é oficial com 621 (17º), a mediana de três runs (629, 621 e 604), os dois últimos servidos por outro provedor; o GLM-5.3-Flash faz 624 por cerca de um décimo do custo, e o GLM-5.3-FlashX 597
- O DeepSeek V4.1 Flash é o agente mais barato aqui (de US$ 0,01 a 0,04 por run; os dois últimos levaram menos de dois minutos cada) e é oficial com 612 (runs de 625, 612 e 597), em 21º. O DeepSeek V4 Flash em xhigh, pela Novita, fez 617 no primeiro run (18º). Em high, rodado por dois outros provedores, publica 282, o menor de seus dois runs (612 e 282), em último: o primeiro corrigiu oito falhas por completo, enquanto a correção de injeção de SQL do segundo lança exceção em toda busca e o CSV do cliente sai numa linha só. A DeepSeek agora direciona o nome V4 Flash para o V4.1 na própria API, então não é certo quais pesos esses provedores serviram. O DeepSeek V4 Pro, o modelo maior, é oficial com 496, a mediana de três runs por dois provedores (604, 496 e 432), todos abaixo dos 612 oficiais do DeepSeek V4.1 Flash: o primeiro dá confiança 100 a injeção de SQL em duas funções que só recebem inteiros, e os outros dois deixaram a query N+1 no lugar.
- Vinte e quatro agentes não rodaram em xhigh. O Kimi K2.7 Code (nos dois IDs da Moonshot), o Qwen3 Coder Next e o Claude Haiku 4.5 não têm ajuste de esforço e rodaram no padrão do modelo; os dois modelos Grok, os cinco modelos GLM, os três modelos DeepSeek, os Gemini 3.8 e 3.7 Flash e o Nex N2.5 Pro rodaram em high, no opencode, e o Gemini 3.8 Flash também em medium; o MiniMax-M3 rodou no opencode com a variante thinking e o Kimi K3 com a variante high; o Sonnet 5.5 rodou duas vezes em max, uma delas no modo multiagente, e o GPT-6.1-sol e o GPT-6-astra uma vez cada em ultra. Os demais rodaram em xhigh.
- Qwen3 Coder Next, DeepSeek V4 Pro, MiniMax-M3 com a variante thinking, Kimi K2.7 Code, GPT-5.3-Codex, Kimi K2.7 Code highspeed, GLM-5.2, Nex N2.5 Pro, Claude Haiku 4.5 e DeepSeek V4 Flash fecham a tabela (507, 496, 462, 415, 403, 402, 388, 317, 317 e 282; os quatro últimos abaixo da linha de aprovação). O Nex N2.5 Pro é lento demais para fechar três runs: 10h 03min e 19h 35min, os runs de agente único mais longos daqui, e um terceiro anulado depois de mais de 21 horas, então fica com dois; os dois corrigiram a maior parte das falhas de segurança, os dois quebraram o contrato, e ele publica o menor, 317 (317 e 428). O Claude Haiku 4.5 é oficial com 317 (runs de 317, 369 e 232); no primeiro, de 2,5 minutos e US$ 0,21, a correção de visibilidade dele esconde os próprios chamados de um cliente na página principal, ao comparar um inteiro com a string que o mysqli devolve. Todos menos o Qwen3 Coder Next deixaram a query N+1 no lugar. O Qwen3 Coder Next tem a explicação mais fraca (18 de 50) e a pior calibração (Brier 0,301): reportou com confiança 100 três falhas que não podem existir, entre elas injeção de SQL em duas funções que só recebem inteiros, como o Kimi K2.7 Code. Também não rodou nenhum teste.
- Do 9º ao 23º lugar a diferença é de 41 pontos (638 a 597), dentro do ruído de um run único. O GPT-5.6-terra reportou o menor número de falhas plantadas e mesmo assim ficou em 15º, pela compatibilidade e pelo que corrigiu.
- Os modelos GPT estão entre os mais bem calibrados (Brier de 0,015 ou menos): menos achados, cada um com confiança alta e quase todos reais.
Achar não é corrigir
Lado a lado, os três modelos Claude acham quase as mesmas falhas e corrigem quantidades diferentes delas. Um total só esconde qual das duas coisas está medindo.
- Eles acham quase o mesmo. No run que conta de cada um, o Sonnet 5.5 em xhigh reportou 12 das 13 falhas plantadas e o Fable 5.1 e o Opus 5.5, 11; nos oito runs somados, cada um achou 11 ou 12
- Sonnet 5.5 corrige mais, no run que conta. O run oficial dele corrigiu 11 das 13, contra 9 do run oficial do Opus e 10 do Fable. Run a run, varia: o Sonnet corrigiu 11, 11 e 8, o Opus 9 em cada um dos três, o Fable 9 e 10. Fable e Opus acharam e explicaram a injeção de fórmula no CSV e a deixaram no lugar, para proteger quem consome o arquivo; o Sonnet a corrigiu em dois dos três runs, prefixando só as células que começam uma fórmula. A vantagem de 92 pontos sobre o 717 oficial do Opus vem de código limpo (+100), não de segurança (+17); a de 45 pontos sobre o 764 do Fable vem de segurança (+17) e arquitetura (+25)
- Mais computação não mudou o padrão. Os runs dos Claude de um agente só levaram de 16 a 27 minutos cada, e os três do mesmo esforço max fizeram 807, 773 e 820. O Sonnet 5.5 no modo multiagente levou 7h 55min, 2h e 3h 34min e US$ 233, 171 e 119 para fazer 774, 820 e 759, e é oficial com 774 contra os 807 de um agente só: no melhor caso empatou com os 820 de um agente só, com as mesmas correções e uma verificação mais funda do próprio código, e em nenhum dos três runs o dispatcher chegou ao relatório.
- Como ler. Nesta tarefa os três modelos Claude enxergam os mesmos problemas; o que os separa é até onde vão para corrigi-los dentro do contrato. Na mediana, o Sonnet foi mais longe; um run sozinho pode inverter isso, como o terceiro do Sonnet. Uma tarefa, dois ou três runs por modelo: um padrão para testar, não um veredito