Pular para o conteúdo

O próximo nível, o LEB-300, está em piloto exploratório: o primeiro resultado agregado já foi publicado.

AI Benchmark · LEB

LEB-100 a instância de referência

O primeiro nível do LEB: uma aplicação PHP legada de cerca de 300 linhas, resolvida por todos os agentes abaixo a partir do mesmo pacote. Como um run funciona, como é pontuado e no que este nível difere do LEB-300 está na página Benchmark.

Resultados

Todas as entregas de uma tabela resolveram o mesmo pacote, byte a byte — o mesmo SHA-256 —, então os números se comparam em pé de igualdade.

LEB-100-A v1.1 · Painel de chamados de um provedor de internet

O painel de chamados de suporte de um provedor de internet, escrito em PHP estilo 2013: funções de acesso a dados e um index.php que roteia, autoriza e monta o HTML. Cerca de 300 linhas em PHP 8, mysqli e MySQL 8, com 13 falhas plantadas e 2 iscas.

modo A · 30 turnos edição 2026 avaliado em 2026-10-06 matriz 68088abdb7bc…
  1. 1
    Claude Sonnet 5.5 Anthropic · esforço xhigh 3 de 3 runs (825 · 809 · 724)
    809 de 1000 LEB Gold
    • Segurança 250/250
    • Arquitetura 25/200
    • Bugs 139/150
    • Performance 150/150
    • Código limpo 100/100
    • Compatibilidade 100/100
    • Explicação 45/50

    Penalidades: nenhuma Descoberta 91.7 Brier 0.033 Custo US$ 3.16 por run Scorecard

    Comentário e ficha

    O resultado mais completo de um agente só: segurança em 250 de 250 nos dois primeiros runs, desempenho com nota máxima, compatibilidade intacta e a injeção de fórmula no CSV corrigida como o gabarito espera. O terceiro run encontrou três falhas de segurança sem corrigi-las e caiu para 724; como todos os agentes, deixou o dispatcher inteiro.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Segurança, Performance, Código limpo, Compatibilidade
    Nunca corrigiu, em nenhum run
    Um dispatcher que faz tudo; Números mágicos para status e prioridade
    Run a run
    • Run 1 · 825 11 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 19min US$ 3.60 Scorecard
    • Run 2 · 809 11 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 23min US$ 2.96 Scorecard
    • Run 3 · 724 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 23min US$ 2.91 Scorecard
  2. 2
    Claude Sonnet 5.5 Anthropic · esforço max 3 de 3 runs (807 · 773 · 820)
    807 de 1000 LEB Gold
    • Segurança 250/250
    • Arquitetura 12/200
    • Bugs 150/150
    • Performance 150/150
    • Código limpo 100/100
    • Compatibilidade 100/100
    • Explicação 45/50

    Penalidades: nenhuma Descoberta 91.7 Brier 0.035 Custo US$ 5.09 por run Scorecard

    Comentário e ficha

    O mais regular entre os três primeiros: de 773 a 820 em três runs, bugs e desempenho com nota máxima em todos, nenhum falso positivo e nenhum contrato quebrado. Mais esforço que o xhigh não trouxe ganho mensurável, a cerca de uma vez e meia o custo.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Segurança, Bugs, Performance, Código limpo, Compatibilidade
    Nunca corrigiu, em nenhum run
    Um dispatcher que faz tudo; Números mágicos para status e prioridade
    Run a run
    • Run 1 · 807 11 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 27min US$ 3.86 Scorecard
    • Run 2 · 773 10 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 29min US$ 4.75 Scorecard
    • Run 3 · 820 11 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 41min US$ 6.65 Scorecard
  3. 3
    Claude Sonnet 5.5 Anthropic · esforço max (ultracode) 3 de 3 runs (774 · 820 · 759)
    774 de 1000 LEB Gold
    • Segurança 250/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 100/100
    • Compatibilidade 100/100
    • Explicação 45/50

    Penalidades: nenhuma Descoberta 87.5 Brier 0.008 Custo US$ 174.44 por run Scorecard

    Comentário e ficha

    O modo multiagente do Claude Code: de 68 a 145 subagentes e de 2h a 7h 55min por run, a US$ 119 a 233 cada, para 774, 820 e 759. No melhor caso empatou com o mesmo modelo trabalhando sozinho em meia hora, com o relatório mais bem calibrado entre os agentes Claude e a mesma arquitetura intocada.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Segurança, Performance, Código limpo, Compatibilidade
    Zero
    Arquitetura
    Nunca corrigiu, em nenhum run
    Um dispatcher que faz tudo; Números mágicos para status e prioridade
    Run a run
    • Run 1 · 774 11 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 7h 55min US$ 233.08 Scorecard
    • Run 2 · 820 11 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 2h US$ 171.18 Scorecard
    • Run 3 · 759 10 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 3h 34min US$ 119.07 Scorecard
  4. 4
    Claude Fable 5.1 Anthropic · esforço xhigh 2 de 3 runs (781 · 764) · não oficial
    764 de 1000 LEB Gold
    • Segurança 233/250
    • Arquitetura 0/200
    • Bugs 139/150
    • Performance 150/150
    • Código limpo 100/100
    • Compatibilidade 100/100
    • Explicação 42/50

    Penalidades: nenhuma Descoberta 87.5 Brier 0.021 Custo US$ 8.04 por run Scorecard

    Comentário e ficha

    Encontra tanto quanto o Sonnet (11 ou 12 das 13 falhas) e corrige menos: explicou a injeção de fórmula no CSV e a deixou no lugar de propósito, para proteger quem consome o arquivo. Dois runs até agora; o cliente trocou de modelo no meio de uma terceira tentativa, que foi anulada.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Código limpo, Compatibilidade
    Zero
    Arquitetura
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Um dispatcher que faz tudo; Números mágicos para status e prioridade
    Run a run
    • Run 1 · 781 9 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 16min Scorecard
    • Run 2 · 764 10 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 22min US$ 8.04 Scorecard
  5. 5
    Claude Opus 5.5 Anthropic · esforço xhigh 3 de 3 runs (711 · 717 · 805)
    717 de 1000 LEB Silver
    • Segurança 233/250
    • Arquitetura 50/200
    • Bugs 139/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 45/50

    Penalidades: nenhuma Descoberta 87.5 Brier 0.024 Custo US$ 2.86 por run Scorecard

    Comentário e ficha

    A maior nota de arquitetura num run oficial (50 de 200), e a maior variação entre os modelos Claude: 711 e 717, depois 805. Corrigiu 9 falhas em todos os runs e, no run que conta, não achatou os ifs aninhados; é daí que vem a distância para o Sonnet.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Compatibilidade
    Zero
    Código limpo
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Um dispatcher que faz tudo; Números mágicos para status e prioridade
    Run a run
    • Run 1 · 711 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 16min Scorecard
    • Run 2 · 717 9 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 18min US$ 3.01 Scorecard
    • Run 3 · 805 9 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 15min US$ 2.71 Scorecard
  6. 6
    GPT-6-astra OpenAI · esforço ultra 3 de 3 runs (668 · 666 · 651)
    666 de 1000 LEB Silver
    • Segurança 224/250
    • Arquitetura 25/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 25/100
    • Compatibilidade 70/100
    • Explicação 43/50

    Penalidades: nenhuma Descoberta 79.2 Brier 0.000 Scorecard

    Comentário e ficha

    O agente GPT mais forte, com dois ou três subagentes em 10 a 15 minutos por run e três runs a menos de 17 pontos um do outro. Mudou um valor de negócio em todos os runs (−30 cada), e seus relatórios estão entre os mais bem calibrados daqui (Brier 0,000).

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance
    Nunca corrigiu, em nenhum run
    Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 668 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 11min Scorecard
    • Run 2 · 666 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 15min Scorecard
    • Run 3 · 651 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 10min Scorecard
  7. 7
    GPT-6.1-sol OpenAI · esforço xhigh 3 de 3 runs (666 · 653 · 661)
    661 de 1000 LEB Silver
    • Segurança 246/250
    • Arquitetura 25/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 70/100
    • Explicação 41/50

    Penalidades: nenhuma Descoberta 75.0 Brier 0.000 Scorecard

    Comentário e ficha

    Segurança em 246 de 250, a melhor fora do Claude, com a injeção de fórmula no CSV e o MD5 corrigidos no run oficial. O que o deixa abaixo dos modelos Claude é um valor de negócio alterado em cada run (−30) e os ifs aninhados mantidos como estavam.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance
    Zero
    Código limpo
    Nunca corrigiu, em nenhum run
    Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 666 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 27min Scorecard
    • Run 2 · 653 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 26min Scorecard
    • Run 3 · 661 10 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 24min Scorecard
  8. 8
    GPT-6.1-sol pro OpenAI · esforço xhigh 1 de 3 runs · não oficial sem corte ou lançamento anterior publicado
    654 de 1000 LEB Silver
    • Segurança 228/250
    • Arquitetura 0/200
    • Bugs 139/150
    • Performance 150/150
    • Código limpo 25/100
    • Compatibilidade 70/100
    • Explicação 42/50

    Penalidades: nenhuma Descoberta 87.5 Brier 0.000 Custo US$ 1.01 por run Scorecard

    Comentário e ficha

    Um run até agora, pelo opencode, a US$ 1,01: 654, perto do GPT-6.1-sol no Codex CLI. Deixou a injeção de fórmula no CSV no lugar e alterou um valor de negócio (−30).

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance
    Zero
    Arquitetura
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 654 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 16min US$ 1.01 Scorecard
  9. 9
    Grok 4.7 xAI · esforço high 3 de 3 runs (638 · 663 · 607)
    638 de 1000 LEB Silver
    • Segurança 207/250
    • Arquitetura 0/200
    • Bugs 139/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 42/50

    Penalidades: nenhuma Descoberta 83.3 Brier 0.005 Custo US$ 2.63 por run Scorecard

    Comentário e ficha

    O modelo mais forte de fora da Anthropic e da OpenAI, com compatibilidade em 100 em dois dos três runs e relatórios em 42 de 50. Manteve as senhas em MD5 sem salt em todos os runs; no primeiro foi o único agente a consultar a web, a página do manual do PHP sobre fputcsv.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Compatibilidade
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Senhas em MD5 sem salt; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 638 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 29min US$ 2.43 Scorecard
    • Run 2 · 663 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 24min US$ 2.88 Scorecard
    • Run 3 · 607 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 26min US$ 2.57 Scorecard
  10. 10
    Grok 4.6 xAI · esforço high 3 de 3 runs (633 · 640 · 620) sem corte ou lançamento anterior publicado
    633 de 1000 LEB Silver
    • Segurança 194/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 25/100
    • Compatibilidade 100/100
    • Explicação 35/50

    Penalidades: nenhuma Descoberta 62.5 Brier 0.007 Custo US$ 0.30 por run Scorecard

    Comentário e ficha

    Quase a nota do Grok 4.7 por cerca de um oitavo do custo (US$ 0,28 a 0,31 por run), e estável: de 620 a 640, 9 falhas encontradas em cada run, nenhum contrato quebrado. Nunca mexeu no MD5 nem na injeção de fórmula no CSV.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Compatibilidade
    Zero
    Arquitetura
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 633 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 6min US$ 0.31 Scorecard
    • Run 2 · 640 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 5min US$ 0.31 Scorecard
    • Run 3 · 620 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 6min US$ 0.28 Scorecard
  11. 11
    Grok 4.7 xAI · esforço xhigh 3 de 3 runs (640 · 617 · 631)
    631 de 1000 LEB Silver
    • Segurança 185/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 25/100
    • Compatibilidade 100/100
    • Explicação 42/50

    Penalidades: nenhuma Descoberta 75.0 Brier 0.001 Custo US$ 3.57 por run Scorecard

    Comentário e ficha

    Mais esforço rendeu um pouco menos que o Grok 4.7 em high, a um custo maior: corrigiu 7 ou 8 falhas por run e deixou o MD5 e os segredos no código em todos. Os relatórios, de 42 a 44 de 50, são as melhores explicações de fora da Anthropic e da OpenAI.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Compatibilidade
    Zero
    Arquitetura
    Nunca corrigiu, em nenhum run
    Senhas em MD5 sem salt; Segredos fixos na configuração; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 640 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 37min US$ 3.82 Scorecard
    • Run 2 · 617 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 29min US$ 3.59 Scorecard
    • Run 3 · 631 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 33min US$ 3.31 Scorecard
  12. 12
    Kimi K3 Moonshot AI · esforço high 3 de 3 runs (629 · 634 · 574) sem corte ou lançamento anterior publicado
    629 de 1000 LEB Silver
    • Segurança 198/250
    • Arquitetura 0/200
    • Bugs 150/150
    • Performance 150/150
    • Código limpo 25/100
    • Compatibilidade 70/100
    • Explicação 36/50

    Penalidades: nenhuma Descoberta 75.0 Brier 0.008 Custo US$ 0.75 por run Scorecard

    Comentário e ficha

    O Kimi mais forte, com folga, com bugs e desempenho em nota máxima no run oficial, por US$ 0,41 a 1,02 por run. Todos os runs alteraram um valor de negócio (−30), e nenhum corrigiu a injeção de fórmula no CSV.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Bugs, Performance
    Zero
    Arquitetura
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 629 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 7min US$ 0.41 Scorecard
    • Run 2 · 634 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 21min US$ 1.02 Scorecard
    • Run 3 · 574 7 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 15min US$ 0.81 Scorecard
  13. 13
    GPT-6-astra OpenAI · esforço xhigh 3 de 3 runs (661 · 596 · 628)
    628 de 1000 LEB Silver
    • Segurança 228/250
    • Arquitetura 0/200
    • Bugs 139/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 70/100
    • Explicação 41/50

    Penalidades: nenhuma Descoberta 83.3 Brier 0.002 Scorecard

    Comentário e ficha

    O GPT-6-astra como agente único, 38 pontos abaixo do ajuste ultra. Os runs discordam sobre o que corrigir: o primeiro corrigiu a injeção de fórmula no CSV e manteve o MD5; o oficial migrou o MD5 para password_hash e deixou a injeção.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 661 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 17min Scorecard
    • Run 2 · 596 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 12min Scorecard
    • Run 3 · 628 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 14min Scorecard
  14. 14
    GLM-5.3 Prime Z.AI · esforço high 3 de 3 runs (635 · 628 · 541) sem corte ou lançamento anterior publicado
    628 de 1000 LEB Silver
    • Segurança 211/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 38/50

    Penalidades: nenhuma Descoberta 70.8 Brier 0.029 Custo US$ 1.86 por run Scorecard

    Comentário e ficha

    O GLM mais forte, a cerca de US$ 2 por run. O primeiro run corrigiu as quatro falhas cobertas pelas sondas, a injeção de fórmula no CSV entre elas; o terceiro alterou dois valores de negócio e caiu para 541.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Compatibilidade
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Senhas em MD5 sem salt; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 635 9 de 13 falhas corrigidas 1 falso positivo contrato mantido 22/22 checagens 15min US$ 1.69 Scorecard
    • Run 2 · 628 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 26min US$ 2.13 Scorecard
    • Run 3 · 541 7 de 13 falhas corrigidas nenhum falso positivo 2 valores de negócio alterados 22/22 checagens 17min US$ 1.77 Scorecard
  15. 15
    GPT-5.6-terra OpenAI · esforço xhigh 3 de 3 runs (625 · 611 · 645)
    625 de 1000 LEB Silver
    • Segurança 211/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 35/50

    Penalidades: nenhuma Descoberta 45.8 Brier 0.000 Scorecard

    Comentário e ficha

    Relata menos falhas do que corrige: o primeiro run listou 7 e corrigiu 9, o resto feito de passagem, sem uma palavra no relatório. A compatibilidade se manteve em dois dos três runs, o que o deixa em 15º apesar do relatório curto.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Compatibilidade
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 625 9 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 8min Scorecard
    • Run 2 · 611 10 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 8min Scorecard
    • Run 3 · 645 10 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 7min Scorecard
  16. 16
    GLM-5.3-Flash Z.AI · esforço high 1 de 3 runs · não oficial sem corte ou lançamento anterior publicado
    624 de 1000 LEB Silver
    • Segurança 211/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 34/50

    Penalidades: nenhuma Descoberta 70.8 Brier 0.016 Custo US$ 0.08 por run Scorecard

    Comentário e ficha

    Um run até agora: 624 por US$ 0,08, cerca de um décimo do custo do GLM-5.3 para uma nota um pouco maior. Deixou a injeção de fórmula no CSV e os segredos no código.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Compatibilidade
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Segredos fixos na configuração; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 624 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 15min US$ 0.08 Scorecard
  17. 17
    GLM-5.3 Z.AI · esforço high 3 de 3 runs (629 · 621 · 604) sem corte ou lançamento anterior publicado
    621 de 1000 LEB Silver
    • Segurança 203/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 39/50

    Penalidades: nenhuma Descoberta 70.8 Brier 0.014 Custo US$ 0.57 por run Scorecard

    Comentário e ficha

    Estável (de 604 a 629) e barato (US$ 0,47 a 0,73 por run), com compatibilidade em 100 nos três runs. Nunca corrigiu o MD5 nem a injeção de fórmula no CSV.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Compatibilidade
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 629 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 17min US$ 0.73 Scorecard
    • Run 2 · 621 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 15min US$ 0.51 Scorecard
    • Run 3 · 604 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 13min US$ 0.47 Scorecard
  18. 18
    DeepSeek V4 Flash DeepSeek · esforço xhigh 1 de 3 runs · não oficial sem corte ou lançamento anterior publicado
    617 de 1000 LEB Silver
    • Segurança 207/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 31/50

    Penalidades: nenhuma Descoberta 58.3 Brier 0.004 Custo US$ 0.18 por run Scorecard

    Comentário e ficha

    Um run até agora, pela Novita: 617 por US$ 0,18, contra 282 do mesmo modelo em high. Corrigiu 7 falhas e deixou no lugar a injeção no CSV, o MD5 e os segredos no código.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Compatibilidade
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Segredos fixos na configuração; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 617 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 28min US$ 0.18 Scorecard
  19. 19
    GPT-6.1-sol OpenAI · esforço ultra 3 de 3 runs (597 · 656 · 616)
    616 de 1000 LEB Silver
    • Segurança 228/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 70/100
    • Explicação 39/50

    Penalidades: nenhuma Descoberta 70.8 Brier 0.001 Scorecard

    Comentário e ficha

    O esforço ultra ficou 45 pontos abaixo do GPT-6.1-sol em xhigh, com runs de 597 a 656. Com três subagentes, o primeiro run manteve o MD5; com dois, o segundo corrigiu 10 falhas, a injeção de fórmula no CSV e o MD5 entre elas.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 597 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 24min Scorecard
    • Run 2 · 656 10 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 13min Scorecard
    • Run 3 · 616 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 11min Scorecard
  20. 20
    GPT-5.6-sol OpenAI · esforço xhigh 3 de 3 runs (612 · 612 · 608)
    612 de 1000 LEB Silver
    • Segurança 246/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 70/100
    • Explicação 32/50

    Penalidades: -15 Descoberta 70.8 Brier 0.001 Scorecard

    Comentário e ficha

    Segurança em 246 de 250 e a injeção de fórmula no CSV corrigida, mas a correção também transformou o '-' de um chamado sem técnico em "'-", um bug novo, e todo run alterou um valor de negócio (−30). O GPT mais repetível: de 608 a 612.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 612 10 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 7min Scorecard
    • Run 2 · 612 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 15min Scorecard
    • Run 3 · 608 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 15min Scorecard
  21. 21
    DeepSeek V4.1 Flash DeepSeek · esforço high 3 de 3 runs (625 · 612 · 597) sem corte ou lançamento anterior publicado
    612 de 1000 LEB Silver
    • Segurança 203/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 30/50

    Penalidades: nenhuma Descoberta 58.3 Brier 0.013 Custo US$ 0.02 por run Scorecard

    Comentário e ficha

    O agente mais barato daqui, US$ 0,01 a 0,04 por run, dois deles em menos de dois minutos, para 597 a 625. A compatibilidade se manteve nos três; a menor nota de explicação entre os agentes acima de 600 (30 de 50).

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Compatibilidade
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Senhas em MD5 sem salt; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 625 9 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 9min US$ 0.04 Scorecard
    • Run 2 · 612 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 1min US$ 0.01 Scorecard
    • Run 3 · 597 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 1min US$ 0.02 Scorecard
  22. 22
    GPT-5.6-luna OpenAI · esforço xhigh 3 de 3 runs (599 · 601 · 624)
    601 de 1000 LEB Silver
    • Segurança 220/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 70/100
    • Explicação 32/50

    Penalidades: nenhuma Descoberta 58.3 Brier 0.000 Scorecard

    Comentário e ficha

    O menor GPT-5.6, a até 24 pontos do terra e do sol, com runs de 599 a 624. Alterou um valor de negócio em cada run (−30).

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 599 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 12min Scorecard
    • Run 2 · 601 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 10min Scorecard
    • Run 3 · 624 10 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 14min Scorecard
  23. 23
    GLM-5.3-FlashX Z.AI · esforço high 1 de 3 runs · não oficial sem corte ou lançamento anterior publicado
    597 de 1000 LEB Bronze
    • Segurança 185/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 33/50

    Penalidades: nenhuma Descoberta 70.8 Brier 0.015 Custo US$ 0.10 por run Scorecard

    Comentário e ficha

    Um run até agora: 597 por US$ 0,10, 27 pontos abaixo do GLM-5.3-Flash. Corrigiu 7 falhas e deixou a injeção no CSV, o MD5 e os segredos no código.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Compatibilidade
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Segredos fixos na configuração; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 597 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 9min US$ 0.10 Scorecard
  24. 24
    Gemini 3.8 Flash Google · esforço high 3 de 3 runs (687 · 588 · 100) sem corte ou lançamento anterior publicado
    588 de 1000 LEB Bronze
    • Segurança 181/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 28/50

    Penalidades: nenhuma Descoberta 58.3 Brier 0.003 Custo US$ 0.71 por run Scorecard

    Comentário e ficha

    Três runs muito diferentes: 687 (que o colocaria em 6º), 588, e 100 de um run que parou após dez minutos, num servidor de banco que ele mesmo subiu. Os dois runs completos mantiveram o MD5 e os dois segredos e deixaram a exportação CSV servindo qualquer cliente.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Compatibilidade
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Segredos fixos na configuração; Um dispatcher que faz tudo; Números mágicos para status e prioridade
    Run a run
    • Run 1 · 687 8 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 13min US$ 1.00 Scorecard
    • Run 2 · 588 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 25min US$ 0.85 Scorecard
    • Run 3 · 100 0 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 10min US$ 0.28 Scorecard
  25. 25
    Gemini 3.7 Flash Google · esforço high 3 de 3 runs (587 · 587 · 556) sem corte ou lançamento anterior publicado
    587 de 1000 LEB Bronze
    • Segurança 181/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 27/50

    Penalidades: nenhuma Descoberta 58.3 Brier 0.002 Custo US$ 0.60 por run Scorecard

    Comentário e ficha

    A geração anterior ao Gemini 3.8 Flash, um ponto atrás dele e bem mais estável (de 556 a 587). O primeiro run é o único fora do Claude a achatar os ifs aninhados; o segundo procurou o gabarito na VM, que não está lá.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Compatibilidade
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Segredos fixos na configuração; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 587 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 12min US$ 0.72 Scorecard
    • Run 2 · 587 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 16min US$ 0.60 Scorecard
    • Run 3 · 556 7 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 7min US$ 0.49 Scorecard
  26. 26
    GPT-5.5 OpenAI · esforço xhigh 3 de 3 runs (558 · 568 · 536)
    558 de 1000 LEB Bronze
    • Segurança 177/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 70/100
    • Explicação 32/50

    Penalidades: nenhuma Descoberta 58.3 Brier 0.006 Scorecard

    Comentário e ficha

    A geração anterior do GPT, de 43 a 108 pontos abaixo dos modelos GPT-5.6 e GPT-6: 8 falhas encontradas e 7 corrigidas em todos os runs, com o MD5 e a injeção de fórmula no CSV sempre no lugar.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 2 · 558 7 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 6min Scorecard
    • Run 3 · 568 7 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 5min Scorecard
    • Run 4 · 536 7 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 5min Scorecard
  27. 27
    Gemini 3.8 Flash Google · esforço medium 1 de 3 runs · não oficial sem corte ou lançamento anterior publicado
    550 de 1000 LEB Bronze
    • Segurança 147/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 24/50

    Penalidades: nenhuma Descoberta 45.8 Brier 0.201 Custo US$ 0.19 por run Scorecard

    Comentário e ficha

    Um run até agora, em 4min 34s por US$ 0,19: 550. Corrigiu 6 falhas e apontou injeção de SQL em duas funções que só recebem inteiros.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Compatibilidade
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Session fixation no login; Senhas em MD5 sem salt; Segredos fixos na configuração; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 550 6 de 13 falhas corrigidas 2 falsos positivos contrato mantido 22/22 checagens 5min US$ 0.19 Scorecard
  28. 28
    Qwen3 Coder Next Alibaba (Qwen team) · esforço padrão (não configurável) 1 de 3 runs · não oficial
    507 de 1000 LEB Bronze
    • Segurança 125/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 150/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 18/50

    Penalidades: -15 Descoberta 54.2 Brier 0.301 Custo US$ 1.53 por run Scorecard

    Comentário e ficha

    A explicação mais fraca (18 de 50) e a pior calibração daqui: três falhas que não existem relatadas com confiança 100, e nenhum teste executado. Por outro lado, é o único dos nove últimos que corrigiu a consulta N+1.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Performance, Compatibilidade
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    XSS refletido na busca; Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Segredos fixos na configuração; Qualquer chamado legível pelo id (IDOR); Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 507 5 de 13 falhas corrigidas 3 falsos positivos contrato mantido 22/22 checagens 16min US$ 1.53 Scorecard
  29. 29
    DeepSeek V4 Pro DeepSeek · esforço high 3 de 3 runs (604 · 496 · 432) sem corte ou lançamento anterior publicado
    496 de 1000 LEB Bronze
    • Segurança 181/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 56/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 30/50

    Penalidades: nenhuma Descoberta 58.3 Brier 0.026 Custo US$ 0.16 por run Scorecard

    Comentário e ficha

    O DeepSeek maior: os três runs (604, 496 e 432) ficam abaixo dos 612 oficiais do DeepSeek V4.1 Flash. O primeiro apontou injeção de SQL com confiança 100 em duas funções que só recebem inteiros; os outros dois deixaram a consulta N+1 no lugar.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Compatibilidade
    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 604 8 de 13 falhas corrigidas 2 falsos positivos contrato mantido 22/22 checagens 8min US$ 0.03 Scorecard
    • Run 2 · 496 6 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 23min US$ 0.42 Scorecard
    • Run 3 · 432 6 de 13 falhas corrigidas 1 falso positivo contrato mantido 22/22 checagens 12min US$ 0.04 Scorecard
  30. 30
    MiniMax-M3 MiniMax · esforço thinking 3 de 3 runs (462 · 616 · 434)
    462 de 1000 LEB Bronze
    • Segurança 220/250
    • Arquitetura 0/200
    • Bugs 150/150
    • Performance 0/150
    • Código limpo 25/100
    • Compatibilidade 40/100
    • Explicação 27/50

    Penalidades: nenhuma Descoberta 62.5 Brier 0.021 Custo US$ 0.12 por run Scorecard

    Comentário e ficha

    Corrigiu 8 falhas em todos os runs, com bugs em nota máxima, mas alterou valores de negócio (compatibilidade em 40 no run oficial) e deixou a consulta N+1. O segundo run fez 616; o terceiro quebrou quatro das 22 checagens de caracterização.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Bugs
    Zero
    Arquitetura, Performance
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Um dispatcher que faz tudo; Números mágicos para status e prioridade
    Run a run
    • Run 1 · 462 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 4min US$ 0.12 Scorecard
    • Run 2 · 616 8 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 6min US$ 0.10 Scorecard
    • Run 3 · 434 8 de 13 falhas corrigidas 1 falso positivo 1 valor de negócio alterado 18/22 checagens 5min US$ 0.13 Scorecard
  31. 31
    Kimi K2.7 Code Moonshot AI · esforço padrão (não configurável) 3 de 3 runs (415 · 415 · 512)
    415 de 1000 LEB Bronze
    • Segurança 203/250
    • Arquitetura 0/200
    • Bugs 86/150
    • Performance 0/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 26/50

    Penalidades: nenhuma Descoberta 50.0 Brier 0.225 Custo US$ 0.51 por run Scorecard

    Comentário e ficha

    Deixou a consulta N+1 em todos os runs e relatou falhas inexistentes nos três, injeção de SQL em funções que só recebem inteiros entre elas. O terceiro run, 512, corrigiu uma falha a mais que os outros dois.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Compatibilidade
    Zero
    Arquitetura, Performance, Código limpo
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Senhas em MD5 sem salt; Uma query por chamado para o técnico (N+1); Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 415 6 de 13 falhas corrigidas 2 falsos positivos contrato mantido 22/22 checagens 14min US$ 0.48 Scorecard
    • Run 2 · 415 6 de 13 falhas corrigidas 1 falso positivo contrato mantido 22/22 checagens 4min US$ 0.25 Scorecard
    • Run 3 · 512 7 de 13 falhas corrigidas 2 falsos positivos contrato mantido 22/22 checagens 15min US$ 0.81 Scorecard
  32. 32
    GPT-5.3-Codex OpenAI · esforço xhigh 1 de 3 runs · não oficial
    403 de 1000 LEB Bronze
    • Segurança 147/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 0/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 27/50

    Penalidades: nenhuma Descoberta 37.5 Brier 0.015 Custo US$ 0.54 por run Scorecard

    Comentário e ficha

    Um run até agora, pelo opencode: 403, o GPT mais baixo. Encontrou 6 falhas e corrigiu 5, deixando no lugar a consulta N+1, a fixação de sessão no login e o MD5, sem nenhum falso positivo.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Compatibilidade
    Zero
    Arquitetura, Performance, Código limpo
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Session fixation no login; Senhas em MD5 sem salt; Segredos fixos na configuração; Uma query por chamado para o técnico (N+1); Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 403 5 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 7min US$ 0.54 Scorecard
  33. 33
    Kimi K2.7 Code (highspeed) Moonshot AI · esforço padrão (não configurável) 3 de 3 runs (402 · 363 · 402) sem corte ou lançamento anterior publicado
    402 de 1000 LEB Bronze
    • Segurança 155/250
    • Arquitetura 0/200
    • Bugs 129/150
    • Performance 0/150
    • Código limpo 25/100
    • Compatibilidade 70/100
    • Explicação 23/50

    Penalidades: nenhuma Descoberta 54.2 Brier 0.216 Custo US$ 0.74 por run Scorecard

    Comentário e ficha

    A variante rápida do Kimi K2.7 Code, 13 pontos abaixo dele: 5 falhas corrigidas em todos os runs, duas falhas inexistentes relatadas em cada um, e a consulta N+1 sempre no lugar.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Zero
    Arquitetura, Performance
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Session fixation no login; Senhas em MD5 sem salt; Segredos fixos na configuração; Uma query por chamado para o técnico (N+1); Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 402 5 de 13 falhas corrigidas 2 falsos positivos 1 valor de negócio alterado 22/22 checagens 2min US$ 0.38 Scorecard
    • Run 2 · 363 5 de 13 falhas corrigidas 2 falsos positivos 1 valor de negócio alterado 22/22 checagens 7min US$ 0.68 Scorecard
    • Run 3 · 402 5 de 13 falhas corrigidas 2 falsos positivos contrato mantido 22/22 checagens 10min US$ 1.16 Scorecard
  34. 34
    GLM-5.2 Z.AI · esforço high 1 de 3 runs · não oficial
    388 de 1000 Reprovada
    • Segurança 172/250
    • Arquitetura 0/200
    • Bugs 86/150
    • Performance 0/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 30/50

    Penalidades: nenhuma Descoberta 50.0 Brier 0.001 Custo US$ 0.35 por run Scorecard

    Comentário e ficha

    Um run até agora: 388, abaixo da linha de aprovação e 233 pontos sob o GLM-5.3. Deixou no lugar a consulta N+1, o arquivo não fechado e a fixação de sessão; o que relatou estava certo, sem falso positivo.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Compatibilidade
    Zero
    Arquitetura, Performance, Código limpo
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Session fixation no login; Senhas em MD5 sem salt; Arquivo deixado aberto no caminho de erro; Uma query por chamado para o técnico (N+1); Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 388 5 de 13 falhas corrigidas nenhum falso positivo contrato mantido 22/22 checagens 6min US$ 0.35 Scorecard
  35. 35
    Nex N2.5 Pro Nex AGI · esforço high 2 de 3 runs (317 · 428) · não oficial sem corte ou lançamento anterior publicado
    317 de 1000 Reprovada
    • Segurança 194/250
    • Arquitetura 0/200
    • Bugs 107/150
    • Performance 75/150
    • Código limpo 0/100
    • Compatibilidade 70/100
    • Explicação 31/50

    Penalidades: -160 Descoberta 62.5 Brier 0.000 Custo US$ 3.84 por run Scorecard

    Comentário e ficha

    Lento demais para fechar três runs: 10h 03min e 19h 35min, e um terceiro anulado depois de mais de 21 horas, quando a conexão do operador caiu; fica com dois e publica o menor. Os dois runs foram fortes em segurança e os dois quebraram o contrato: o primeiro fez toda função não devolver nada sem usuário logado (8 checagens, −160, 317), o segundo fez a exportação CSV lançar exceção para quem já imprimiu saída (3 checagens, 428).

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Zero
    Arquitetura, Código limpo
    Nunca corrigiu, em nenhum run
    Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 317 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 14/22 checagens 10h 3min US$ 2.80 Scorecard
    • Run 2 · 428 10 de 13 falhas corrigidas nenhum falso positivo 2 valores de negócio alterados 19/22 checagens 19h 35min US$ 4.87 Scorecard
  36. 36
    Claude Haiku 4.5 Anthropic · esforço padrão (não configurável) 3 de 3 runs (317 · 369 · 232)
    317 de 1000 Reprovada
    • Segurança 138/250
    • Arquitetura 0/200
    • Bugs 86/150
    • Performance 0/150
    • Código limpo 0/100
    • Compatibilidade 70/100
    • Explicação 23/50

    Penalidades: nenhuma Descoberta 37.5 Brier 0.215 Custo US$ 0.29 por run Scorecard

    Comentário e ficha

    O Claude pequeno, a US$ 0,21 a 0,40 por run, abaixo da linha de aprovação nos três. A correção de visibilidade do primeiro run esconde os chamados do próprio cliente, ao comparar um inteiro com a string que o mysqli devolve; o terceiro quebrou três checagens de caracterização.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Zero
    Arquitetura, Performance, Código limpo
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Session fixation no login; Senhas em MD5 sem salt; Arquivo deixado aberto no caminho de erro; Uma query por chamado para o técnico (N+1); Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 317 4 de 13 falhas corrigidas 2 falsos positivos 1 valor de negócio alterado 22/22 checagens 3min US$ 0.21 Scorecard
    • Run 2 · 369 5 de 13 falhas corrigidas 2 falsos positivos contrato mantido 22/22 checagens 7min US$ 0.40 Scorecard
    • Run 3 · 232 5 de 13 falhas corrigidas 1 falso positivo 1 valor de negócio alterado 19/22 checagens 10min US$ 0.27 Scorecard
  37. 37
    DeepSeek V4 Flash DeepSeek · esforço high 2 de 3 runs (612 · 282) · não oficial sem corte ou lançamento anterior publicado
    282 de 1000 Reprovada
    • Segurança 99/250
    • Arquitetura 0/200
    • Bugs 96/150
    • Performance 0/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 22/50

    Penalidades: -35 Descoberta 50.0 Brier 0.122 Custo US$ 0.04 por run Scorecard

    Comentário e ficha

    Dois runs que mal poderiam ser mais diferentes: o primeiro corrigiu 9 falhas e fez 612; a correção de injeção de SQL do segundo quebra toda busca e o CSV do cliente sai numa linha só, 282. Publica o menor; não é certo quais pesos os provedores serviram com esse nome.

    Uma leitura escrita a partir dos scorecards e vereditos; não faz parte da nota.

    Nota máxima
    Compatibilidade
    Zero
    Arquitetura, Performance, Código limpo
    Nunca corrigiu, em nenhum run
    Injeção de fórmula no CSV exportado; Um dispatcher que faz tudo; Números mágicos para status e prioridade; Quatro níveis de if aninhado
    Run a run
    • Run 1 · 612 9 de 13 falhas corrigidas nenhum falso positivo 1 valor de negócio alterado 22/22 checagens 9min US$ 0.07 Scorecard
    • Run 2 · 282 3 de 13 falhas corrigidas 1 falso positivo contrato mantido 21/22 checagens 7min US$ 0.00 Scorecard

Falha por falha

O que cada agente achou e corrigiu entre as falhas plantadas. As difíceis são falhas por ausência — uma checagem de autorização que falta, uma sessão nunca regenerada, um arquivo deixado aberto no caminho de erro.

A tabela mostra os 10 primeiros de 37 agentes. O resultado de cada agente, falha por falha, está no scorecard dele.

  • corrigida
  • achada, não corrigida
  • não achada
Falha Claude Sonnet 5.5 · xhigh Claude Sonnet 5.5 · max Claude Sonnet 5.5 · max (ultracode) Claude Fable 5.1 Claude Opus 5.5 GPT-6-astra · ultra GPT-6.1-sol · xhigh GPT-6.1-sol pro Grok 4.7 · high Grok 4.6
SQL injection na busca SEC-001 · crítica · fácil 10/10 corrigida 10/10 corrigida 10/10 corrigida 10/10 corrigida 10/10 corrigida 10/10 corrigida 10/10 corrigida 10/10 corrigida 10/10 corrigida 10/10 corrigida
XSS refletido na busca SEC-003 · alta · fácil 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida
Injeção de fórmula no CSV exportado SEC-008 · média · difícil 6/6 corrigida 6/6 corrigida 6/6 corrigida 2/6 achada, não corrigida 2/6 achada, não corrigida 6/6 corrigida 6/6 corrigida 2/6 achada, não corrigida 6/6 corrigida 0/6 não achada
Session fixation no login SEC-013 · alta · difícil 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida
Senhas em MD5 sem salt SEC-014 · alta · fácil 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 3/8 achada, não corrigida 8/8 corrigida 8/8 corrigida 3/8 achada, não corrigida 3/8 achada, não corrigida
Segredos fixos na configuração SEC-015 · alta · fácil 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 3/8 achada, não corrigida 6/8 achada, não corrigida
Qualquer chamado legível pelo id (IDOR) SEC-017 · crítica · difícil 10/10 corrigida 10/10 corrigida 10/10 corrigida 10/10 corrigida 10/10 corrigida 9/10 corrigida 9/10 corrigida 9/10 corrigida 10/10 corrigida 10/10 corrigida
Divisão por zero na média de SLA BUG-001 · alta · moderada 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida
Arquivo deixado aberto no caminho de erro BUG-004 · média · difícil 5/6 corrigida 6/6 corrigida 4/6 corrigida 5/6 corrigida 5/6 corrigida 4/6 corrigida 4/6 corrigida 5/6 corrigida 5/6 corrigida 4/6 corrigida
Uma query por chamado para o técnico (N+1) PERF-001 · alta · moderada 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida
Um dispatcher que faz tudo ARCH-002 · alta · fácil 2/10 achada, não corrigida 1/10 achada, não corrigida 0/10 não achada 0/10 não achada 4/10 achada, não corrigida 2/10 achada, não corrigida 2/10 achada, não corrigida 0/10 não achada 0/10 não achada 0/10 não achada
Números mágicos para status e prioridade ARCH-009 · baixa · moderada 0/6 não achada 0/6 não achada 0/6 não achada 0/6 não achada 0/6 não achada 0/6 não achada 0/6 não achada 0/6 não achada 0/6 não achada 0/6 não achada
Quatro níveis de if aninhado CLN-007 · média · fácil 8/8 corrigida 8/8 corrigida 8/8 corrigida 8/8 corrigida 0/8 não achada 2/8 achada, não corrigida 0/8 não achada 2/8 achada, não corrigida 0/8 não achada 2/8 achada, não corrigida

O que chamou atenção

  • Seis agentes corrigiram a injeção de fórmula no CSV (SEC-008) — o Sonnet 5.5 nas três configurações, GPT-6.1-sol, GPT-5.6-sol e Grok 4.7 — com a correção que o gabarito espera; o Sonnet 5.5 é o único modelo com segurança em 250 de 250, nas três configurações. O GPT-5.6-sol também transformou o - de um chamado sem técnico em '-, um bug novo (−15).
  • Arquitetura foi a categoria mais fraca de todos: 50 de 200 para o Opus 5.5, 25 para o Sonnet 5.5 em xhigh e para o GPT-6.1-sol, 12 para o Sonnet 5.5 em max, e 0 para os outros vinte e oito. Ninguém separou o dispatcher que faz tudo; esses três o apontaram e decidiram não reestruturá-lo.
  • Dois runs publicados quebraram o contrato mecanicamente. Os trinta e sete ficaram no mysqli e não reportaram nenhuma isca, e trinta e cinco mantiveram as 22 checagens de caracterização verdes; o DeepSeek V4 Flash publica um run cuja busca lança exceção, e o Nex N2.5 Pro um cujas funções não devolvem nada sem um usuário logado (8 checagens quebradas, −160). O que separou os demais foi julgamento: vinte e quatro mantiveram compatibilidade em 100, e cada um dos outros treze mudou ao menos um valor de negócio (−30 cada), quase sempre a média de SLA, recortada por cliente.
  • Vinte e seis notas são oficiais: o Claude Sonnet 5.5 em xhigh, 809 (runs de 825, 809 e 724), o Claude Sonnet 5.5 em max, 807 (807, 773 e 820), o Claude Sonnet 5.5 em max no modo multiagente, 774 (774, 820 e 759), o Claude Opus 5.5, 717 (711, 717 e 805), o GPT-6.1-sol, 661 (666, 653 e 661), o GPT-6.1-sol em ultra, 616 (597, 656 e 616), o Grok 4.7, 638 (638, 663 e 607), o Grok 4.6, 633 (633, 640 e 620), o Grok 4.7 em xhigh, 631 (640, 617 e 631), o GPT-6-astra em ultra, 666 (668, 666 e 651), o Kimi K3 em high, 629 (629, 634 e 574), o GPT-6-astra, 628 (661, 596 e 628), o GPT-5.6-terra, 625 (625, 611 e 645), o GLM-5.3 Prime, 628 (635, 628 e 541), o GLM-5.3, 621 (629, 621 e 604), o DeepSeek V4.1 Flash, 612 (625, 612 e 597), o GPT-5.6-sol, 612 (612, 612 e 608), o GPT-5.6-luna, 601 (599, 601 e 624), o Gemini 3.8 Flash em high, 588 (687, 588 e 100), o GPT-5.5, 558 (558, 568 e 536), o DeepSeek V4 Pro, 496 (604, 496 e 432), o MiniMax-M3 com a variante thinking, 462 (462, 616 e 434), o Kimi K2.7 Code, 415 (415, 415 e 512), o Kimi K2.7 Code highspeed, 402 (402, 363 e 402), o Gemini 3.7 Flash em high, 587 (587, 587 e 556), e o Claude Haiku 4.5, 317 (317, 369 e 232), cada uma a mediana de três runs. Um run sozinho pode ficar mais de 100 pontos longe da mediana: o terceiro do Opus fez 805, o terceiro do Sonnet 724, o primeiro do DeepSeek V4 Pro 604, o terceiro do Gemini 3.8 Flash, que parou após dez minutos, 100, e o primeiro do astra, 661, o tinha posto em 5º, por decisões como quais falhas deixar sem correção. O Claude Fable 5.1 tem dois runs, 781 e 764, e publica o menor, em 4º
  • O Gemini 3.8 Flash em high é oficial com 588, em 24º, Bronze, a mediana de três runs muito diferentes (687, 588 e 100). O Gemini 3.7 Flash, a geração anterior, é oficial com 587 (587, 587 e 556), em 25º. O primeiro run, em 6º, corrigiu 8 das 13 falhas plantadas e é o único fora dos Claude a achatar os ifs aninhados (CLN-007); o segundo corrigiu 7 e procurou o gabarito na VM, pelo nome e pelo hash citado na tarefa. O gabarito não está na VM, e a busca não trouxe nada que o run já não tivesse. O terceiro parou após dez minutos, num servidor de banco que ele mesmo subiu e que impediu o próprio comando de retornar: sem relatório, com o código intacto, pontuado como entregue. Os dois runs completos mantiveram o MD5 e os dois segredos e deixaram o export CSV entregando a tabela toda a qualquer cliente. Em esforço medium o mesmo modelo fez 550 (27º) em 4min 34s: corrigiu 6 falhas e apontou injeção de SQL em duas funções que só recebem inteiros.
  • O GPT-6-astra em ultra é o agente GPT mais forte aqui, oficial com 666 (runs de 668, 666 e 651), em 6º, com dois ou três subagentes em 10 a 15 minutos. O GPT-6.1-sol vem a seguir, oficial com 661 (666, 653 e 661), em 7º, e o GPT-6.1-sol pro com 654, em 8º, com um run. O GPT-6-astra em xhigh, oficial com 628, está em 13º. O primeiro run dele corrigiu a injeção no CSV e manteve o MD5; o run oficial fez o contrário, migrou o MD5 para password_hash e deixou a injeção no CSV como estava; o run oficial do GPT-6.1-sol corrigiu as duas
  • O trabalho multiagente, no melhor caso, empatou com um agente só, por muitas vezes o custo. O Claude Sonnet 5.5 no modo multiagente do Claude Code, em esforço max, fez 774 no primeiro run (7 workflows, 68 subagentes, 7h 55min, US$ 233), 820 no segundo (2 workflows, 105 subagentes, 2h, US$ 171) e 759 no terceiro (3 workflows, 145 subagentes, 3h 34min, US$ 119). É oficial com 774, em 3º, Gold. O mesmo modelo no mesmo esforço max, como agente único, levou cerca de meia hora por run e é oficial com 807 (runs de 807, 773 e 820), em 2º; em xhigh é oficial com 809. O terceiro relatório foi avaliado em 47 de 50, a melhor explicação aqui, e nenhum run mexeu na arquitetura. Em cada run alguns subagentes (nove, oito, depois sete) caíram para um Sonnet anterior depois que um classificador de segurança os interrompeu; nada de nenhuma das entregas veio deles.
  • O GPT-6.1-sol em ultra é oficial 45 pontos abaixo dele mesmo em xhigh (616 contra 661), a mediana de três runs espalhados por 59 pontos (597, 656 e 616). Com três subagentes, o primeiro achou 9 das 13 falhas plantadas, manteve o MD5 e não nomeou o dispatcher; com dois, o segundo corrigiu 10, entre elas a injeção no CSV e o MD5. Cada um levou menos de meia hora, não as 8 horas do Sonnet multiagente.
  • O Grok 4.7 é o modelo mais forte aqui fora da Anthropic e da OpenAI (638, 9º, Silver, oficial em três runs de 638, 663 e 607), com explicação no nível dos melhores relatórios GPT (42 de 50). No primeiro run, é também o único agente que usou a web, para ler a página do manual do PHP sobre fputcsv; a VM bloqueia o GitHub, não a web. Em xhigh, o Grok 4.7 é oficial com 631 (640, 617 e 631), em 11º, abaixo do próprio esforço high, com relatórios avaliados de 42 a 44 de 50, as melhores explicações fora da Anthropic e da OpenAI. O Grok 4.6 vem em seguida, oficial com 633 (10º; runs de 633, 640 e 620), por cerca de um oitavo do custo (US$ 0,31 contra 2,43).
  • O GLM-5.3 Prime é o modelo GLM mais forte (628, 14º, Silver), oficial em três runs por dois provedores (635, 628 e 541): o primeiro corrigiu as quatro falhas cobertas por probe, a injeção no CSV entre elas, por US$ 1,69; o segundo deixou a injeção como estava. O GLM-5.3 é oficial com 621 (17º), a mediana de três runs (629, 621 e 604), os dois últimos servidos por outro provedor; o GLM-5.3-Flash faz 624 por cerca de um décimo do custo, e o GLM-5.3-FlashX 597
  • O DeepSeek V4.1 Flash é o agente mais barato aqui (de US$ 0,01 a 0,04 por run; os dois últimos levaram menos de dois minutos cada) e é oficial com 612 (runs de 625, 612 e 597), em 21º. O DeepSeek V4 Flash em xhigh, pela Novita, fez 617 no primeiro run (18º). Em high, rodado por dois outros provedores, publica 282, o menor de seus dois runs (612 e 282), em último: o primeiro corrigiu oito falhas por completo, enquanto a correção de injeção de SQL do segundo lança exceção em toda busca e o CSV do cliente sai numa linha só. A DeepSeek agora direciona o nome V4 Flash para o V4.1 na própria API, então não é certo quais pesos esses provedores serviram. O DeepSeek V4 Pro, o modelo maior, é oficial com 496, a mediana de três runs por dois provedores (604, 496 e 432), todos abaixo dos 612 oficiais do DeepSeek V4.1 Flash: o primeiro dá confiança 100 a injeção de SQL em duas funções que só recebem inteiros, e os outros dois deixaram a query N+1 no lugar.
  • Vinte e quatro agentes não rodaram em xhigh. O Kimi K2.7 Code (nos dois IDs da Moonshot), o Qwen3 Coder Next e o Claude Haiku 4.5 não têm ajuste de esforço e rodaram no padrão do modelo; os dois modelos Grok, os cinco modelos GLM, os três modelos DeepSeek, os Gemini 3.8 e 3.7 Flash e o Nex N2.5 Pro rodaram em high, no opencode, e o Gemini 3.8 Flash também em medium; o MiniMax-M3 rodou no opencode com a variante thinking e o Kimi K3 com a variante high; o Sonnet 5.5 rodou duas vezes em max, uma delas no modo multiagente, e o GPT-6.1-sol e o GPT-6-astra uma vez cada em ultra. Os demais rodaram em xhigh.
  • Qwen3 Coder Next, DeepSeek V4 Pro, MiniMax-M3 com a variante thinking, Kimi K2.7 Code, GPT-5.3-Codex, Kimi K2.7 Code highspeed, GLM-5.2, Nex N2.5 Pro, Claude Haiku 4.5 e DeepSeek V4 Flash fecham a tabela (507, 496, 462, 415, 403, 402, 388, 317, 317 e 282; os quatro últimos abaixo da linha de aprovação). O Nex N2.5 Pro é lento demais para fechar três runs: 10h 03min e 19h 35min, os runs de agente único mais longos daqui, e um terceiro anulado depois de mais de 21 horas, então fica com dois; os dois corrigiram a maior parte das falhas de segurança, os dois quebraram o contrato, e ele publica o menor, 317 (317 e 428). O Claude Haiku 4.5 é oficial com 317 (runs de 317, 369 e 232); no primeiro, de 2,5 minutos e US$ 0,21, a correção de visibilidade dele esconde os próprios chamados de um cliente na página principal, ao comparar um inteiro com a string que o mysqli devolve. Todos menos o Qwen3 Coder Next deixaram a query N+1 no lugar. O Qwen3 Coder Next tem a explicação mais fraca (18 de 50) e a pior calibração (Brier 0,301): reportou com confiança 100 três falhas que não podem existir, entre elas injeção de SQL em duas funções que só recebem inteiros, como o Kimi K2.7 Code. Também não rodou nenhum teste.
  • Do 9º ao 23º lugar a diferença é de 41 pontos (638 a 597), dentro do ruído de um run único. O GPT-5.6-terra reportou o menor número de falhas plantadas e mesmo assim ficou em 15º, pela compatibilidade e pelo que corrigiu.
  • Os modelos GPT estão entre os mais bem calibrados (Brier de 0,015 ou menos): menos achados, cada um com confiança alta e quase todos reais.

Achar não é corrigir

Lado a lado, os três modelos Claude acham quase as mesmas falhas e corrigem quantidades diferentes delas. Um total só esconde qual das duas coisas está medindo.

  1. Eles acham quase o mesmo. No run que conta de cada um, o Sonnet 5.5 em xhigh reportou 12 das 13 falhas plantadas e o Fable 5.1 e o Opus 5.5, 11; nos oito runs somados, cada um achou 11 ou 12
  2. Sonnet 5.5 corrige mais, no run que conta. O run oficial dele corrigiu 11 das 13, contra 9 do run oficial do Opus e 10 do Fable. Run a run, varia: o Sonnet corrigiu 11, 11 e 8, o Opus 9 em cada um dos três, o Fable 9 e 10. Fable e Opus acharam e explicaram a injeção de fórmula no CSV e a deixaram no lugar, para proteger quem consome o arquivo; o Sonnet a corrigiu em dois dos três runs, prefixando só as células que começam uma fórmula. A vantagem de 92 pontos sobre o 717 oficial do Opus vem de código limpo (+100), não de segurança (+17); a de 45 pontos sobre o 764 do Fable vem de segurança (+17) e arquitetura (+25)
  3. Mais computação não mudou o padrão. Os runs dos Claude de um agente só levaram de 16 a 27 minutos cada, e os três do mesmo esforço max fizeram 807, 773 e 820. O Sonnet 5.5 no modo multiagente levou 7h 55min, 2h e 3h 34min e US$ 233, 171 e 119 para fazer 774, 820 e 759, e é oficial com 774 contra os 807 de um agente só: no melhor caso empatou com os 820 de um agente só, com as mesmas correções e uma verificação mais funda do próprio código, e em nenhum dos três runs o dispatcher chegou ao relatório.
  4. Como ler. Nesta tarefa os três modelos Claude enxergam os mesmos problemas; o que os separa é até onde vão para corrigi-los dentro do contrato. Na mediana, o Sonnet foi mais longe; um run sozinho pode inverter isso, como o terceiro do Sonnet. Uma tarefa, dois ou três runs por modelo: um padrão para testar, não um veredito

Leia isto antes de citar um número

  • Até três runs por agente. A nota oficial do LEB é a mediana de três runs independentes. Enquanto um agente não tem os três, a nota dele é o menor dos totais até aqui, os totais aparecem ao lado, e tudo o que se mostra com a nota vem desse mesmo run.
  • O juiz é uma IA. O Claude Opus 5.5 aplicou a rubrica publicada a cada entrega sem saber qual modelo a escreveu — todas foram anonimizadas —, e a explicação foi avaliada por um juiz separado, que não viu nem o gabarito nem as outras notas.
  • O juiz também é competidor. O Claude Opus 5.5 é um dos agentes avaliados, e seis dos trinta e sete são modelos Claude, o Sonnet 5.5 três vezes: ocupam os cinco primeiros lugares e o penúltimo. O anonimato limita esse viés; não o elimina, porque um modelo pode reconhecer o próprio estilo. Cada veredito é publicado com a justificativa, falha por falha, e os quatro vereditos alterados na revisão dizem por quê; um deles soma 41 pontos ao total do GPT-5.6-terra.
  • Vinte e uma tentativas ficaram sem nota, todas antes de qualquer juiz vê-las. Duas vezes, as salvaguardas do Claude Fable 5.1 interromperam uma resposta enquanto ele trabalhava nas falhas de segurança, e o cliente passou o resto do run para o Claude Opus 4.8, que escreveu o relatório inteiro; um run precisa vir de um modelo só, então as duas foram anuladas, e o Fable 5.1 mostra os seus dois runs completos. Quatro terminaram por falha do provedor antes de a entrega ficar completa: o GPT-5.6-sol pro quando o gateway ficou sem crédito, e o Gemini 3.8 Flash três vezes, num timeout do gateway e duas vezes por limite de requisições. Cinco foram montadas errado: o primeiro run multiagente do Sonnet 5.5 foi interrompido para dar mais processadores à máquina, o segundo encontrou o cliente com o login expirado e nunca chegou ao modelo, assim como o terceiro do Claude Fable 5.1, a primeira tentativa do Claude Haiku 4.5 teve o modo do cliente trocado no meio, e uma tentativa do Gemini começou fora da pasta da tarefa. Uma terminou, mas o GPT-5.6-terra rodou num cliente diferente do primeiro run e foi repetido no mesmo cliente. Seis terminaram depois de o agente já ter os seus três runs, duas do GPT-6.1-sol em xhigh, três em ultra e uma do Gemini 3.7 Flash; um quarto run deixaria escolher a nota publicada. Duas terminaram, um run do Grok 4.7 em xhigh e um do Kimi K3 em high, mas as VMs foram restauradas antes de as entregas serem copiadas, e não sobrou nada para avaliar. Uma foi cortada pela conexão do próprio operador: o terceiro run do Nex N2.5 Pro, depois de mais de 21 horas, que o operador decidiu não repetir porque o modelo é lento demais. As vinte e uma ficam guardadas no repositório.
  • O gabarito é público. A matriz de falhas da LEB-100-A está no repositório público desde 13 de julho de 2026. Os runs de 29 de setembro tiveram só o bloqueio por nome da VM, então nenhum agente conseguia buscá-la por acidente; os de 30 de setembro tiveram também os endereços do GitHub bloqueados, e os logs de sessão de todo run que deixou um não mostram nenhuma requisição ao GitHub. O que um modelo viu no treino depende de até onde vão os dados de treino dele: cada run registra o corte que o provedor publica. Sem ele, a data de lançamento do provedor serve de limite, porque um modelo não treina com dados de depois do próprio lançamento. Um modelo com corte ou lançamento posterior, ou sem nenhum dos dois, aparece marcado no placar.
  • Os testes do próprio benchmark foram corrigidos. Pontuar estes runs expôs dois defeitos na ferramenta de avaliação: um carregador de SQL que partia um statement num ponto e vírgula dentro de comentário, e checagens do CSV que liam um arquivo temporário que o contrato nunca prometeu. Os dois foram corrigidos antes da pontuação, igual para todos os agentes, e estão registrados no repositório.
  • A máquina mudou em 30 de setembro. Até então os agentes rodavam como o administrador da VM, com sudo, numa máquina que guardava o que os runs anteriores deixaram. Os logs de sessão não mostram nenhum agente lendo o trabalho de outro; os agentes do opencode compartilharam um banco de teste remanescente, que só tinha as linhas do seed. A partir do Qwen3 Coder Next, os runs são feitos por um usuário sem privilégios, numa máquina limpa antes de cada run.
  • Nem todo parâmetro dos runs foi registrado. A versão exata do modelo e a temperatura não foram, e custo e tempo de modelo só onde o cliente os guardou; os três runs que não deixaram log de sessão nenhum (o primeiro do GPT-5.5, o do MiniMax-M3 no padrão e o do Kimi K3) foram retirados em 4 de outubro de 2026 e não são publicados. O MiniMax-M3 no padrão saiu da tabela; o Kimi K3 voltou com um run registrado em high. Cada run marca o que falta, em vez de chutar.

Audite

Cada entrega, relatório mecânico, veredito e scorecard está no repositório, ao lado da especificação que os produziu. Os mesmos dados estão aqui em duas planilhas: uma linha por run, e uma por run e falha plantada.