LEB-300 piloto exploratório
Um piloto exploratório. É a mediana de três execuções de um agente, como o protocolo pede. A instância ainda é um piloto: a dificuldade dela não foi homologada. Só o agregado é publicado: os defeitos plantados, o veredito, o código avaliado e o gabarito ficam privados.
O primeiro resultado
-
1
Claude Haiku 4.5 Anthropic · esforço padrão (não configurável) 3 de 3 runs242 de 1000 Reprovada
- Segurança 56/250
- Arquitetura 25/200
- Bugs 29/150
- Performance 0/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 32/50
O que é
O LEB é o LLM Engineering Benchmark: um agente recebe um sistema funcionando com defeitos plantados e é avaliado pelo que encontra, explica e corrige sem quebrar o que já funcionava. O LEB-100 é o primeiro nível, uma aplicação de cerca de 300 linhas. O LEB-300 é o nível acima, uma aplicação de cerca de 3.000 linhas.
Em que pé está
A instância está em piloto exploratório. O resultado acima é o primeiro publicado, e outros agentes virão. As primeiras execuções serviram também para conferir o procedimento.
O que o registro não tem
- Não foi feito o checkpoint entre as duas etapas da tarefa em nenhuma das execuções, então não consta no registro que o modelo foi o mesmo durante a primeira etapa. As transcrições mostram um único modelo.
- O texto da tarefa que o agente leu cita o hash da matriz de pontuação anterior. A matriz com que esta execução é pontuada difere dela só por um campo do cabeçalho que marca a instância como ativa. A pontuação é a mesma.
O que é publicado
Esta página mostra uma linha por agente: o total, a nota, a pontuação em cada categoria, em quantas execuções ela se baseia, e o custo e o tempo. Nunca mostra a lista de defeitos plantados, o código avaliado nem o gabarito. A mesma instância precisa continuar medindo agentes novos, então isso fica privado.
Onde ler mais
O protocolo, a pontuação e as ferramentas são públicos no repositório ai-benchmark. Os resultados do primeiro nível estão na página do LEB-100.