Pular para o conteúdo
AI Benchmark · LEB

LEB-300 piloto exploratório

Um piloto exploratório. É a mediana de três execuções de um agente, como o protocolo pede. A instância ainda é um piloto: a dificuldade dela não foi homologada. Só o agregado é publicado: os defeitos plantados, o veredito, o código avaliado e o gabarito ficam privados.

O primeiro resultado

  1. 1
    Claude Haiku 4.5 Anthropic · esforço padrão (não configurável) 3 de 3 runs
    242 de 1000 Reprovada
    • Segurança 56/250
    • Arquitetura 25/200
    • Bugs 29/150
    • Performance 0/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 32/50

    Custo US$ 0.96 por run Sessão de 13.4 min

O que é

O LEB é o LLM Engineering Benchmark: um agente recebe um sistema funcionando com defeitos plantados e é avaliado pelo que encontra, explica e corrige sem quebrar o que já funcionava. O LEB-100 é o primeiro nível, uma aplicação de cerca de 300 linhas. O LEB-300 é o nível acima, uma aplicação de cerca de 3.000 linhas.

Em que pé está

A instância está em piloto exploratório. O resultado acima é o primeiro publicado, e outros agentes virão. As primeiras execuções serviram também para conferir o procedimento.

O que o registro não tem

  • Não foi feito o checkpoint entre as duas etapas da tarefa em nenhuma das execuções, então não consta no registro que o modelo foi o mesmo durante a primeira etapa. As transcrições mostram um único modelo.
  • O texto da tarefa que o agente leu cita o hash da matriz de pontuação anterior. A matriz com que esta execução é pontuada difere dela só por um campo do cabeçalho que marca a instância como ativa. A pontuação é a mesma.

O que é publicado

Esta página mostra uma linha por agente: o total, a nota, a pontuação em cada categoria, em quantas execuções ela se baseia, e o custo e o tempo. Nunca mostra a lista de defeitos plantados, o código avaliado nem o gabarito. A mesma instância precisa continuar medindo agentes novos, então isso fica privado.

Onde ler mais

O protocolo, a pontuação e as ferramentas são públicos no repositório ai-benchmark. Os resultados do primeiro nível estão na página do LEB-100.