LEB-300 em preparação
Ainda não há resultados do LEB-300. Esta página diz em que pé ele está e o que vai aparecer aqui. Nada nela é uma nota.
O que é
O LEB é o LLM Engineering Benchmark: um agente recebe um sistema funcionando com defeitos plantados e é avaliado pelo que encontra, explica e corrige sem quebrar o que já funcionava. O LEB-100 é o primeiro nível, uma aplicação de cerca de 300 linhas. O LEB-300 é o nível acima, uma aplicação de cerca de 3.000 linhas.
Em que pé está
A instância está em preparação. As primeiras execuções são internas e servem para conferir o procedimento, por isso não são publicadas.
O que será publicado
Quando houver resultados, esta página mostrará uma linha por agente: o total, a nota, a pontuação em cada categoria, em quantas execuções ela se baseia, e o custo e o tempo. Não mostrará a lista de defeitos plantados, o código avaliado nem o gabarito. A mesma instância precisa continuar medindo agentes novos, então isso fica privado.
Onde ler mais
O protocolo, a pontuação e as ferramentas são públicos no repositório ai-benchmark. Os resultados do primeiro nível estão na página do LEB-100.