Pular para o conteúdo
AI Benchmark · LEB

LEB-300 em preparação

Ainda não há resultados do LEB-300. Esta página diz em que pé ele está e o que vai aparecer aqui. Nada nela é uma nota.

O que é

O LEB é o LLM Engineering Benchmark: um agente recebe um sistema funcionando com defeitos plantados e é avaliado pelo que encontra, explica e corrige sem quebrar o que já funcionava. O LEB-100 é o primeiro nível, uma aplicação de cerca de 300 linhas. O LEB-300 é o nível acima, uma aplicação de cerca de 3.000 linhas.

Em que pé está

A instância está em preparação. As primeiras execuções são internas e servem para conferir o procedimento, por isso não são publicadas.

O que será publicado

Quando houver resultados, esta página mostrará uma linha por agente: o total, a nota, a pontuação em cada categoria, em quantas execuções ela se baseia, e o custo e o tempo. Não mostrará a lista de defeitos plantados, o código avaliado nem o gabarito. A mesma instância precisa continuar medindo agentes novos, então isso fica privado.

Onde ler mais

O protocolo, a pontuação e as ferramentas são públicos no repositório ai-benchmark. Os resultados do primeiro nível estão na página do LEB-100.