Benchmark é pista, não sentença
Comparar modelos é útil, mas uma nota isolada raramente responde qual modelo deve entrar no seu produto. Testes públicos usam tarefas específicas, prompts conhecidos e métricas que podem não ter relação com o seu fluxo.
O benchmark serve para montar uma shortlist. A decisão acontece quando o modelo enfrenta exemplos reais.
Monte um conjunto pequeno de tarefas
Separe de 20 a 50 casos representativos: uma função de código, uma explicação para usuário, uma classificação, uma consulta ao banco e um caso de recusa. Inclua exemplos fáceis e casos que já deram problema.
Para cada resposta, avalie correção, instruções seguidas, clareza, latência e custo. Se o sistema gera código, rode testes automatizados; opinião humana sozinha deixa passar regressões.
Meça a experiência inteira
Um modelo pode ser excelente isoladamente e ruim no produto. Contexto grande aumenta custo, uma resposta longa atrasa a interface e uma chamada extra ao banco pode apagar a economia do modelo mais barato.
Registre pelo menos:
- tempo até o primeiro token e tempo total;
- tokens de entrada e saída;
- número de retries e falhas de ferramenta;
- taxa de respostas que exigem revisão;
- custo por tarefa concluída, não por chamada.
Não escolha um modelo para sempre
Use uma camada de configuração para trocar o provedor sem reescrever o produto. Guarde as entradas e as avaliações com cuidado, removendo dados pessoais. Assim você consegue repetir o teste quando preço, versão ou política mudar.
Também vale ter um modelo econômico para tarefas simples e um modelo mais capaz para exceções. Roteamento é mais trabalhoso que escolher um campeão, mas costuma representar melhor o orçamento real.
Os posts recentes de benchmark do Akita são uma boa referência de método: comparar versões, explicitar o contexto e observar que resultados mudam. A parte que eu não terceirizaria é a suíte local, feita com o seu código e com o seu usuário em mente.
Leitura relacionada: LLM Benchmark v4: Genesys PI, novo competidor brasileiro — AkitaOnRails.