Como os scores são calculados
- Coleta: cada fonte pública é baixada por adaptadores oficiais (API/JSON/Parquet), nunca por scraping de HTML.
- Snapshot: cada download recebe hash SHA-256 e permanece imutável (raw evidence é append-only).
- Entidades: um Modelo e uma Configuração de Avaliação (ex.: reasoning effort) são entidades separadas. GPT-X (High) e GPT-X (xHigh) nunca são mesclados.
- Normalização: cada benchmark vira percentil midrank (0–100) dentro da população do próprio snapshot do benchmark — nunca média de pontuações brutas de escalas diferentes.
- Agregação por dimensão: mediana ponderada dos percentis, com pesos de qualidade de fonte e correção de sobreposição (benchmarks compostos que compartilham componentes recebem meio peso).
- Intelligence Score v0.1: média ponderada de Reasoning 40% / Coding 25% / Agent 20% / Instruction 15%, calculada somente quando ≥3 das 4 dimensões têm confiança média ou alta.
- Preferência humana (LMArena) NÃO entra no Intelligence Score. Preço e velocidade NÃO entram no Intelligence Score.
- Confiança: alta = 3+ famílias independentes de benchmark; média = 2; baixa = 1; insuficiente = nenhuma.
- Determinismo: mesma evidência gera exatamente os mesmos scores (rebuild determinístico).
- Falha de fonte: mantém o último snapshot válido (last-known-good); o leaderboard nunca é zerado.
- Política de população (Phase 1.1): boards com uma versão por snapshot usam somente a versão mais recente como população (versões misturadas são excluídas e registradas); fontes append-log (Aider) usam o arquivo completo como população, e por modelo vale a entrada mais recente — nunca o máximo histórico.
- Cobertura (coverage) = benchmarks com dados ÷ benchmarks configurados na dimensão. Cada dimensão expõe também benchmarkFamilyCount e lastUpdated da evidência contribuinte.
- Isolamento de métricas: rating Bradley-Terry (boards de texto) e IPS score (Agent Arena) são escalas diferentes — nunca comparados em bruto; cada um é normalizado dentro da população do próprio board antes de entrar em dimensões derivadas.
- Sobreposição: benchmarks da mesma família (ex.: boards LMArena) nunca recebem peso independente completo — o segundo recebe meio peso — e a confiança conta apenas famílias distintas. Índices compostos (Artificial Analysis) estão documentados no overlap registry; AA está inativo por decisão do owner (2026-09-13).
- Resolução de nomes (Phase 1.1 audit): nomes com sufixo ambíguo (-max, -high) são resolvidos assim: ① id exato completo quando existe no registry (ex.: qwen3.8-max é um id de tier independente), ② exceto quando o sufixo é um esforço de raciocínio válido da base (ex.: glm-5.2-max → GLM 5.2 no nível max) — thinking/non-thinking nunca são dobrados; ③ o que não pode ser confirmado vai para a inbox de mapeamento humano.
Intelligence v0.1
Intelligence só é calculada quando ≥3 das 4 dimensões têm confiança média ou alta. Enquanto isso: Insuficiente — nunca preenchida com estimativa.
| Dimensão | Peso |
|---|---|
| Raciocínio | 40% |
| Código | 25% |
| Agente | 20% |
| Instrução | 15% |
Regra da configuração principal O ranking usa a configuração padrão (#default) quando existe; caso contrário a melhor configuração disponível, sempre com o configId visível.
Atribuição
- LMArena — LMArena leaderboard-dataset, CC BY 4.0 — https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset
- Artificial Analysis — Artificial Analysis — https://artificialanalysis.ai (attribution required on all display of their data)
- Aider — Aider polyglot leaderboard — https://aider.chat/docs/leaderboards/
- models.dev — models.dev (MIT) — https://models.dev
- OpenRouter — OpenRouter — https://openrouter.ai
Veja também a lista completa de fontes com licenças, cadências e status.
