MandAPI Radar

Metodologia

Scores are computed only from public, structured, verifiable benchmark data. Every score is traceable to immutable evidence records with source hashes. Missing data is never treated as zero.

Atualizado em 13/09/2026 03:13 UTC

Como os scores são calculados

  1. Coleta: cada fonte pública é baixada por adaptadores oficiais (API/JSON/Parquet), nunca por scraping de HTML.
  2. Snapshot: cada download recebe hash SHA-256 e permanece imutável (raw evidence é append-only).
  3. Entidades: um Modelo e uma Configuração de Avaliação (ex.: reasoning effort) são entidades separadas. GPT-X (High) e GPT-X (xHigh) nunca são mesclados.
  4. Normalização: cada benchmark vira percentil midrank (0–100) dentro da população do próprio snapshot do benchmark — nunca média de pontuações brutas de escalas diferentes.
  5. Agregação por dimensão: mediana ponderada dos percentis, com pesos de qualidade de fonte e correção de sobreposição (benchmarks compostos que compartilham componentes recebem meio peso).
  6. Intelligence Score v0.1: média ponderada de Reasoning 40% / Coding 25% / Agent 20% / Instruction 15%, calculada somente quando ≥3 das 4 dimensões têm confiança média ou alta.
  7. Preferência humana (LMArena) NÃO entra no Intelligence Score. Preço e velocidade NÃO entram no Intelligence Score.
  8. Confiança: alta = 3+ famílias independentes de benchmark; média = 2; baixa = 1; insuficiente = nenhuma.
  9. Determinismo: mesma evidência gera exatamente os mesmos scores (rebuild determinístico).
  10. Falha de fonte: mantém o último snapshot válido (last-known-good); o leaderboard nunca é zerado.
  11. Política de população (Phase 1.1): boards com uma versão por snapshot usam somente a versão mais recente como população (versões misturadas são excluídas e registradas); fontes append-log (Aider) usam o arquivo completo como população, e por modelo vale a entrada mais recente — nunca o máximo histórico.
  12. Cobertura (coverage) = benchmarks com dados ÷ benchmarks configurados na dimensão. Cada dimensão expõe também benchmarkFamilyCount e lastUpdated da evidência contribuinte.
  13. Isolamento de métricas: rating Bradley-Terry (boards de texto) e IPS score (Agent Arena) são escalas diferentes — nunca comparados em bruto; cada um é normalizado dentro da população do próprio board antes de entrar em dimensões derivadas.
  14. Sobreposição: benchmarks da mesma família (ex.: boards LMArena) nunca recebem peso independente completo — o segundo recebe meio peso — e a confiança conta apenas famílias distintas. Índices compostos (Artificial Analysis) estão documentados no overlap registry; AA está inativo por decisão do owner (2026-09-13).
  15. Resolução de nomes (Phase 1.1 audit): nomes com sufixo ambíguo (-max, -high) são resolvidos assim: ① id exato completo quando existe no registry (ex.: qwen3.8-max é um id de tier independente), ② exceto quando o sufixo é um esforço de raciocínio válido da base (ex.: glm-5.2-max → GLM 5.2 no nível max) — thinking/non-thinking nunca são dobrados; ③ o que não pode ser confirmado vai para a inbox de mapeamento humano.
Intelligence v0.1
DimensãoPeso
Raciocínio40%
Código25%
Agente20%
Instrução15%
Intelligence só é calculada quando ≥3 das 4 dimensões têm confiança média ou alta. Enquanto isso: Insuficiente — nunca preenchida com estimativa.
Regra da configuração principal O ranking usa a configuração padrão (#default) quando existe; caso contrário a melhor configuração disponível, sempre com o configId visível.

Atribuição

Veja também a lista completa de fontes com licenças, cadências e status.