{
  "meta": {
    "title": "Protocolo brasileiro de avaliação operacional de modelos de IA",
    "version": "0.1",
    "status": "request_for_comments",
    "verifiedThrough": "2026-08-18",
    "locale": "pt-BR",
    "resultsPublished": false,
    "notePt": "Este documento publica o método antes dos resultados. Não há ranking próprio da NOLASCO AI nesta versão."
  },
  "unitOfEvaluation": {
    "required": ["modelSnapshot", "inferenceProvider", "endpointOrRoute", "regionWhenPublished", "precisionWhenPublished"],
    "rulePt": "Nenhuma nota pode ser atribuída apenas a um alias mutável ou a uma família comercial."
  },
  "tracks": [
    {"id":"atendimento","namePt":"Atendimento e operações","tasksPt":["responder clientes com política fornecida","classificar intenção","extrair dados estruturados","escalar caso incerto"],"metricsPt":["correção","aderência à política","JSON válido","taxa de escalonamento adequado","custo por conversa"]},
    {"id":"rag-documental","namePt":"RAG e documentos brasileiros","tasksPt":["localizar evidência em documento","responder com citação","recusar quando a base não contém resposta","comparar versões"],"metricsPt":["recall de evidência","fidelidade da citação","alucinação","custo por documento"]},
    {"id":"redacao-ptbr","namePt":"Redação profissional em português","tasksPt":["resumir","reescrever para público definido","seguir terminologia brasileira","preservar números e ressalvas"],"metricsPt":["fidelidade","clareza","adequação de registro","erros factuais"]},
    {"id":"codigo","namePt":"Código e agentes","tasksPt":["corrigir falha reproduzível","usar ferramentas","gerar teste","explicar risco da mudança"],"metricsPt":["testes aprovados","regressões","chamadas de ferramenta","tempo e custo até conclusão"]},
    {"id":"multimodal","namePt":"Documentos, imagem e áudio","tasksPt":["ler tabela ou formulário","transcrever fala brasileira","relacionar texto e imagem","preservar estrutura"],"metricsPt":["extração exata","WER quando aplicável","estrutura preservada","custo por unidade nativa"]},
    {"id":"seguranca","namePt":"Segurança e confiabilidade","tasksPt":["resistir a instrução conflitante","proteger dados fornecidos","reconhecer incerteza","pedir confirmação antes de ação sensível"],"metricsPt":["violações","falsas recusas","calibração","ações sem confirmação"]}
  ],
  "execution": {
    "promptPolicyPt": "Prompts, system instructions e exemplos são versionados. Ajustes específicos por modelo devem ser declarados.",
    "samplingPt": "Temperatura, seed, número de repetições e limites de saída são registrados por execução.",
    "operationalMetrics": ["latencyToFirstToken","totalLatency","inputTokens","outputTokens","toolCalls","retries","usd","brlWithDatedFx"],
    "reproducibility": ["runDate","sourceUrl","modelSnapshot","offerId","provider","region","parameters","rawUsage"]
  },
  "contamination": {
    "policyPt": "Itens avaliativos permanecem privados, recebem hash e são rotacionados. Exemplos públicos são separados do conjunto pontuado.",
    "disqualifiersPt": ["questão publicada antes da execução","snapshot ou rota não identificados","resultado sem log de uso","intervenção humana não declarada"]
  },
  "publication": {
    "separateScores": ["qualidade","custo","latência","confiabilidade"],
    "forbiddenPt": "Não produzir uma nota única universal nem chamar um modelo de melhor para todas as tarefas.",
    "correctionPolicyPt": "Erros de protocolo ou cálculo geram versão nova, errata pública e preservação do resultado anterior."
  },
  "results": []
}
