Mudança de modelo de dados
Time quer migrar Customer entity de v1 para v2. Eval mostra se accuracy cai ou sobe.
Evals avalia o contexto que Strattum entrega para o agente em três dimensões: completude, precisão e relevância. Cada mudança de ontologia, Skill ou transform gera um report antes do merge.
O retrieval trouxe tudo que era relevante? Strattum mede o que ficou de fora: contrato ativo, ticket recente, NPS.
A informação retornada está correta e atualizada? Strattum checa cada chunk contra ground-truth ou regras.
O que voltou era relevante para a pergunta? Mede o ruído no retrieval, os chunks descartáveis que a LLM paga para processar.
A/B teste: ontology v2 vs v3, embedding model A vs B, top_k 5 vs 10. Decisão data-driven.
Conjunto de perguntas + resposta esperada (ou regras de aprovação). Strattum cuida do resto.
Cada PR de ontologia/Skill/transform dispara Evals. Reports antes do merge.
Dashboards por dimensão. Regressão dispara alerta. Aprovação de PR baseada em score.
Métricas clássicas de IR adaptadas para retrieval enterprise.
Avaliações qualitativas usando LLM como juiz, calibrado contra human ratings.
Cada eval mostra qual chunk veio, de qual fonte, com qual score.
Compare 2 versões em paralelo. Decida com base no golden set.
Rotação periódica do golden set sobre tráfego real, anomalia detectada.
Reports exportáveis para reguladores. Trilha de decisões.
Time quer migrar Customer entity de v1 para v2. Eval mostra se accuracy cai ou sobe.
Trocar bge-large por text-embedding-3? Eval mede impacto antes do rollout.
Eval re-roda perguntas existentes. Catch regression antes do merge.
Eval mede qualidade do retrieval do grafo: entidades, relações, timeline.
Conheça Memory Graph →