Trabalho de conhecimento com agentes
Z AI · Avaliação independente
GLM-5.3
Versão avaliada pela Artificial Analysis: GLM-5.3 (max).
Inclui modelos de todos os criadores, não apenas o catálogo Lume. As posições seguem a ordem publicada pela AA, incluindo variantes de raciocínio.
Do resultado geral aos detalhes
10 avaliações, diferentes capacidades
Os valores abaixo vêm das avaliações publicadas pela AA. Percentuais, Elo e índices têm escalas diferentes e não devem ser comparados entre si.
Tarefas profissionais do mundo real
GDPval-AA v2
Automação de fluxos de trabalho
AutomationBench-AA
Programação e uso de terminal por agentes
Terminal-Bench 4.0
Programação científica
SciCode
Conhecimento e raciocínio avançado
Humanity's Last Exam
Raciocínio sobre documentos profissionais
GDP.pdf
Raciocínio em física
CritPt
Conhecimento e confiabilidade factual
AA-Omniscience
Raciocínio com contexto longo
AA-LCR v1.1
Fonte dos valores: Tabela de avaliações da Artificial Analysis ↗ Abre em uma nova aba
Como usar estas avaliações
O índice reúne avaliações de tarefas diferentes. Ele não é uma porcentagem de acertos nem uma garantia de desempenho em português. Considere as avaliações relevantes para seu projeto e faça seus próprios testes.
AA-Omniscience pode ter valores negativos: o índice penaliza respostas incorretas. Um valor ausente aparece como indisponível, nunca como zero. Elo representa uma avaliação relativa e não uma taxa de acerto.
As avaliações são da Artificial Analysis, não da infraestrutura Lume. Versão, modo de raciocínio e configuração podem mudar os resultados. Nesta prévia, apenas lume-mock-small pode ser chamado; os modelos abaixo ainda não estão habilitados.
Testar a demonstração →Demonstração local
Disponível para testar agora
Abra o console para consultar a demonstração.
Esta demonstração usa um Mock local. Os modelos comerciais e as avaliações AA abaixo são independentes deste teste.
Abrir laboratório