COERE
Tópico de recurso: <span>Benchmarks e arenas de IA</span>
LiveCodeBench
valia geração e execução de código com problemas atualizados continuamente.
Ver conteúdoSWE-bench
Mede a capacidade de modelos e agentes de programação de resolver problemas reais.
Ver conteúdoHumanity’s Last Exam
Avalia modelos com perguntas elaboradas por especialistas em diferentes áreas acadêmicas.
Ver conteúdoARC Prize
Mede a capacidade dos sistemas de IA de reconhecer padrões e resolver problemas visuais.
Ver conteúdo