Pesquisadores da Meta AI e da Universidade de Illinois Urbana-Champaign apresentaram o EvoHarness-RL, uma abordagem para treinar agentes a administrar melhor o ambiente externo durante tarefas complexas. O método organiza esse espaço em crenças sobre o ambiente, progresso da tarefa e experiência reutilizável. Nos testes divulgados pela reportagem, um modelo Qwen3-8B treinado com a técnica alcançou 96,9% de sucesso médio no benchmark ALFWorld, superando a configuração de referência e aproximando-se do desempenho de modelos fechados maiores. O sistema também aprende a consultar ferramentas quando o benefício compensa o custo computacional. A pesquisa é relevante para empresas porque sugere que parte da eficiência de agentes pode vir da arquitetura de memória e execução, e não apenas de modelos maiores. Ainda assim, resultados de benchmark exigem validação independente antes de orientar decisões de produção.

Fontes consultadas

Fonte usada: VentureBeat

Imagem/foto: Sem foto oficial publicada pela organização.

A IA pode organizar e reescrever informações oficiais, mas não pode inventar fatos ou alterar o sentido das fontes consultadas.

Links oficiais