IBM Research apresenta avaliação de consistência para agentes de IA com ALTK-Evolve
A IBM Research publicou uma análise detalhada sobre a avaliação de consistência em agentes de inteligência artificial utilizando o framework ALTK-Evolve. O estudo utiliza o benchmark AppWorld, que propõe tarefas realistas compostas por múltiplas etapas executadas por meio de APIs, com média de 9,5 chamadas de API distribuídas em 1,8 aplicativos, sendo que os casos mais complexos demandam fluxos de controle mais elaborados.
Para medir a consistência dos agentes, os pesquisadores aplicaram uma métrica chamada Scenario Goal Completion, abreviada como SGC. Trata-se de um critério rigoroso que exige sucesso em todas as variantes de um mesmo cenário, avaliando se o agente consegue manter um desempenho estável diante de pequenas variações na formulação da tarefa. A avaliação foi conduzida com um agente baseado na arquitetura ReAct, que combina raciocínio e ação de forma intercalada, recebendo a instrução da tarefa acompanhada das cinco diretrizes mais relevantes recuperadas a partir de execuções anteriores.
Os resultados obtidos demonstram ganhos expressivos quando o sistema de memória do ALTK-Evolve é ativado. No nível de dificuldade fácil, a taxa de conclusão subiu de 79,0% para 84,2%, um aumento de 5,2 pontos percentuais. No nível médio, o avanço foi de 56,2% para 62,5%, representando 6,3 pontos de melhoria. O salto mais significativo ocorreu nos cenários classificados como difíceis, nos quais a taxa saltou de 19,1% para 33,3%, um incremento de 14,2 pontos. No agregado geral, o sistema alcançou 58,9% de conclusão contra 50,0% da versão de referência, totalizando uma melhora de 8,9 pontos percentuais.
Esses números reforçam que a incorporação de diretrizes recuperadas dinamicamente contribui de forma mais substancial justamente nos cenários onde os agentes costumam apresentar maior dificuldade. A recuperação das cinco melhores orientações geradas em uma execução prévia permite que o agente acesse conhecimento contextual relevante sem a necessidade de retreinar o modelo subjacente. O conjunto de dados de treinamento e desenvolvimento foi separado de uma partição de teste nunca vista, garantindo que a avaliação refletisse a capacidade de generalização do sistema.
Um dos pontos destacados na publicação é a facilidade de integração do ALTK-Evolve com diferentes stacks de desenvolvimento. O framework é compatível com clientes de modelos de linguagem amplamente utilizados, como OpenAI, LiteLLM e os agentes disponibilizados pela plataforma Hugging Face. Por meio de uma única importação, `altk_evolve.auto`, e o acionamento de uma flag, desenvolvedores podem emitir rastros de execução para a interface do Arize Phoenix, uma ferramenta de observabilidade para aplicações com modelos de linguagem. A partir desses rastros, o sistema consegue gerar automaticamente diretrizes de melhoria para os agentes, sem que seja necessário alterar a infraestrutura existente.
A abordagem adotada pelo ALTK-Evolve se diferencia de estratégias que dependem da manutenção de um único documento consolidado de instruções, frequentemente chamado de playbook. Em vez disso, o framework trabalha com diretrizes individuais que podem ser recuperadas conforme a necessidade, o que tende a reduzir o consumo de tokens e a facilitar a manutenção do sistema ao longo do tempo.
O framework também oferece uma modalidade sem código, compatível com assistentes de programação baseados em IA, possibilitando que profissionais sem experiência avançada em programação consigam incorporar os mecanismos de aprendizado contínuo em seus agentes.
A publicação integra uma série de iniciativas da IBM Research voltadas para o desenvolvimento de ferramentas middleware para agentes de IA, com foco em detectar, reparar e mitigar modos comuns de falha. O ALTK-Evolve representa mais um passo nessa direção, fornecendo componentes modulares que se encaixam em interfaces padronizadas e podem ser combinados com soluções já existentes no mercado.