Amazon Bedrock AgentCore Evaluations padroniza a avaliação de agentes de inteligência artificial independentemente do framework utilizado

Equipes que desenvolvem agentes de inteligência artificial em ambiente de produção enfrentam um problema recorrente: a variedade de frameworks disponíveis continua crescendo, mas as ferramentas de avaliação não acompanharam esse ritmo. A maioria dos sistemas de avaliação foi projetada para funcionar com um framework específico, um cliente de modelo de linguagem específico ou um padrão de rastreamento particular. Quando o agente é construído fora dessa compatibilidade restrita, todo o pipeline de avaliação deixa de funcionar.

Avaliar agentes de IA sem depender de framework: conheça o Amazon Bedrock AgentCore Evaluations, a solução que unifica a medição de qualidade por meio do OpenTelemetry - Imagem complementar

Para resolver essa fragmentação, a Amazon Bedrock AgentCore Evaluations adota uma abordagem que desvincula a avaliação da escolha do framework. A solução se apoia no OpenTelemetry, um padrão aberto de instrumentação que padroniza a forma como sistemas distribuídos emitem dados de rastreamento, métricas e registros. Como todos os frameworks relevantes já oferecem suporte ao OpenTelemetry, seja de forma nativa ou por meio de bibliotecas de instrumentação, o serviço consegue avaliar qualquer agente cujos dados de telemetria sejam transmitidos por esse protocolo, sem importar qual SDK esteja por baixo.

PUBLICIDADE

O serviço lê três tipos específicos de eventos de rastreamento, chamados de spans, para reconstruir o que aconteceu em uma sessão e atribuir uma nota ao agente. O primeiro é o span de invocação do agente, que representa o ciclo completo de resposta a uma solicitação do usuário, contendo o prompt inicial e a resposta final. O segundo é o span de inferência, que registra cada chamada individual ao modelo de linguagem, incluindo o histórico de mensagens e a resposta gerada. O terceiro é o span de execução de ferramenta, que documenta cada ferramenta acionada pelo agente, com nome, parâmetros de entrada e resultado. Demais tipos de span, como os relacionados a recuperação de documentos, reordenação de resultados ou verificação de guardrails, são tratados como contexto adicional e não exigem configuração especial.

A identificação de cada span é feita automaticamente pelo nome de escopo da biblioteca de instrumentação instalada, sem que o desenvolvedor precise configurar nada manualmente. Os frameworks atualmente reconhecidos incluem Strands Agents, LangGraph, OpenAI Agents SDK, LlamaIndex, Google ADK e Claude Agent SDK. A cobertura, porém, vai além dessa lista: qualquer biblioteca cujo nome de escopo siga os prefixos opentelemetry.instrumentation ou openinference.instrumentation é lida por um caminho genérico, bastando seguir as convenções semânticas adequadas para que o framework seja avaliado.

Para que uma sessão seja avaliada de ponta a ponta, dois requisitos precisam ser atendidos. O primeiro é o agrupamento: os spans do agente precisam conter um identificador de sessão compatível com o runtimeSessionId utilizado na invocação. No ambiente do AgentCore Runtime, esse atributo é injetado automaticamente pela distribuição AWS do OpenTelemetry, sem necessidade de alterações no código do agente. O segundo requisito é que a fonte de dados inclua o conteúdo das mensagens, e não apenas os spans. Para agentes que utilizam a observabilidade unificada, que é o padrão para agentes recém-criados, esse conteúdo já fica disponível no mesmo grupo de logs dos spans.

A classificação dos spans utiliza convenções semânticas distintas conforme a biblioteca de instrumentação empregada. As convenções OpenTelemetry GenAI definem operações como invoke_agent, chat e execute_tool por meio do atributo gen_ai.operation.name. Já a especificação OpenInference, mantida pela Arize AI e amplamente adotada nos ecossistemas LlamaIndex, Haystack e Phoenix, utiliza o atributo openinference.span.kind, com valores como LLM, TOOL, AGENT e CHAIN. O serviço de avaliação interpreta ambos os esquemas e produz resultados uniformes.

O AgentCore Evaluations oferece dois modos de avaliação complementares. O modo sob demanda é voltado para pipelines de integração e entrega contínuas, permitindo que sessões geradas em testes sejam pontuadas com base em referências como respostas esperadas, trajetórias de ferramentas e asserções comportamentais. O modo online monitora o tráfego em produção de forma contínua, com amostragem configurável, e utiliza apenas avaliadores que não dependem de dados de referência, já que o tráfego ao vivo não possui respostas esperadas associadas.

Os resultados das avaliações online ficam disponíveis em um grupo de logs do CloudWatch, permitindo a criação de alarmes e painéis para acompanhamento contínuo da qualidade dos agentes em produção. Como o mesmo pipeline processa tanto avaliações sob demanda quanto online, as pontuações obtidas em testes e em produção são diretamente comparáveis quando o comportamento do agente se mantém estável.

Com uma única suíte de avaliação capaz de operar sobre qualquer agente que emita telemetria dentro de um escopo reconhecido, a Amazon Bedrock AgentCore Evaluations oferece uma abordagem unificada para medir a qualidade de sistemas agênticos em todo o ciclo de desenvolvimento.