OpenAI anuncia melhorias no sistema de cache de prompts do GPT-6
A OpenAI apresentou um sistema aprimorado de cache de prompts para a família de modelos GPT-6, voltado a oferecer taxas de reutilização de cache mais altas por padrão e novas ferramentas para que desenvolvedores possam acompanhar o desempenho, identificar falhas e definir quais trechos do prompt devem ser armazenados. A proposta central é tornar agentes persistentes mais rápidos e reduzir os custos de operação.
O mecanismo de cache funciona a partir do conceito de prefixos compartilhados, ou seja, as partes iniciais do prompt que se repetem entre diferentes chamadas ao modelo. Na nova versão, sempre que esses prefixos forem reutilizados dentro de uma janela de 30 minutos, o sistema passa a oferecer descontos de cache para o desenvolvedor. Isso significa que, em cenários com prompts extensos e repetitivos — comuns em fluxos agentes de longa duração —, boa parte do processamento deixa de ser refeita a cada requisição, o que tende a diminuir a latência e o custo por chamada.
Outra novidade é a introdução de diagnósticos de cache, recurso que permite monitorar por que uma determinada requisição resultou em falha de cache, isto é, por que o sistema não conseguiu reutilizar os prefixos esperados. A API devolve um objeto chamado prompt_cache_diagnostics, contendo informações como o motivo da falha e a quantidade de tokens que poderiam ter sido reaproveitados. Um exemplo mostrado pela empresa indica um caso em que o motivo registrado foi tools_changed, com 5.629 tokens reutilizáveis e 5.629 tokens que perderam o cache justamente porque houve alteração nas ferramentas utilizadas entre as chamadas. Esse tipo de retorno facilita a identificação de pontos onde a estrutura do prompt pode ser otimizada para aumentar a taxa de acerto.
Além do diagnóstico, a OpenAI passou a oferecer pontos de quebra explícitos de cache, função que permite ao desenvolvedor escolher manualmente quais prefixos do prompt devem ser reaproveitados. Em vez de depender apenas da detecção automática, agora é possível delimitar com precisão as partes estáticas do prompt — como instruções de sistema, definições de ferramentas e materiais de referência — que se beneficiam do armazenamento em cache, separando-as das seções dinâmicas que mudam a cada interação, como a mensagem mais recente do usuário. Um guia de cache de prompts foi atualizado para explicar como utilizar esses pontos de quebra, qual é o tempo de permanência dos prefixos no cache e de que forma alterações em definições de ferramentas e entradas podem afetar a reutilização.
Com as melhorias, a empresa busca dar mais previsibilidade e controle ao uso de cache, especialmente em aplicações baseadas em agentes que mantêm sessões prolongadas e compartilham grandes blocos de contexto entre chamadas consecutivas. As mudanças combinam o aumento automático da taxa de acerto com instrumentos de diagnóstico e configuração explícita, criando um conjunto de recursos voltado tanto à redução de custos quanto à diminuição do tempo de resposta em aplicações que dependem de prompts extensos e repetitivos.