INTELIGÊNCIA ARTIFICIAL. PENSAMENTO CRÍTICO.Acompanhe por RSS
GuiasGUIA DE REFERÊNCIA

Cache de prompts ou compactação: quando usar cada recurso na API da OpenAI?

Cache reaproveita prefixos estáveis; compactação reduz o contexto de interações longas. Veja limites, custos a conferir e pendências para o Brasil.

EM POUCAS LINHAS

  • Cache favorece requisições com prefixo estável, mas uma sessão contínua não garante acerto.
  • Compactação reduz o contexto de interações longas; seu item de estado é opaco.
  • Compactar pode alterar o prefixo e interromper a reutilização do cache.
  • Tarifas do modelo e condições comerciais aplicáveis no Brasil exigem conferência antes de estimar custos.

A escolha depende do problema que a aplicação enfrenta. Se várias requisições repetem instruções ou material inicial, o cache pode evitar o reprocessamento desse trecho. Se uma interação acumula histórico até pressionar a janela de contexto, a compactação pode reduzir o que precisa seguir para as próximas etapas. São mecanismos diferentes, e combiná-los não garante economia cumulativa. As páginas oficiais consultadas são os guias de cache e de compactação: documentação de recursos, não anúncios datados de lançamento nem estudos independentes de desempenho.

Quando priorizar o cache de prompts

O cache reaproveita o trabalho de processar um prefixo quando uma requisição posterior encontra uma entrada correspondente; a entrada nova ainda precisa ser processada para gerar a resposta, segundo a documentação de cache. Isso favorece fluxos em que instruções de desenvolvimento, definições de ferramentas ou referências compartilhadas permanecem iguais no início do contexto e o conteúdo variável vem depois. Um exemplo hipotético: um atendimento recebe perguntas distintas, mas usa as mesmas instruções e o mesmo material de referência em diversas chamadas. É o prefixo comum, não apenas a semelhança entre as perguntas, que importa.

A correspondência exige que o prefixo renderizado permaneça igual: alterar conteúdo ou uma configuração relevante antes de um ponto de cache impede a reutilização a partir da alteração, explica a OpenAI. Por isso, deixar datas, identificadores de usuário e outros dados variáveis depois do trecho compartilhado é uma decisão de organização do contexto. Também convém manter estáveis as definições e a ordem das ferramentas; trocar o texto visível da pergunta não é a única forma de perder uma correspondência.

Há limites de elegibilidade. Para GPT-5.6 e modelos posteriores, a documentação estabelece um prefixo mínimo de 1.024 tokens de entrada visíveis para cache; em modelos anteriores, o mínimo varia conforme as configurações da requisição (fonte). A página diz que o cache é ativado por padrão em modelos compatíveis, mas distingue modos implícito e explícito nos modelos mais novos; no modo exclusivamente explícito, sem pontos marcados, não há gravação de cache. Uma sessão contínua, portanto, não equivale a um acerto garantido: a entrada correspondente ainda precisa estar disponível e a requisição precisa alcançá-la, conforme o mesmo guia.

Quando compactar o contexto

A compactação atende a outro sinal: a conversa cresceu e é preciso reduzir seu contexto preservando o estado necessário aos turnos seguintes, conforme o guia de compactação. Em vez de depender da repetição literal do começo do prompt, ela produz um contexto menor para continuar o fluxo. Isso pode ser útil em uma tarefa prolongada com mensagens, resultados de ferramentas e decisões acumuladas; não é motivo para compactar toda conversa curta.

Na API Responses, a modalidade no servidor é habilitada por context_management com compact_threshold; quando a contagem renderizada ultrapassa o limite configurado, o servidor compacta sem exigir chamada separada a /responses/compact, segundo a documentação. Quem precisa decidir quando fazer a operação pode usar o endpoint separado. Nesse caso, o contexto enviado para compactação ainda deve caber na janela do modelo, e a janela retornada deve ser passada integralmente à próxima chamada, orienta a OpenAI.

O item de compactação leva adiante estado anterior em menos tokens, mas é opaco e não foi concebido para interpretação humana (fonte). Portanto, ele não substitui um registro legível de requisitos, decisões ou fatos que a aplicação precise conferir. O guia apresenta a preservação de estado como finalidade do recurso, não como garantia de que toda informação continuará recuperável com a mesma precisão em qualquer tarefa.

Usar os dois exige observar o prefixo

Compactar, resumir ou truncar o histórico pode alterar o prefixo e reiniciar sua reutilização pelo cache, adverte o guia de cache. A consequência prática é ponderar ganhos diferentes: manter o histórico intacto pode favorecer leituras em cache enquanto ele cresce; compactá-lo pode reduzir o tamanho do contexto seguinte, mas fazer com que parte dos tokens deixe de encontrar a entrada anterior. Uma estratégia é preservar instruções compartilhadas estáveis no começo, compactar quando o histórico exigir e verificar o uso nas chamadas seguintes. O ponto de equilíbrio de cada aplicação depende do padrão de requisições, dos tokens reutilizados e do custo de continuar com um contexto maior; não é possível calculá-lo apenas com os trechos de documentação fornecidos.

Custos e verificações para uma aplicação no Brasil

A cobrança de cache varia por modelo: tokens de entrada podem ser cobrados pela tarifa sem cache, pela de leitura do cache ou pela de gravação; a gravação não é uma taxa adicional sobre os mesmos tokens, esclarece a OpenAI. Para GPT-5.6 e posteriores, o guia informa gravação a 1,25 vez a tarifa padrão de entrada e leitura a 0,1 vez na maioria desses modelos, com 0,05 vez para GPT-6.1 Sol. Esses fatores não devem ser transferidos para modelos anteriores, cujas regras diferem no guia. O acervo também traz uma comparação de mudanças no GPT-6.1 Sol, mas a tarifa comercial vigente para uma implementação precisa ser conferida para o modelo escolhido.

Antes de projetar economia, compare chamadas representativas: proporção de prefixos reaproveitados, tokens efetivamente cobrados em cada categoria, tamanho do contexto após compactar e comportamento da tarefa. O guia de cache mostra campos de uso como cached_tokens e cache_write_tokens; o guia de compactação descreve os fluxos, mas não quantifica ali o custo de cada operação de compactação. O material disponibilizado nesta apuração não basta para estabelecer faturamento em reais, tributos, condições comerciais ou disponibilidade regional específica para desenvolvedores no Brasil. Esses pontos permanecem pendentes de conferência antes de converter uma estimativa técnica em orçamento local; a parte não fornecida do guia de cache não foi examinada.

Fontes e referências

  1. Prompt caching | OpenAI APIdevelopers.openai.com · Consultado em 04/10/2026
  2. Compaction | OpenAI APIdevelopers.openai.com · Consultado em 04/10/2026
Transparência editorial. Este texto foi pesquisado, redigido e revisado com agentes de IA. A revisão automatizada confere fontes, consistência e clareza; não equivale a uma auditoria humana independente. Resultados de terceiros são identificados. Conheça a política editorial.
Compartilhar no WhatsAppSugerir correção