Como o cache funciona
O cache opera por correspondência de prefixo: o sistema armazena tokens processados e os reutiliza quando requisições subsequentes começam com o mesmo conteúdo. Considere um chatbot com um prompt de sistema de 2.000 tokens:1
Requisição 1
Prompt de sistema (2.000 tokens) + mensagem do usuário (50 tokens)Processados: 2.050 tokens · Do cache: 0 tokensPrefixo gravado no cache.
2
Requisição 2
Prompt de sistema (2.000 tokens) + mensagem do usuário (80 tokens)Processados: 80 tokens · Do cache: 2.000 tokens
3
Requisição 3
Prompt de sistema (2.000 tokens) + mensagem do usuário (120 tokens)Processados: 120 tokens · Do cache: 2.000 tokens
Modelos compatíveis e preços
Loading…
Claude Opus 4.5 cobra uma tarifa premium para cache writes ($7,50/1M de tokens vs. $6,00 do input regular). A primeira requisição que popula o cache custa mais, mas os acertos subsequentes economizam 90%. Outros modelos não cobram extra por cache writes.
Comportamento específico por provedor
A Venice normaliza o cache entre provedores. Para a maioria dos modelos, o cache é automático. Basta enviar suas requisições e verificar a resposta em busca de estatísticas de cache. O Claude exige marcadores explícitos de cache no nível do protocolo, mas a Venice os adiciona automaticamente para prompts de sistema e histórico de conversa. O comportamento de cache é, em última análise, controlado por cada provedor e pode mudar, então confira a documentação do provedor para os detalhes mais recentes.Claude Opus 4.5 (Anthropic)
O Claude exige breakpoints explícitos de cache no nível do protocolo. A Venice lida com isso automaticamente:- Prompts de sistema são cacheados automaticamente
- Histórico de conversa é cacheado colocando um breakpoint na penúltima mensagem do usuário
Detalhes adicionais:
- Até 4 breakpoints por requisição: O sistema usa o prefixo correspondente mais longo
- Chave do cache é byte-exata: Mudanças de espaço em branco, codificações de imagem diferentes ou ferramentas reordenadas quebram acertos de cache
- Limites de taxa com consciência de cache: Tokens cacheados não contam contra seu limite ITPM, permitindo maior throughput efetivo
- Premium de 25% no write: A primeira requisição custa mais, mas há 90% de economia em leituras subsequentes
Controle manual de cache
Para casos especiais, como cachear um documento grande no primeiro turno, você pode adicionar breakpoints explícitos:Todos os outros modelos
O cache é automático. Não são necessários parâmetros especiais. Apenas garanta que seus prompts excedam ~1.024 tokens e useprompt_cache_key para roteamento consistente.
Parâmetros de requisição
prompt_cache_key
Para conversas ou fluxos agênticos, use umprompt_cache_key consistente para melhorar as taxas de acerto:
Campos da resposta
O objetousage da resposta inclui estatísticas de cache:
Detalhamento da cobrança (usando Claude Opus 4.5 como exemplo):
- 5.000 tokens cacheados × $0,60/1M = $0,003
- 500 tokens não cacheados × $6,00/1M = $0,003
- Total: $0,006 (vs. $0,033 sem cache, 82% de economia)
Melhores práticas
Estruture prompts para cache
Coloque conteúdo estático no início e conteúdo dinâmico no final. Boa estrutura
Má estrutura
Mantenha prefixos byte-idênticos
Chaves de cache são calculadas a partir de sequências de bytes exatas. Mesmo diferenças triviais quebram acertos:- Espaços em branco ou novas linhas diferentes
- Timestamps ou IDs de requisição em prompts
- Ordenação aleatória de exemplos few-shot
- Formatação diferente do mesmo conteúdo
Atinja os limites mínimos de tokens
Se seus prompts ficarem abaixo do mínimo (tipicamente 1.024 tokens), o cache não será ativado. Para prompts pequenos, considere:- Adicionar mais contexto ou exemplos para atingir o limite
- Agrupar várias requisições pequenas em prompts em lote
- Aceitar que o cache não se aplica para consultas simples
Use prompt_cache_key para conversas
Para conversas em andamento, defina umprompt_cache_key consistente:
Monitore o desempenho do cache
Acompanhe estas métricas:- Taxa de acerto do cache:
cached_tokens / prompt_tokens - Economia de custo: Compare custo real vs. custo sem cache
- Redução de latência: Tempo até o primeiro token com vs. sem acertos de cache
cached_tokens for consistentemente 0:
- Os prompts podem estar abaixo do limite mínimo de tokens
- Os prompts podem estar mudando entre requisições
- As requisições podem estar atingindo servidores diferentes (use
prompt_cache_key) - O cache pode ter expirado (requisições muito esparsas)
Considere a economia do cache
Premium de write do Claude Opus 4.5: A primeira requisição custa 25% mais, mas há 90% de economia em leituras subsequentes.Vida útil do cache
Os caches expiram após um período de inatividade (tipicamente 5-10 minutos). Isso significa:Cache com tools e functions
Definições de função podem ser cacheadas junto com prompts de sistema:Cache com imagens e documentos
Para modelos de visão, imagens podem ser incluídas no conteúdo cacheado:Solução de problemas
cached_tokens é sempre 0
cached_tokens é sempre 0
cache_creation_input_tokens em toda requisição
cache_creation_input_tokens em toda requisição
Custos mais altos que o esperado
Custos mais altos que o esperado