Em 16 de agosto de 2026, a DeepSeek reformulou sua precificação de API para um sistema tarifário de Horário de Pico (Peak: 01:00–04:00 e 06:00–10:00 UTC) e Fora de Pico (Off-Peak), unificando seus modelos nas famílias V4-Flash e V4-Pro. Mesmo com o reajuste, a DeepSeek permanece como uma das opções mais baratas do mundo, custando de 8x a 20x menos que concorrentes ocidentais através do mecanismo de Prompt Caching.
1. A Nova Estrutura de Preços da DeepSeek
A empresa substituiu a taxa fixa anterior por valores que variam em 100% (2x) conforme o horário do dia, aposentando os nomes legados deepseek-chat e deepseek-reasoner em favor dos modelos V4-Flash (baixa latência) e V4-Pro (raciocínio profundo).
2. Tabela de Custos por 1 Milhão de Tokens
No V4-Flash Fora de Pico: Cache Hit $0.007, Input normal $0.22 e Output $0.66. No V4-Pro Fora de Pico: Cache Hit $0.022, Input $0.66 e Output $1.98. Nos horários de pico (01:00–04:00 UTC e 06:00–10:00 UTC), os valores dobram exatamente.
3. Análise de ROI: DeepSeek vs. Modelos Ocidentais
Enquanto o Claude Opus 5 custa $15/$75 por 1M de tokens e o GPT-4o gira em torno de $2.50/$10, o DeepSeek V4-Flash opera a fração de centavos. Para automações de atendimento, CRMs de WhatsApp e triagens de grande escala, a economia mensal viabiliza margens operacionais imbatíveis.
4. Como Economizar mais de 95% com Prompt Caching
Ao manter prompts de sistema estáticos, colocar variáveis dinâmicas no fim das mensagens e ordenar históricos cronologicamente, os acertos de cache reduzem o custo de entrada para apenas $0.007 por milhão de tokens no V4-Flash.
5. Estratégias de Gestão Financeira de Tokens
Agende jobs assíncronos (como relatórios e indexação de dados) para rodar fora do horário de pico e configure proxies inteligentes (como LiteLLM) para acionar o V4-Pro somente quando a complexidade da tarefa exigir raciocínio profundo.