Pular para o conteúdo
Chandler Nguyen
IA6 min de leitura

Minha conta de IA caiu de $200/mês para $45. Eu entreguei mais, não menos.

Junho: $57.01. Julho: $33.09. Dois meses depois de mudar para o DeepSeek V4 Pro via OpenCode, meus custos de IA caíram 75%. O histórico de commits prova que eu entreguei mais, não menos — 786 commits em 4 produtos. Aqui está o detalhamento completo.

Paguei à Anthropic US$1,892.38 ao longo de 13 meses. Isso era o Claude Code Max a $200 por mês, mais uns $20-100 extras para o Codex da OpenAI. No total, algo entre $200 e $300 todo mês só em ferramentas de IA.

Cancelei o Claude Max em abril. E escrevi sobre isso — várias vezes. Cada post era uma tentativa honesta de descobrir como seria a configuração certa enquanto as ferramentas não paravam de mudar debaixo dos meus pés.

Dois meses atrás, abandonei de vez o dual-wielding. Mudei para um único modelo — DeepSeek V4 Pro com High Thinking — usando um único harness de codificação. Eis o que realmente aconteceu.

Junho: $57.01. Julho: $33.09.

Fatura da DeepSeek de junho de 2026

Minha conta de junho da DeepSeek: 4,1 bilhões de tokens processados, $57.01 no total.

Fatura da DeepSeek de julho de 2026

Julho: 2,1 bilhões de tokens, $33.09. A queda veio em parte porque terminei um projeto enorme de localização em junho e em parte porque melhorei no prompt engineering — prompts menores, menos retries, mesma qualidade de saída.

Dois meses somados: $90.10. Isso é menos da metade do que eu pagava por um único mês de Claude Max. Menos de um terço se você contar a assinatura do Codex por cima.

A pergunta que todo mundo faz quando você corta os custos em 75% é: "Você desacelerou?" Aqui está a resposta.

786 Commits. 4 Produtos. Zero Lentidão.

Eu acompanho meu trabalho pelo git. Não é uma métrica perfeita de produtividade — contagem de linhas não significa nada, e um único commit pode representar desde a correção de um typo até uma migração de banco de dados. Mas, em termos de direção, ele conta algo real.

Entre 1º de junho e 31 de julho de 2026, nos quatro produtos que mantenho:

  • DIALOGUE (plataforma de podcast): 382 commits. Lancei uma rede de podcasts da Copa do Mundo em 6 idiomas, com publicação automática para o YouTube, Spotify e Apple Podcasts. Montei um calendário de conteúdo SEO com 41 posts. Rodei um framework completo de avaliação do pipeline com 40 episódios e um juiz LLM avaliando 7 dimensões por episódio.

  • chandlernguyen.com (este site + Ask Sydney): 168 commits. Localizei completamente um curso de 7 módulos para o japonês. Construí um framework de avaliação da Sydney com 30 perguntas e pontuação por juiz LLM. Reestruturei o system prompt da Sydney do zero. Redesenhei a homepage.

  • Prova (coach de IA para builders): 228 commits. Entreguei sequências unificadas de currículo para três personas. Construí uma experiência nativa para iPad com drag-and-drop. Adicionei sincronização de rascunhos entre dispositivos e caminhos de reset guiados por brief.

  • STRAŦUM (inteligência de marketing): 8 commits. Período tranquilo. Às vezes, não entregar é a decisão certa.

Eu não estava desacelerando. Se alguma coisa, eu estava acelerando — 786 commits em dois meses é o meu período mais produtivo desde que comecei a construir publicamente em 2023.

O Modelo: DeepSeek V4 Pro com High Thinking

O modelo que estou usando não é a opção mais barata da DeepSeek. O V4 Flash custa $0.14 por milhão de tokens de entrada (cache miss) e $0.28 por milhão de saída. Eu usei a versão Pro — $0.435 por milhão de entrada, $0.87 por milhão de saída — com o modo High Thinking ativado. Não é a configuração mais barata. Eu deveria mesmo mudar para o Flash — é ainda mais barato. Mas quando a conta total é de $33, a urgência simplesmente não existe.

Vou começar a usar mais o Flash daqui para frente. Mas isso diz algo sobre a psicologia das ferramentas baratas: quando o custo é baixo o suficiente, você para de otimizar. Você só constrói.

O Multiplicador do Cache Que Ninguém Menciona

Esta é a parte que mais importa, e a parte que torna possíveis os números do título acima.

O OpenCode, o harness de codificação que uso, mantém um cache de prompts da DeepSeek. Minha taxa de cache hit fica entre 90-95%+. Isso transforma completamente a economia:

Tipo de tokenPreço por 1M de tokens
Entrada (cache miss)$0.435
Entrada (cache hit)$0.003625
Saída$0.87

Tokens de entrada com cache hit custam 120 vezes menos que tokens de cache miss. Com 90%+ de cache hit, seu custo efetivo de entrada vira um erro de arredondamento. A maior parte do que você paga é a saída — o código realmente gerado, as respostas reais. Essa é a arquitetura que torna possível pagar $33/mês com uso pesado.

Sem o cache, 4,1 bilhões de tokens de entrada a $0.435/M custariam cerca de $1,780 — só em junho. Com 95% de cache hit, o custo efetivo de entrada cai para aproximadamente $7. O modelo é barato. O cache o torna de graça.

Como é a Qualidade Nesse Preço

A pergunta honesta: o DeepSeek V4 Pro entrega a mesma qualidade do que eu tinha com a combinação Claude Max + Codex a $200/mês?

A resposta é: depende do que você mede, mas para as minhas cargas de trabalho, a diferença é pequena e está diminuindo.

Em tarefas de codificação: o OpenCode + DeepSeek dá conta da mesma faixa de trabalho que eu fazia com Claude Code e Codex — TypeScript, React, Next.js, FastAPI, Python, Swift, migrações de banco de dados, configs YAML, shell scripts. A diferença de eficiência de tokens que notei com o Codex (cerca de 3x menos tokens que o Claude para o mesmo trabalho, como mencionei nos posts de março) também se aplica aqui, de outro jeito — o DeepSeek é mais conciso. Menos comentário, mais código.

Em tarefas de escrita: uso o mesmo modelo DeepSeek para escrever — posts de blog, conteúdo de curso, system prompts — direto no OpenCode. O ciclo de edição é diferente do que eu estava acostumado com o Claude. O estilo padrão do Claude é mais polido; o DeepSeek é mais direto. Nenhum é melhor. Você ajusta seus prompts.

Na avaliação da Sydney: depois de migrar o Ask Sydney para o DeepSeek, rodei uma avaliação de 30 perguntas com um juiz LLM. Os resultados: a qualidade da recuperação não mudou, a precisão das citações ficou em média 4.2/5, e a fidelidade de voz — o quanto a Sydney soa como eu — marcou 4.4/5. O que precisou de trabalho foi o grounding das fontes em tópicos de finanças e saúde, mas isso foi uma correção de prompt engineering, não um problema de qualidade do modelo. Apertei o system prompt — adicionei uma regra exigindo pelo menos uma citação de post do blog por afirmação importante em tópicos sensíveis — e fiz o redeploy.

O padrão que vi tanto no DIALOGUE quanto no Ask Sydney é o mesmo: nesse nível de preço, o prompt engineering pesa mais. Quando você paga $200 por mês para o Claude, pode se dar ao luxo de deixar o modelo resolver sozinho. Quando você paga $33, precisa ser mais específico. A boa notícia: o modelo segue instruções.

Uma Ferramenta, Um Modelo. A Simplificação Mental Que Ninguém Menciona.

A economia de custo é o que as pessoas notam. A mudança que importa mais: quando você para de administrar várias assinaturas e cadeias de ferramentas, você recupera largura de banda mental.

Minha configuração de abril era Claude Code para arquitetura e frontend, Codex para a implementação, e a API do Claude para o pipeline de podcast do DIALOGUE. Três fluxos de autenticação diferentes. Três comportamentos de rate limit diferentes. Três páginas de assinatura para conferir quando algo parava de funcionar.

Não sinto falta do dual-wielding. Nenhuma. Uma ferramenta, um modelo, um único modelo mental de como o sistema se comporta. Abro o OpenCode. Digito. Funciona.

Esse é o limite que importa. Não é "é melhor?". É: "é bom o suficiente para que o preço desapareça como variável?"

A Realidade dos Preços — e o Que Vem a Seguir

O preço atual da DeepSeek inclui esta nota:

Planejamos aumentar o preço geral dos serviços da API da DeepSeek em um futuro próximo, com um aumento significativo esperado.

Os preços vão subir. Sempre sobem. O mês de $33 não vai continuar em $33 para sempre. Mas o padrão — barato o suficiente para você parar de otimizar, taxas de cache hit que transformam o custo de entrada em erro de arredondamento, prompt engineering que fecha a lacuna de qualidade — é duradouro.

Dois meses, $90.10 no total, 786 commits. Não vou voltar para cadeias de ferramentas de $300/mês a menos que algo me force. E vou começar a usar mais o Flash — porque, nesse ponto, por que não?

Ainda codando, ainda aprendendo, ainda entregando (por $45 ao mês).

Abraços, Chandler :P