मैंने 13 महीनों में Anthropic को US$1,892.38 चुकाए। वो था Claude Code Max — $200 प्रति महीने — और उसके ऊपर OpenAI के Codex के लिए अतिरिक्त $20-100। दोनों मिलाकर, सिर्फ़ AI tooling पर हर महीने कहीं $200 से $300 के बीच खर्च होता था।
मैंने अप्रैल में Claude Max cancel कर दिया। मैंने इसके बारे में लिखा — कई बार। हर post सही setup ढूँढने की एक ईमानदार कोशिश थी, जबकि tools मेरे पैरों तले लगातार बदल रहे थे।
दो महीने पहले मैंने dual-wielding पूरी तरह बंद कर दी। मैंने एक ही coding harness के ज़रिए एक ही model — DeepSeek V4 Pro with High Thinking — पर switch कर लिया। यहाँ बता रहा हूँ कि असल में क्या हुआ।
जून: $57.01। जुलाई: $33.09।

मेरा जून का DeepSeek बिल: 4.1 billion tokens processed, कुल $57.01।

जुलाई: 2.1 billion tokens, $33.09। यह गिरावट आंशिक रूप से इसलिए आई क्योंकि मैंने जून में एक बड़ा localization project पूरा किया, और आंशिक रूप से इसलिए क्योंकि मैं prompt engineering में बेहतर हो गया — छोटे prompts, कम retries, same output quality।
दो महीने मिलाकर: $90.10। यह उससे भी कम है जो मैं एक अकेले महीने के Claude Max के लिए दे रहा था। और अगर Codex subscription को भी गिनें, तो एक-तिहाई से भी कम।
जब आप खर्च 75% घटाते हैं, तो हर कोई तुरंत यही सवाल पूछता है: "क्या आप धीमे हो गए?" यहाँ है जवाब।
786 Commits। 4 Products। Zero Slowdown।
मैं अपना काम git के ज़रिए track करता हूँ। यह perfect productivity metric नहीं है — line counts का कोई मतलब नहीं, और एक अकेला commit typo fix से लेकर database migration तक कुछ भी represent कर सकता है। लेकिन दिशा देखने के लिहाज़ से यह आपको कुछ असली बताता है।
1 जून से 31 जुलाई 2026 के बीच, चारों products पर जिन्हें मैं maintain करता हूँ:
-
DIALOGUE (podcast platform): 382 commits। 6 भाषाओं का World Cup podcast network लॉन्च किया, जिसमें YouTube, Spotify और Apple Podcasts पर automated publishing है। 41-post का SEO content calendar बनाया। 40 episodes और हर episode पर 7 dimensions score करने वाले LLM judge के साथ full pipeline evaluation framework चलाया।
-
chandlernguyen.com (यह site + Ask Sydney): 168 commits। 7-module course को पूरी तरह Japanese में localize किया। LLM-as-judge scoring के साथ 30-question का Sydney eval framework बनाया। Sydney का system prompt शुरू से दोबारा structure किया। Homepage redesign की।
-
Prova (AI builder coach): 228 commits। तीनों personas के लिए unified curriculum sequences ship कीं। Drag-and-drop के साथ iPad-native experience बनाया। Cross-device draft sync और brief-driven reset paths जोड़े।
-
STRAŦUM (marketing intelligence): 8 commits। शांत अवधि। कभी-कभी कुछ न ship करना ही सही call होता है।
मैं धीमा नहीं हो रहा था। हुआ यह है कि मैं accelerate कर रहा था — दो महीनों में 786 commits, 2023 में public में build करना शुरू करने के बाद से मेरा सबसे productive दौर है।
Model: DeepSeek V4 Pro with High Thinking
जो model मैं इस्तेमाल कर रहा हूँ वो DeepSeek का सबसे सस्ता option नहीं है। V4 Flash की कीमत $0.14 प्रति million input tokens (cache miss) और $0.28 प्रति million output है। मैंने Pro version इस्तेमाल किया — $0.435 प्रति million input, $0.87 प्रति million output — High Thinking mode on करके। सबसे सस्ता config नहीं। मुझे शायद Flash पर switch कर लेना चाहिए — वो और भी सस्ता है। लेकिन जब total bill $33 हो, तो urgency बस होती नहीं।
अब से मैं Flash को ज़्यादा इस्तेमाल करना शुरू करूँगा। लेकिन यही आपको cheap tools की psychology के बारे में कुछ बताता है: जब cost इतनी कम हो जाती है, तो आप optimize करना बंद कर देते हैं। आप बस build करते रहते हैं।
वो Cache Multiplier जिसके बारे में कोई बात नहीं करता
यहाँ है सबसे ज़रूरी हिस्सा — और वो हिस्सा जो ऊपर के headline numbers को संभव बनाता है।
OpenCode, जो coding harness मैं इस्तेमाल करता हूँ, एक DeepSeek prompt cache maintain करता है। मेरी cache hit rate 90-95%+ पर चलती है। यह economics को पूरी तरह बदल देता है:
| Token type | Price per 1M tokens |
|---|---|
| Input (cache miss) | $0.435 |
| Input (cache hit) | $0.003625 |
| Output | $0.87 |
Cache-hit input tokens की कीमत cache-miss tokens से 120 गुना कम है। 90%+ cache hit पर आपका effective input cost बस rounding error है। ज़्यादातर जो आप चुकाते हैं वो output है — असली generated code, असली responses। यही architecture है जो heavy usage के साथ $33/महीना संभव बनाता है।
Cache के बिना, $0.435/M पर 4.1 billion tokens input की कीमत करीब $1,780 होती — सिर्फ़ जून के लिए। 95% cache hit के साथ effective input cost घटकर करीब $7 रह जाता है। Model सस्ता है। Cache उसे free बना देता है।
इस कीमत पर Quality कैसी दिखती है
ईमानदार सवाल: क्या DeepSeek V4 Pro वैसी ही quality produce करता है जैसी मुझे $200/महीने वाले Claude Max + Codex combo से मिल रही थी?
जवाब: यह इस पर depend करता है कि आप क्या measure करते हैं, लेकिन मेरे workloads के लिए, gap छोटा है और लगातार बंद हो रहा है।
Coding tasks पर: OpenCode + DeepSeek उसी range का काम handle करता है जो मैं Claude Code और Codex के साथ कर रहा था — TypeScript, React, Next.js, FastAPI, Python, Swift, database migrations, YAML configs, shell scripts। Codex के साथ जो token-efficient difference मैंने नोट किया था (equivalent काम के लिए Claude से करीब 3x कम tokens, जैसा मैंने अपनी March posts में बताया था) वो यहाँ भी एक अलग तरह से लागू होता है — DeepSeek ज़्यादा concise है। कम commentary, ज़्यादा code।
Writing tasks पर: मैं लिखने के लिए भी वही DeepSeek model इस्तेमाल करता हूँ — blog posts, course content, system prompts — सीधे OpenCode में। Editing cycle कुछ और है जो मुझे Claude के साथ आदत थी। Claude की default style ज़्यादा polished है; DeepSeek ज़्यादा direct। कोई बेहतर नहीं है। आप अपने prompts adjust करते हैं।
Sydney eval पर: Ask Sydney को DeepSeek पर switch करने के बाद, मैंने LLM judge के साथ 30-question evaluation चलाई। नतीजे: retrieval quality में कोई बदलाव नहीं आया, citation accuracy का औसत 4.2/5 रहा, और voice fidelity — Sydney कितना मेरी तरह बोलता है — ने 4.4/5 score किया। जिस चीज़ पर काम करने की ज़रूरत थी वो finance और healthcare topics पर source grounding थी, लेकिन वो prompt engineering का fix था, model quality का issue नहीं। मैंने system prompt और कसा — एक rule जोड़ा कि sensitive topics पर हर major claim के साथ कम से कम एक blog post citation हो — और redeploy कर दिया।
जो pattern मैंने DIALOGUE और Ask Sydney दोनों में देखा है वो यही है: इस price point पर prompt engineering का ज़्यादा वज़न होता है। जब आप Claude को $200/महीना दे रहे होते हैं, तो आप यह afford कर सकते हैं कि model चीज़ें खुद figure out कर ले। जब आप $33 दे रहे होते हैं, तो आपको ज़्यादा specific होना पड़ता है। अच्छी खबर: model instructions follow करता है।
One Tool, One Model। वो Mental Simplification जिसके बारे में कोई बात नहीं करता।
Cost savings वो है जो लोग notice करते हैं। जो shift ज़्यादा मायने रखता है वो यह: जब आप कई subscriptions और tool chains manage करना बंद कर देते हैं, तो आप mental bandwidth वापस पा लेते हैं।
मेरा अप्रैल का setup था — Claude Code architecture और frontend काम के लिए, Codex implementation के लिए, और Claude का API DIALOGUE की podcast pipeline के लिए। तीन अलग authentication flows। तीन अलग rate limit behaviors। जब कुछ काम करना बंद कर देता था तो check करने के लिए तीन अलग subscription pages।
मुझे dual-wielding बिल्कुल miss नहीं होती। बिल्कुल नहीं। One tool, one model, system के व्यवहार के लिए one mental model। मैं OpenCode खोलता हूँ। मैं type करता हूँ। यह चलता है।
वही threshold मायने रखता है। यह नहीं कि "क्या यह बेहतर है।" बल्कि: "क्या यह इतना अच्छा है कि price एक variable की तरह गायब हो जाए।"
Pricing की असली तस्वीर — और आगे क्या होगा
DeepSeek की मौजूदा pricing में यह note शामिल है:
हम निकट भविष्य में DeepSeek API services की overall pricing बढ़ाने की योजना बना रहे हैं, और एक significant increase की उम्मीद है।
Prices बढ़ेंगी। हमेशा बढ़ती हैं। $33 वाला महीना हमेशा $33 नहीं रहेगा। लेकिन pattern — इतना सस्ता कि आप optimize करना बंद कर दें, cache hit rates जो input costs को rounding errors में बदल देती हैं, prompt engineering जो quality gap को बंद कर देती है — durable है।
दो महीने हो गए, कुल $90.10, 786 commits। मैं $300/महीने वाली tool chains पर वापस नहीं जा रहा, जब तक कि कोई चीज़ मुझे मजबूर न करे। और मैं Flash को ज़्यादा इस्तेमाल करने लगूँगा — क्योंकि इस point पर, क्यों नहीं?
अब भी coding, अब भी सीख रहा हूँ, अब भी ship कर रहा हूँ ($45 प्रति महीने में)।
शुभकामनाओं सहित, Chandler :P