Chuyển đến nội dung
Chandler Nguyen
AI7 phút đọc

Hóa Đơn AI Từ $200/Tháng Xuống $45. Tôi Ship Nhiều Hơn, Không Ít Đi

Tháng 6: $57.01. Tháng 7: $33.09. Hai tháng sau khi chuyển sang DeepSeek V4 Pro qua OpenCode, chi phí AI của tôi giảm 75%. Lịch sử commit chứng minh tôi ship nhiều hơn, không ít đi — 786 commits trên 4 sản phẩm. Đây là toàn bộ phân tích chi tiết.

Tôi đã trả cho Anthropic US$1,892.38 trong 13 tháng. Đó là Claude Code Max ở mức $200 một tháng, cộng thêm khoảng $20-100 cho Codex của OpenAI. Tổng cộng, mỗi tháng chỉ riêng công cụ AI đã ngốn khoảng $200 đến $300.

Tôi đã hủy Claude Max vào tháng 4. Tôi đã viết về chuyện đó — nhiều lần. Mỗi bài là một nỗ lực thành thật để tìm ra setup đúng đắn, trong khi các công cụ cứ thay đổi ngay dưới chân tôi.

Hai tháng trước, tôi bỏ hẳn việc dùng song song hai tool. Tôi chuyển sang một mô hình duy nhất — DeepSeek V4 Pro với High Thinking — thông qua một coding harness duy nhất. Đây là những gì thực sự đã xảy ra.

Tháng 6: $57.01. Tháng 7: $33.09.

DeepSeek June 2026 billing

Hóa đơn DeepSeek tháng 6 của tôi: 4.1 tỷ token được xử lý, tổng cộng $57.01.

DeepSeek July 2026 billing

Tháng 7: 2.1 tỷ token, $33.09. Con số giảm một phần vì tôi hoàn thành một dự án localization lớn trong tháng 6, một phần vì tôi đã giỏi prompt engineering hơn — prompt ngắn hơn, retry ít hơn, chất lượng output vẫn như cũ.

Hai tháng cộng lại: $90.10. Chưa bằng một nửa số tiền tôi từng trả cho một tháng Claude Max. Chưa bằng một phần ba nếu tính cả gói Codex bên trên.

Câu hỏi mà ai cũng hỏi ngay khi bạn cắt giảm 75% chi phí là: "Bạn có chậm lại không?" Đây là câu trả lời.

786 commits. 4 sản phẩm. Không hề chậm lại.

Tôi theo dõi công việc qua git. Đây không phải thước đo năng suất hoàn hảo — số dòng code chẳng có nghĩa lý gì, và một commit có thể đại diện cho bất cứ thứ gì từ sửa lỗi chính tả đến database migration. Nhưng nhìn theo hướng, nó nói cho bạn biết điều gì đó thật.

Trong khoảng từ 1/6 đến 31/7/2026, ở bốn sản phẩm tôi đang duy trì:

  • DIALØGUE (podcast platform): 382 commits. Ra mắt mạng lưới podcast World Cup 6 ngôn ngữ với hệ thống tự động xuất bản lên YouTube, Spotify và Apple Podcasts. Xây lịch nội dung SEO 41 bài. Vận hành một khung đánh giá pipeline đầy đủ với 40 tập và một LLM judge chấm 7 tiêu chí cho mỗi tập.

  • chandlernguyen.com (site này + Ask Sydney): 168 commits. Localize hoàn chỉnh một khóa học 7 module sang tiếng Nhật. Xây khung eval Sydney 30 câu hỏi với chấm điểm LLM-as-judge. Viết lại từ đầu system prompt của Sydney. Thiết kế lại homepage.

  • Prova (AI builder coach): 228 commits. Ship chuỗi curriculum thống nhất cho ba persona. Xây trải nghiệm iPad-native với drag-and-drop. Thêm đồng bộ draft giữa các thiết bị và luồng reset theo brief.

  • STRAŦUM (marketing intelligence): 8 commits. Giai đoạn yên tĩnh. Đôi khi không ship lại là quyết định đúng.

Tôi không hề chậm lại. Nếu có gì đó thì là tôi đang tăng tốc — 786 commits trong hai tháng là quãng năng suất nhất của tôi kể từ khi bắt đầu build công khai vào 2023.

Mô hình: DeepSeek V4 Pro với High Thinking

Mô hình tôi đang dùng không phải lựa chọn rẻ nhất của DeepSeek. V4 Flash có giá $0.14 cho mỗi triệu token input (cache miss) và $0.28 cho mỗi triệu token output. Tôi dùng bản Pro — $0.435 mỗi triệu input, $0.87 mỗi triệu output — với chế độ High Thinking bật. Không phải config rẻ nhất. Chắc tôi nên chuyển sang Flash — nó còn rẻ hơn. Nhưng khi tổng hóa đơn chỉ có $33, thì chẳng còn cảm giác khẩn trương nào nữa.

Từ giờ tôi sẽ dùng Flash nhiều hơn. Nhưng điều đó cũng nói lên một điều về tâm lý của công cụ rẻ: khi chi phí đủ thấp, bạn ngừng tối ưu. Bạn chỉ việc build.

Hệ số nhân cache mà không ai nói đến

Đây là phần quan trọng nhất, và là phần khiến các con số ở tiêu đề phía trên trở nên khả thi.

OpenCode, coding harness tôi đang dùng, duy trì một prompt cache cho DeepSeek. Tỷ lệ cache hit của tôi chạy ở 90-95%+. Điều đó thay đổi hoàn toàn cơ cấu chi phí:

Loại tokenGiá mỗi 1 triệu token
Input (cache miss)$0.435
Input (cache hit)$0.003625
Output$0.87

Token input trúng cache rẻ hơn 120 lần so với token trượt cache. Ở mức cache hit 90%+, chi phí input thực tế của bạn chỉ như một sai số làm tròn. Phần lớn số tiền bạn trả là cho output — chính là code được sinh ra, chính là những phản hồi thực. Đó là kiến trúc giúp mức $33/tháng trở nên khả thi dù dùng rất nhiều.

Nếu không có cache, 4.1 tỷ token input ở mức $0.435/M sẽ tốn khoảng $1,780 — chỉ riêng tháng 6. Với cache hit 95%, chi phí input thực tế tụt xuống còn khoảng $7. Mô hình thì rẻ. Cache biến nó thành gần như miễn phí.

Chất lượng ở mức giá này trông ra sao

Câu hỏi thật lòng: DeepSeek V4 Pro có cho chất lượng tương đương với combo Claude Max + Codex $200/tháng mà tôi từng dùng không?

Câu trả lời là: tùy vào thứ bạn đo, nhưng với workloads của tôi, khoảng cách là nhỏ và đang thu hẹp dần.

Về các tác vụ code: OpenCode + DeepSeek xử lý cùng một dải công việc tôi từng làm với Claude Code và Codex — TypeScript, React, Next.js, FastAPI, Python, Swift, database migration, YAML config, shell script. Sự khác biệt về hiệu quả token mà tôi nhận thấy với Codex (ít hơn khoảng 3 lần token so với Claude cho cùng khối lượng công việc, như tôi đã đề cập trong các bài tháng 3) vẫn đúng ở đây nhưng theo một cách khác — DeepSeek cô đọng hơn. Ít bình luận hơn, nhiều code hơn.

Về các tác vụ viết: Tôi dùng chính mô hình DeepSeek đó để viết — bài blog, nội dung khóa học, system prompt — ngay trong OpenCode. Chu kỳ chỉnh sửa khác với những gì tôi quen dùng với Claude. Style mặc định của Claude bóng bẩy hơn; DeepSeek thẳng hơn. Không bên nào tốt hơn. Bạn chỉ cần điều chỉnh prompt.

Về eval Sydney: Sau khi chuyển Ask Sydney sang DeepSeek, tôi chạy một bài đánh giá 30 câu hỏi với một LLM judge. Kết quả: chất lượng retrieval không đổi, độ chính xác citation trung bình 4.2/5, và voice fidelity — mức độ Sydney nghe giống tôi đến đâu — đạt 4.4/5. Thứ cần cải thiện là độ bám nguồn ở các chủ đề tài chính và sức khỏe, nhưng đó là vấn đề prompt engineering chứ không phải chất lượng mô hình. Tôi siết lại system prompt — thêm một quy tắc yêu cầu ít nhất một blog post citation cho mỗi tuyên bố lớn ở chủ đề nhạy cảm — rồi redeploy.

Mô hình tôi thấy ở cả DIALØGUE lẫn Ask Sydney là một: ở mức giá này, prompt engineering nặng ký hơn. Khi bạn trả $200 một tháng cho Claude, bạn có thể để mô hình tự tìm ra cách. Khi bạn chỉ trả $33, bạn cần cụ thể hơn. Tin tốt: mô hình tuân theo chỉ dẫn.

Một tool, một mô hình. Sự đơn giản hóa tinh thần mà không ai nói đến.

Chi phí tiết kiệm được là thứ người ta chú ý. Nhưng sự thay đổi quan trọng hơn là: khi bạn ngừng quản lý nhiều gói đăng ký và chuỗi công cụ, bạn lấy lại được không gian tinh thần.

Setup tháng 4 của tôi là Claude Code cho phần kiến trúc và frontend, Codex cho phần triển khai, và Claude API cho podcast pipeline của DIALØGUE. Ba luồng xác thực khác nhau. Ba hành vi rate limit khác nhau. Ba trang gói đăng ký khác nhau để kiểm tra khi có thứ gì đó ngừng hoạt động.

Tôi không hề nhớ việc dùng song song hai tool. Một chút cũng không. Một tool, một mô hình, một mô hình tinh thần duy nhất cho cách hệ thống vận hành. Tôi mở OpenCode. Tôi gõ. Nó chạy.

Đó mới là ngưỡng quan trọng. Không phải "nó có tốt hơn không." Mà là: "nó có đủ tốt để giá tiền biến mất như một biến số không."

Thực tế về giá — và điều gì xảy ra tiếp theo

Bảng giá hiện tại của DeepSeek có một ghi chú thế này:

We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected.

Giá sẽ tăng. Chúng luôn luôn tăng. Tháng $33 sẽ không mãi là $33. Nhưng mô hình đó — đủ rẻ để bạn ngừng tối ưu, tỷ lệ cache hit biến chi phí input thành sai số làm tròn, prompt engineering thu hẹp khoảng cách chất lượng — là bền vững.

Đã hai tháng, tổng $90.10, 786 commits. Tôi sẽ không quay lại chuỗi công cụ $300/tháng trừ khi có điều gì đó buộc tôi phải làm. Và tôi sẽ bắt đầu dùng Flash nhiều hơn — vì đến mức này thì sao lại không?

Vẫn đang code, vẫn đang học, vẫn đang ship (với $45 một tháng).

Thân mến, Chandler :P