DeepSeek V4.1 Flash 调价:缓存命中和没命中差 50 倍,坑在这里
这条不是发布会新闻,是账单新闻。DeepSeek 的官方定价页跟着 V4.1 Flash 一起更新了,几个数字值得抄进你的成本表(单位:美元 / 百万 token):
| 计费项 | 闲时 | 高峰 |
|---|---|---|
deepseek-flash 输入(缓存命中) | $0.003 | $0.006 |
deepseek-flash 输入(缓存未命中) | $0.15 | $0.3 |
deepseek-flash 输出 | $0.6 | $1.2 |
deepseek-v4-pro 输出 | $1.98 | $3.96 |
高峰时段是周一到周五 UTC 01:00–04:00 与 06:00–10:00(换算北京时间 9:00–13:00、14:00–18:00),中国法定节假日全天算闲时,周末也全天算闲时。
真正的重点藏在第一行和第一列的对比里:缓存命中 $0.003,未命中 $0.15,差 50 倍。 这意味着你同样的业务量、同样的模型,账单可能因为输入怎么拼而相差一个数量级。
为什么会有这种差额:DeepSeek 的缓存按前缀匹配。它会把你输入里前面一段稳定不变的内容缓存下来,下次请求只要前缀一致,这部分就按命中价算。一旦前缀变了(哪怕只变一个字符),从变化点开始全部按未命中重新计费。
所以对独立开发者来说,“优化成本”的第一步不是换更便宜的模型,是把 prompt 重新排一遍:
- 把不变的部分放最前面:系统提示、工具定义、少样本示例、知识片段。顺序固定不要动态调整。
- 把每次都变的部分放最后:用户输入、当前时间戳、一次性 ID、随机数。
- 别把变量塞进前缀:很多人习惯在系统提示里写”今天是 {{date}}“,这一句会让每天第一次请求必然未命中,之后当天缓存才会生效——更好的做法是把日期放到用户输入那段。
- 按用户或租户分桶:多用户共享同一个前缀命中率反而高,但如果在前缀里塞了用户画像,等于给每个用户各开一份缓存。
泼点冷水:别指望命中率做到 100%。多轮对话、RAG 检索内容每次不同、上下文窗口被截断都会把缓存打散。合理的验收线是先看一个月的实际情况再定目标,别拿理论值做预算。另外这张表是美元标价,人民币通道计费以平台实际汇率与余额结算为准,月底对账时对一两次。
顺带一条:V4 Pro 原本计划随 Flash 上线下线,后来因为不少开发者反馈还在依赖旧版、反对下线,官方改口在 9 月 14 日之后继续提供 deepseek-v4-pro-0813 的调用。这是一次提醒——再便宜的模型也别只绑一家,模型层做一层抽象,留一条能在一小时内切走的备用通道。
原文出处 · 事实以此为准
DeepSeek API Docs · Models & Pricing