DeepSeek V4.1 Flash:半万亿 MoE 把推理成本压到两分钱
DeepSeek 在 9 月 10 日放出 V4.1 Flash,一个 552B 参数的多模态 MoE,但每次推理只激活 8B(prefill)/16B(decode)参数,上下文窗口 1M token,MIT 协议开源。它在工程上最值得一人公司盯的不是「多大」,而是「多便宜」。
几个关键数字(来自 DeepSeek 自己的评测):
- KV cache 890 字节/token,而初代 DeepSeek 是 389,000 字节——小了 400 倍以上。这就是为什么它能把长上下文的服务成本压到很低。
- 在 45 万亿多模态 token 上从零训练;DeepSeek 自测 Terminal-Bench 2.1 得 90.6、DeepSWE 1.1 得 74.2,高于 Opus 5 和 GPT-5.6 Sol。
- 按 DeepSeek 口径,单任务成本大约 2 分钱。
对一个人公司真正有用的点:
- 本地/小卡也能扛长上下文。 KV cache 暴降意味着同样显存能塞下更长对话和历史,做长文档分析、长代码库问答时,硬件门槛低了一大截。
- MIT + 开放权重 = 能自己部署。 不想把客户数据送出去的,可以挂到自己机器上,上下文一句不出本地。
- 2 分钱/任务的量级,让「给每个客户跑一遍分析」「批量处理一堆文档」这种之前嫌贵的动作,可以放心自动化了。
几个要泼的冷水:
- 数字来自 DeepSeek 自家评测,独立复测还没跟上,先当「上限」看,别当「保底」。
- 552B 总参数再怎么省激活,跑起来也远不是消费级显卡能轻松扛的;真要自托管得算清显存账。
- 半年内模型迭代极快,别为了追这个版本专门重构你的推理栈。
我的建议:把它当成「长上下文 + 低成本」的备选底座,用 API 或 OpenRouter 先跑通你的场景再决定是否自托管。重点看 KV cache 优势在你的长文本任务上到底能省多少,而不是盯着 552B 这个总参数。
- 发布与权重索引:ThursdAI · Open Source Releases(含 V4.1 Flash 条目)
- 权重与 tech report:Hugging Face · deepseek-ai/DeepSeek-V4.1-Flash
原文出处 · 事实以此为准
ThursdAI · Open Source Releases