分层推理省钱法:小模型扛量,大模型扛质
我踩过最贵的一个坑,不是订阅费,是「默认全用旗舰模型」。早期我把摘要、重写、打标签、清洗这些活全丢给最强模型,月底账单吓一跳,回头一看,其中八成其实 7B 本地模型就干得凑合。
问题不在模型,在我没给任务分档。
核心:按「容错 × 价值」把流量分层
- 第 0 层 · 扛量:批量摘要、旧文重写、表格清洗、评论打标——量大、容错高、错了能重跑。这一层交给本地 7B/8B(Ollama 跑)或最便宜的 API,一次跑几千条,边际成本接近零。
- 第 1 层 · 常规交互:客服初稿、邮件、中等难度的改写——要一定质量但不致命。交给中档模型,价格和质量都在甜区。
- 第 2 层 · 关键决策:对客的核心文案、合同/代码的最终质检、复杂推理——不容错、价值高。这一层才上最强模型,但它只占你总流量的一个小头。
省钱的秘密就一句话:钱花在边际收益最高的那一小段,其余能下沉就下沉。
怎么落地(我现在的做法)
- 统一入口。 用 LiteLLM 起一个 OpenAI 兼容网关,所有调用走一个 endpoint,模型名加前缀切供应商。好处是路由和成本追踪都在一处,不用在每个脚本里散落 key。
- 给每个任务标「最低可接受档位」。 不是「用哪个模型」,而是「这个活最低用哪个模型不至于翻车」。默认下沉到该档,只有触发质量门才升级。
- 用升级代替全量贵模型。 呼应 GitHub HydraFusion 的思路:便宜模型先出一版,质量门判断要不要升级强模型审稿/重写。大多数任务在「草稿 + 一次审稿」后就够了,根本到不了第 2 层。
- 本地跑量。 量大的脏活在本地 Ollama 跑,不花一分云 API 钱;敏感数据也不出本机。
升级模型的判断清单
不是「难」就升级,是这几个信号出现才升:
- 输出要直接对客、错了要赔/要重做;
- 任务涉及长链条推理或多步规划,小模型明显跑偏;
- 这是你产品的核心产出,质量直接决定复购。
其余一律下沉。
几个坑
- 小模型的能力边界要先压测。 拿自己最难的 20 条样本跑一遍,再决定放不放进第 0 层,别凭感觉。
- 路由规则要写死,别靠模型自己选。 「能下沉就下沉」是你在代码/配置里定的规矩,不是给模型的提示词。
- 成本追踪必须开。 不接数据库、只看内存态的话,省钱就是空话——月底你根本不知道哪层在烧钱。LiteLLM 的 Proxy 配个 Postgres,按项目看花费。
- 别为了省把关键层也省了。 下沉过头,对客质量掉下去,省下的 API 钱不够赔口碑。
最后一句:分层推理不是「少花钱」,是「把钱花在刀刃上」。一人公司最稀缺的是每一分算力对应的确定性——把贵模型留给真正配得上它的那 10% 的活,剩下的交给能跑量的小模型,这才是可持续的用法。