成本控制指南
同样的业务量,成本可能差好几倍。下面是可以直接落地的做法,按收益从高到低排列。
1. 给每把 Key 设额度与模型白名单
- 一把 Key 一个用途(后端服务 / 客户端 / 批量任务),分开限制。
- 白名单只放开真正用到的模型:既能省钱,也能防"误用贵模型"。
2. 显式设置 max_tokens
输出是单价最高的部分。不设上限时,模型可能生成远超需要的长度。
3. 善用缓存价
命中缓存的部分按缓存价计费(通常远低于输入价)。做法:
- 把稳定不变的前缀(系统提示词、知识库片段、少样本示例)放在消息前部;
- 同一份上下文在短时间内重复使用时,不要重排内容顺序;
- 在「使用日志 → 计费过程」里能看到缓存命中 tokens 的数量,据此验证优化是否生效。
4. 避开高峰时段(或用平价模型)
高峰倍率按请求进入平台的时刻判定:工作日 09:00–12:00 与 14:00–18:00(不含法定节假日)价格上浮。 批量任务可以挪到平峰时段跑。
5. 用「智能路由」压成本
对成本敏感、对来源不敏感的模型,把路由设为价格优先(按渠道成本升序)。 平台做限免/折扣活动时,命中活动会按活动价计费。
6. 给批量任务加护栏
- 应用侧限制并发任务数,避免瞬时把额度打满;
- 轮询任务时用退避(任务类接口见「任务类接口」一篇);
- 给批量任务单独发一把 Key 并设置较低额度,出问题只影响这一把。
7. 定期核对
- 「钱包 → 余额明细」看资金流水;
- 「使用日志 → 导出对账单」按时间范围导出自查;
- 「性能看板」看成功率与延迟,避免因重试造成隐性成本。