Phase 18:成本与性能优化
模型路由、缓存、Token 预算与降级
关键要点
- 按任务复杂度和延迟目标选择模型,比固定使用一个模型更稳
- 缓存可以把重复请求成本降到接近 0
- Token 预算应该覆盖输入上下文和输出长度两端
学习目标
- 理解模型路由如何平衡质量、延迟和成本
- 能用缓存减少重复请求成本
- 知道 token 预算会同时影响输入成本和输出延迟
标签:Cost · Latency · Model Routing · Cache
预计学习时间:34 分钟 | 难度:高级
模型路由、缓存、Token 预算与降级
标签:Cost · Latency · Model Routing · Cache
预计学习时间:34 分钟 | 难度:高级