Phase 18:成本与性能优化

模型路由、缓存、Token 预算与降级

关键要点

  • 按任务复杂度和延迟目标选择模型,比固定使用一个模型更稳
  • 缓存可以把重复请求成本降到接近 0
  • Token 预算应该覆盖输入上下文和输出长度两端

学习目标

  • 理解模型路由如何平衡质量、延迟和成本
  • 能用缓存减少重复请求成本
  • 知道 token 预算会同时影响输入成本和输出延迟

标签:Cost · Latency · Model Routing · Cache

预计学习时间:34 分钟 | 难度:高级

Agent 知识中心
加载中...