AI 成本指南

AI 成本优化指南与最佳实践

在不牺牲质量的前提下降低 LLM API 支出的实用、经实战验证的技巧。

提示词缓存要点

按供应商缓存输入费率复用符合条件的稳定提示词与参考上下文,并实际测量命中率和成本变化。

  • 将稳定内容(系统提示、工具、参考资料)置于开头。
  • 将可变的用户输入放在提示词末尾。
  • 在静态前缀上启用缓存并衡量命中率。
阅读英文完整指南

按难度进行模型路由

将简单任务发送给小型廉价模型,把旗舰模型留给真正的推理,从而大幅降低综合成本。

  • 在推理前按复杂度对每个请求分类。
  • 将分类与提取路由到小型模型。
  • 仅将困难任务升级到旗舰模型。

输出 Token 控制

输出成本是输入的数倍。约束并塑造回复,以控制最昂贵的 Token。

  • 在每次调用上设置明确的 max_tokens。
  • 在由机器消费的场景中要求简洁或结构化输出。
  • 优先选择长上下文配短回答,而非冗长生成。

RAG 上下文效率

检索会悄然膨胀输入 Token。调优分块与重排序,发送更少、更精准的段落。

  • 使用固定评估集测试多种分块大小。
  • 对候选进行重排序,仅保留达到实测相关性阈值的段落。
  • 发送前去除样板文本并去重。
阅读英文完整指南

AI Agent 预算

Agent 在每次循环都会重发不断增长的上下文。限制步数并压缩历史,让运行更经济。

  • 为每次 Agent 运行设置硬性步数上限。
  • 摘要对话历史,而非携带完整记录。
  • 使用廉价模型进行编排与工具选择。
阅读英文完整指南

基础设施成本卫生

除 Token 外,重试、嵌入与闲置容量也会累积。让成本在整个技术栈中可观测。

  • 通过稳健的错误处理与验证减少重试。
  • 为嵌入设置版本并增量重嵌。
  • 对自托管 GPU 容量进行合理规格或自动扩缩。