AI 成本指南
AI 成本优化指南与最佳实践
在不牺牲质量的前提下降低 LLM API 支出的实用、经实战验证的技巧。
提示词缓存要点
按供应商缓存输入费率复用符合条件的稳定提示词与参考上下文,并实际测量命中率和成本变化。
- 将稳定内容(系统提示、工具、参考资料)置于开头。
- 将可变的用户输入放在提示词末尾。
- 在静态前缀上启用缓存并衡量命中率。
按难度进行模型路由
将简单任务发送给小型廉价模型,把旗舰模型留给真正的推理,从而大幅降低综合成本。
- 在推理前按复杂度对每个请求分类。
- 将分类与提取路由到小型模型。
- 仅将困难任务升级到旗舰模型。
输出 Token 控制
输出成本是输入的数倍。约束并塑造回复,以控制最昂贵的 Token。
- 在每次调用上设置明确的 max_tokens。
- 在由机器消费的场景中要求简洁或结构化输出。
- 优先选择长上下文配短回答,而非冗长生成。
RAG 上下文效率
检索会悄然膨胀输入 Token。调优分块与重排序,发送更少、更精准的段落。
- 使用固定评估集测试多种分块大小。
- 对候选进行重排序,仅保留达到实测相关性阈值的段落。
- 发送前去除样板文本并去重。
AI Agent 预算
Agent 在每次循环都会重发不断增长的上下文。限制步数并压缩历史,让运行更经济。
- 为每次 Agent 运行设置硬性步数上限。
- 摘要对话历史,而非携带完整记录。
- 使用廉价模型进行编排与工具选择。
基础设施成本卫生
除 Token 外,重试、嵌入与闲置容量也会累积。让成本在整个技术栈中可观测。
- 通过稳健的错误处理与验证减少重试。
- 为嵌入设置版本并增量重嵌。
- 对自托管 GPU 容量进行合理规格或自动扩缩。