上下文缓存TTL策略规划器

根据上下文复用频率与缓存计费规则,规划应选择哪个TTL缓存档位,并估算相比不缓存能节省的成本。

免费在线工具
Loading…

使用说明

  1. 填写「同一上下文平均复用间隔(分钟)」,即相同上下文被再次调用的平均时间间隔。
  2. 填写「同一上下文调用次数」,即该上下文预计会被复用几次。
  3. 填写「单次调用输入Token数」及「可缓存Token占比」(如系统提示词+长文档等固定前缀占比)。
  4. 填写「基础单价」「缓存写入价格倍数」「缓存命中读取折扣」(参考所用模型服务商的实际计费文档填写)。
  5. 结果区自动显示推荐TTL档位、不缓存成本、缓存后成本、节省比例及具体建议文字,修改任一输入实时重新计算。
  6. 点击「加载示例数据」可快速查看一个典型场景(10分钟复用间隔、5次调用)的规划结果。

功能介绍

  • 内置5分钟/1小时/24小时三档常见Prompt Caching TTL选项,按标准价格系数区分。
  • 综合上下文平均复用间隔、复用次数、单次输入Token数、可缓存Token占比、基础单价、缓存写入价格倍数、缓存命中读取折扣七项参数进行计算。
  • 自动选出「能覆盖复用间隔的最小TTL档位」作为推荐(TTL越长通常标准成本越高,选够用的最小档最省钱)。
  • 当复用间隔超过所有TTL档位、或同一上下文只调用一次时,明确提示不建议开启缓存。
  • 对比缓存前后总成本与节省百分比,并给出具体建议说明。

使用场景

客服/知识库问答机器人成本优化
针对反复复用同一份长文档/知识库上下文的问答场景,规划合适的缓存TTL以降低API调用成本。
多轮对话Agent的Prompt缓存策略设计
为需要在多轮对话中反复携带相同系统提示词和历史上下文的Agent应用,设计成本最优的缓存TTL方案。
LLM应用上线前的API成本预估
在产品上线前,结合预估的用户请求模式规划缓存策略,预估引入Prompt Caching后能降低多少API成本。

常见问题

为什么要选「能覆盖复用间隔的最小TTL」而不是直接选最长的?
很多模型服务商对更长的TTL档位收取略高的标准/维持成本(本工具用standingCostMultiplier模拟这个差异)。只要选中的TTL大于等于复用间隔,缓存就不会在下次复用前过期,此时选最小满足条件的档位通常整体成本最低。
复用间隔超过所有TTL档位时为什么不建议缓存?
因为缓存会在下一次实际复用发生之前就过期失效,等于每次都要重新支付一次「写入」成本却拿不到「命中折扣」带来的收益,反而可能比不开缓存更贵,所以不建议开启。
「可缓存Token占比」应该怎么估算?
指输入内容中可以被稳定复用的固定前缀部分(如系统提示词、长文档、少样本示例等)占总输入Token数的比例,会随对话动态变化的部分不计入,可以粗略统计固定前缀长度除以总输入长度得到。