Prompt缓存节省成本计算器

输入每天请求次数、每次请求的prompt总token数与可缓存token数、缓存命中率,按厂商预设或自定义的缓存写入/命中价格倍数,估算启用Prompt Caching后每天/每月能省多少钱。

免费在线工具
Loading…

使用说明

  1. 在「厂商预设」下拉框选择 Anthropic Claude / OpenAI / Gemini,会自动填入对应的缓存写入价格倍数和命中价格倍数,也可以手动改成你实际拿到的报价。
  2. 填写「每天请求次数」「常规输入单价」(美元/百万token)。
  3. 填写「每次请求 prompt 总 token 数」和「其中可缓存的 token 数」(如固定的系统提示词、长文档、工具定义等重复出现的部分)。
  4. 填写「缓存命中率」:即多次请求中,命中已缓存内容(而非首次写入)的比例。
  5. 点击「计算」,查看不启用缓存 vs 启用缓存的每日成本对比,以及每日/每月节省金额和节省比例。
  6. 点击「加载示例数据」可快速看到一个典型场景(5000次/天请求、92%缓存命中率)下的计算结果。

功能介绍

  • 内置 Anthropic Claude(写入1.25倍/命中0.1倍)、OpenAI(写入1倍/命中0.5倍)、Google Gemini(写入1倍/命中0.25倍)三种厂商价格预设,一键套用。
  • 成本模型区分「不可缓存部分」「缓存命中部分」「缓存未命中(写入)部分」分别计价,符合主流厂商真实计费逻辑。
  • 同时给出每日成本对比、每日节省、每月节省(按30天折算)与节省百分比四项结果。
  • 所有价格倍数均可手动覆盖预设值,适配非标准报价场景。

使用场景

客服机器人成本优化评估
客服机器人每次请求都携带固定的知识库前缀和系统提示词,填入日请求量和缓存命中率,评估启用Prompt Caching后能降低多少API支出。
多厂商价格方案对比
分别切换Anthropic、OpenAI、Gemini预设,对比同样的调用规模下哪家的缓存机制更省钱,辅助模型选型决策。
长文档问答场景成本预估
针对携带长文档上下文的问答类应用,估算把文档部分设为可缓存内容后的成本降幅,判断是否值得改造调用方式。
预算汇报材料准备
计算出启用缓存前后的每月成本差异,作为向团队/上级申请启用缓存功能或调整调用架构的数据支撑。

常见问题

缓存写入价格倍数和命中价格倍数是什么意思?
多数厂商的Prompt Caching对首次写入缓存的token收取比常规单价更高的费用(如Anthropic为1.25倍),而对后续命中缓存的token收取更低费用(如Anthropic为0.1倍,即打1折)。工具按这两个倍数分别计价再求和。
缓存命中率应该怎么估算?
如果你的请求里有固定不变的系统提示词或长上下文(比如客服机器人的知识库前缀),命中率通常很高(90%以上);如果每次请求内容都不重复,缓存命中率会很低,节省也会很有限。建议参考实际调用日志统计。
为什么“不启用缓存”的成本里不区分写入和命中?
不启用缓存时,每次请求的全部prompt token都按常规单价计费,不存在写入/命中的区分,这正是缓存能省钱的原因所在。
这个工具会连接我的API账号查询真实用量吗?
不会。本工具是纯前端计算器,所有计算基于你手动填写的参数在浏览器本地完成,不会读取或上传任何账号数据。
每月节省金额是怎么算出来的?
按「每日节省金额 × 30」简单折算,实际每月天数、请求量波动会有出入,仅作为量级参考。