RAG检索延迟估算器

填写query embedding、向量检索、可选rerank重排序、LLM首字节延迟(TTFT)、生成速度等各阶段耗时,估算RAG问答的端到端平均延迟与p95延迟,并按阶段拆分占比找出瓶颈。

免费在线工具
Loading…

使用说明

  1. 依次填写「Query Embedding耗时」「向量库检索耗时」(单位均为毫秒)。
  2. 如果链路中包含rerank重排序阶段,勾选「启用Rerank重排序阶段」并填写其耗时,不勾选则该阶段不计入总延迟。
  3. 填写「LLM首字节延迟TTFT」「预期输出token数」「LLM生成速度」(tokens/秒),工具会自动折算出LLM生成阶段耗时。
  4. 填写「p95放大系数」(默认1.5),用于从平均延迟估算高峰期的尾部延迟。
  5. 点击「计算」查看平均总延迟和p95总延迟两个汇总卡片,以及下方各阶段耗时占比的条形图,用来判断瓶颈在哪一环。
  6. 点击「加载示例数据」快速查看一个典型RAG问答场景的计算结果。

功能介绍

  • 覆盖RAG链路的5个典型阶段:Query Embedding、向量检索、Rerank重排序(可选开关)、LLM首字节延迟、LLM逐字生成。
  • LLM生成耗时按「输出token数 ÷ 生成速度」自动折算,无需手动换算。
  • 提供可调节的p95放大系数,从平均延迟估算高峰期尾部延迟,更贴近真实用户感知。
  • 各阶段耗时占比用条形图直观展示,帮助快速定位延迟瓶颈集中在检索环节还是生成环节。

使用场景

上线前延迟预算评估
在正式接入向量库和LLM之前,先用预估的各阶段耗时估算端到端延迟是否能满足产品对响应速度的要求。
是否启用Rerank的取舍判断
对比启用和不启用Rerank两种配置下的总延迟差异,结合Rerank带来的检索质量提升,判断这个延迟代价是否值得。
延迟瓶颈定位
填入实测的各阶段耗时数据,通过占比条形图快速判断延迟主要花在了向量检索、Rerank还是LLM生成阶段,指导优化方向。
模型选型时延迟对比
固定检索侧的耗时,只切换LLM的TTFT和生成速度参数,对比不同模型在同一RAG链路下的端到端延迟表现。

常见问题

p95放大系数应该填多少?
这是一个经验系数,用于从平均延迟粗略估算尾部延迟,常见取值在1.5~2之间;如果你有实测的p95/平均值比例,建议直接使用真实比例填入会更准确。
不启用Rerank会怎样影响结果?
取消勾选「启用Rerank重排序阶段」后,该阶段的耗时不会计入总延迟计算,适合评估“去掉rerank步骤能省多少延迟”这类场景。
LLM生成速度应该填多少?
建议填写你实际调用的模型在生产环境下的实测吞吐(tokens/秒),不同模型、不同并发压力下这个值差异很大,理论峰值通常比实际值乐观。
这个工具是实时测量还是估算?
是纯估算工具,基于你手动填写的各阶段耗时参数在浏览器本地计算,不会真实调用任何向量库或LLM接口。