AI Agent记忆Token预算规划器

按上下文窗口大小、系统提示词与工具定义占用,规划短期对话、长期记忆检索、工具调用结果的Token预算分配。

免费在线工具
Loading…

使用说明

1. 选择模型上下文窗口预设(或选择“自定义”手动填写窗口大小);2. 填写系统提示词与工具/函数定义各自占用的Token数;3. 设置短期对话历史、长期记忆检索结果、工具调用结果回填三者的分配百分比(建议之和为100%);4. 填写单轮对话平均Token数;5. 点击“计算预算分配”查看堆叠图、明细表及预估可支撑对话轮数。点击“加载示例数据”可快速查看示例结果。

功能介绍

支持8K/32K/128K/200K/1M五档常见上下文窗口预设及自定义窗口大小,先扣除系统提示词与工具/函数定义的固定Token占用,再按用户设置的百分比将剩余空间分配给“短期对话历史”“长期记忆检索结果”“工具调用结果回填”三部分,用堆叠进度条与明细表展示各部分Token数及占总窗口比例,并根据单轮对话平均Token数估算触发历史裁剪/摘要前大约可支撑的原始对话轮数;分配百分比之和不等于100%或固定占用超过窗口总量时会给出警告提示。

使用场景

Agent开发者设计记忆架构
在设计AI Agent的短期记忆/长期记忆/RAG检索比例时,用工具快速试算不同分配方案下的可用对话轮数,辅助架构决策。
程序员评估模型切换后的上下文影响
从32K窗口模型切换到128K/200K模型时,用工具重新规划各部分预算分配,评估是否需要调整摘要触发阈值。
技术负责人向团队解释上下文管理策略
用堆叠图和明细表向团队/客户直观展示Agent上下文预算是如何分配的,辅助技术方案沟通。

常见问题

三个百分比之和不等于100%会怎样?
工具不会自动归一化,而是按你填写的原始百分比直接计算,并在结果顶部给出警告提示,方便你自行判断是刻意预留缓冲空间,还是输入有误需要调整。
“可支撑对话轮数”是怎么算出来的?
用分配给“短期对话历史”的Token数,除以你填写的单轮对话平均Token数(用户消息+助手回复之和)得到,代表在触发历史裁剪或摘要之前,Agent大约能保留多少轮原始对话而不丢失细节。
为什么要单独给“工具调用结果回填”留预算?
很多AI Agent在执行工具调用(搜索、查数据库、跑代码)后需要把结果重新塞回上下文供模型继续推理,如果没有为这部分预留空间,长文本工具结果容易挤占对话历史或触发过早的上下文截断,导致Agent“失忆”。