RAG文本分块计算器

输入长文本,设置chunk_size与overlap参数,本地按估算token数切分文本并展示每块的字符数、估算token数与内容预览,辅助RAG系统分块策略调优。

免费在线工具
Loading…

使用说明

  1. 在「输入长文本」区域粘贴需要切分的长文本。
  2. 设置 Chunk Size(按token计),可从256/512/1024/2048预设值中选择,或选择「自定义...」手动输入token数。
  3. 设置 Overlap(重叠比例),以百分比表示,占chunk size的比例,最大90%,用于让相邻分块保留一定重复内容。
  4. 页面会实时展示总块数、平均字符数/块、平均估算Token/块,并在下方列出每一块的字符数、估算token数与内容预览。
  5. 点击「加载示例长文本」可快速加载一段关于RAG技术的示例长文本进行体验。

功能介绍

  • 支持chunk_size按token设置,内置256/512/1024/2048四档常用预设,也支持自定义token数。
  • overlap以百分比形式设置相邻分块的重叠比例(最大90%,避免因重叠过大导致切分异常)。
  • 分块前会先估算当前文本的字符/token比例(CJK字符约1.7字符/token,其他字符约4字符/token),再据此把token级参数换算为字符位置做滑动窗口切分,中英文混排文本也能得到合理的分块结果。
  • 输出每一块的字符数、估算token数与内容预览(超长内容自动截断预览),并汇总总块数、平均字符数、平均token数。
  • 纯本地JavaScript计算,不上传文本内容。
  • 提供「加载示例长文本」快速体验功能。

使用场景

RAG知识库分块策略调优
在构建检索增强生成(RAG)系统的向量知识库前,测试不同chunk_size和overlap组合下的分块效果,评估是否符合语义完整性与检索精度的平衡要求。
长文档预处理评估
对长篇文档、说明书、合同等内容进行分块预览,提前了解切分后每块的大小分布,辅助设计文档处理流程。
向量数据库导入前的容量估算
估算长文本切分后的总块数,辅助预估向量数据库的存储量和后续embedding调用成本。
对比不同重叠比例的分块差异
调整overlap百分比,直观对比重叠切分与非重叠切分产生的分块数量和内容重复程度差异。

常见问题

分块用的token数是精确计算的吗?
不是。工具使用近似估算算法(CJK字符约1.7字符/token,其他字符约4字符/token)来估算文本的字符/token比例,再据此做字符级切分,不是基于真实tokenizer的精确token边界切分,实际结果与目标模型官方tokenizer可能有偏差。
分块是否考虑句子或段落边界?
不考虑。当前实现是纯字符级滑动窗口切分,不做语义或句子边界优化,如需按句子/段落切分需要额外的文本预处理。
overlap最大能设置多少?
最大90%。设置过高的重叠比例会导致分块数量大幅增加且内容高度重复,工具会自动将超过90%的输入值限制在90%以内,避免异常情况。
chunk_size和overlap的单位分别是什么?
chunk_size的单位是估算token数(如512表示约512个token),overlap的单位是百分比,表示相邻两个分块之间重叠部分占chunk_size的比例(如10%表示重叠约51.2个token,按512 token为例)。