向量嵌入模型漂移监控自查工具

录入一批金丝雀样本在新旧embedding模型下的余弦相似度,本地计算整体漂移程度、风险分级,并提供漂移监控实践自查清单。

免费在线工具
Loading…

使用说明

使用步骤:

  1. 用一批固定的“金丝雀”文本,分别通过新旧embedding模型算出对应向量的余弦相似度
  2. 在文本框里按每行“标签,相似度”格式录入,例如 faq-refund,0.95
  3. 设置相似度告警阈值(默认0.9),低于此值的样本会被计入“低于阈值占比”
  4. 点击“分析漂移”,查看样本数、平均相似度、最低相似度、低于阈值占比,以及0-100的综合漂移分数和风险等级(低/中/高)

可点击“加载示例数据”查看一组预设样本的分析效果。页面下方附带一份漂移监控实践自查清单,供团队评估监控流程是否完善。计算全部在浏览器本地完成,不上传数据,也不调用任何embedding模型。

功能介绍

升级embedding模型版本(或供应商悄悄更新模型权重)后,语义向量空间可能发生漂移,导致RAG检索/召回质量下降。本工具让用户手工录入一批“金丝雀”文本在新旧模型下的余弦相似度(标签,相似度 每行一条),本地计算:

  • 样本数、平均相似度、最低相似度
  • 低于告警阈值的样本占比
  • 0-100综合漂移分数,及对应的低/中/高风险等级

并附带一份漂移监控实践自查清单(是否建立固定金丝雀集、是否记录历史趋势、是否人工抽检边界样本、索引是否全量重建、是否有回滚机制)。所有输入数据和计算都在浏览器本地完成。

使用场景

RAG系统embedding模型升级前评估
团队计划把RAG系统的embedding模型从旧版本升级到新版本前,先用一批核心业务金丝雀查询分别过新旧模型,用本工具评估语义漂移程度,决定是否需要全量重建向量索引。
供应商模型静默更新后的排查
发现RAG召回质量下降后,怀疑是embedding供应商悄悄更新了模型权重,用历史保留的向量与当前重新计算的向量做对比,快速确认是否存在漂移。

常见问题

工具会帮我调用embedding模型计算相似度吗?
不会,本工具不调用任何AI模型或API,用户需要自己先用新旧两个embedding模型分别算出金丝雀文本的向量并计算余弦相似度,再把结果(标签,相似度)粘贴进本工具做统计分析。
漂移分数是怎么算出来的?
综合考虑平均相似度、最低相似度和低于阈值样本占比,分数越低代表漂移程度越大,具体权重逻辑在代码本地计算,不涉及外部服务。