文本嵌入相似度演示

输入一句查询文本和最多10条候选文本,用Jaccard、余弦(词袋)、简化TF-IDF三种词汇重叠算法计算相似度百分比并排序,用于演示相似度概念(非真实Embedding模型)。

免费在线工具
Loading…

使用说明

  1. 在“查询句子”文本框中输入一句要比较的文本。
  2. 在“候选句子”文本框中输入若干条候选文本,一行一个,最多支持10条(超过会自动截断)。
  3. 点击“计算相似度”,结果会按余弦相似度从高到低排序展示。
  4. 每条结果同时显示Jaccard、余弦、TF-IDF三种相似度分数(百分比),以及查询与该候选之间的匹配词高亮列表。
  5. 点击“加载示例数据”可以快速填入一句“人工智能”主题的查询句和8条候选句进行体验。

功能介绍

  • 页面顶部明确提示:本工具使用词汇重叠法模拟相似度,不是调用神经网络生成的真实Embedding向量
  • 中文按单字分词、英文/数字按连续字母数字串分词(长度需大于1)
  • Jaccard相似度:计算查询与候选分词集合的交并比
  • 余弦相似度:基于词频构建词袋向量后计算夹角余弦值
  • 简化TF-IDF相似度:以候选文本集合为语料库计算逆文档频率,再计算TF-IDF向量的余弦相似度
  • 自动列出查询与每条候选之间的共同出现词汇(匹配词高亮标签)
  • 最多支持10条候选句子批量比较,结果按余弦相似度自动排序

使用场景

理解Embedding相似度计算的基本原理
在实际接入向量数据库或Embedding API之前,通过这个工具直观理解“文本相似度”是如何从词汇重叠被量化为一个百分比分数的。
对比不同相似度算法的差异
输入同一组查询和候选文本,观察Jaccard、余弦、TF-IDF三种算法给出的分数为何不同,理解各算法对词频、文档长度的敏感度差异。
RAG检索效果的教学演示
在给团队讲解检索增强生成(RAG)中“召回候选文档”环节时,用词汇重叠的简化模型直观展示排序逻辑,避免直接讲解神经网络细节。
快速筛查候选文本中的关键词覆盖情况
通过“匹配词”高亮功能,快速看出候选文本中哪些词与查询句重合,用于文案关键词检查或简单的文本查重初筛。

常见问题

这个工具是调用OpenAI或其他厂商的真实Embedding API计算相似度吗?
不是,页面顶部已明确提示,工具使用的是词汇重叠法(Jaccard/余弦/TF-IDF)在浏览器本地计算,没有调用任何真实的神经网络Embedding模型或联网请求。
为什么两句话语义很像但用词完全不同,这里的分数却很低?
因为工具基于表面词汇重叠计算,无法识别“语义相近但用词不同”的情况;真实Embedding模型通过神经网络学习语义表示,能捕捉到这种深层相似性,而本工具是刻意做的简化演示。
候选句子超过10条会怎样?
工具会自动截断为前10条并同步更新候选文本框的内容,超出部分不会参与计算。
中文和英文的分词方式一样吗?
不一样,中文按单个汉字切分为token,英文和数字按连续字母数字串切分(且长度需大于1个字符,单字母会被过滤)。
TF-IDF分数里的“逆文档频率”是基于什么语料计算的?
是以当前输入的所有候选句子(加上查询句)作为临时语料库统计词频,语料库仅在当次计算中有效,不会保留历史输入。