模型评估指标速查
速查机器学习与LLM评估指标,涵盖BLEU、ROUGE、F1、pass@k、BERTScore,附公式与混淆矩阵计算器。
免费在线工具
Loading…
使用说明
- 在「任务类型筛选」中点击页签(文本生成、分类、翻译、QA、代码生成或全部),过滤出对应任务的评估指标。
- 浏览指标卡片:每张卡片包含名称与别名、计算公式、取值范围、通俗解读和适用任务标签。
- 需要使用分类指标时,在「混淆矩阵计算器」中输入 TP、FP、FN、TN 四个数值。
- 工具实时计算准确率、精确率、召回率和 F1 分数(百分比显示)。
- 可点击「加载示例数据」恢复默认示例数值。
功能介绍
- 收录 13 个常用评估指标:BLEU、ROUGE、METEOR、Perplexity、Accuracy、Precision、Recall、F1、Exact Match、pass@k、BERTScore、ELO、ROUGE-L。
- 每个指标卡片包含公式、取值范围、通俗解读与适用任务标签。
- 支持按任务类型筛选:文本生成、分类、翻译、QA、代码生成。
- 内置交互式混淆矩阵计算器,实时计算准确率、精确率、召回率与 F1。
- 内容覆盖传统 NLP 指标与 LLM 时代指标(pass@k、ELO、BERTScore),并注明各自的适用场景与局限。
使用场景
快速查阅指标含义
看到论文里的 BLEU-4 或 pass@10 不明白,打开速查卡看公式和解读。
设计评测方案
根据任务类型筛选出合适指标,如翻译任务用 BLEU/METEOR,问答任务用 Exact Match,代码生成用 pass@k。
分类结果快速计算
拿到分类模型的 TP、FP、FN、TN,输入四个数值立即得到准确率、精确率、召回率和 F1。
系统学习评估知识
按任务分类逐个阅读指标卡,理解 n-gram 指标与语义指标的差异、ELO 排名原理等。
常见问题
这些指标数据是最新的吗?
指标的定义和公式是标准且稳定的知识;工具同时收录了传统指标与 LLM 时代的新指标(pass@k、ELO、BERTScore),可放心查阅。
Perplexity 能跨模型比较吗?
不能。不同 tokenizer 的模型间困惑度不可直接比较,需在相同分词方案下才有意义,工具说明中已注明。
混淆矩阵计算支持小数吗?
支持,四个输入框按数值解析并实时计算,输出为百分比格式。
有 Fβ 的说明吗?
F1 卡片中提及 Fβ 是 F1 的广义形式,β大于1 时更重视召回率;如需更详细的公式可以进一步搜索相关资料。
ELO 评分是什么?
源自国际象棋的排位系统,被 LMSYS Chatbot Arena 用于 LLM 对比评测,基于用户对两个模型回答的胜负比较更新分数。