AI Agent 评测基准集选型工具
按Agent类型(编程/客服对话/RAG问答/工具调用/通用助手)和评测关注点(准确性/工具调用成功率/多轮一致性/安全性等)匹配推荐合适的公开评测基准集,如SWE-bench、AgentBench、ToolBench、MT-Bench等16个业界常用基准。
免费在线工具
Loading…
使用说明
1. 在下拉框中选择你要评测的Agent类型。
2. 勾选一个或多个评测关注点(可多选)。
3. 点击「推荐基准集」,结果按匹配度从高到低排列,每张卡片显示基准名称、匹配度分数与简介。
4. 点击「加载示例数据」快速查看一份工具调用类Agent的示例推荐。
功能介绍
本工具内置16个业界公开、广泛引用的AI Agent/LLM评测基准集介绍,包括SWE-bench、HumanEval、AgentBench、ToolBench、GAIA、WebArena、MT-Bench、τ-bench、MMLU、TruthfulQA、HellaSwag、RAGAS、BEIR、SafetyBench、ARC-AGI等。
选择你的Agent类型(编程Agent/客服对话Agent/RAG问答Agent/多步骤工具调用Agent/通用助手),再勾选评测关注点(准确性、工具调用成功率、多轮一致性、安全性、延迟、成本),工具按「类型匹配+关注点重合度」打分并按匹配度从高到低推荐基准集,每个基准附一句话说明其评测内容。
本工具只做静态规则匹配推荐,不接入任何真实评测运行环境,具体评测执行需自行搭建或参考对应基准的官方仓库。
使用场景
新Agent项目立项时确定评测方案
项目启动阶段用本工具快速圈定候选基准集,作为评测方案设计的起点,再结合业务场景自定义评测数据。
对比不同基准集覆盖的能力维度
输出结果列出每个基准集对应的评测关注点,帮助团队理解各基准集之间的能力互补关系,避免评测维度重复或遗漏。
常见问题
这个工具能直接跑评测吗?
不能。本工具只做基准集选型推荐,输出的是「该用哪个基准集」的建议,实际评测执行需要你自行搭建环境或使用对应基准的官方代码仓库。
匹配度分数是怎么算的?
Agent类型命中记2分,每个匹配的评测关注点记1分,总分从高到低排序,分数越高代表这个基准集越贴合你的场景。
为什么同一个Agent类型会推荐多个基准集?
一个Agent类型往往需要从多个维度评测(比如工具调用Agent既要看工具调用成功率也要看多轮一致性),所以推荐结果通常是一组互补的基准集,而不是唯一答案。