LLM越狱攻击模式自查清单

按角色扮演、编码混淆、语境操纵、系统提示攻击4大类勾选团队现有防护是否覆盖常见LLM越狱手法,本地计算覆盖率与未覆盖缺口。

免费在线工具
Loading…

使用说明

页面按4个类别列出常见的LLM越狱攻击手法,每项附有示例和缓解建议:

  1. 逐条勾选团队产品/Prompt护栏已经能防御的手法
  2. 点击“计算覆盖率”,查看总体覆盖率、按类别统计的覆盖情况,以及未覆盖手法清单
  3. 可点击“加载示例数据”快速体验一组预设勾选结果
  4. 点击“清空”可重置全部勾选

清单归纳自公开安全研究总结的常见越狱手法,仅供内部自查用,不接入任何真实检测服务,也不构成安全承诺。

功能介绍

本工具在浏览器本地维护一份分4类(角色扮演类、编码混淆类、语境操纵类、系统提示攻击类)的LLM越狱手法清单,每项都附带典型示例和对应的缓解建议。用户勾选团队现有防护已覆盖的手法后,点击按钮即可算出:

  • 总体防护覆盖率(百分比)
  • 已覆盖/总数的具体条数
  • 按类别拆分的覆盖情况对比
  • 尚未覆盖的手法清单,方便定位防护盲区

所有计算在本地完成,不上传任何数据。

使用场景

LLM应用上线前自查
在发布聊天机器人或AI Agent产品前,团队安全负责人用这份清单快速自查现有Prompt护栏覆盖了哪些已知越狱手法,定位需要补强的方向。
安全培训与交接材料
作为团队内部培训或交接文档的一部分,帮助新成员快速了解常见越狱攻击类型及对应的缓解思路。

常见问题

这个清单能替代真实的安全渗透测试吗?
不能。本清单只是团队自查用的参考列表,归纳自公开安全研究,不构成安全承诺,也不会调用任何真实检测或渗透测试服务,正式上线前仍建议做专业红队测试。
勾选数据会上传吗?
不会,所有勾选和计算都在浏览器本地完成,不会发送到服务器。