LLM 护栏配置生成器
勾选PII脱敏、提示词注入防御、内容审核、越狱检测、速率限制等常见LLM应用护栏规则,为每项设置阻断/警告/仅记录处置级别,一键生成可评审、可存档的护栏配置清单(Markdown/JSON)。
免费在线工具
Loading…
使用说明
1. 填写应用名称(可选)。
2. 在输入侧/输出侧/运行时三个分组中,勾选需要启用的护栏规则,并为每一项选择处置级别:阻断(拦截请求/响应)、警告(放行但标记提醒)、仅记录(放行,只留痕)。
3. 点击「生成护栏配置清单」,在Markdown/JSON两个标签页之间切换查看结果,可复制到文档或代码仓库中存档。
4. 点击「加载示例数据」可快速查看一份客服机器人场景的示例配置。
功能介绍
本工具内置12项业界常见的LLM应用护栏规则,按输入侧、输出侧、运行时三个阶段分组:
- 输入侧:PII脱敏、提示词注入防御、越狱检测、话题范围限制
- 输出侧:输出内容审核、幻觉标注、输出格式校验、输出侧PII泄露扫描
- 运行时:速率限制、成本熔断、审计日志、人工升级通道
为每一项勾选是否启用,并选择处置级别(阻断/警告/仅记录),点击「生成护栏配置清单」即可得到一份结构化的Markdown文档和对应JSON数据,方便团队评审和存档。工具不接入任何真实检测服务,具体规则的技术实现需由开发团队自行完成。
使用场景
AI产品上线前安全评审
产品团队在LLM应用上线前,用本工具快速梳理需要覆盖的护栏规则清单,作为安全评审会议的讨论基础。
开发团队护栏需求拆解
把生成的JSON配置清单转成开发任务清单,按输入侧/输出侧/运行时分批实现。
常见问题
这个工具会真的拦截违规内容吗?
不会。本工具只生成一份护栏配置清单文本(Markdown/JSON),用于团队规划和评审,具体的检测与拦截逻辑需要开发团队在应用中自行实现。
12项护栏规则是怎么分组的?
按处理阶段分为输入侧(请求进入模型前的防御)、输出侧(模型返回后的过滤)、运行时(贯穿全程的限流与审计)三组,方便按阶段规划实现优先级。
处置级别(阻断/警告/仅记录)有什么区别?
阻断表示直接拦截该请求或响应;警告表示放行但打标提醒人工关注;仅记录表示放行且只做日志留痕,不影响用户体验,三档对应不同的风险容忍度。