检测能力库与防护策略包
在大模型应用落地与内容安全防护中,安全检测绝非简单的“在反向代理上配置若干敏感词”,而是面临不同业务场景的处置动作冲突(如客服需脱敏、内测需仅记录、财务需刚性阻断)、测试环境高频误报以及策略变更缺乏安全预演等现实治理难题。
OmniCortex 在安全围栏体系中设立了「检测能力库」,作为安全规则资产治理与策略装配中枢。通过规则资产库、防护策略包与运行时沙盒的解耦设计,将安全需求转化为可预期、可验证的实际防护效果。
一、 核心治理架构与能力流转
1. 业务场景驱动的规则与动作解耦
传统安全网关常将“检测规则”与“拦截动作”强行绑定,导致规则库无序膨胀。OmniCortex 实现规则与动作的彻底解耦:
- 规则专注识别:规则库仅负责精准识别违规特征(如身份证号、云凭据、注入攻击);
- 策略包自主裁决:同一条检测规则,在面向公众的客服场景执行柔性脱敏 (Redact),在内部研发助手执行仅记录观察 (Detect Only),而在高密业务场景执行严格阻断 (Block)。
2. 策略资产装配与防护流转全景
系统确立了 Engine(驱动引擎) ➔ Rules(原子规则资产) ➔ Template(防护策略包 + 动作映射) 的三层解耦架构。规则池专职“纯粹检测与命中识别”,策略包专职“挑选规则并显式赋予处置动作”:
脱敏掩码 (REDACT) · 注入攻击 ➔ 严格阻断 (BLOCK)仅记审计 (DETECT_ONLY) · 生产高危凭据 ➔ 严格阻断 (BLOCK)二、 检测规则资产与核心防护能力
管理入口:「安全围栏」➔「检测能力库」➔ 选中驱动 ➔「规则库」。

📸 截图替换指引(图 1:规则资产库与双模编辑)
- 需截图内容:登录控制台,进入「安全围栏」→「检测能力库」,在左侧侧栏选中
regex驱动,点击顶部第三个导航按钮「规则库」,切换至「自定义规则」子标签。 - 关键画面要素:
- 左侧侧栏 (
EngineSidebar):高亮选中regex引擎卡片; - 顶部 Hero 概览:展示引擎大图标、
REGEX徽标、运行正常绿色状态 Tag 以及能力点缀; - 二级分段控制器:呈现「内置规则」与「自定义规则」胶囊按钮,并展示规则总数统计数字;
- 右侧操作栏:包含搜索框与紫蓝渐变的「新建规则」按钮;
- 表格区域:完整展示规则名称、规则描述、严重程度 Tag、规则配置预览(包含高亮规则表达式与脱敏提示
→ [PHONE_NUMBER])以及操作列。
- 左侧侧栏 (
- 推荐保存路径:
- 中文版:
Documentation/docs/public/images/guardrails/zh/capabilities-rules-catalog.png - 英文版:
Documentation/docs/public/images/guardrails/en/capabilities-rules-catalog.png
- 中文版:
内置规则库与自定义规则分级治理
- 内置合规基线库 (Built-in Catalog):
- 系统开箱预置的标准安全规则,具备只读保护机制,防止关键合规防线被误删改;
- 覆盖常用个人隐私(居民身份证、护照、手机号、银行卡)、主流云厂商 API Key/凭证、对抗性注入与通用敏感词库;
- 每条规则预设权威危害评级(低危、中危、高危、严重、紧急),为全局威胁态势大盘提供量化依据。
- 企业自定义规则 (Custom Rules):
- 支持面向企业专有业务需求扩展定制,例如内部工号规则、未经公开的核心项目代号、行业专有合规词汇等。
三、 防护策略包与处置动作裁决
规则库负责发现违规,而「防护策略包」负责决定如何处置违规。管理员挑选规则组合,并为每条规则指定具体的处置行为。
管理入口:「安全围栏」➔「检测能力库」➔ 选中驱动 ➔「防护策略包」。

📸 截图替换指引(图 2:防护策略包组装与动作裁决)
- 需截图内容:在「防护策略包」Tab 中点击新建或编辑某个策略包,展开宽屏抽屉(
TemplateDrawer)。 - 关键画面要素:
- 顶部隔离提示条:展示当前策略包绑定的引擎驱动标识及「引擎隔离保护」徽标;
- 基础信息区:策略包名称与说明输入框;
- 已配规则与批量工具栏:展示已选规则数量徽标、「全部 / 阻断 / 脱敏 / 仅检测」动作分类胶囊筛选器、批量设置动作按钮;
- 有序规则列表:清晰呈现规则序号(
1, 2, 3...)、规则名称、分类徽标,以及每条规则右侧独立的 Action 下拉单选器(BLOCK/REDACT/DETECT_ONLY)。
- 推荐保存路径:
- 中文版:
Documentation/docs/public/images/guardrails/zh/capabilities-policy-assembly.png - 英文版:
Documentation/docs/public/images/guardrails/en/capabilities-policy-assembly.png
- 中文版:
1. 三大处置动作与防护效果展示
在防护策略包中,规则只负责“识别特征”,而策略包负责“定义处置动作”。每条规则均可被独立配置为以下三种动作之一,直接决定流量命中后的最终业务归宿:
典型处置效果凭证
- 拦截响应呈现 (BLOCK):触发刚性阻断时,调用方立即收到 HTTP
400 / 422结构化安全响应,透明获知被拦截的具体规则与风险级别:
{
"error": {
"message": "Request blocked by safety guardrail policy [injection_defense].",
"type": "guardrail_violation",
"code": "content_policy_violation",
"details": {
"action": "BLOCK",
"rule": "prompt_injection_jailbreak",
"category": "injection",
"severity": "CRITICAL"
}
}
}脱敏改写呈现 (REDACT):动态掩码打码,保障个人隐私与敏感凭据零出境,同时下游大模型基于脱敏上下文正常连续应答:
- 用户原始输入:
“请查询客户张三(身份证:110101199003072345,电话:13800138000)的会员级别。” - 实际送入模型:
“请查询客户张三(身份证:[ID_CARD],电话:[PHONE_NUMBER])的会员级别。” - 模型正常解答:
“已为您查询到该客户的会员级别为白金会员,享有专属客服权益。”
- 用户原始输入:
静默观察呈现 (DETECT_ONLY):业务调用 100% 透明放行且 0 感知,违规特征与调用上下文完整沉淀至审计日志,用于新上线规则为期 1~2 周的触发率与误报率无损评估。
2. 差异化业务策略配方实践
通过灵活装配,企业可针对不同业务场景配置针对性的策略效果包:
| 业务场景策略包 | 核心规则组合 | 赋予处置动作 | 达成的防护目标 |
|---|---|---|---|
| 对外公共客服策略包 | 越狱攻击防御 公民个人隐私 (PII) 广告禁词过滤 | BLOCKREDACTREDACT | 严防恶意越狱攻击破壁;同时对客户提交的电话/证件自动掩码,确保数据合规的同时不破坏解答体验。 |
| 内部研发助手策略包 | 生产凭证扫描 代码私钥证书 测试手机号码 | BLOCKBLOCKDETECT_ONLY | 杜绝任何生产秘钥和特权凭据通过 Copilot 外泄;对代码注释中的测试手机号仅记录观察,不打断开发者思路。 |
| 金融与核心财务策略包 | 银行卡号检测 大额财务数字 机密合同文本 | BLOCKBLOCKBLOCK | 执行最高密级的刚性阻断,任何核心财务数据尝试发往外部模型均被立刻熔断,留存严密审计日志。 |
3. 生产防线依赖安全保护
当一个防护策略包已被一条或多条运行中的安全防线挂载使用时,系统自动开启依赖保护机制:若操作员尝试删除该策略包,控制台将直观列出所有关联防线并阻止删除操作,避免误删导致生产安全防线失效。
四、 引擎配置与健康检查
管理入口:「安全围栏」➔「检测能力库」➔ 选中驱动 ➔「引擎配置」。
在引擎配置中,管理员可对选定的安全驱动进行集中维护:
- 启停总控:一键开启或全局停用指定驱动,停用后网关不再调度该驱动执行检测;
- 参数维护:维护驱动运行所需的连接参数与外部鉴权凭证,支持一键填入官方推荐配置;
- 健康探活:点击「健康检查」即时探测外部服务的连通状态与响应延迟,提前发现网络抖动或鉴权异常。
五、 运行时引擎沙盒实操 (Runtime Sandbox)
在检测能力库右上角,提供常驻的紫蓝渐变 「运行时沙盒」 入口。沙盒直接接入网关当前运行态引擎,提供 100% 生产同质的验证环境。
1. 生产真实现象拟真验证
- 拒绝模拟偏差:沙盒直接调用生产运行中的安全引擎实例,杜绝“沙盒测试能通过,推到线上全误报”的环境脱节问题;
- 多规则组合穿透:支持任意勾选单条或整套规则集,验证多重规则交叠时的综合防护效果。
2. 沙盒即时诊断与脱敏改写预览
沙盒支持直接在输入区粘贴包含敏感业务信息的样本(如身份证、工号或敏感凭据),点击运行后即刻呈现防护效果:

📸 截图替换指引(图 3:运行时沙盒诊断与脱敏改写)
- 需截图内容:在「检测能力库」点击右上角常驻的「运行时沙盒」按钮,在右侧滑出的沙盒抽屉中勾选待测规则,在样本输入框输入测试文本,点击底部的「运行诊断 (⌘/Ctrl+Enter)」获取结果。
- 关键画面要素:
- 已选规则列表:顶部展示参与本次测试的已选规则徽标;
- 诊断样本输入区:输入包含敏感特征的测试文本,展示字符计数器(如
128 / 4096); - 指标速览卡片:展示「已命中 / 未命中」状态标签、规则总数与纯内核执行耗时(毫秒级);
- 脱敏改写预览区 (
Redacted Preview):清晰呈现敏感内容被替换为占位符(如[ID_CARD]、[PHONE_NUMBER])后的最终文本与一键复制按钮; - 违规切片详情 (
Findings):展示命中规则的标识键、字符起止区间[start, end)及对应严重程度 Tag。
- 推荐保存路径:
- 中文版:
Documentation/docs/public/images/guardrails/zh/capabilities-sandbox-diagnosis.png - 英文版:
Documentation/docs/public/images/guardrails/en/capabilities-sandbox-diagnosis.png
- 中文版:
- 即时改写验证:若命中的规则配置为脱敏动作,沙盒将直接回显脱敏后的文本内容,一键直观检验占位符替换效果;
- 字符级切片定位:精确呈现命中内容在原文本中的起止偏移量区间
[start, end)及危害等级; - 毫秒级内核耗时:实时展示检测纯计算耗时,便于评估规则上线后的性能表现。
六、 常见问题与效果调优 (FAQ)
| 场景与现象 | 原因分析 | 推荐调优与处置方案 |
|---|---|---|
| 研发调试样本被规则误拦截 | 研发测试样本中包含了符合检测特征的模拟词或测试数据 | 在面向内部研发助手的策略包中,将对应规则处置动作调整为仅记录观察(DETECT_ONLY),避免阻断正常调试。 |
| 合法业务对话被误判脱敏 | 规则匹配范围过于宽泛(如普通的四位数字被误认为特定代码) | 针对该规则添加上下文排除词,或将规则危害等级适当降级,在策略包中调整为 DETECT_ONLY 观察一段时间后针对性调精。 |
| 删除策略包时提示存在依赖冲突 | 该策略包当前已被一个或多个正在运行的安全防线挂载 | 前往「安全防线」工作台,在对应的业务防线中解绑或替换该策略包,确认无外部业务依赖后再行删除。 |
| 外部安全检测服务响应慢导致耗时增加 | 外部检测接口网络拥堵或链路延迟较高 | 前往「安全防线」工作台,在对应防线步骤中将超时上限设为合理区间(如 500ms),并将该步骤的逃生模式配置为 FAIL_OPEN(旁路放行),在外部服务拥堵时自动保障业务通畅。 |