Skip to content

检测能力库与防护策略包

在大模型应用落地与内容安全防护中,安全检测绝非简单的“在反向代理上配置若干敏感词”,而是面临不同业务场景的处置动作冲突(如客服需脱敏、内测需仅记录、财务需刚性阻断)、测试环境高频误报以及策略变更缺乏安全预演等现实治理难题。

OmniCortex 在安全围栏体系中设立了「检测能力库」,作为安全规则资产治理与策略装配中枢。通过规则资产库、防护策略包与运行时沙盒的解耦设计,将安全需求转化为可预期、可验证的实际防护效果。


一、 核心治理架构与能力流转

1. 业务场景驱动的规则与动作解耦

传统安全网关常将“检测规则”与“拦截动作”强行绑定,导致规则库无序膨胀。OmniCortex 实现规则与动作的彻底解耦:

  • 规则专注识别:规则库仅负责精准识别违规特征(如身份证号、云凭据、注入攻击);
  • 策略包自主裁决:同一条检测规则,在面向公众的客服场景执行柔性脱敏 (Redact),在内部研发助手执行仅记录观察 (Detect Only),而在高密业务场景执行严格阻断 (Block)

2. 策略资产装配与防护流转全景

系统确立了 Engine(驱动引擎) ➔ Rules(原子规则资产) ➔ Template(防护策略包 + 动作映射) 的三层解耦架构。规则池专职“纯粹检测与命中识别”,策略包专职“挑选规则并显式赋予处置动作”:

1. 多维安全驱动能力 (Engine Drivers)
纳管企业合规词库、敏感凭据扫描、个人隐私识别 (PII)、对抗式提示词注入检测等全品类安全驱动
↓ 提供开箱即用的检测规则与定制扩展能力
2. 原子规则资产库 (Rules Catalog) ── 专注违规特征识别与切片定位
内置合规基线库:系统预置 · 涵盖标准公民隐私、通用违规违禁词、主流公有云敏感凭据
企业自定义规则:按需自建 · 适配企业内部工号、专有项目代号与定制敏感特征
↓ 跨引擎自由组装 · 显式赋予场景化处置动作
3. 场景化防护策略包 (Policy Packages) ── 因地制宜的业务防护效果
对外公众客服场景:手机号/邮箱/证件 ➔ 脱敏掩码 (REDACT) · 注入攻击 ➔ 严格阻断 (BLOCK)
对内研发助手场景:测试手机号 ➔ 仅记审计 (DETECT_ONLY) · 生产高危凭据 ➔ 严格阻断 (BLOCK)
↓ 挂载至业务安全防线流水线 (Inbound 输入门控 / Outbound 输出门控)
4. 安全防线与业务流量门控 (Defense Lines & Traffic Gates)

二、 检测规则资产与核心防护能力

管理入口:「安全围栏」➔「检测能力库」➔ 选中驱动 ➔「规则库」

规则资产库与双模编辑

📸 截图替换指引(图 1:规则资产库与双模编辑)

  • 需截图内容:登录控制台,进入「安全围栏」→「检测能力库」,在左侧侧栏选中 regex 驱动,点击顶部第三个导航按钮「规则库」,切换至「自定义规则」子标签。
  • 关键画面要素
    1. 左侧侧栏 (EngineSidebar):高亮选中 regex 引擎卡片;
    2. 顶部 Hero 概览:展示引擎大图标、REGEX 徽标、运行正常 绿色状态 Tag 以及能力点缀;
    3. 二级分段控制器:呈现「内置规则」与「自定义规则」胶囊按钮,并展示规则总数统计数字;
    4. 右侧操作栏:包含搜索框与紫蓝渐变的「新建规则」按钮;
    5. 表格区域:完整展示规则名称、规则描述、严重程度 Tag、规则配置预览(包含高亮规则表达式与脱敏提示 → [PHONE_NUMBER])以及操作列。
  • 推荐保存路径
    • 中文版:Documentation/docs/public/images/guardrails/zh/capabilities-rules-catalog.png
    • 英文版:Documentation/docs/public/images/guardrails/en/capabilities-rules-catalog.png

内置规则库与自定义规则分级治理

  • 内置合规基线库 (Built-in Catalog)
    • 系统开箱预置的标准安全规则,具备只读保护机制,防止关键合规防线被误删改;
    • 覆盖常用个人隐私(居民身份证、护照、手机号、银行卡)、主流云厂商 API Key/凭证、对抗性注入与通用敏感词库;
    • 每条规则预设权威危害评级(低危、中危、高危、严重、紧急),为全局威胁态势大盘提供量化依据。
  • 企业自定义规则 (Custom Rules)
    • 支持面向企业专有业务需求扩展定制,例如内部工号规则、未经公开的核心项目代号、行业专有合规词汇等。

三、 防护策略包与处置动作裁决

规则库负责发现违规,而「防护策略包」负责决定如何处置违规。管理员挑选规则组合,并为每条规则指定具体的处置行为。

管理入口:「安全围栏」➔「检测能力库」➔ 选中驱动 ➔「防护策略包」

防护策略包组装与动作裁决

📸 截图替换指引(图 2:防护策略包组装与动作裁决)

  • 需截图内容:在「防护策略包」Tab 中点击新建或编辑某个策略包,展开宽屏抽屉(TemplateDrawer)。
  • 关键画面要素
    1. 顶部隔离提示条:展示当前策略包绑定的引擎驱动标识及「引擎隔离保护」徽标;
    2. 基础信息区:策略包名称与说明输入框;
    3. 已配规则与批量工具栏:展示已选规则数量徽标、「全部 / 阻断 / 脱敏 / 仅检测」动作分类胶囊筛选器、批量设置动作按钮;
    4. 有序规则列表:清晰呈现规则序号(1, 2, 3...)、规则名称、分类徽标,以及每条规则右侧独立的 Action 下拉单选器(BLOCK / REDACT / DETECT_ONLY)。
  • 推荐保存路径
    • 中文版:Documentation/docs/public/images/guardrails/zh/capabilities-policy-assembly.png
    • 英文版:Documentation/docs/public/images/guardrails/en/capabilities-policy-assembly.png

1. 三大处置动作与防护效果展示

在防护策略包中,规则只负责“识别特征”,而策略包负责“定义处置动作”。每条规则均可被独立配置为以下三种动作之一,直接决定流量命中后的最终业务归宿:

⚖️策略包规则处置分流拓扑
单规则匹配 · 三向终局
触发前提:会话流量命中某条安全规则(如识别到身份证号、内部敏感凭据或越狱提示词)策略包依配置分流至对应通道 ↓
BLOCK严格阻断
立即中断请求流水线,拒绝向下游模型派发任何 Token,直接返回标准 HTTP 400 安全违规响应
🛑 零风险扩散 · 零 Token 损耗
REDACT柔性脱敏
动态将敏感内容替换为规范占位符(如 [ID_CARD]),模型接收脱敏内容并正常解答
🛡️ 隐私零外泄 · 业务不断流
DETECT_ONLY仅检测观察
不修改亦不阻断数据流,业务调用端 0 感知,全量违规命中记录静默沉淀至后台审计日志
👁️ 全量留痕取证 · 策略无损灰度

典型处置效果凭证

  • 拦截响应呈现 (BLOCK):触发刚性阻断时,调用方立即收到 HTTP 400 / 422 结构化安全响应,透明获知被拦截的具体规则与风险级别:
json
{
  "error": {
    "message": "Request blocked by safety guardrail policy [injection_defense].",
    "type": "guardrail_violation",
    "code": "content_policy_violation",
    "details": {
      "action": "BLOCK",
      "rule": "prompt_injection_jailbreak",
      "category": "injection",
      "severity": "CRITICAL"
    }
  }
}
  • 脱敏改写呈现 (REDACT):动态掩码打码,保障个人隐私与敏感凭据零出境,同时下游大模型基于脱敏上下文正常连续应答:

    • 用户原始输入“请查询客户张三(身份证:110101199003072345,电话:13800138000)的会员级别。”
    • 实际送入模型“请查询客户张三(身份证:[ID_CARD],电话:[PHONE_NUMBER])的会员级别。”
    • 模型正常解答“已为您查询到该客户的会员级别为白金会员,享有专属客服权益。”
  • 静默观察呈现 (DETECT_ONLY):业务调用 100% 透明放行且 0 感知,违规特征与调用上下文完整沉淀至审计日志,用于新上线规则为期 1~2 周的触发率与误报率无损评估。

2. 差异化业务策略配方实践

通过灵活装配,企业可针对不同业务场景配置针对性的策略效果包:

业务场景策略包核心规则组合赋予处置动作达成的防护目标
对外公共客服策略包越狱攻击防御
公民个人隐私 (PII)
广告禁词过滤
BLOCK
REDACT
REDACT
严防恶意越狱攻击破壁;同时对客户提交的电话/证件自动掩码,确保数据合规的同时不破坏解答体验。
内部研发助手策略包生产凭证扫描
代码私钥证书
测试手机号码
BLOCK
BLOCK
DETECT_ONLY
杜绝任何生产秘钥和特权凭据通过 Copilot 外泄;对代码注释中的测试手机号仅记录观察,不打断开发者思路。
金融与核心财务策略包银行卡号检测
大额财务数字
机密合同文本
BLOCK
BLOCK
BLOCK
执行最高密级的刚性阻断,任何核心财务数据尝试发往外部模型均被立刻熔断,留存严密审计日志。

3. 生产防线依赖安全保护

当一个防护策略包已被一条或多条运行中的安全防线挂载使用时,系统自动开启依赖保护机制:若操作员尝试删除该策略包,控制台将直观列出所有关联防线并阻止删除操作,避免误删导致生产安全防线失效。

四、 引擎配置与健康检查

管理入口:「安全围栏」➔「检测能力库」➔ 选中驱动 ➔「引擎配置」

在引擎配置中,管理员可对选定的安全驱动进行集中维护:

  • 启停总控:一键开启或全局停用指定驱动,停用后网关不再调度该驱动执行检测;
  • 参数维护:维护驱动运行所需的连接参数与外部鉴权凭证,支持一键填入官方推荐配置;
  • 健康探活:点击「健康检查」即时探测外部服务的连通状态与响应延迟,提前发现网络抖动或鉴权异常。

五、 运行时引擎沙盒实操 (Runtime Sandbox)

在检测能力库右上角,提供常驻的紫蓝渐变 「运行时沙盒」 入口。沙盒直接接入网关当前运行态引擎,提供 100% 生产同质的验证环境。

1. 生产真实现象拟真验证

  • 拒绝模拟偏差:沙盒直接调用生产运行中的安全引擎实例,杜绝“沙盒测试能通过,推到线上全误报”的环境脱节问题;
  • 多规则组合穿透:支持任意勾选单条或整套规则集,验证多重规则交叠时的综合防护效果。

2. 沙盒即时诊断与脱敏改写预览

沙盒支持直接在输入区粘贴包含敏感业务信息的样本(如身份证、工号或敏感凭据),点击运行后即刻呈现防护效果:

运行时沙盒诊断与脱敏改写

📸 截图替换指引(图 3:运行时沙盒诊断与脱敏改写)

  • 需截图内容:在「检测能力库」点击右上角常驻的「运行时沙盒」按钮,在右侧滑出的沙盒抽屉中勾选待测规则,在样本输入框输入测试文本,点击底部的「运行诊断 (⌘/Ctrl+Enter)」获取结果。
  • 关键画面要素
    1. 已选规则列表:顶部展示参与本次测试的已选规则徽标;
    2. 诊断样本输入区:输入包含敏感特征的测试文本,展示字符计数器(如 128 / 4096);
    3. 指标速览卡片:展示「已命中 / 未命中」状态标签、规则总数与纯内核执行耗时(毫秒级);
    4. 脱敏改写预览区 (Redacted Preview):清晰呈现敏感内容被替换为占位符(如 [ID_CARD][PHONE_NUMBER])后的最终文本与一键复制按钮;
    5. 违规切片详情 (Findings):展示命中规则的标识键、字符起止区间 [start, end) 及对应严重程度 Tag。
  • 推荐保存路径
    • 中文版:Documentation/docs/public/images/guardrails/zh/capabilities-sandbox-diagnosis.png
    • 英文版:Documentation/docs/public/images/guardrails/en/capabilities-sandbox-diagnosis.png
  • 即时改写验证:若命中的规则配置为脱敏动作,沙盒将直接回显脱敏后的文本内容,一键直观检验占位符替换效果;
  • 字符级切片定位:精确呈现命中内容在原文本中的起止偏移量区间 [start, end) 及危害等级;
  • 毫秒级内核耗时:实时展示检测纯计算耗时,便于评估规则上线后的性能表现。

六、 常见问题与效果调优 (FAQ)

场景与现象原因分析推荐调优与处置方案
研发调试样本被规则误拦截研发测试样本中包含了符合检测特征的模拟词或测试数据在面向内部研发助手的策略包中,将对应规则处置动作调整为仅记录观察(DETECT_ONLY),避免阻断正常调试。
合法业务对话被误判脱敏规则匹配范围过于宽泛(如普通的四位数字被误认为特定代码)针对该规则添加上下文排除词,或将规则危害等级适当降级,在策略包中调整为 DETECT_ONLY 观察一段时间后针对性调精。
删除策略包时提示存在依赖冲突该策略包当前已被一个或多个正在运行的安全防线挂载前往「安全防线」工作台,在对应的业务防线中解绑或替换该策略包,确认无外部业务依赖后再行删除。
外部安全检测服务响应慢导致耗时增加外部检测接口网络拥堵或链路延迟较高前往「安全防线」工作台,在对应防线步骤中将超时上限设为合理区间(如 500ms),并将该步骤的逃生模式配置为 FAIL_OPEN(旁路放行),在外部服务拥堵时自动保障业务通畅。