正则模式匹配引擎 (regex)
正则模式匹配引擎(regex)是 OmniCortex 安全围栏体系中的核心轻量级防护驱动。该引擎直接运行于网关进程中,专注于对已知格式的敏感词汇、企业专有编码标识以及结构化个人身份信息(PII)进行实时识别、拦截与动态脱敏。
regex 引擎无需依赖任何外部网络服务或算法模型,具备极高的并发吞吐能力与确定性防护表现,是企业构建大模型安全防线中成本最低、响应最快的第一道基石防线。
一、 运行形态与部署依赖
| 评估维度 | 特性表现 |
|---|---|
| 运行形态 | 内置运行 (In-Process),作为网关内置原生驱动,随网关实例启动即可直接工作。 |
| 网络环境依赖 | 完全零外部网络依赖,全程在网关本地内存中执行,无需访问任何外网或第三方服务。 |
| 凭据与鉴权 | 完全免凭据,无需申请或配置任何 API Key、Token 或认证证书。 |
| 开销与稳定性 | 资源消耗极低,具备免疫正则拒绝服务(ReDoS)的高并发稳定性,对大模型调用几乎不产生感知延迟。 |
二、 能力边界与处置动作
1. 防护阶段覆盖
- 输入侧防护 (Input Phase):全面审查客户端输入的提示词(Prompt)与多轮历史上下文。在敏感文本抵达上游模型前完成识别,防止企业内部敏感格式标识或隐私信息流向公有云大模型;
- 输出侧防护 (Output Phase):实时审查大模型生成的返回文本。在模型输出个人隐私、测试账号或敏感格式数据时即时拦截或脱敏,防止违规内容呈现给终端用户;
- 双通道流式感知:原生支持流式打字机输出的实时动态改写;同时能够智能区分大模型的正文通道与深度思考通道(Reasoning),支持仅对正文执行脱敏,避免破坏模型思考链协议。
2. 支持的处置动作矩阵
| 处置动作 | 支持情况 | 动作生效表现与业务影响 |
|---|---|---|
刚性阻断 (block) | ✅ 支持 | 一旦命中规则立即终止推理链路,向客户端返回标准安全阻断响应并明确标注违规规则,防止有害请求继续流转。 |
动态脱敏 (redact) | ✅ 支持 | 命中规则后将敏感字符就地替换为掩码(如 [ID_CARD] 或 ******),保障会话顺畅流转的同时消除泄密风险。 |
仅检测审计 (detect_only) | ✅ 支持 | 旁路静默观察,不对输入或输出做任何阻断与修改,仅在全量安全审计日志中记录违规线索,用于新规则上线前的灰度评估。 |
三、 典型业务应用场景
- 场景一:企业专有代号与涉密项目防护 员工在向大模型提问或生成文档时,无意中输入内部机密项目代号(如
PROJECT-Alpha-XXXX)、内部工号或服务器主机名。regex引擎在前置阶段毫秒级拦截或替换为掩码,杜绝内部资产标识泄露至外部大模型。 - 场景二:客户身份与通讯隐私合规清洗 在智能客服、企业知识库问答场景中,实时识别用户输入或模型输出中的居民身份证、手机号、座机号码与电子邮箱,自动完成动态打码,确保企业满足个人信息保护合规要求。
- 场景三:金融账户与银行卡号防护 拦截或脱敏会话中涉及的主流银行卡号、信用卡号及国际银行账户编码(IBAN),防止高危金融资产信息在会话上下文中明文传播。
- 场景四:内网 IP 与设备资产防测绘 在技术支持与运维助手对话中,自动识别并脱敏内网 IPv4、IPv6 地址及物理网卡 MAC 地址,防止企业内部网络拓扑信息被大模型外部上下文获取。
四、 规则体系与自定义扩展能力
1. 开箱即用规则库 (12 项内置合规规则)
系统首发内置了 12 类开箱即用的高频合规规则。不同于普通的模糊匹配,内置规则全面集成了真实算法级后置校验,能够智能识别虚假测试乱码,彻底解决纯正则匹配高误报的硬伤:
| 规则标识 | 实体分类 | 默认级别 | 核心校验能力表现 | 默认脱敏掩码 | 典型防护目标 |
|---|---|---|---|---|---|
pii.cn_id_card | 个人身份 | 高危 | ISO 7064 MOD 11-2 校验码 + 出生日期范围验证(过滤虚假身份证) | [ID_CARD] | 18 位中国第二代居民身份证号码 |
pii.cn_mobile | 通讯隐私 | 中危 | 工信部主流运营商号段前缀校验(过滤非手机号格式) | [PHONE] | 11 位中国大陆手机号码(支持 +86 前缀) |
pii.cn_landline | 通讯隐私 | 低危 | 3~4 位国内行政区号 + 7~8 位本地号码结构校验 | [TEL] | 国内各城市固定电话号码 |
pii.cn_passport | 证件隐私 | 高危 | G / E / D 标准普通护照号前缀与位长校验 | [PASSPORT] | 中华人民共和国普通护照号码 |
pii.credit_card | 金融安全 | 高危 | Luhn 算法模十校验和(过滤无意义的长数字串) | [CARD] | Visa、MasterCard、Amex、银联等主流银行卡 |
pii.iban | 金融安全 | 高危 | MOD-97 国际银行账户校验和 | [IBAN] | 国际标准银行账户编号 (IBAN) |
pii.email | 个人身份 | 中危 | RFC 5322 标准格式与顶级域名结构校验 | [EMAIL] | 各类企业与个人电子邮箱地址 |
pii.ipv4 | 网络资产 | 低危 | 0~255 点分十进制数值有效边界校验 | [IPV4] | 局域网与公网 IPv4 节点地址 |
pii.ipv6 | 网络资产 | 低危 | RFC 4291 标准与双冒号压缩格式校验 | [IPV6] | 紧凑与标准 IPv6 网络地址 |
pii.mac_address | 设备资产 | 低危 | 冒号或连字符分隔的 12 位十六进制网卡地址 | [MAC] | 终端或服务器网卡物理地址 |
pii.us_ssn | 国际身份 | 高危 | 排除全零与保留地理区段的标准格式校验 | [SSN] | 美国社会安全保障号 (SSN) |
pii.us_passport | 国际身份 | 高危 | 9 位标准护照编码结构校验 | [PASSPORT] | 美国出入境护照号码 |
2. 自定义规则扩展能力
- 是否支持自定义:完全支持。企业可针对内部特定的业务术语、保密代号自由添加自定义规则;
- 修饰符支持:支持配置忽略大小写(
i)、多行模式(m)、单行跨行模式(s)等常用正则选项; - 具名捕获组局部脱敏: 支持通过指定具名捕获组(如
capture_group: "secret")仅对敏感数据本身进行掩码,完整保留前后文提示词。例如定义订单号-(?P<secret>\d{8})时,仅会将 8 位数字替换为掩码,前缀订单号-仍保持原样输出。
五、 关键配置项说明
管理员在配置 regex 引擎时,可根据业务流量特点调节以下保护阈值:
| 配置项 | 参数类型 | 默认值 | 业务配置含义与建议 |
|---|---|---|---|
单次检查文本上限 (max_input_bytes) | 整数 (字节) | 1048576 (1 MiB) | 单次请求最大允许检测的文本大小(系统硬上限 10 MiB)。当超出限制时自动拒绝,防止极端异常大文本拖垮网关算力。 |
单次最大命中上限 (max_findings) | 整数 (个) | 256 | 单次检测允许的最大发现违规数量(系统硬上限 10,000)。当命中数击穿该阈值时自动触发安全熔断,防止恶意堆砌敏感词造成资源消耗。 |
脱敏掩码提示符 (redact_hint / mask) | 字符串 | 依据规则预设 | 执行脱敏改写时替换的提示文字(如 [CONFIDENTIAL] 或 ******),最大支持 128 字符。 |
六、 适用边界与编排建议
1. 推荐适用场景
- 已知格式标识清洗:具备明确前缀、后缀或固定位长规则的业务订单号、内部保密工号、专有系统标识符;
- 结构化个人隐私(PII)合规治理:需要以确定性掩码方式对居民身份证、手机号、固定电话、银行卡等标准格式数据进行合规清洗;
- 零网络开销与严格离线环境:业务对网关吞吐与调用延迟极度敏感,或生产环境处于严格网络隔离内网,无法调用任何外部安全服务。
2. 不适用或不建议单独依赖的场景
- 高随机性代码凭据检测:各类云厂商 API 密钥、私钥证书、数据库连接串通常具备高度随机性与特定厂商指纹特征,仅靠手写正则表达式极难穷举且极易产生误报或漏检;
- 非结构化语义实体识别:上下文中的特定人名、地名、公司机构名等缺乏固定格式特征,纯字符模式无法理解复杂的自然语言上下文;
- 对抗性越狱与提示词注入:面对“角色扮演诱导”、“忽略前序规则约束”等复杂的自然语言对抗攻击,无法通过静态字符模式进行有效防御。
💡 责任链编排建议
在 OmniCortex 的防线责任链中,由于 regex 引擎直接运行于本地进程内且开销极低,通常建议将其编排在流水线较靠前的位置,作为低开销的快速预检与短路过滤层。关于如何自由编排多引擎顺序、配置动态条件分流与故障逃生策略,详见 防线工作台:责任链编排与流量分流。