企业自定义模型定价与核算中心
在企业大模型接入与治理中,不同供应商和各类模型往往采用不同的计费标准与计量单位。OmniCortex 提供原生的模型计价 (Model Pricing) 与 价格覆盖 (Pricing Override) 核心能力:
- 模型计价:为接入的各类模型统一设定计价标准与度量衡,覆盖常规 Token、深度思考推理、长上下文缓存读写、多模态以及工具调用等多维度计费项;
- 价格覆盖:支持按全局维度或按特定虚拟密钥(Virtual Key)对模型单价进行灵活覆盖,实现不同业务凭据或应用场景下的差异化核算,并将核算结果实时注入全链路可观测审计日志。
核心机制与业务场景
1. 模型计价:多维计量与统一度量衡
网关提供统一的度量衡标准,将各类计费方式统一归一化为标准的每百万 Token 费率($/1M Tokens)。
模型计价全面覆盖模型的各类计算消耗:
- 基础 Token 计价:标准的输入 Prompt 费率与输出 Completion 费率;
- 深度推理思考计价:针对具备深度思考链的模型(如 DeepSeek-R1、OpenAI o1/o3),为思考过程内容 (
reasoning_tokens) 单独配置计费费率; - 长上下文缓存计价:支持区分 Prompt Cache 首次写入缓存费率 (
cache_creation) 与命中缓存读取费率 (cache_read),真实反映长文本多轮对话的消耗; - 多模态与工具计价:支持针对图像输入/生成、音视频处理、联网检索工具调用及每请求固定处理底费单独设定价格。
2. 价格覆盖:多级作用域与差异化核算
系统支持通过创建价格覆盖(Pricing Override)规则,在不同作用域对模型的默认价格进行自定义改写:
- 全局覆盖 (
global):面向全网关生效,覆盖系统模型目录中该模型的默认价格; - 凭据覆盖 (
virtual_key):仅当请求使用指定的虚拟密钥发起时生效。可针对不同业务团队、不同项目凭据配置专属核算单价,满足企业内部差异化核算与分摊需求; - 全链路审计联动:每笔请求完成推理后,网关实时根据命中的计价规则与消耗的各维度用量计算单次请求金额,并自动归档至可观测审计日志。
3. 多层级定价覆盖与判定拓扑
在请求处理流水线中,网关依据“作用域精度优先”原则进行多级费率裁决,确保特定业务凭据的定价优先级高于通用默认规则:
控制台配置
管理入口:「模型与治理」➔「模型定价」(路由 /model/custom-pricing)。
1. 定价规则全景看板与多维检索
看板集中展示当前登记的全部定价覆盖规则及其作用域归属,支持按模型名称、所属虚拟密钥与上游供应商进行过滤:

📸 截图替换指引(图 1:模型定价全景看板与规则检索)
- 需截图内容:登录控制台,进入「模型与治理」→「模型定价」,处于规则列表展示状态。
- 关键画面要素:
- 顶部核心统计卡片:展示全部规则(Total)、全局规则(Global)、虚拟密钥覆盖规则(Virtual Key)3 项数量指标;
- 多维筛选过滤栏:包含模型名称检索输入框、作用域单选筛选按钮(全部 / 全局 / 虚拟密钥)、虚拟密钥筛选下拉列表与「新建规则」主按钮;
- 规则列表表格:包含作用域 Badge(Global 蓝色徽标、Virtual Key 紫色徽标)、模型匹配模式(Exact / Wildcard)、供应商标签、输入/输出单价详情(Prompt/Completion $/1M Tokens)以及操作列。
- 推荐保存路径:
- 中文版:
Documentation/docs/public/images/custom-pricing/zh/custom-pricing-overview.png - 英文版:
Documentation/docs/public/images/custom-pricing/en/custom-pricing-overview.png
- 中文版:
2. 定价覆盖规则配置抽屉 (PricingOverrideSheet)
点击看板右上角「新建规则」或表格操作列的「编辑」按钮,右侧滑出配置抽屉,包含两个配置阶段:

📸 截图替换指引(图 2:模型定价覆盖配置抽屉)
- 需截图内容:在「模型定价」页面点击「新建规则」滑出右侧抽屉,展示分步配置项与数据编辑区。
- 关键画面要素:
- 抽屉选项卡与头部:包含「作用域与模型匹配」和「定价矩阵」两步选项卡切换;
- 匹配参数区:作用域单选(Global / Virtual Key)、匹配模式(Exact / Wildcard)、模型匹配表达式输入框、适用请求类型勾选 Tag;
- 定价矩阵表单与 JSON 联动:左侧结构化输入框(Input Cost、Output Cost、Reasoning Cost 等)与右侧 Raw JSON 实时代码面板联动展示。
- 推荐保存路径:
- 中文版:
Documentation/docs/public/images/custom-pricing/zh/pricing-override-sheet.png - 英文版:
Documentation/docs/public/images/custom-pricing/en/pricing-override-sheet.png
- 中文版:
步骤一:作用域与模型匹配 (Scope & Match)
- 规则名称 (Rule Name):用于标识该条覆盖策略的业务用途(如
DeepSeek-R1 全局基准定价或项目组 A 专属 GPT-4o 费率覆盖); - 作用域类型 (Scope Kind):
- 全局覆盖 (
global):面向全网关生效,覆盖该模型默认的系统级计价; - 虚拟密钥覆盖 (
virtual_key):仅当请求通过指定虚拟密钥发起时生效,下拉选择对应的虚拟密钥凭据;
- 全局覆盖 (
- 供应商限定 (Provider,可选):若留空,则规则匹配任意供应商名下的同名模型;若指定特定 Provider,则仅当流量派发至该供应商时生效;
- 匹配模式 (Match Type):
Exact(精确匹配):请求中的模型标识必须与配置完全一致(例如deepseek-ai/DeepSeek-R1);Wildcard(通配符匹配):支持使用*匹配一类模型集合(例如gpt-4o*可匹配gpt-4o、gpt-4o-mini及后续版本);
- 适用请求类型 (Request Types):限定费率覆盖适用的 API 请求大类。支持多选:
Chat / Text / Responses:对话补全、文本生成与长思考链路;Embedding:向量计算请求;Rerank:重排检索请求;Audio:语音合成 (TTS) 与语音识别转录 (STT);Image:文生图、图像变体与图生图编辑;Video:视频生成与重构;OCR:光学字符识别提取。
步骤二:定价矩阵设置 (Pricing Matrix)
抽屉支持可视化结构表单与 Raw JSON 代码块双向实时响应式同步。在表单中填入数值,右侧 JSON 视图即时格式化输出;直接在 JSON 面板粘贴标准化配置对象,左侧表单项亦自动解析校验。
多维度计价矩阵与参数规格
系统底层以微小单 Token 浮点数精准存储,前端控制台界面与导入导出格式统一转换为标准工程单位,消除录入时的小数点误读:
| 定价类别 | 参数字段 (pricing_patch) | 展示与录入单位 | 业务含义与生效机制 |
|---|---|---|---|
| 基础 Token | input_cost_per_token | $/1M Tokens | 模型的标准输入 Prompt 费率。按请求消耗的标准输入 Token 数量核算。 |
output_cost_per_token | $/1M Tokens | 模型的标准补全 Completion 费率。按请求生成的输出 Token 数量核算。 | |
| 深度推理思考 | reasoning_cost_per_token | $/1M Tokens | 推理思考型模型(如 DeepSeek-R1、OpenAI o1/o3)生成的思考链 (Thinking Process) 内容独立费率。 |
| 上下文缓存 | cache_creation_input_token_cost | $/1M Tokens | 长上下文 Prompt Cache 首次写入缓存产生的费率(Cache Write)。 |
cached_tokens_cost_per_token | $/1M Tokens | 请求命中既有上下文缓存时的读取费率(Cache Hit Read)。通常显著低于普通输入费率。 | |
| 附加能力与工具 | search_cost_per_call | $/次 (Per Call) | 模型开启内置联网搜索检索工具时,单次请求附加收取的检索服务费。 |
code_interpreter_cost_per_call | $/次 (Per Call) | 启用沙箱代码执行器环境时附加收取的单次调用费。 | |
fixed_cost_per_call | $/次 (Per Call) | 无论请求消耗多少 Token,固定追加的单次处理底费。 | |
| 多模态视觉 | cost_per_image | $/张 (Per Image) | 视觉多模态输入时每张图像的基础核算单价。 |
image_generation_hd_cost | $/张 (Per Image) | 高清图像生成任务的单张固定收费。 | |
| 音频与视频 | cost_per_minute_audio | $/分钟 (Per Minute) | 语音合成或转录任务按音频时长(分钟)核算的费率。 |
cost_per_minute_video | $/分钟 (Per Minute) | 视频生成或理解任务按视频时长(分钟)核算的费率。 |
💡 工程核算建议
针对具备上下文缓存能力的现代模型(如 Claude 3.5、DeepSeek-V3),建议同步配置 cached_tokens_cost_per_token。网关在解析上游响应时,会自动根据返回的 prompt_tokens_details.cached_tokens 数量将命中缓存部分拆分核算,确保长会话的审计数据真实客观。
常见异常与故障排查
| 现象与问题表现 | 根因排查方向 | 推荐处理方案 |
|---|---|---|
| 自定义价格未生效,日志仍显示官方公网默认单价 | 1. 检查是否存在更高优先级的规则覆盖(例如存在相同模型的 virtual_key 规则,导致当前请求命中了密钥级配置而非预期全局配置);2. 检查模型名称大小写与拼写, exact 模式下为大小写敏感的精确比对;3. 检查当前请求类型是否在规则的 request_types 允许列表中。 | 前往「模型定价」列表,使用过滤工具定位该模型命中的所有规则;若请求类型为 Embedding,需确保规则的 request_types 勾选了 Embedding。 |
| 长上下文请求费用未反映缓存命中优惠 | 定价矩阵中仅配置了 input_cost_per_token,未单独配置 cached_tokens_cost_per_token。 | 编辑该条定价覆盖规则,切换至「定价矩阵」步骤,补齐 cached_tokens_cost_per_token(Cached tokens / token)数值后保存。 |
| 通配符规则导致非目标模型意外命中 | 使用了过于宽泛的通配符表达式(例如 gpt* 同时匹配了 gpt-4o、gpt-3.5-turbo 和 gpt-custom-finetuned)。 | 收紧匹配表达式范围(如调整为 gpt-4o*),或对于特定模型建立专用的 exact 精确匹配规则,利用精确匹配高于通配符的优先级予以精准约束。 |
| 新建规则时提示已存在冲突 (409 Conflict) | 同一作用域(相同 Virtual Key 或同一全局维度)且相同 Provider 下,已存在相同模型匹配表达式的规则。 | 在列表中搜索对应模型表达式,直接在既有规则上点击「编辑」调整定价矩阵,无需重复新建。 |