Enterprise Multi-Model Gateway
一个网关,
混用所有模型
顶层模型规划、开源 SOTA 执行,输出对齐;一个接口接入 100+ 供应商,成本约降到 1/10。
1/10
成本 COST
100+
供应商 PROVIDERS
4×4
进/出协议 PROTOCOLS
97%
能力保留 CAPABILITY
Core Capabilities
一个接口,混用与融合所有模型
route(any_model)
多模型路由
一个接口调用所有模型。智能 fallback、负载均衡、自动重试,单点故障不再阻断业务。
compose(plan, execute)
混用 Composition
跨厂商混用:Anthropic 规划、GLM / Qwen 执行、小模型批量分类——各层用最合适的模型。
ensemble(n, vote)
融合 Ensemble
单次调用扇出 N 个模型,投票 / 评判 / best-of-N 聚合,单一模型达不到的质量。
Model Mix-and-Match
混用 + 融合:单一模型达不到的质量
Composition 把任务拆开、各层择优;Ensemble 把答案做多、聚合取优。两者在同一个工作流里编排。
COMPOSITION PIPELINE
顶层闭源模型负责规划与硬推理
claude-opus · gpt-5
开源 SOTA 承载执行体量
glm · qwen · deepseek
能力标准化层对齐输出与工具调用
capability normalization
ENSEMBLE FAN-OUT · N IN → 1 OUT
const result = await client.compose([
{ model: "claude-opus-4", task: "plan" }, // 顶层模型:规划
{ model: "deepseek-v4", task: "implement" }, // 开源 SOTA:执行
{ model: "glm-5", task: "review" }, // 校验与输出对齐
])
// 相同结果 · 成本 ≈ 1/10 · 输出已对齐Capability Normalization
让编排成为可能的能力层
混用的前提,是不同模型的能力被归一化到同一平面。网关补齐七个耦合点:
工具调用统一
function calling 跨协议语义对齐
结构化输出兼容
JSON schema 输出全模型可用
缓存统一
prompt cache 命中降本 50–90%
推理 token 适配
reasoning effort 归一映射
多模态格式
image / audio / video 输入归一
计费抽象
输入 / 输出 / 缓存分项计价
数据流
内存中流转,不落盘
LiteLLM 只翻译 API 信封;我们保证能力对齐。
One API · Four Protocols
一个 API,四种协议,全模态
入站用你已有的 SDK,出站接任意 provider——任意 A→B 互转,协议不再是选型约束。
INBOUND · 你的 SDK
OUTBOUND · PROVIDER
Why 1/10 the Cost?
为什么是 1/10 的成本
TOP-TIER 端到端
$338K/mo
所有环节都用顶层闭源模型:规划、执行、校验同价。
GATELLM 编排
$35K/mo
顶层模型只做规划,开源 SOTA 扛执行体量,缓存再削一半。
- ✓
BYOK 无加价
自带密钥,网关不加价转售 token。
- ✓
混用扛执行
开源 SOTA 承载执行体量,单价差一个量级。
- ✓
缓存命中
prompt cache 命中率高的场景降本 50–90%。
* 基于公开定价的示意模型,实际随业务场景与混用比例浮动。
Compliance
采购关心的三件事,定价前先落地
法务可签的 DPA
GDPR / CCPA 就绪的数据处理协议,标准条款直接签,不等定制。
跑不掉的账单
BYOK 无加价 + 硬配额上限,成本归属到项目与团队,超支自动阻断。
Prompt 不到达我们
完全自托管,密钥不落盘,TLS 1.3,客户端准入强制。
Token Ops
看得见、守得住的 token 支出
可观测
用量与成本实时可见,按模型 / 密钥 / endpoint 切片。
成本归属
按项目 / 团队归集,每分钱知道花在谁身上。
预算强制
软预算告警、硬限额阻断、限流策略可下发。
准入与审计
客户端准入强制,全链路审计轨迹可导出。