多模型智能调度
ModelSwitch 多模型智能调度引擎
为每一次 AI 调用匹配更合适的模型。按任务类型、时延预算、成本与可用性动态路由,让 VisionX 理解层与 VANTA 端侧推理始终跑在当时最优的模型上。
ModelSwitch 为软件调度运行时,对接项目选型的端侧与云端模型服务;可用模型清单随项目、区域与合规要求配置,不构成对任一模型厂商的排他承诺或通用 SLA。
核心能力
智能路由
按任务语义、模态与时延预算,将请求分发到最匹配的模型,避免「一律上最大模型」。
成本优化
简单任务走轻量模型,复杂推理再升级大模型,压低 Token 与调用成本。
故障切换
主模型超时、限流或不可用时自动 failover,保证门店、产线与端侧任务不中断。
负载均衡
在多供应商、多实例之间分摊流量,平滑峰值与配额约束。
调度流程
STEP 1
请求刻画
任务类型、模态、时延与成本约束
STEP 2
策略匹配
路由表 + 实时健康度与配额
STEP 3
模型调用
端侧小模型或云端大模型
STEP 4
回退与记账
失败切换、重试与成本审计
可调度模型族
动态切换火山、通义千问、Kimi、智谱 GLM、DeepSeek、MiniMax、MiMo 等模型,并按项目接入端侧 Draft 模型。
- 火山引擎
- 通义千问
- Kimi
- 智谱 GLM
- DeepSeek
- MiniMax
- MiMo
- 端侧 Draft 模型
落地场景
具身理解
场景问答与语义对齐优先低时延模型,复杂规划再升级到更强推理模型。
端云协同
与 TurboCore 配合:端侧草稿预测,云端按策略选择验证模型。
多供应商韧性
单一云厂商限流或故障时自动切到备选模型,保障现场任务连续。
关键能力指标
调度目标
每次调用匹配更合适的模型
按任务与约束
切换范围
多厂商动态切换
火山 / Qwen / Kimi / GLM / DeepSeek 等
可用性
自动 failover
超时与限流回退
成本
按任务分级调用
轻任务不上大模型
可调度模型清单与切换策略按项目配置;指标不构成通用 SLA,以合同与实测为准。