多模型智能调度

ModelSwitch 多模型智能调度引擎

为每一次 AI 调用匹配更合适的模型。按任务类型、时延预算、成本与可用性动态路由,让 VisionX 理解层与 VANTA 端侧推理始终跑在当时最优的模型上。

ModelSwitch 为软件调度运行时,对接项目选型的端侧与云端模型服务;可用模型清单随项目、区域与合规要求配置,不构成对任一模型厂商的排他承诺或通用 SLA。

核心能力

  • 智能路由

    按任务语义、模态与时延预算,将请求分发到最匹配的模型,避免「一律上最大模型」。

  • 成本优化

    简单任务走轻量模型,复杂推理再升级大模型,压低 Token 与调用成本。

  • 故障切换

    主模型超时、限流或不可用时自动 failover,保证门店、产线与端侧任务不中断。

  • 负载均衡

    在多供应商、多实例之间分摊流量,平滑峰值与配额约束。

调度流程

  1. STEP 1

    请求刻画

    任务类型、模态、时延与成本约束

  2. STEP 2

    策略匹配

    路由表 + 实时健康度与配额

  3. STEP 3

    模型调用

    端侧小模型或云端大模型

  4. STEP 4

    回退与记账

    失败切换、重试与成本审计

可调度模型族

动态切换火山、通义千问、Kimi、智谱 GLM、DeepSeek、MiniMax、MiMo 等模型,并按项目接入端侧 Draft 模型。

  • 火山引擎
  • 通义千问
  • Kimi
  • 智谱 GLM
  • DeepSeek
  • MiniMax
  • MiMo
  • 端侧 Draft 模型

落地场景

  • 具身理解

    场景问答与语义对齐优先低时延模型,复杂规划再升级到更强推理模型。

  • 端云协同

    与 TurboCore 配合:端侧草稿预测,云端按策略选择验证模型。

  • 多供应商韧性

    单一云厂商限流或故障时自动切到备选模型,保障现场任务连续。

关键能力指标

  • 调度目标

    每次调用匹配更合适的模型

    按任务与约束

  • 切换范围

    多厂商动态切换

    火山 / Qwen / Kimi / GLM / DeepSeek 等

  • 可用性

    自动 failover

    超时与限流回退

  • 成本

    按任务分级调用

    轻任务不上大模型

可调度模型清单与切换策略按项目配置;指标不构成通用 SLA,以合同与实测为准。