端云协同推理
TurboCore 推理引擎
软硬一体边缘协同推理框架:以端侧推理算力与分布式协同算法,破解「时延—效率—隐私」不可能三角,让终端大模型可用、可快、可安心。
TurboCore 当前交付形态为软件推理运行时与端云协同算法,部署于项目选型的 NPU/GPU/CPU;专用 AI 推理芯片为研究方向与路线图能力,量产型号将单独发布。
研究背景与挑战
未来的终端设备需要大模型能力,但本地数据上送大模型面临四大核心挑战:
01
Token 效率
终端调用大模型算力时,如何节省 Token 消耗、提升效率?
02
时延
如何降低 Token 时延?
03
加速比
如何提升推理加速比?
04
隐私
如何更好地保护本地隐私数据?
总体目标与技术路线
总体目标
构建软硬一体的边缘协同推理框架,利用终端侧 AI 推理算力与分布式协同算法,破解「时延—效率—隐私」不可能三角。
技术路线 · 协同推理流程
终端侧 · 异构双脑
- 专用 / 选型 AI 推理算力 · 本地执行
- 本地小模型(Draft Model,如 Qwen-0.8B 量级)
云端 · 大模型服务
- 并行验证与生成
- 高效、安全、低时延回传
STEP 1
本地数据处理
脱敏 · 压缩 · 特征提取
STEP 2
草稿预测
端侧小模型前向生成 Token
STEP 3
Token 序列验证
云端大模型并行验证
STEP 4
结果回传
高效、安全、低时延反馈
主要研究方向与思路
01
异构双脑协同与投机采样加速
端侧小模型(Draft Model)前向预测,云端大模型并行验证 Token 序列;降低交互轮次与空转等待。
- 推理加速目标 2–3×
- 显著降低首 Token 时延(TTFT)
02
语义压缩与 Token 效率优化
将本地原始数据(图像、音频等)压缩为高密度、可脱敏的特征向量(Embeddings),减少冗余上云。
- 云端 Token 消耗预计节省 50%+
03
隐私屏障与脱敏特征映射
设计原则:「数据不出端,特征才上云」。敏感处理优先在端侧加密计算环境完成,结合差分隐私与特征混淆,仅上送单向特征向量。
- 高敏处理本地化
- 原始隐私数据默认不出端
04
终端侧 AI 推理算力架构创新
面向 Transformer 算子的硬件级优化路径:高效 KV Cache 管理、低功耗矩阵运算单元、高带宽片上存储;与软件运行时协同演进。
- 算力密度与能效提升(路线图)
关键性能指标
推理加速
2–3×
目标
TTFT 首 Token 时延
显著降低
相对基线
云端 Token 消耗
节省 50%+
预期
隐私保护
数据不出端
特征上云
指标为特定模型、硬件与任务集下的内部目标或 POC 参考,不构成通用 SLA;以合同与实测为准。
预期成果与价值
- 形成软硬一体边缘协同推理框架
- 沉淀端云协同核心算法与工程能力
- 显著提升推理效率、降低 Token 与带宽成本
- 强化用户隐私与数据安全保障
- 推动大模型在终端规模化落地,夯具身智能底座