高通联合阶跃、无量火、江波龙实现手机端侧30B-MoE大模型落地

2026-09-23 09:45 作者:投降输一半 点击量:8044
高通 2026骁龙峰会 无量火 阶跃 江波龙

9月23日消息,在2026骁龙峰会现场,高通正式公布重磅端侧AI生态成果。依托全新第六代骁龙8超级至尊版移动平台,高通携手阶跃、无量火、江波龙达成四方深度技术合作,成功完成阶跃StepEdge-Omni 30B-MoE混合专家大模型的移动端深度适配与全链路推理优化,顺利在智能手机终端跑通300亿参数级超大模型,实现全流程本地离线AI智能体服务,标志着手机端侧AI正式迈入大模型自主智能新时代。

本次落地的30B-MoE模型是目前移动端规格最高的端侧大模型,区别于传统稠密大模型,混合专家架构具备极致高效的运算优势。传统稠密模型运行时需要激活全部参数,算力与内存消耗巨大,而MoE模型可根据实际任务需求,智能激活对应专家模块参与运算,在完整保留大模型超强理解、推理能力的前提下,大幅降低计算负荷与内存带宽占用,成为超大模型下沉手机、PC等终端设备的核心技术路径。

高通联合阶跃、无量火、江波龙实现手机端侧30B-MoE大模型落地

四方联合技术攻坚实现多项行业突破性优化。无量火自研Ember推理引擎与Ember Kernel端侧编排内核,依托骁龙平台完整软件栈,通过XCompute异构调度技术打通CPU、GPU、NPU算力壁垒,在零模型结构修改、零精度损耗的前提下,将30B-MoE模型运行内存需求降低超50%。江波龙则凭借独家iSA存储智能体方案,实现存算协同联动,优化模型权重闪存加载逻辑,大幅降低内存常驻占用,显著提升大模型加载与持续运行效率。

极致的软硬件协同优化,造就了行业顶尖的端侧AI性能表现。这套端侧智能体方案依托NPU+GPU双引擎协同加速,模型预填充吞吐突破330 Token/s,相较纯NPU通用方案性能提升超30%,解码吞吐稳定在28 Token/s,首词生成达到毫秒级响应,速度远超传统云端API调用,彻底告别网络延迟卡顿问题。

功能层面,全新端侧智能体可实现全链路自主办公服务,涵盖邮件智能解析、智能行程规划、日历自动同步、航班酒店智能推荐、行程一键分享、邮件自动草拟等复杂场景。所有运算、交互流程均在本地终端完成,无需调用云端服务器,在保障极速响应的同时,彻底规避数据上传风险,全面保护用户隐私安全。

高通技术公司高级副总裁兼手机业务总经理Chris Patrick表示,本次四方合作打通了硬件、软件、存储、AI模型的全链条技术壁垒,让复杂AI智能体工作流可高效落地移动端终端。通过极致优化30B-MoE模型端侧部署效率,实现了高性能、低功耗、高隐私的AI体验,为下一代个性化、自适应移动智能服务普及奠定基础。

阶跃副总裁、端侧模型负责人俞刚指出,30B-MoE是目前手机端侧最大参数规模模型,也是首款适配第六代骁龙8超级至尊版平台的MoE架构大模型。全新骁龙旗舰平台的顶级端侧算力,充分释放了超大模型的智能潜力,为低时延、高隐私的终端AI创新应用打开全新想象空间。

无量火CEO王瑜琨表示,本次通过自研内核与推理引擎的深度优化,成功实现手机端流畅运行30B超大模型,大幅降低高端端侧AI的落地门槛。未来将持续联合高通深耕端侧MoE技术,推动智能手机进化为真正自主感知、主动服务的个人智能终端。

江波龙副总裁、嵌入式存储事业部总经理黄强补充,端侧AI规模化普及的核心在于存算一体协同突破。公司适配骁龙全新平台的iSA存储智能体,有效破解大模型运行的存储瓶颈,通过算力与存储深度联动,保障端侧大模型长期稳定运行,助力终端AI产业高质量扩容。

本次30B-MoE大模型成功端侧落地,打破了超大模型依赖云端运算的行业固有格局。依托骁龙全新旗舰平台的硬核算力与生态伙伴的技术协同,移动端正式具备运行超大规模AI模型的能力,将推动智能体AI从“云端通用交互”走向“端侧个性化自主服务”,成为2026-2027年旗舰手机AI体验升级的核心风向标。