从数据到Token:Arm揭示边缘AI计算存储新趋势


9月23日,在GMIF 2026全球存储器行业创新峰会上,Arm全球存储业务负责人John Xavier Lionel发表了题为《从数据到Token:重塑边缘AI的计算与存储架构》的主题演讲,围绕生成式人工智能(AI)时代计算与存储的演进趋势分享了最新洞察。

从数据到Token:Arm揭示边缘AI计算存储新趋势

AI正深刻改变存储需求格局

随着AI模型规模持续扩大、上下文长度不断增长以及并发用户数量激增,存储已成为制约AI系统性能的核心要素之一。在推理流程中,解码(Decode)阶段需要频繁访问KV Cache,这使得内存容量、带宽以及数据传输效率直接决定了系统的整体性能与吞吐量。因此,对生成式AI而言,系统效能不再仅仅取决于计算资源的多寡,而是越来越依赖于内存、存储及数据传输系统能否稳定而高效地向计算单元供给所需数据。

与此同时,随着生成式AI进入规模化部署阶段,Token(词元)正逐渐成为衡量AI运营成本的新基准。举例来说,若100万台设备每天执行20次AI交互,且每次生成500个Token,那么每天产生的Token总量将高达约100亿个。每一次交互所生成的Token都会带来计算、内存、存储、网络以及能耗等多方面的成本开销。由此可见,推理已从一次性的技术投入转变为持续性的运营支出。对于整个产业而言,未来最关键的问题不再是“能够生成多少Token”,而是“能否以更高的效率和更低的成本产出有价值的智能”。

AI时代的竞争焦点,也正从单纯追逐更高的TOPS数值,转向如何在计算、内存、存储与数据移动之间构建更为高效的系统平衡。

分布式AI:让智能部署在最恰当的位置

随着AI不断从云端向边缘延伸,行业的关注点已从“云还是边缘”的二选一难题,转变为“如何将合适的AI工作负载放置在最适合的运行位置”。

不同类型的AI工作负载对性能、时延、隐私、功耗及成本的要求迥异,因此它们需要被部署在各自最合适的计算层级。例如,始终在线感知、唤醒词检测以及异常检测等轻量级任务,适合在低功耗终端设备本地执行;而AI助手、多模态交互等对时延和隐私敏感的应用,则更适合在手机、PC、XR设备和机器人等高性能边缘设备上运行;行业模型和本地化AI服务可以依托边缘基础设施来部署;至于超大模型、复杂推理、模型训练以及全球化服务等工作负载,则更适宜放在云端。

通过在云端、边缘基础设施与终端设备之间科学合理地分配AI工作负载,企业能够在处理能力、时延、隐私保护、成本控制以及能效利用等方面取得更优的平衡。对用户而言,这意味着更快的响应速度、更强的隐私保障、更可靠的使用体验,以及更具个性化的智能服务。

存储已成为边缘AI系统竞争力的关键一环

得益于小语言模型(SLM)、量化技术、异构计算架构以及软件生态的持续演进,边缘AI正步入快速发展期。过去只能在云端运行的AI能力,如今正被逐步部署到终端设备上,这不仅提升了响应速度、保护了数据隐私,还让本地智能应用成为现实。与此同时,随着模型规模、本地知识库以及用户上下文的不断扩张,边缘AI系统对存储容量、内存带宽、模型加载速度、安全性以及功耗管理等方面的要求也在持续提高,由此带来了新的系统设计挑战。

以生成式AI推理为例,它需要持续访问模型权重、上下文以及键值缓存(KV Cache)。即便配备了强大的AI加速器,如果数据无法高效地在存储、内存和计算单元之间流转,系统性能依然会受到显著制约。

在这一过程中,存储系统的角色也在发生深刻变化。过去,存储主要用来保存操作系统、应用程序和用户数据;而如今,随着越来越多的AI能力向设备侧迁移,模型、向量数据、本地知识库以及Agent记忆等AI资产也开始长期驻留在设备端。存储所承载的,已经不只是单纯的数据,而是模型、知识与智能能力本身。

Armv9计算平台拓展边缘AI能力边界

随着边缘AI从始终在线感知、关键词检测和异常检测等轻量级应用,逐步扩展到AI PC、多模态AI、机器人和本地生成式AI应用,模型和上下文已从MB级跃升至GB级,这对系统的计算、内存和存储能力提出了更高标准。

对于低功耗边缘设备而言,Arm Cortex-M CPU能够在有限的功耗预算内提供高效的AI能力,其核心设计原则包括:尽可能减少外部数据移动,使活跃数据尽量靠近计算单元,高效地将模型存储在Flash中,并按需配置AI加速能力。

随着模型规模、上下文长度以及本地知识库的持续扩大,边缘AI正迈向大模型时代。此时,系统面临的挑战已不再局限于计算能力本身,而是更多来自容量、带宽和数据移动效率。基于同样的设计理念,Arm推出了基于Cortex-A320 CPU与Ethos-U85 NPU的Armv9边缘AI计算平台,通过增强的内存架构、更高效的数据访问能力以及CPU与NPU的协同计算设计,支持运行参数超过10亿的大语言模型,为生成式AI、多模态AI和智能体应用提供更强大的边缘侧计算能力。

AI时代的下一场竞争,不再仅仅是TOPS的比拼,而是如何在计算、内存、存储和数据移动之间实现最佳协同的系统设计之战。Arm正通过覆盖从低功耗终端到高性能边缘设备的完整计算平台,以及持续优化的异构计算架构,助力生态伙伴更高效地释放AI潜能,推动边缘AI迈向十亿参数时代。

– 结束 –


© 版权声明
THE END
欢迎随手分享,喜欢就支持一下吧
点赞10 分享
评论 抢沙发

    暂无评论内容