0
个人AI的实现,到底需要一套怎样的计算底座?当手机开始理解用户意图、调用工具并连续完成任务,计算平台要支撑的已不只是一次模型推理,而是完整的个人AI体验。

在今天的Arm Everywhere China 2026大会上,Arm发布了最新的CSS for Mobile 2。可以观察到,AI在全新的手机计算子系统中扮演了两个不同角色,CPU通过增强AI计算能力,帮助更多应用用上AI;Mali GPU首次原生集成神经网络加速器,用AI推动游戏性能和体验跨越式提升。
Arm的CPU正在推动端侧AI进一步普及。“目前几乎所有旗舰智能手机,无论是安卓还是iOS手机,均已采用SME2技术。”Arm边缘AI智能终端计算副总裁James McNiven表示。SME2是Arm给CPU增加的一套AI矩阵运算加速能力。
新一代Arm C2 Ultra带来15%的单线程性能提升,增强SME2支持的C2 CPU集群,在特定AI模型上的执行性能可达到上一代的1.7倍。
全新的Arm Mali GPU让人眼前一亮。在《光影新生》演示中给出的数据显示,Mali G2-Ultra NX借助神经图形技术,相比没有AI辅助渲染的上一代Mali G1-Ultra,帧率与能效最高达到4倍。AI开始参与画面重建,让手机能够以不同于传统渲染的方式获得更高的游戏性能。
CPU加速AI普及,AI加速GPU进化。但在这套面向个人AI的平台中,Arm为什么没有同时纳入自家的NPU?James McNiven解释:“在移动设备领域,Arm一贯的思路是将NPU层面的技术创新更多交由合作伙伴主导。”
把NPU的差异化创新留给伙伴后,Arm将重点放在CPU、GPU以及支撑硬件能力的软件生态上。从KleidiAI到神经图形模型、SDK和游戏引擎合作,Arm正在缩短处理器能力与开发者应用之间的距离。软硬件一体的系统和生态正是Arm在AI时代能够继续成为领导者的关键。
SME2成为旗舰标配,Arm CPU加速端侧AI普及
个人AI带来的计算负载,比运行一次模型复杂得多。以预订结婚纪念日晚餐为例,智能体需要完成语音转文字,搜索用户喜欢的餐厅、日历和相册,再生成指令、访问网页并执行操作,如果餐厅订满,整套流程还要重新运行。

CPU既要运行部分轻量级模型,也要承担工具调用和任务编排,每个环节的延迟都会影响最终体验。
Arm C2 Ultra针对这类负载增强了单线程性能、执行引擎和数据访问能力。根据Arm给出的数据,其单线程性能和网页浏览性能均提升15%,应用启动和多线程性能分别提升12%。单线程性能的提升,会直接影响智能体交互、工具调用和并行任务的响应速度。

在C2 CPU集群中,C2 Ultra负责需要快速响应的突发负载,C2 Pro则以更高能效承担持续任务。Arm的合作伙伴可以按照产品定位调整两类核心的数量,而不是用一种核心覆盖所有场景。对于同时包含模型推理、系统服务和前台应用的个人AI负载,这种配置空间比单独追求一个峰值数字更有实际意义。
更明显的AI性能提升来自SME2。在特定AI模型中,增强SME2支持的C2 CPU集群,执行性能可以达到上一代的1.7倍。不过,端侧AI不仅受计算能力限制,也经常受制于内存带宽。

以大语言模型为例,处理整段输入的预填充阶段包含大量矩阵运算,更接近计算密集型任务;逐字生成答案时,处理器需要频繁读取模型权重,又更容易受到内存带宽限制。
SME2提高矩阵计算效率,低位宽与缓存设计则减少需要搬运的数据,几项改进分别对应模型运行的不同阶段。
面对计算密集型负载,量化是一个解决方法,从INT8、INT4进一步走向INT2。位宽降低后,计算量和数据量随之减少,但也可能损失精度。Arm边缘AI CPU产品管理总监Daniel Lu对雷峰网(公众号:雷峰网)表示:“量化感知训练能够缓解模型从INT8降到INT4、INT4降到INT2带来的精度损失,业界也在持续缩小精度损耗。”
相比追求更高的主频或峰值算力,Arm更关注降低延迟。Daniel Lu表示,“如果一味追求峰值性能,反而可能影响延迟。持续运行的高计算密集型算法更适合GPU或NPU,CPU则应聚焦低延迟应用,以及能够控制在本地算力预算内的小语言模型。搭载SME引擎的CPU集群等效算力约为5至6TOPS。”
内存受限时,再高的计算性能也可能消耗在等待数据上。Daniel Lu介绍,C2 CPU集群同时配备私有L2缓存与大容量共享L3缓存,能够减少访问系统级缓存乃至DRAM的频次,从而降低延迟以及数据移动产生的功耗。

从低位宽矩阵计算到缓存拓扑,C2 CPU集群针对的是端侧AI落地后的实际瓶颈。SME2已经进入几乎所有旗舰手机,下一步的关键是让开发者更方便地使用这层广泛存在的AI能力。
Mali GPU首次集成AI加速器,手游性能跨越式提升
如果说CPU的进化是让更多应用能够使用AI,Mali G2-Ultra NX则让AI直接参与图形计算,改变GPU输出画面的方式。
实时光线追踪、复杂几何细节和动态全局光照正在进入手机,散热、电池容量和内存带宽却很难同步跃升。依靠GPU逐像素渲染,开发者不得不在画质、帧率和功耗之间反复取舍。
Mali G2-Ultra NX首次在Mali GPU中原生集成神经网络加速器,让手游开发者不再需要反复取舍。

全新GPU采用神经超级采样(NSS)技术,先以较低分辨率渲染,再由神经网络重建高分辨率画面;神经超级采样与降噪(NSSD)同时处理光追噪声;神经帧率提升(NFRU)则利用前后两个真实渲染帧重建中间帧。

这不是让大语言模型“凭空生成”画面。Mali G2-Ultra NX采用卷积神经网络,以GPU渲染的真实画面、运动向量和深度信息为输入完成重建。开发者也可以用自己的游戏内容训练模型,让输出保持原有的美术风格。

在《光影新生》的三帧演示中,第一帧和第三帧只有四分之一像素采用传统方式渲染,中间帧完全由AI重建。综合计算,八分之七的像素由AI完成重建。

AI插帧也会带来新的延迟问题。以30FPS为例,每个真实帧的时间预算约为33毫秒,系统既要完成真实帧渲染,也要在合适的时序插入重建帧。如果调度不当,帧率数字提高了,操作响应仍可能变慢。因此,NFRU不仅依赖GPU中的NX单元,也需要Android帧节奏机制和游戏引擎共同配合,保证生成帧进入显示链路时不破坏交互延迟。
这使Mali G2-Ultra NX的帧率与能效最高达到上一代的4倍,DRAM流量最高降低70%。如果不使用神经图形技术,Arm给出的综合游戏基准性能平均提升20%,同频游戏实测性能最高提升14%。两组数字的差距,正体现了AI为GPU打开的增量空间。
传统图形能力也在升级。Mali G2-Ultra NX引入新的执行引擎和第三代光追单元,以更紧凑的三角形数据表达减少重复数据,在现有光追基准测试中可将DRAM带宽需求降低约13%。
“AI增强图形将逐渐成为行业标配。”James McNiven指出,Arm会同时加强AI功能和传统图形渲染技术。神经网络加速器并非取代渲染单元,简单画面的传统渲染成本已经很低,面对几何细节和光照更复杂的内容,AI重建才更容易体现效率优势。
这颗GPU也能承担图形之外的AI计算。Arm边缘AI高级产品经理Deyan Lazarov告诉雷峰网,只要神经网络采用INT8等合适的数据格式,就可以在GPU上运行;即使部分计算使用浮点格式,GPU也能处理。不过,现阶段Arm的重点仍是图形应用。
CPU For AI,解决AI如何走向更多应用;AI For GPU,回答AI如何改进已有的计算产品。两条路径在CSS for Mobile 2上交汇。
NPU留给伙伴,Arm用系统和软件支撑个人AI
Arm CSS for Mobile 2没有集成Arm NPU,并不意味着个人AI不需要NPU。CPU适合任务编排、工具调用和低延迟的轻量级负载,GPU兼顾图形与通用计算,NPU则擅长持续运行计算密集型模型。
James McNiven表示:“在移动设备领域,Arm一贯的思路是将NPU层面的技术创新更多交由合作伙伴主导,我们在物联网场景有Ethos系列NPU。”
手机芯片厂商通常拥有自己的NPU架构,也会围绕自有模型、操作系统和第一方AI功能深度优化。
第三方应用面对的情况不同。开发者需要覆盖不同品牌和芯片,如果每款NPU都单独适配,成本会明显提高。CPU和GPU相对标准化的编程环境,更适合作为广泛应用的共同基础。具体任务运行在CPU、GPU还是NPU,则通常由系统厂商通过软件调度。
Arm CSS for Mobile为合作伙伴保留了配置空间。C2 CPU集群最高支持14个核心,客户可以按工作负载搭配C2 Ultra与C2 Pro。Mali G2-Ultra NX也允许配置着色器核心和NX单元,再围绕工艺、频率和功耗优化。
Arm的重点,是提供经过系统优化的CPU、GPU、互联IP,以及连接硬件与应用的软件系统CSS。与以往相比,Arm今年发布新一代CPU和GPU时,也把软件栈和生态放在了更重要的位置。
Deyan Lazarov解释:“我们高度重视软件生态建设,核心目标是降低开发者使用门槛,让技术更易于上手。”过去彼此分开的图形、通用计算与神经网络计算,正在进入统一的计算体系,开发工具也需要随之打通。

在GPU方面,Arm开放神经图形模型,并提供SDK、示例代码和游戏引擎插件,还与腾讯游戏、Unity中国等伙伴推进适配。在CPU的软件生态构建上,KleidiAI把针对SME2优化的计算内核接入不同AI框架。开发者无需直接处理底层指令,也能调用新的硬件能力。

这层软件抽象对端侧AI尤其重要。模型和应用如果需要逐一识别底层CPU指令、GPU单元和不同芯片配置,新硬件能力很难快速普及。当优化内核通过常用框架和引擎交付,开发者沿用熟悉的工具链,就能在不重写应用的情况下获得硬件加速。
Arm Everywhere China 2026反复强调软件,目的正是让新增算力真正进入应用,而不是停留在芯片规格表中。
这也是Arm从IP走向CSS后必须补上的一环。单独提供CPU或GPU IP,客户需要自行完成大量集成和系统优化。CSS组合CPU、GPU和系统IP,帮助客户缩短芯片研发周期。软件生态继续向上连接模型、框架与应用,让硬件能力更快转化为产品体验。
个人AI仍在快速变化,CPU、GPU和NPU的分工也会继续调整。相比给出一种固定组合,Arm选择提供可配置的计算基础,再用软件降低开发和迁移门槛。
CPU推动AI普及,AI推动GPU进化,合作伙伴用NPU形成差异化,软件把不同处理器连接到应用。持续迭代的硬件和不断完善的软件生态,将成为Arm在个人AI时代继续站在计算中心的关键。
雷峰网原创文章,未经授权禁止转载。详情见转载须知。