0
记者:郭思
编辑:包永刚

“善弈者谋势,不善弈者谋子。”这句古老的智慧,正精准地映射出当下AI产业的演进轨迹。
当行业狂热于大模型训练阶段的算力军备竞赛时,一场更为深刻的重心迁移正在悄然发生,AI已经从回答问题走向解决问题,从单纯的模型训练走向复杂的智能体推理。这种转变对底层算力架构的冲击,远比表面看起来要深远得多。
如果说训练阶段是GPU闷头计算的大兵团作战,那么推理时代则是一场需要精密调度的现代化战争。
在这场变革中,英特尔在9月22的Connection大会上给出了一个明确的判断:推理时代,CPU正从“配角”蜕变为整个系统的“控制中枢”。当AI真正开始干活,算力的定义正在被重写。
01、数字AI:当智能体规模化,CPU为何重回C位?
想要理解CPU的“逆袭”,核心是厘清智能体执行与传统模型训练的本质差异。模型训练是标准化、可并行的批量任务,核心目标是极致提升整体吞吐量;而智能体是典型的串行状态机,每一步任务执行都依赖上一步的输出结果,任意环节的微小延迟,都会沿着任务链路层层放大,最终影响整体智能体验。这也意味着,传统CPU一味追求平均吞吐的优化思路已然过时,稳定、可控、超低的端到端延迟,成为智能体规模化落地的核心硬性约束。
不仅如此,智能体场景的硬件负载矛盾愈发突出。高并发工具调用与高带宽AI推理任务需要在单芯片内混跑,二者对内存资源的需求相互冲突,叠加多租户场景下的安全隔离、资源独占需求,传统CPU架构的短板彻底暴露,架构革新与系统重构势在必行。
对于这一难题,英特尔并没有选择惯用的单点堆砌参数,而是从系统层面重新划分数据中心的架构。
大会现场,英特尔数据中心集团副总裁、中国区总经理陈葆立表示,“未来的数据中心将被拆分为三类集群:负责智能体执行和任务编排的CPU集群、负责模型推理计算的GPU集群,以及承载长对话、文档等持续新增业务数据的存储集群。这三类集群之间的数据调度,全部由CPU完成。”

落到产品上,采用Intel 18A制程、最高拥有288个能效核的至强6+处理器配合智能体套件,单颗即可部署近千个智能体。

英特尔表示,这一优势并不是凭空想象,而是有着实测数据支撑:
在SWE-bench测试中,其单智能体性能领先竞品15%;在云端沙箱场景下,面对10分钟内批量启动上万沙箱、单沙箱延迟200ms以内的严苛要求,至强6+支持350个沙箱并发,性能约为竞品的1.46倍。结论显而易见:在智能体场景下,性能和响应速度缺一不可。
而另一方面,CPU在三个具体环节上的价值也十分突出。首先是异构数据预处理,智能体需要抓取网页、视频、PDF等素材并做文本提取,这类任务GPU并不擅长,而至强AMX加速器让向量化和重排序分别达到基准的2倍和4倍。
其次是存储调度,从HBM到DRAM再到本地SSD,成本和延迟呈反向变化,CPU作为核心调度者,联合焱融科技基于至强6和MRDIMM的方案,在MLPerf Storage v3.0中拿下了Llama3检查点读写和3D-Unet训练两项全球第一,有效消除了存储瓶颈。
最后是KV Cache管理,面对百万Token上下文约300GB的容量,英特尔的KV Cache智能加速套件通过QAT实现无损压缩,将300GB原始数据压至200GB,并借助DSA引擎将数据搬运最高加速9.66倍。
把这一系列环节串联起来,便能得出清晰结论:步入智能体时代,GPU 承载 “智” 的核心推理运算,而 CPU 既要承担基础计算,更要扛起全局 “管” 的重任。随着业务规模扩张,这套调度管控工作的复杂度呈指数级攀升,而这恰恰是英特尔长期积淀形成的独有优势。
02. 物理AI:控制、成本与算法路线的破局
如果说数字AI的战场在云端,那么物理AI的征途则在真实的物理世界。
“我们希望当大家提到物理AI时,第一个想到的厂商是英特尔。”雷峰网(公众号:雷峰网) 雷峰网
英特尔副总裁兼端侧计算和物理AI事业部中国区总经理高嵩在Connection大会上这样表态。

这句话说起来容易,但落地起来实际难度却不少。
物理AI与数字AI的核心差异在于,机器人必须与真实物理环境交互。行业里一个现实的痛点是:让机器人跳舞容易,做精密操作难。
这一现象的难点在于控制,对于机器人而言,动态环境下的实时感知与精准执行,目前仍是巨大的瓶颈。
第三代酷睿Ultra的应对方案是“大小脑融合”。依托XPU异构架构,推理决策与实时运动执行被整合在单颗SoC上。其中,CPU作为“小脑”,以4kHz的控制频率每秒完成4000次动作调整,保障关节电机精准响应;GPU承载高阶AI推理,在Pi0.5精度下推理时延仅为78毫秒,低于人类视觉200-250毫秒的平均反应时间;NPU则面向视觉感知,YOLOv12n推理仅需3.55毫秒,每秒处理约280帧,远超普通摄像头60帧的输出上限。
传统方案需要多个独立单元分工处理感知、决策和控制,不仅响应慢,还容易出现协同偏差。单芯片整合后,工程师得以将精力从底层调优转移到上层智能开发。
在成本方面,具身智能的Token消耗随用户量线性增长。某具身企业创始人透露,工程师一下午的训练就能烧掉数百美元。
对于这一难点,英特尔的思路是通过硬件负载整合降低底层开销,将推理决策和运动控制统一到单颗SoC的异构架构上,从硬件层面压缩算力冗余和能耗,把整体拥有成本拉到可商业化的区间。
而在算法路线上,具身领域目前没有统一范式,世界模型、VLA等路线仍在并行演进。芯片架构设计周期长达两到三年,押错路线的代价极其高昂。
面对这个问题,不同于很多厂商一味强调"靠近客户需求",英特尔提供了一个更辩证的思路——不仅要倾听客户的声音,更要有自身的战略判断。"我们也希望用我们自己内部的前瞻视角、结合自身的架构优化,与最广泛的生态进行合作,找准技术落地的正确方向,这是认知智能体发展在当下需要完成的事情。"高嵩表示。
英特尔的差异化策略在于:不盲目追随单一算法路线,而是以开放的架构和生态,支撑多种算法范式的并行验证与快速迭代。
目前,英特尔已联合科通工业、神州数码等合作伙伴推出基于第三代酷睿Ultra平台的具身智能开发套件,并携手多家伙伴面向制造、建筑、医疗、智慧城市、仓储物流、酒店等多种场景推进项目从原型走向量产,以生态的广度对冲算法路线的不确定性。
此次,英特尔也正式宣布,英特尔具身套件将于11月份在京东上线,也意味着,开发者离触手可及的机器人又近了一步。
写在最后
正如开篇所言,在AI从算得快走向干得了活的今天,系统设计的重心正在向执行面迁移。
英特尔在数字AI侧的判断是:推理和智能体部署放大了CPU侧的系统工作,而x86在控制面、生态适配和基础设施软件上的存量优势,正好能接住这个需求;在物理AI侧,则用异构SoC缩短机器人的感知-决策-控制闭环,靠生态广度对冲算法路线的不确定性。
不一定完全会用到所有的算力,但提供一个最优的系统级选择,也许便是生产力提高的关键。
当AI真正开始解决现实问题,算力的版图,已然重塑。
雷峰网原创文章,未经授权禁止转载。详情见转载须知。