全球「AI学术顶会」精华汇聚地
您正在使用IE低版浏览器,为了您的雷峰网账号安全和更好的产品体验,强烈建议使用更快更安全的浏览器
此为临时链接,仅用于文章预览,将在时失效
人工智能开发者 正文
发私信给高允毅
发送

0

深度解读:智谱为什么要在 Infra 层搞 RSI?

本文作者: 高允毅   2026-09-18 14:48
导语:电话会揭秘智谱策略,以递归式优化跑赢300亿算力成本战。
深度解读:智谱为什么要在 Infra 层搞 RSI?
电话会揭秘智谱策略,以递归式优化跑赢300亿算力成本战。

    作者丨高允毅

    编辑丨岑   峰

                                                                                                       

9月17日,唐杰罕见的发了一条长推,这次他聊的是最近最火的话题之一:RSI
智谱也在暗暗发力RSI,他们已经把RSI放到了Infra层面,做出一套由GLM-5.3驱动的推理基础设施。正是这套Infra系统,让 GLM-5.3-Flash,即前段时间火遍全球的匿名模型 Ox-Alpha,在发布一周内,就迅速成为了全网使用最广泛的模型之一,短短六天内处理了超过 62万亿个 Token。
深度解读:智谱为什么要在 Infra 层搞 RSI?
更具有里程碑意义的是,这一切,全是在十万张国产芯片上跑出来的。
要知道,我们过去一直难以摆脱对英伟达的依赖,正在于国产芯片底层软件生态的薄弱,这中间有无数难以想象的算子兼容与通信难题。再加十万张芯片这个量级,难度是呈指数级上升的,在这样的集群里,每天都可能有几百张卡发生硬件故障、网络掉线或数据丢包。
而唐杰透露,从第一次全量跑通到把全部的真实生产流量切过去,智谱居然只用了短短两周。这在以往,需要一支经验丰富的基础设施工程师团队花费数周甚至数月才能完成。
面对硬件生态的不完美,智谱用软件给硬件“打补丁”并做到了极致优化。不仅让大模型顺利跑通,更使端到端吞吐量直接提升了 3.2 倍
这背后体现了智谱的一个核心判断:在算力受到外部严格限制的情况下,中国 AGI 能否取得突破,关键除了拥有多少芯片,而在于能否通过软件更高效地调动和利用算力。智谱此举,实质上是希望借助 RSI 建立一种“底层解耦”的能力,使 AI 能够自主适配不同硬件生态,跨越硬件之间的兼容障碍。
也就是说,智谱正试图把“国产算力不好用”这一行业难题,转变为“由 AI 自动挖掘硬件极限”的技术主动权。
国产芯片集群、由 AI 深度参与的 Infra 系统、全球出圈模型,这三件事组合在一起,连唐杰忍不住感慨:我们距离RSI的终局还相差甚远,但那个 “模型优化系统、系统反哺模型” 的最小循环,已经真实地转动了起来。
深度解读:智谱为什么要在 Infra 层搞 RSI?

01


十万张国产芯片集群:

一场没有参考答案的部署硬仗

唐杰表示要在十万张国产芯片,把一个大模型真正跑通、部署好,这并非易事。
这个事至少有三个坎,每个都足以拖垮一支经验丰富的工程团队。
首先,国产芯片的内存和数据传输速度天生就有限,不能直接照搬英伟达那套成熟经验。
其次是软件栈极不成熟,很多底层组件缺失。这里缺乏现成的运维手册,很多关键算子没有现成实现,大量底层文档甚至常常只能靠“猜”去推测和验证。
此外,还要考虑模型本身的负载极限。GLM-5.3-Flash 是全新架构,既要同时处理文字和图像,还要处理 100 万 token 的超长上下文。这意味着 KV 缓存的容量压力会呈几何级暴涨。
智谱的解法是用 GLM-5.3 驱动的Infra Agent,把几个关键技术融合一处,用软件工程能力补硬件短板。
比如,用通信换内存。采用节点内张量并行”与“层分割”,把模型按层拆分,同时在单个服务器内让多张芯片共同分担最核心的注意力和输出计算。
用计算换内存。开启 ReplaySSM 策略,内存装不下时先把数据丢掉,等用到的时候再让芯片当场现算,用极短的计算时间换取宝贵的内存空间。
用精度换容量。采用 W8A8 量化,把模型权重和激活都压缩到 8 位,直接砍掉一半以上的存储和带宽占用;再把最占空间的 KV 缓存,根据数据重要程度混用 INT8、FP8、BF16 三种精度进行动态压缩,把每一卡显存都利用到极致。
在此基础上,他们进一步把编码、预填充、解码三个阶段彻底解耦,用解耦换调度自由度。再加上 Infra Agent 的快速迭代,使得国产芯片利用率、单 Token 成本逼近英伟达的水平。
但最重要的问题在于,当 Infra Agent 陷入停滞时,往往不是因为写不出代码,而是它不知道 “为什么情况变得更糟了”。 
真实的推理系统不是一段静态的代码,而是从底层芯片、网络通信、内存分配到上层服务动态交织的“复杂生态”,任何一个微小的环节偏差都会引发连锁反应。在系统工程里,这被称为“稀疏反馈”
系统只会甩出一个结果,“吞吐量下降 20%”。但你并不知道,问题究竟出在底层代码、内存调度,还是数据传输?是哪一次改动引发了崩溃?下一步又该往哪走?
如果让AI去找问题,每次都要耗费数小时跑一遍完整的测试,极高的试错成本让 AI 的探索过程极其漫长。
传统的系统优化其实不缺工具,日志、测试、性能分析满天飞,但它们全都分散在不同的工程阶段里。如果是有经验的Infra工程师,他们会有“工程直觉”判断问题所在。
智谱想做的,就是把这个“工程直觉”逻辑量化,做成一套反馈机制,让AI可以追踪溯源问题所在。这个定位要足够精准,成本低廉且及时,还经得起验证。
在智谱看来,未来大厂之间的代际差距,将由“模型参与构建自身系统的深度”来决定。谁能率先跑通“模型训练 Infra”的闭环,谁就能获得智力增长的复利,从而在物理算力受限的情况下实现非线性的超车。
对此,智谱给出的答案,是一套叫“密集反馈”(Dense Feedback)的分层验证体系。
深度解读:智谱为什么要在 Infra 层搞 RSI?

02


密集反馈:AI版Infra工程师

智谱把“密集反馈”拆成三部分,分别是正确性反馈、系统行为反馈、性能反馈。它们对应的是Infra系统中三个底层问题,“算得对不对”、“卡在哪一步” 以及 “哪种解法最优”
深度解读:智谱为什么要在 Infra 层搞 RSI?
这就像一个资深的推理工程师,突然遇到告警,他会脑中自动弹出一条排查路径。要想理解智谱这套体系,我们不妨跟着三个真实的工程案例,看看人类工程师的工程直觉,是怎么被编码成 AI 的能力的。

案例一:长上下文精度漂移(正确性反馈)

在处理长上下文时,为了让多张芯片同时干活,系统会把长文字切成好几段,每张芯片算一段,最后再把各段的结果“拼接”起来。这种情况容易出现“长上下文精度漂移”,模型输出的结果偏差越大。
如果是资深Infra工程师,会顺着执行链路一步步去抓中间结果、拉误差曲线,排查到底是哪一次“拼接”污染了数据。
智谱把这套排查逻辑,沉淀成了正确性反馈体系。AI 像拿着显微镜一样,一眼看到是 KDA 内核在底层默认采用的计算精度,导致了舍入误差“滚雪球”累积。锁定问题后,AI 自动从开源经验库中匹配方案,把计算显式升级为更高精度的组合算法,从而解决问题。

案例二:KV 传输并发瓶颈(系统行为反馈)

系统在做大模型推理时,有一步叫“Prefill(预填充)”,就是先把用户的提示词理解一遍,并生成需要的缓存。理想情况下,系统应该“一边用 GPU 计算,一边跨节点搬运缓存数据”。
然而结果显示,两者加起来的总时间,比单独做计算慢了整整 20%。这意味着搬运基本是在“排队等”,没有和计算同步进行。
面对这种问题,传统的排查方式极其痛苦。工程师需要拉出一张巨幅的“全链路时序图”去人眼检查时间线,甚至得跨语言去翻看底层通信库(DeepEP)的 C++ 源码,盲猜是不是全局解释器锁(GIL)忘了释放,导致负责搬运的 Python 线程被卡死。
智谱把这套排查逻辑做成了“系统行为反馈体系”,相当于给 AI 装了一台“全链路 X 光机”:
它会自动拉取执行时序,看计算和通信有没有重叠。一旦发现该重叠的没重叠,直接在时序图上把异常时间片标红。
发现异常后,AI 会顺着调用链一路往下追,跨过 Python 和 C++ 的语言边界,直接钻到最底层的接口实现里去检查锁的状态。
定位到问题后,它会自动给出修复方案,并且用“时序 + 性能”两个标准一起验证:既要看时间片有没有真的重叠起来,也要看端到端性能有没有真的提上去。 
这样原本需要数天才能解决并发问题,AI几秒内就能快速解决。

案例三:解码内核冗余计算(性能反馈)

模型在生成文字时,会调用一个核心计算模块(解码内核)。如果这个模块跑得不够快,会拖慢整体速度。
资深的Infra工程师会去肉眼翻看底层的汇编或算子代码。为了让多张芯片同时以最高速干活,系统通常会采用“分块(Tiling)”策略,把一个庞大的计算任务切成四个小块同时推进。这会导致一些本来只需要算一次的公共步骤,可能会重复计算四次。这是典型的“为了并行而并行”。
智谱把大量内核优化里的通用套路,变成了可复用的“优化模板库”,再配合性能反馈体系,让 AI 拥有了一套自动化搜索引擎:
首先,性能反馈会先判断瓶颈在哪。然后,AI 会去“优化模板库”里找匹配的套路。这个库是 AI 读遍了 SGLang、Flash Linear Attention、DeepGEMM 这些项目里高手手写的内核,提炼出来的通用优化骨架。
当匹配到对应场景后,AI 直接套用这个思路重构代码,跑个小规模测试验证效果,把有效的保留下来,并反哺回模板库,让它变得越来越强。
从定位问题、检查问题到解决问题,在工程层面,AI 的排障能力已经深入算子精度层,跨越了语言边界,而那些成功优化出的经验,正在以前所未有的速度形成复利效应。
Infra的RSI将是如此景象,AI工程师具备了资深系统工程师的诊断能力,可以在工程层面,更快更细致地去执行。而人类工程师把关风险和业务决策,Infra系统进化成可以高速运转流水线。
深度解读:智谱为什么要在 Infra 层搞 RSI?

03


  从“卖工具”到“卖效率”:

被订单倒逼出的 RSI

智谱过去一直凭借强悍的 Coding 能力被称为 “国内版 Claude”,瓜分了国内大部分Coding市场。但今年以来,这家大模型公司明显把大量精力砸向了底层 Infra。
为什么智谱今年会做出如此重大的战略转向?从9月16日,智谱面向投资者举行电话沟通会中,我们可以窥见一二。
智谱高层表示,今年 2 月 GLM-5 发布后,市场需求迎来大井喷,调用量瞬间暴增 10 倍,导致发布当周的算力储备就被彻底耗尽。受限于极度紧缺的算力,智谱甚至被迫紧急停售了其主力赚钱产品 Coding Plan。
受限于算力紧缺,智谱只能选择 “All-in-Infra” 策略,并火速收购了中科加禾,把整体算力使用效率提升了 2-3 倍。但即便如此,依然填不上 Coding 需求暴涨的缺口。
智谱的核心增长约束就是算力,只要给它足够的算力,它就能立刻把产品卖出去换成真金白银。
事实也很快验证了市场的预判。7 月,智谱 40 亿美元融资到位后,智谱立刻全面重启 Coding Plan 销售。这是停售半年后首次完全开放,销量直接增长超过 15 倍,再次验证了“有多少算力,就有多少收入”的逻辑。
智谱高层算过“算力”这笔账。如果前期采取饱和投入,重金砸下 300亿元 算力,其中40%用于模型训练、60%用于推理服务。一旦这60%的推理算力全价打满,凭借 GLM-5.3 理论上高达 80% 的超高毛利率,年营收能直接冲上 400 亿元。这意味着,仅需一年,智谱就能不仅收回全部算力成本,还能顺便覆盖掉训练研发的费用。
对比来看,如果只保守投入 100 亿元,必然会导致研发受阻、订单流失,陷入“两头落空”的窘境。因此,对大模型公司而言,必须坚定选择算力的规模化扩张(Scaling),没有退路。
为此,智谱布了三层牌。
首先,智谱搭建 1GW 级的超大算力数据中心,解决算力“有没有”的问题,另一方面用全国产芯片,控成本,解决自主可控的长期风险。
其次,采用云分成模式,把开源模型变成云货架上的商品。智谱已经和多家海外巨头云服务商、国内头部云厂商签署了收入分成协议:GLM 系列开源模型以托管 API 的形式上架各大云平台,收入从 10 月起正式确认。
这相当于把算力压力、运维成本、全球分发全部外包出去,智谱自己轻资产变现。
另外,在企业级 Co-work(协同工作)赛道上,GLM-5.3 最先跑通网络安全场景。目前已有 100 家安全企业接入 GLM 模型,覆盖主流安全厂商、互联网大厂、研究机构、金融机构。根据 Gartner 的预测,2026 年全球信息安全终端支出将达 2489 亿美元,2030 年更将达到 3726 亿美元,这给智谱留下了巨大的想象空间。
说到底,智谱重投 Infra,正是 Coding 需求爆发后的必然延伸。
参考链接:https://z.ai/blog/glm-built-its-inference-infrastructure
深度解读:智谱为什么要在 Infra 层搞 RSI?

上车,雷峰网(公众号:雷峰网)带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

深度解读:智谱为什么要在 Infra 层搞 RSI?

扫描上方二维码

或点击阅读原文关注专区。

雷峰网原创文章,未经授权禁止转载。详情见转载须知

深度解读:智谱为什么要在 Infra 层搞 RSI?

分享:
相关文章
最新文章
请填写申请人资料
姓名
电话
邮箱
微信号
作品链接
个人简介
为了您的账户安全,请验证邮箱
您的邮箱还未验证,完成可获20积分哟!
请验证您的邮箱
立即验证
完善账号信息
您的账号已经绑定,现在您可以设置密码以方便用邮箱登录
立即设置 以后再说