}

过去几年,大模型竞争的主线很清晰:更大的模型、更多的数据和更强的GPU集群。

但随着预训练边际收益递减,模型能力Scaling正从单纯的预训练堆叠向后训练强化学习(RL)转变,数学推理、代码生成、复杂决策、长时序Agent等高阶能力,越来越依赖后训练强化学习(RL)激发。RL通过生成、执行、反馈和奖励,让模型持续学习推理、规划与自我纠错的能力。

由此,大模型发展从“一次性训练”进入“持续训练”,模型能力Scaling也从预训练延伸至生成、反馈和迭代全过程。SemiAnalysis指出,当RL成为模型能力持续Scaling的关键,竞争的就不只是算法,还有支撑模型持续生成、训练和更新的AI基础设施系统。

问题也随之变成:当模型越依赖RL获得能力,谁来支撑这种能力持续低成本地生产。

从“模型+算力”到算法与AI基础设施共同Scaling

智谱近期的模型迭代,为观察后训练RL提供了一个窗口。

智谱公告指出,GLM-5.3与GLM-5.2在相同基座上推进强化学习,通过后训练Scaling持续提升模型智能上界。以GLM-5.2为例,其在SWE-bench Pro取得62.1分、Terminal-Bench 3.0达到81.0分,核心驱动力正是面向长时序、多步骤、工具联动场景的RL训练。这意味着,复杂推理和Agent能力的提升,正越来越依赖强化学习。

这一变化也正在影响AI产业链分工方式:模型厂商不再只是单独推进算法,而是需要与AI基础设施共同服务于“智能持续生产”。

目前,GLM-5系列、DeepSeek R系列等主流推理模型均已部署于九章智算云,实现规模化Token生产。不同于“模型+算力”的传统产业关系,九章智算云与模型厂商双方形成了算法与工程系统双向RL Scaling的协作模式:模型厂商持续挑战RL算法和策略边界,九章智算云则持续打磨适配的算力调度、推理服务和状态管理,实现工业级应用。大规模应用的模型算法再进化,进而提出更高的基础设施要求,而基础设施的持续迭代又为更大规模RL实现打开空间。

由此,模型厂商与AI基础设施成为RL的一体两面,RL从模型训练中的单一算法环节,升级为AI云必须具备的核心能力。模型、算力、数据、状态和推理不再彼此割裂,而是共同构成一条持续运行的智能生产线。

真正的问题也由“模型+算力”转向如何让算法与基础设施协同Scaling,以“一条智能生产线”更低成本持续生产有效Token和模型能力。

RL让训练与推理成为一条生产线

强化学习与传统预训练的核心差异,不在于增加一种训练算法,而在于改变了训练系统的结构。

一个完整的RL系统通常由三部分组成:Generator、Environment和Trainer。


Generator接收Prompt并通过推理生成Rollout;Environment执行代码、工具调用或任务模拟并返回Reward;Trainer依据Rollout和Reward更新模型权重,再将新权重回传Generator,形成Generate→Reward→Train→Update→Generate的持续闭环。与预训练依赖固定数据集不同,RL的训练数据由模型实时生成,因此训练与推理第一次真正形成了连续生产关系。

问题也因此出现。如果Trainer每秒能够消费100个样本,而Generator只能生成60个,训练算力就会闲置;反之则会造成Rollout堆积、数据陈旧,形成Policy Staleness。

因此,RL基础设施优化的核心不再是单点GPU利用率,而是Trainer Throughput与Effective Generator Throughput的动态匹配。

依托这套机制,训练与推理首次形成真正意义上的连续生产关系。RL系统越来越像一个分布式生产系统:Generator是生产者,Trainer是消费者,整个RL系统本质上成为一个需要持续平衡吞吐、数据新鲜度与资源利用率的分布式生产系统。

九章智算云与中国人民大学STILL项目团队联合发布的《An Empirical Study on Eliciting and Improving R1-like Reasoning Models》验证了这一机制,研究显示,Qwen2.5-32B、DeepSeek-R1-Distill-Qwen-1.5B等模型均可通过持续RL迭代释放潜在推理能力,后者在AIME 2024上的准确率达到39.33%。研究同时表明,On-policy学习是持续提升性能的重要机制,而单纯奖励更长回答容易产生“length hacking”;通过动态更新Reward Model的Cooper方法,可以缓解Reward Hacking,改善端到端RL效果。

这说明RL绝非简单的增量训练,而是策略、生成、环境、训练和反馈高度耦合的系统工程。

其中最容易被忽视的,是Generator与Trainer之间的动态匹配。Generator过慢,训练GPU等待;Generator过快,Rollout堆积并逐渐陈旧。对于长时序Agent任务,一次Rollout还包含多轮工具调用和超长上下文,使Generator本身已经成为完整的实时推理系统。更进一步,两者共享的不只是GPU,还包括模型权重、Rollout、KV Cache、Environment状态和任务队列。权重更新过慢会导致Policy Staleness,更新过于频繁又会增加模型加载与数据搬运成本。

所以,RL基础设施真正要解决的并非单独提高训练吞吐或推理吞吐,而是让Generator与Trainer在整个生命周期内保持高效匹配。

九章智算云正是围绕这一问题构建RL工程化基础设施:将Generator、Environment和Trainer纳入统一工作流,通过全局动态调度适应不同阶段的资源需求——生成环节成为瓶颈时增加推理资源,训练进入高峰时重新分配算力,Environment等待时释放闲置GPU。由此,AI调度对象从“哪台机器有空闲GPU”升级为“模型、轨迹、状态和下一步计算应该在哪里”。


这么做的好处是直接提升模型速度,在 MiniMax M2.1 229B 和 Qwen3-Coder-Next 80B 等前沿模型上,首日速度提升 1.5 倍;随着流量变化,速度比静态预测器再提升1.25 倍。

与此同时,大多数部署方案都是离线训练投机者并将其冻结,导致部署速度慢,且会随着流量和目标模型的变化而失效。九章智算云将在线投机者学习重新定义为在生产环境中运行的异步强化学习问题:接受和拒绝的令牌作为奖励信号,训练服务器持续更新投机者,并且新的权重可以热插拔到服务器,实现零停机时间。

这意味着,AI云正走向AI全工作流调度的自适应推测训练。

状态资源化:训推一致是衡量AI Infra的核心之一

计算之外,运行状态本身也是基础设施的核心资源。

Agent交互产生的上下文与KV Cache、RL生成的轨迹数据与奖励信号、实时更新的模型权重,共同构成AI持续进化的状态资产。若这些资源被绑定在单一GPU或节点,跨节点搬运、重复Prefill和计算就会成为新的系统瓶颈。

传统数据路径通常需要经过存储、CPU内存、框架Buffer和GPU显存,多次复制和转发。在RL持续循环中,这些非计算开销会层层累积、持续放大。针对这一行业痛点,九章智算云依托DingoFS分布式文件底座、DFKV分布式缓存、全域零拷贝链路、RDMA高速网络等底层技术,重新组织数据与状态流转。

零拷贝缩短数据传输路径、减少CPU参与,降低RL闭环中的非计算开销;DFKV则将KV Cache从单GPU临时缓存升级为可定位、可迁移、可跨任务复用的状态资源,让已经产生的上下文继续创造价值。

由此,AI调度逻辑也从“哪里有空闲GPU”,升级为“模型、算力、上下文和状态应该在哪里组合”。如果Agent已在某节点完成大量Prefill,后续请求即可复用已有KV Cache,避免重复计算;训练与推理间的模型权重交换,也可依托高速数据路径降低传输成本。

基于此,九章智算云真正的训推一致的核心思路:不是简单共享训练与推理算力,而是让两者共享一套能够同时感知计算、数据、状态和工作流的统一基础设施。在RL体系中,Generator本身就是训练闭环的一部分;在Agent运行场景中,上下文与KV Cache又是任务持续运行的核心状态,二者天然深度耦合。这意味着,推理效率正在直接前置为训练效率:每一次高效Token生成、每一次KV Cache复用、每一次精准调度,都可能转化为模型迭代效率的提升。

SemiAnalysis RL系统专项分析指出,只有实现训推吞吐与系统状态高度匹配的基础设施,才能充分释放RL的性能潜力,支撑模型获得更优能力。而九章智算云则因专注于这一点,在中国市场率先完成了大规模、全场景的工程验证。

AI云也由“算力供应商”成为连接训练、推理、状态与模型迭代的核心底座。

从RL到推理优化,竞争的是“有效Token”

“训推一致”的系统能力成为RL的基础,这样的做法带来显著好处:加速推理优化技术进入生产级别,反过来影响训练效率,促成Token成本的直线下降。

这其中与MoE架构、推理优化、模型量化、模型架构和硬件协同设计等技术融合尤为关键。如Prefill与Decode具有不同的计算特征,PD分离可以将两类负载匹配到更合适的资源池;Chunked Prefill通过拆解超长上下文,缓解不同阶段的资源竞争;Speculative Decoding则由小模型生成候选Token、大模型批量验证,降低逐Token串行计算带来的开销。

这些技术看似独立,本质在解决同一个问题:让有限GPU生产更多有效Token。在九章智算云体系中变为一条生产线——Generator产生的Token不是最终答案,而是下一轮训练的原材料。Generator效率越高,同等算力就能生成更多Rollout;KV Cache复用减少重复Prefill;PD分离与动态调度则进一步提升计算与带宽匹配效率。

由此,训练与推理优化最终统一为AI基础设施生产级目标:单位算力的有效Token产出率,以及Token向模型智能的转化效率。

这也是九章智算云RL技术路线核心价值:并非单独搭建RL训练平台,而是将Generator、Trainer、Environment、模型权重、KV Cache与GPU算力整合进统一AI Runtime。模型厂商持续提高RL训练强度,基础设施同步优化Rollout生成、状态复用和资源调度,两者共同决定后训练Scaling能够走多远。

这一能力也将从大模型延伸至具身智能。Agent的工具调用、多轮决策,以及机器人的感知、推理、行动与反馈,本质都是动态试错和持续学习的RL闭环。未来,迭代环境将从代码沙箱、工具调用场景,延伸至模拟器、真实机器人与物理世界,但基础设施需求依然一致:弹性算力、实时推理、状态管理、高频反馈和持续迭代。

随着行业从大规模训练转向后训练强化学习,RL正在从单一模型训练算法,成为连接大模型、Agent与具身智能的通用技术底座。RL让模型能力持续Scaling,九章智算云则让这种Scaling能够高效、规模化地发生。这正是强化学习从算法走向AI云原生基础设施核心技术栈的关键所在。