对于AI应用,多数人只关注到它性能的变化,却想不到它性能的每一次巨变,都伴随着算力设施的重大变迁。大模型初始阶段,算力以训练算力为主,而当AI应用与企业业务更多地融合之后,推理算力成为了关键。智能体让代理式AI变成主角时,AI从静态问答走向具备自主规划、工具调用、代码执行、多轮长上下文交互的代理式AI(Agentic AI),传统分立服务器、单一GPU集群架构的底层瓶颈全面暴露出来。代理式AI底座因此而需要一场更彻底的重构,NVIDIA Vera Rubin平台也恰好在这一时期初露头角,它引领的将是代理式AI时代一场必然发生的革命。
传统基础设施底座的短板
2026年,智能体进入试点爆发期,客服、金融、办公等垂直场景专业智能体实现规模化落地,市场增速超60%。并且在2027年,智能体应用将进入扩张整合期,智能体等应用普及率将超70%。2028年,智能体应用将步入成熟渗透期,智能体企业普及率突破70%,成为各行业数字化标配。与之相对应,企业基础设施也需要进行相应的革新。
概括来说,对应于智能体新应用,传统基础设施存在算力架构错配、推理成本失控、网络与能效天花板、安全体系缺失等四大短板。
从算力架构错配的角度来看,智能体依赖海量CPU沙箱环境做任务编排、结果校验,传统x86 CPU单核性能、内存带宽不足,并行场景延迟剧烈波动;大模型MoE训练与长上下文推理对GPU间全互联带宽提出了指数级需求。
再从推理成本失控的问题来分析,万亿参数模型、百万级Token上下文催生海量KV缓存,通用存储无法承载高频读写,每Token成本持续走高,成为AI厂商规模化盈利核心阻碍。
网络与能效天花板同样是必须要解决的问题,大规模AI工厂东西向流量激增,传统光模块功耗高、带宽不足;数据中心供电容量受限,硬件功耗与算力产出失衡。
最后,安全体系的缺失,对于企业级应用来说是必须要补上的一环。原因在于自主智能体具备代码执行、数据访问权限,传统主机侧安全易被入侵绕过,缺少芯片级、分布式零信任防护架构。
AI工厂平台的进化
在英伟达倡导AI工厂平台之前,CPU+GPU+DPU的3U体系已经很流行,其本质就是要求不仅CPU、GPU尽最大限度地处理数据,DPU也要拓宽网络通道,让数据和处理结果实现取大程度的交互。而英伟达AI工厂平台在此基础之上,已经进化了一大步。
NVIDIA于GTC2026正式宣布NVIDIA Vera Rubin平台搭载的七款新芯片已全面投产,旨在扩展全球最大 AI 工厂的规模。Vera Rubin以七款芯片、五大专用机架、全栈协同设计,打造面向代理式AI的一体化超级计算机,实现从模型预训练、微调、强化学习到智能体实时推理的全生命周期算力支撑,彻底解决传统AI基础设施碎片化、低能效、高成本短板。
具体来看,Vera Rubin 核心设计逻辑摒弃“单服务器为计算单元”的传统思路,将整机柜POD作为统一计算主体,依托第三代MGX模块化机架架构,集成7款全新自研芯片,拆分五大功能专用机架,所有硬件深度协同调度,形成一台逻辑统一的巨型AI超算。整套平台覆盖计算、互联、网络、存储四大赛道芯片,实现全链路自研闭环。
其中的NVIDIA Vera Rubin NVL72 机架,集成了通过 NVLink 6 互连的 72 个 Rubin GPU 和 36 个 Vera CPU,面向MoE混合专家模型、万亿参数大模型优化;对比 Blackwell平台,它带来的最大变化,就是训练同等规模MoE仅需1/4数量的 GPU,推理每瓦特吞吐量提升10倍,每Token成本降至1/10。从而有效应对推理成本失控的问题。
Vera CPU是全球首款专为代理式AI、强化学习定制的ARM处理器,NVIDIA自研的Olympus 88核心(Armv9.2 架构),单线程性能、内存带宽全面碾压传统x86,CPU-GPU通过NVLink-C2C可以实现1.8TB/s 一致性带宽(PCIe 6的7倍),专门承载智能体沙箱、任务编排、代码编译等串行密集任务。
NVLink 6交换机是新一代GPU高速互联芯片,单卡双向带宽 3.6TB/s,为上代 Blackwell的2 倍,支撑NVL72机架72卡全对全无阻塞通信,解决 MoE模型路由通信瓶颈。
ConnectX-9 SuperNIC是新一代高速智能网卡,承载机架内外高速数据转发,与BlueField-4 DPU协同卸载网络、存储负载。
BlueField-4 DPU是第四代数据处理器,核心承载存储加速、芯片级安全、网络卸载,配套 DOCA 软件栈构建 AI 工厂底层安全底座。
Spectrum-6以太网交换机搭载了CPO光电一体化封装技术,面向AI工厂东西向流量,光学能效提升 5 倍,系统可靠性提升10倍,该机架可灵活配置 Spectrum-X 以太网交换机或 NVIDIA Quantum-X800 InfiniBand 交换机,能够在大规模部署中提供低延迟、高吞吐量的机架间互连。
Groq 3 LPU是低延迟推理专用处理器,平台新增推理补位芯片,依靠超大片上SRAM实现确定性超低延迟Token生成,适配百万级上下文智能体并发交互场景。
发生变化的不仅停留在芯片层面,七大芯片落地为五类液冷机架,各司其职、高速互联,共同组成了完整AI工厂POD。
Vera Rubin NVL72 GPU计算机架用于超大规模模型预训练、MoE混合专家模型训练、批量高吞吐推理。对比Blackwell,Vera Rubin NVL72 GPU计算机架同等模型训练GPU数量缩减 75%,集群GPU利用率大幅提升,缩短了训练周期、降低总体拥有成本(TCO);同时还支持 Quantum-X800 InfiniBand横向扩展,适配万卡级AI工厂集群。
Vera CPU机架可以作为代理式 AI 编排底座,其内存搭载第二代LPDDR5X,带宽1.2TB/s、功耗不足30W,传统DDR5功耗超100W;综合性能为传统机架CPU的2倍,单核速度提升 50%,流数据、数据库、编译类工作负载延迟大幅下降。
Groq 3 LPX LPU 推理机架是低延迟长上下文专用,它弥补了GPU在超高并发、超低延迟长上下文推理的短板,与Rubin GPU协同分层解码;LPU 集群可作为单一逻辑处理器运行,指令执行延迟完全确定无波动。
BlueField-4 STX存储机架可以作为KV缓存专属加速层。它实现了全局POD 共享KV缓存,解决智能体多轮交互上下文重复加载痛点;相较通用存储架构,推理吞吐量提升了5倍。Mistral AI等厂商将它应用于代理式AI指数级扩容,保障了海量数据集推理连贯性与速度。
Spectrum-6 SPX网络机架是集群高速互联的中枢,它打通了五大机架间东西向流量,实现整个POD内无阻塞高速数据互通,支撑万级智能体、百万级并发请求下稳定低延迟通信。
攻克基础设施底座的四大短板
了解了Vera Rubin 完整POD级AI工厂平台的构成,也就不难理解它是如何补齐传统基础设施底座的四大短板了。
应对算力架构错配问题,Vera Rubin完整POD级AI工厂平台利用CPU/GPU/LPU三位一体分工重构算力逻辑,实现异构协同计算。
传统AI架构仅以GPU为核心,CPU仅做辅助调度,无法适配智能体 “推理+规划+工具执行”复合负载;而Vera Rubin采用专业算力分工架构,Rubin GPU负责大模型权重矩阵运算、大规模预训练、批量高吞吐推理;Vera CPU接管所有串行、分支密集任务——智能体环境模拟、代码沙盒、任务编排、数据库查询、编译,依靠超高单核性能解决传统CPU瓶颈;NVLink-C2C一致性互连实现了CPU/GPU内存互通,无需频繁数据拷贝;Groq 3 LPU则专攻低延迟
Token 解码,片上SRAM全驻留KV缓存与局部权重,消除外部内存访问延迟;编译器提前固化指令时序,并发场景延迟零抖动,适配客服、编程智能体等强交互业务。
第三方基准测试验证:Vera CPU对比新一代128核x86处理器综合性能高出1.5 倍,Linux 内核编译单核速度为x86 芯片的2 倍,内存带宽达成率稳定在90%以上,彻底解决智能体多任务并行下内存拥堵问题。
应对网络与能效天花板,NVLink 6高速GPU互联实现了单卡双向带宽3.6TB/s,较上代翻倍,NVL72机架72卡实现全对全通信,MoE模型专家路由无阻塞,集群算力利用率提升40%以上;NVLink-C2C 实现了Vera CPU与Rubin GPU高速相干内存共享,消除PCIe传输瓶颈。Spectrum-X CPO硅光交换实现了光电一体封装替代传统可插拔光模块,光学能效提升5倍,硬件故障率降低90%;大规模横向扩展AI工厂时,大幅降低网络功耗与运维成本,支撑跨机房、跨区域集群高速互联。
在能效方面,Vera CPU采用LPDDR5X低功耗内存,内存功耗降低70%;DSX Max-Q动态供电系统,同功率机房可部署30%更多AI算力;DSX Flex软件将AI工厂转化为电网柔性资产,释放千亿瓦闲置电力容量;Groq 3 LPX每兆瓦推理吞吐量提升了35倍。
应对推理成本失控,Vera Rubin平台彻底转变了AI基础设施评估标准 —— 摒弃传统 “每美元 FLOPS”原始算力指标,以每百万 Token 成本、每兆瓦 Token 产出作为核心商业衡量维度,实现全链路成本大幅下降。
应对安全体系缺失方面,代理式 AI 具备自主访问数据、执行代码能力,攻击面大幅扩张,Vera Rubin 依托 BlueField-4 DPU实现硬件隔离安全体系,区别于传统主机侧软件安全,BlueField-4能够在独立可信执行域中运行,并通过DOCA Argus、DOCA Vault、DOCA Flow,提供涵盖运行时威胁检测、基于文件的存储零信任访问以及高速策略网络执行等专用功能。。
DOCA Argus可以让DPU独立可信域运行,无需主机代理,零损耗监控进程、内存、网络行为,实时识别反向Shell、未授权代码执行等入侵行为;即使主机系统沦陷,安全监控持续生效,检测速度是纯软件方案1000倍。
DOCA Vault能够实现芯片级细粒度权限管控,限制智能体、训练任务仅访问授权数据集与模型,拦截模型、上下文数据泄露。
DOCA Flow可以实现硬件加速7层防火墙、网络分段,线速执行访问策略,阻止威胁跨机架横向扩散。
归纳起来看,整套安全架构与AI工作负载完全解耦,防护过程不占用业务算力,兼顾规模化与数据安全,适配金融、政务等高合规AI智能体场景。
生态的力量
攻克基础设施底座的这四大短板之后,不得不提的还有NVIDIA的完整软件生态,因为这是硬件能否成功的重要影响因素。
在这方面,平台依托 NVIDIA 完整软件生态无缝适配:CUDA、TensorRT-LLM、vLLM、SGLang推理框架原生优化 Vera Rubin 硬件;DOCA 全套开发套件支撑DPU网络、存储、安全自定义开发;统一调度框架实现 GPU、CPU、LPU 混合集群协同调度,无需业务侧大规模代码改造。并且利用合作伙伴的力量,可以覆盖全行业落地场景。
因此,综合来看,作为唯一全栈代理式 AI 原生平台,Vera Rubin平台将推动行业从单机服务器部署转向整机柜一体化超算架构,加速主权AI、大规模自建AI工厂普及。同时,Vera Rubin平台还将打开代理式AI规模化天花板,重构AI硬件价值评判体系。
需要特别注意的是,NVIDIA Vera Rubin并非前代Blackwell平台的简单迭代,而是面向代理式AI时代的架构级革新。通过七款自研芯片、五大功能机架的深度协同,平台打通训练、强化学习、长上下文推理、智能体调度、存储、网络、安全全链路技术壁垒,以整机柜超算形态重构 AI 工厂底层底座。
从技术层面,NVLink 6、CPO 硅光、Vera自研ARM CPU、Groq 3 LPU、BlueField-4 加速存储、芯片级零信任安全六大创新形成组合优势,完美适配万亿参数大模型、百万Token上下文、万级并发自主智能体的新型负载;在商业层面,平台大幅降低每Token综合成本,解决企业落地AI智能体的盈利难题。
因此,一场属于NVIDIA Vera Rubin的基础设施革命,已经开始了。
第四十二届CIO班招生
国际CIO认证培训
首席数据官(CDO)认证培训
责编:lijj
免责声明:本网站(http://www.ciotimes.com/)内容主要来自原创、合作媒体供稿和第三方投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。
本网站刊载的所有内容(包括但不仅限文字、图片、LOGO、音频、视频、软件、程序等)版权归原作者所有。任何单位或个人认为本网站中的内容可能涉嫌侵犯其知识产权或存在不实内容时,请及时通知本站,予以删除。