NVIDIA发布新一代Vera Rubin NVL72机架,功耗超200kW
近日,全球人工智能算力的竞争进入了一个重要阶段。微软和OpenAI相继宣布,他们预定的NVIDIA新款Vera Rubin NVL72机架已正式交付,这也是全球首批获得这种量产硬件的企业,象征着AI基础设施进入了Rubin时代。8月21日,微软首席执行官萨提亚·纳德拉在社交媒体上分享了一系列Vera Rubin的开箱照片,并兴奋地表示首批量产版Vera Rubin系统已送达微软的数据中心,Azure团队正忙于其部署工作。NVIDIA也对此表示祝贺,称“Vera Rubin正在全面进入生产阶段,祝贺微软团队实现这一重要里程碑。”与此同时,OpenAI的算力首席技术官Uday Ruddarraju也分享了相关图片,他提到这是“基础设施发展的一个重要里程碑”。他还表示:“首批NVIDIA Vera Rubin机架现已到货,并投入运行我们的训练系统。这是我们扩展计算能力的重要一步,将推动OpenAI下一代前沿AI的预训练。”自2026年6月NVIDIA宣布Vera Rubin平台进入全面量产以来,距头部客户拿到实物的时间仅仅过了两个月。除了微软和OpenAI,谷歌云和CoreWeave等公司同样位列首批客户。
此次交付的主要机型Vera Rubin NVL72采用了行业标准的48U机架,内部配置了计算托盘和中层板,此外还有包括19英寸电源架在内的多个特定组件。Vera Rubin NVL72的高度达到2.2米,内部的硬件规格相当强大:72颗Rubin GPU和36颗Vera CPU组成36组超级计算单元;每颗Rubin GPU配备288GB的HBM4高带宽显存,使得整机的HBM4总容量达到20.7TB;而LPDDR5X内存总计达到54TB,使得整机内存总量为74.7TB;使用第六代NVLink 6交换机,支持GPU之间以260TB/s的高带宽低延迟互联,确保72颗GPU具有统一的低延迟寻址。此外,整机基于第三代MGX机架架构,采用全模块化的设计,使维护更为便利。
在性能方面,根据NVIDIA的官方测试数据,与Blackwell架构相比,新系统的推理性能提升了5倍,而训练性能则提升了3.5倍。在训练MoE混合专家大模型时,所需的GPU数量仅是上一代GB200 NVL72的四分之一。云计算厂商CoreWeave进行的实测表明,新系统的AI吞吐量与能源利用效率比过去提升了十倍,显著降低了大型模型推理的token单价。每个机柜的ODM采购价格为780万美元,相较于上一代的GB300 NVL72(约400万美元)几乎翻了一番,而存储芯片的成本激增了435%,如今其在整机成本中的占比达到了26%。
随着算力密度的提升,机柜的电力供应和散热问题日益凸显。Vera Rubin NVL72的单机柜满载功耗达225kW,较上代的120至150kW提升了50%,正式进入了单柜功耗200kW的新时代。这一数值涵盖了计算核心、电源转化损耗、液冷散热系统及所有网络设备的综合功耗。为支持如此高的功耗,Vera Rubin NVL72采用了完整的液冷设计,能够在45℃的温水环境下运行,并搭载动态功率转向和智能功率平滑技术,缓解AI负载的剧烈功率波动。目前,该机型依然使用54V直流供电结构,尚未过渡到高压直流供电。
然而,低电压大电流供电架构已难以满足日益增加的功耗需求,因此该行业正在加快向800V高压直流供电结构的转型,以通过提高电压与降低电流来减少能量损耗和材料需求。根据公开的产业计划,Vera Rubin的下一代升级版预计将于2027年过渡到400V供电体系,标志着未来时代的到来。