男生插女生视频-97精品人妻一区二区三区香蕉-日日干天天射-日日网站-亚洲欧美日韩激情-国产精品.www-成人自拍在线-琪琪色18-亚洲福利在线观看视频-91网址在线播放-色欲av无码人妻精品麻豆

你的位置:首頁 > EMC安規 > 正文

AI工廠需要怎樣的數據中心?英偉達Vera Rubin給出了答案

發布時間:2026-07-17 來源:轉載 責任編輯:Lily

【導讀】大模型競爭進入推理階段后,AI基礎設施面對的任務已經和預訓練時期有了明顯差別。過去數年,訓練大模型是AI基礎設施建設的主攻方向。如今到了AI工廠時代,Token開始成為衡量產出的基本單位,推理,尤其是代理式AI,逐漸成為數據中心承載的重要工作負載。


代理式AI需要處理的內容遠比一次模型問答復雜。模型接收用戶輸入后,可能需要生成推理過程,調用搜索、數據庫和企業軟件,執行代碼并訪問外部工具,最后再對結果進行驗證。多個智能體協作時,一項任務還會在不同模型、軟件服務和執行環境之間反復流轉。


這些工作并不都適合交給GPU完成。GPU負責模型計算,CPU需要運行沙箱、編譯代碼、調用工具和管理執行環境;推理生成階段又同時面臨高吞吐量和低延遲要求;不斷擴大的KV Cache則開始占用更多內存和存儲資源。當任務鏈路越來越長,單獨提高GPU峰值算力已經很難帶動整套系統同步提速。


在這樣的工作負載變化下,英偉達打造出一套以Vera Rubin為基礎的POD級AI基礎設施。超級平臺包含Vera CPU、Rubin GPU、Groq 3 LPU、BlueField-4 DPU、NVLink 6交換芯片、ConnectX-9 SuperNIC和Spectrum-6以太網交換芯片七款核心芯片,并組成GPU計算、CPU沙箱、低延遲推理、上下文存儲和網絡五類機架級系統。


這五類系統分別處理高吞吐量計算、密集型CPU任務、低延遲Token生成、KV Cache存儲和集群通信,再通過統一的網絡、供電、液冷和機械架構連接成一座POD級AI工廠。


Vera Rubin的設計重點也由單顆芯片性能,擴展到處理器分工、機柜連接和數據中心基礎設施的整體協同。


1784110502147249.png


五類機架級系統共同組成一臺POD級AI超級計算機


CPU重新成為AI系統的關鍵資源


在強化學習和智能體應用中,CPU可能成為整套系統的瓶頸。隨著智能體循環中的代碼編譯、腳本執行、工具調用和環境驗證任務增加,GPU吞吐量提升并不能同步縮短這些環節的處理時間。強化學習環境和智能體沙箱持續擴張后,CPU機柜在AI集群中的配置規模也開始增加。


Vera CPU采用88個英偉達自研Olympus核心,并引入Spatial Multithreading空間多線程技術。與多個線程高度共享核心資源的常見多線程設計相比,Spatial Multithreading會為兩個硬件線程劃分部分核心資源,減少高并發負載下的資源爭用,使單個沙箱任務的執行時間更加穩定。單顆CPU可以運行176個硬件線程,內存帶寬達到1.2TB/s,每個插槽最多配置1.5TB LPDDR5X SOCAMM內存。與傳統服務器DIMM相比,SOCAMM可以同時保留LPDDR的帶寬和能效優勢,以及服務器需要的模塊化靈活更換能力。


一套獨立的Vera CPU液冷機柜最多可以安裝256顆CPU。按照英偉達公布的數據,單機柜可以同時維持超過22500個強化學習或智能體沙箱環境。


另外,Vera還會以多種形態進入數據中心。它可以作為Vera Rubin NVL72中的主機CPU,通過NVLink-C2C與Rubin GPU緊密連接;也可以進入HGX Rubin NVL8等加速服務器平臺。獨立部署時,Vera還可以組成單路或雙路服務器,承擔數據處理、HPC、云基礎設施和存儲任務;在BlueField-4 STX中,Vera CPU又與ConnectX-9 SuperNIC結合,進入上下文存儲基礎設施。英偉達由此把Vera擴展到了GPU主機、CPU密集型機柜、通用服務器和存儲系統等多個位置。


在英偉達給出的對比數據顯示,Vera CPU的代理式沙盒性能及內存帶寬性能均高于X86。



1784110517557446.png


1784110566868015.png


NVL72機架級計算引擎


CPU地位上升,并沒有削弱GPU在Vera Rubin中的計算核心位置。Vera Rubin NVL72集成72顆Rubin GPU和36顆Vera CPU,由18個計算托盤和9個NVLink交換托盤組成。每個計算托盤安裝兩組Vera Rubin Superchip,機柜內部的72顆GPU再由NVLink組成一個大型計算域。


NVLink承擔的是Scale-up任務,它把同一個機架中的GPU組織成一個高帶寬計算域,模型參數、激活值和中間結果可以在GPU之間高速交換。


NVLink交換芯片還可以執行部分網絡內計算,把數據規約和集合通信中的部分處理移出GPU,由此減少GPU的通信管理開銷。


加碼推理,LPU出現


英偉達在2026年將Groq 3 LPU加入Vera Rubin,形成獨立的LPX推理機柜。每個LPX機柜包含256顆LPU,采用片上SRAM和確定性執行架構,面向低延遲Token生成。LPX會與NVL72配合使用,Rubin GPU處理長上下文、Attention和計算密集型任務,LPU承擔部分逐Token解碼和MoE專家計算。


預填充階段需要一次處理完整輸入上下文,矩陣規模大、并行度高,GPU可以充分發揮計算吞吐和HBM容量。但到了Decode階段,按照自回歸方式逐個生成Token,每一輪都要等待上一輪結果,計算顆粒更小,用戶對延遲也更加敏感。


推理模型開始生成數千甚至數萬個思考Token后,Decode占用的時間迅速增加。擴大Batch可以提高GPU總吞吐量,也會讓一個請求在隊列中等待更長時間。高吞吐量和低交互延遲很難在同一種配置下同時達到。


這套分工把推理進一步拆開:GPU追求整體吞吐量,LPU縮短用戶等待每個Token的時間,CPU則負責執行工具和驗證結果。三類處理器需要反復交換狀態和中間數據,系統性能越來越依賴調度軟件和網絡能否準確地把任務送到合適的硬件。


英偉達公布的測試中,Vera Rubin NVL72與LPX組合在特定萬億參數模型上,相較Blackwell可獲得最高35倍Token產出和最高10倍收入機會。


1784110608223777.png


存儲正在變得極其重要


推理規模擴大后,另一個快速增長的資源是KV Cache。


KV Cache是已經計算過的上下文狀態,模型生成下一個Token時,可以直接讀取這些結果,無需重新計算全部歷史內容。聊天機器人通常只在一次對話中保留上下文,智能體需要長期保存任務目標、工具調用結果、中間推理和其他智能體返回的數據,多個服務還可能重復訪問同一份上下文。


現有推理系統通常把KV Cache放在GPU HBM中。HBM速度快、成本高、容量有限,空間不足后,數據會依次下沉到CPU內存、本地SSD和網絡存儲。每下降一級,容量增加,訪問延遲也會上升。GPU等待KV Cache返回時,Decode流程會暫停,系統吞吐量隨之下降。


傳統共享存儲圍繞永久數據設計,需要處理多副本、數據保護、一致性和長期保存。KV Cache屬于推理過程中產生的臨時狀態,部分數據丟失后也可以重新計算。兩類數據的訪問特征和可靠性要求差異很大,英偉達由此在GPU和CPU內存之外,增加了面向KV Cache的CMX Context Memory Storage。它以BlueField-4 STX機柜為基礎,在POD內部提供一層高帶寬、可共享的上下文存儲,使KV Cache可以在不同輪次、會話和智能體之間重復使用,減少GPU HBM容量占用和遠端共享存儲訪問。


英偉達的CMX可基于BlueField-4 STX機柜構建, NVIDIA BlueField-4 STX?機架采用 NVIDIA BlueField-4 處理器,該處理器結合了 Vera CPU 和 ConnectX-9 SuperNIC,并通過 Spectrum-X 以太網網絡進行橫向擴展。BlueField-4負責NVMe訪問、數據完整性、加密和KV數據傳輸,Spectrum-X提供低延遲的RDMA網絡。系統可以在Decode開始前,把即將使用的數據提前送入GPU或者主機內存,從而減少GPU等待。


英偉達稱,CMX在長上下文和智能體推理中可以帶來最高5倍的持續Token吞吐量,以及最高5倍于傳統存儲的能效。這些指標屬于廠商測試結果,CMX的系統價值仍然容易理解:昂貴的HBM可以保存最活躍的數據,更大規模的推理上下文進入一個針對KV Cache優化的共享層,GPU因此減少重復計算和遠端存儲等待。


1784110642974938.png


如圖所示,G3.5的CMX 位于本地SSD和網絡存儲共享之間,提供了有效數據緩沖。


面對不同數據流的網絡拓撲


計算、CPU執行、低延遲解碼和上下文存儲被拆分到不同機柜后,網絡需要處理的數據流也需要分層傳輸,AI工廠中的網絡可以歸納為五類:Scale-up、Scale-out、Scale-across、存儲網絡和管理網絡。


Scale-up負責連接同一個計算域內的GPU。在Vera Rubin NVL72中,NVLink 6將72顆Rubin GPU組成一個高帶寬計算域,用于模型并行、GPU內存訪問和高頻集合通信,對帶寬、延遲和抖動提出了極高要求。


Scale-out指東西向擴展,負責連接多個機柜。英偉達同時提供InfiniBand和Spectrum-X Ethernet。InfiniBand長期服務于HPC和并行計算,RDMA、無損網絡以及集合通信機制較為成熟;Spectrum-X面向已經擁有大量以太網基礎設施的云廠商和企業,使這些客戶繼續使用已有的運維體系、網絡人才和管理軟件。用戶可以根據自己需求靈活選擇部署。


Scale-across則負責連接不同數據中心。隨著AI工廠的擴大,單個園區的電力、土地和冷卻容量有限,AI集群可能部署在多個建筑、多個園區甚至相距數百公里的設施中。長距離通信會增加傳播延遲和帶寬時延積,機房內部使用的擁塞控制參數難以直接套用。英偉達的Spectrum-XGS技術,通過拓撲感知擁塞控制、延遲管理和端到端遙測,讓分布在不同設施中的算力參與同一套AI任務。英偉達稱,其在跨數據中心環境中的NCCL性能最高可提高1.9倍。


1784110641551107.png


傳統企業數據中心中,一臺服務器或者虛擬機可以獨立處理大部分業務。單個數據包延遲略有波動,通常只會影響一個請求。而AI訓練需要面向數千顆GPU,一輪本地計算結束后,所有節點要通過All-Reduce、All-Gather或All-to-All交換數據,再進入下一輪計算。


因此,不能因為一顆處理器的網絡擁塞影響其他GPU。網絡抖動影響的范圍也由一個請求擴大到整個訓練集群。AI網絡需要同時關注有效帶寬、尾延遲、丟包率、擁塞恢復時間以及每輪通信耗時是否穩定。這需要無損、低延遲和接近零抖動的網絡。


CPO量產進行時


數據中心除了芯片耗能之外,網絡設備的功耗同樣不容忽視。傳統可插拔光模塊速率提升到800Gb/s和1.6Tb/s后,其內部電芯片的耗電量激增,信號損耗、驅動功耗和散熱壓力都會明顯提升。


利用CPO(共封裝光學)技術,可以把硅光引擎放到交換芯片封裝附近,將高速電信號的傳輸距離縮短到毫米級,隨后盡早轉換成光信號,從而減少網絡功耗和延遲。


Spectrum-X Ethernet Photonics基于Spectrum-6,最高交換容量達到409.6Tb/s。與可插拔光模塊方案相比,CPO可以獲得5倍網絡能效,并將AI應用的持續運行時間提高5倍。同時,CPO不需要傳統DSP重定時器,可以縮短網絡延遲。


MGX和DSX把協同設計延伸到機房


英偉達MGX提供開放式模塊化參考架構,使 OEM、ODM 和生態系統合作伙伴能夠更快地構建加速系統,對于系統組裝商而言,MGX 通過使用共享參考設計將每個平臺的研發成本降低 200 – 400 萬美元。


雖然 NVIDIA MGX NVL 機架提供大規模縱向擴展的計算域,但代理式 AI 工作流需要高度專業化的節點來實現超低延遲推理、CPU 沙盒和用于 KV 緩存的加速上下文內存。為滿足這些不同需求,Vera Rubin 推出了 MGX ETL 機架架構,這是一種完全可配置的全新 MGX 機架,其設計采用 Spectrum-X 以太網主干或直接芯片到芯片主干,利用與 MGX NVL 機架相同的機架級生態系統。


MGX ETL與MGX NVL采用相同的機架尺寸,并共享主要機械結構、銅纜背板、供電和液冷部件。OEM和ODM可以在相同的機房條件與供應鏈體系下,構建GPU計算、CPU沙箱、LPX推理和BlueField-4 STX存儲機柜,減少不同系統分別開發和驗證的成本。


功率管理也進入協同設計范圍。AI訓練和推理會產生快速負載變化,在機架層面,Vera Rubin NVL72 通過功率平滑技術來平衡功率波動,并集成了比 Blackwell Ultra 多 6 倍的局部能量緩沖,能夠在源端直接吸收快速的功率瞬變,這套機制可以將峰值電流需求降低最高25%。另外,MGX還支持45℃進水溫度和5000A液冷母排,較高的進水溫度可以減少部分地區對壓縮機制冷的依賴。


NVIDIA Vera Rubin DSX 則是一個 AI 工廠平臺,可為共同設計的 AI 基礎設施 (從芯片到電網) 提供藍圖和參考設計。AI工廠建設前,廠商可以在Omniverse數字孿生中模擬網絡協議、端口配置、機柜布局、功率分配和冷卻效果,提前進行系統仿真,從而提前進行各類指標評估,避免返工。


通過協同設計,拓展整條推理供應鏈


Vera Rubin最值得關注的變化,可能并非某一顆芯片增加了多少算力,而是英偉達開始圍繞推理和智能體任務重新分配系統資源,Vera Rubin也是英偉達迄今為止的集大成者。


GPU仍然是主要的模型計算引擎,CPU需求上升后,英偉達用Vera覆蓋智能體沙箱、強化學習和通用數據處理;Decode對延遲的要求,使得LPU+SRAM進入了推理流程中;KV Cache容量持續擴大,則利用BlueField-4和CMX形成新的存儲形態;最后用不同的網絡連接拓撲將系統構成POD甚至更大規模的集群,諸如NVLink、Spectrum-X、InfiniBand和Spectrum-XGS等等,從而打造出真正的AI工廠。


當基礎設施擴展到POD規模,AI系統的評價維度理應隨之增加。單顆GPU的峰值性能仍然重要,Token生成速度、單用戶延遲、每瓦吞吐量、GPU有效利用率、系統持續運行時間和CPU沙箱處理能力,也開始共同決定一座AI工廠的實際產出。


Vera Rubin代表了英偉達在推理時代的一次能力邊界擴張。產品定義已不只是GPU和服務器,也包括不同處理器之間的任務分工、機柜之間的網絡連接,以及從功率分配、液冷到機房建設的整體協同。


gg_20260512171736_266_20260622170931_179.png

特別推薦
技術文章更多>>
技術白皮書下載更多>>
熱門搜索

關閉

?

關閉