Scale-up(垂直扩展)
在大模型与高性能智算中心的语境下,Scale-up(垂直扩展 / 纵向扩展) 是与 Scale-out(水平扩展 / 横向扩展) 并驾齐驱的两大算力扩张范式之一。
一句话道破本质:Scale-out 是“向外扩”,靠多买服务器、堆机器数量来做大集群;而 Scale-up 则是“向内聚”,它专注于通过极致的高速互联总线,把单个算力单元内部的芯片做得更紧、更快、更像一个无法分割的整体。
在大模型微调、训练与超节点(SuperPod)的构建中,Scale-up 正在扮演至关重要的角色。
一、 物理图景:AI 时代的 Scale-up 到底长什么样?
在传统的云计算时代,Scale-up 指的是在一台服务器上多插几根内存、多换一个更强的 CPU。但在大模型 Infra 领域,Scale-up 被赋予了全新的物理定义:打造“超级节点(SuperPod)”。
-
从单机 8 卡到 NVL72 机柜:传统的 8 卡服务器内部,8 张 GPU 通过 NVLink 互联,这 8 张卡形成了一个单机内的 Scale-up 域。而像 NVIDIA 架构(如 NVL72)则将整个机柜视为一个超节点,通过铜缆背板和 NVSwitch,将一个机柜内的 72 颗甚至更多芯片全部打通,让 72 张卡在数学和物理上表现得像一张巨大无比的“怪兽显卡”。
-
内存池化与统一编址(Global Shared Memory):Scale-up 能够让多张 GPU 通过内存级语义(如 Load/Store/Atomic 操作)直接物理互访对方的显存,延迟极低。这就是说,GPU 0 可以像读写自己的 HBM 显存一样,去直接读写 GPU 71 的显存,从而打破大模型的“内存墙”。
二、 为什么大模型训练必须要 Scale-up?
大模型分布式训练常用的 3D 并行策略(张量并行 TP、流水线并行 PP、数据并行 DP)中,不同的并行模式对网络的要求有着天壤之别:
-
张量并行(Tensor Parallelism, TP)是 Scale-up 的专属舞台:
TP 是把大模型某一层的矩阵矩阵乘法横向切开,分给多张卡计算。在每次前向和反向传播中,这些卡之间都需要高频地、同步地交换几百 GB 的数据。
-
如果走普通的 Scale-out(以太网/RDMA) 网络,通信延迟(微秒级)会瞬间吞噬掉 GPU 的计算时间,导致 GPU 产生大量的“计算空泡”。
-
必须走 Scale-up(NVLink / UALink 等芯片间直连协议),将延迟压到纳秒级,才能跑得通张量并行。
-
三、 Scale-up 的核心底层技术栈
要在一个高带宽域内搞定 Scale-up,主要依赖以下硬核底座:
-
私有/开放的芯片级互联协议:
-
私有垄断:NVIDIA 的 NVLink 和 NVSwitch 技术,目前是 Scale-up 的绝对霸主。
-
开放联盟:为了打破垄断,AMD、谷歌、微软、腾讯等巨头联合成立了 UALink(Ultra Accelerator Link)联盟,或者推进基于以太网物理层的 ESUN(Ethernet Scale-up Network),旨在用统一的开放标准来实现非绿厂芯片的高性能 Scale-up 纵向扩展。
-
-
铜互联与光电协同:
-
在机柜内部(1~3米短距离),Scale-up 疯狂堆叠高速铜缆(如有源铜缆 AEC),利用铜缆极低的能耗和高带宽,满足短距极限吞吐。
-
跨机柜扩展时,则引入 CPO(光电共封装)、OCS(全光交换机)等前沿光通信技术来突破电信号的物理极限。
-
四、 两者不是二选一:Scale-up 与 Scale-out 的协同
在工业界落地万卡、十万卡集群时,这两种架构从来不是对立的,而是完美咬合的组合拳:
-
局部 Scale-up 筑巢:在单个机柜(或超节点)内部,利用 NVLink/UALink 建立极高带宽、极低延迟的物理核心圈,专门用来承载强耦合、高频同步的 张量并行(TP) 和 专家并行(EP)。
-
全局 Scale-out 织网:在超节点与超节点之间,通过我们前文聊过的 InfiniBand / 阿里云 HPN / Solar-RDMA 等无损以太网建立大规模横向互联(Scale-out),用来承载 数据并行(DP) 和 流水线并行(PP)。
一句话总结:
Scale-up 负责把局部的算力单元捏得足够紧、焊得足够快;Scale-out 负责把这些高质量的算力单元无限铺开、连成无边无际的算力海洋。两者结合,才是现代大模型基础设施向前进化的终极标准形态。
