Scale-out(水平扩展)
与专注于“单机/单机柜内部极致内聚”的 Scale-up 相对应,Scale-out(水平扩展 / 横向扩展) 是大模型进入万卡、十万卡超级集群时代的绝对算力供给支柱。
一句话道破本质:Scale-up 是“精益求精”,把单台机器的配置推向物理极限;而 Scale-out 则是“人多力量大”,通过标准的网络通信协议,把成百上千台独立的服务器连接成一个无边无际的分布式算力海洋。
一、 物理图景:AI 时代的 Scale-out 怎么玩?
传统的云计算 Scale-out 只需要通过负载均衡(如我们聊过的 SLB)在最外层分发流量,后端每台物理机各跑各的,互不干扰。
但在大模型分布式训练场景下,Scale-out 迎来了极其硬核的演进。它不是简单的机器拼盘,而是要解决“如何让上万台服务器在地理分散的机房里同步呼吸、联合攻克同一个大模型模型”:
-
多节点流水线(Pipeline Parallelism, PP):
当一个 1750 亿(甚至万亿)参数的大模型大到单个 Scale-up 超节点完全装不下时,Scale-out 登场。我们将模型的 1 到 20 层放在服务器 A,21 到 40 层放在服务器 B,41 到 60 层放在服务器 C。数据像工厂流水线一样,跨越物理服务器进行前向传递和反向求导。
-
海量数据并发(Data Parallelism, DP / ZeRO 阶段):
为了加速训练,我们将庞大的数据集切分成上万份。上千台服务器(每台都是一个 Scale-out 节点)各自拿着一份数据进行计算,并在每个 Step 结束时,跨越全网进行 All-Reduce(梯度全局总和同步)。
二、 为什么大模型后期更依赖 Scale-out?
虽然 Scale-up(如 NVLink)的带宽大到恐怖,但它在物理上面临不可逾越的“空间墙”与“功耗墙”:
-
你无法在一个机柜里塞下无限颗芯片,因为供电、散热(液冷极限)和高密度的信号衰减会迅速让系统崩溃。
-
当模型参数量和数据量大到一定量级后,通过网络将数千台标准的 8 卡服务器横向铺开(Scale-out),是唯一能够无限堆叠算力总量的物理手段。
三、 Scale-out 的核心底层技术栈(如何打通网络墙)
横向扩展最害怕的就是“木桶效应”——某台服务器网卡掉包或者延迟高,上千台机器就要集体停工干等(即网络气泡)。为了解决跨机通信瓶颈,Scale-out 高度依赖以下底层架构:
-
RDMA(远程直接内存访问)无损网络:
-
InfiniBand (IB):标准的超高性能 Scale-out 专用网络,拥有极高的吞吐和几乎为零的软件栈延迟,但价格高昂。
-
RoCE v2(基于以太网的 RDMA):目前互联网巨头大规模外扩的主流选择。它通过端网协同,让服务器 A 的 GPU 能够直接越过 CPU 和操作系统内核,直接读写服务器 B 的 GPU 显存,将跨机延迟压到微秒级。
-
-
智算中心网络架构优化(如前文提到的 HPN 与 Solar-RDMA):
-
采用 Spine-Leaf(叶脊网络)拓扑,确保任意两台服务器之间都是“单跳直达”。
-
利用多路径逐包喷枪分发技术(Packet Spraying),把跨机的大流量拆散动态打向所有交换机,彻底杜绝横向扩展时的网络拥堵。
-
-
云原生高效调度(如 Volcano):
- 当你需要扩容 100 台机器(Scale-out)来分担训练任务时,由 Volcano 这样的批量调度器进行 Gang Scheduling(组团调度)。它确保这 100 台机器在云端同时弹出、同时就绪、并在最邻近的物理网络机架上打包分发,避免算力碎片化。
四、 综合对比:Scale-up vs. Scale-out
在大模型全栈 Infra 团队的日常架构中,两者的物理属性对比极其鲜明:
| 维度 | Scale-up(纵向扩展 / 向内聚) | Scale-out(横向扩展 / 向外扩) |
|---|---|---|
| 核心媒介 | 单机/单机柜内部的高速总线(NVLink / UALink) | 跨机器/跨机房的无损网络(InfiniBand / RoCE v2) |
| 物理带宽 | 极高(TB/s 级别,如 H100 达 900 GB/s) | 较高(GB/s 级别,如标准 400Gbps/800Gbps 网卡) |
| 延迟级别 | 纳秒级(Nanoseconds) | 微秒级(Microseconds) |
| 扩展极限 | 存在强物理天花板(通常单机柜 8~72 卡) | 理论上几乎无上限(可横向扩展至十万卡集群) |
| 承载并行 | 张量并行(TP)、专家并行(EP) | 数据并行(DP)、流水线并行(PP) |
💡 架构师总结
现代智算中心永远是 “先 Scale-up,再 Scale-out”:
在单台 8 卡机器或者单个 NVL72 机柜内,用 Scale-up 把芯片死死焊在一起,攻克最吃带宽的局部矩阵爆算(TP);随后,用 Scale-out 将上万个这样的高性能机柜通过高速以太网/IB 网线横向交织成一张巨型算力网,吞噬海量的数据集(DP)。两者精密的规模化协同,才是 Llama 4、DeepSeek-V3 等超级大模型能够被物理训练出来的终极解。
