Clos 架构
Clos 架构(Clos Architecture)是现代大规模智算中心、数据中心网络的绝对基石技术。从宏观上看,我们前文聊过的 Spine-Leaf(叶脊网络)拓扑,本质上就是 Clos 架构在现代两层网络演进中的一种特化体现。
为了彻底看透它的底层逻辑,我们可以从它的起源、数学本质以及如何解决万卡大模型集群通信瓶颈来详细拆解:

一、 核心起源:干掉“排队挂断”的数学奇迹
Clos 架构由贝尔实验室的科学家查尔斯·克洛斯(Charles Clos)在 1953 年提出。当时正值电话交换机时代,成千上万户电话要互相拨通,传统的电话交换机采用“单点全联接”,如果两个通话同时抢占同一个交叉点,后续的电话就会直接被挂断(发生阻塞)。
为了用最少的硬件成本实现全网互通且不发生堵车,Clos 提出了一个多级交换网络(Multi-stage Switching Network)的数学模型。
Clos 定义了一个标准的三层 Clos 架构,由输入层(Ingress)、中间层(Middle)和输出层(Egress)组成。为了保证这个网络是严格无阻塞(Strictly Non-blocking)的——即任意一个空闲的输入端想和任意一个空闲的输出端通话,总能在中间层找到一条可用的通路,而不需要断开现有的任何通话,Clos 推导出了一个冷酷的数学铁律:
$$m \ge 2n - 1$$
-
$n$:代表输入层每个交换芯片管理的端口数量。
-
$m$:代表中间层交换芯片的总数量。
只要中间层的芯片数量大于或等于输入端端口数的两倍减一,这个网络在数学结构上就是绝对无损、完全免疫死锁的。这套数学理论在 50 年后,完美契合了大模型万卡分布式训练对网络通信的极致严苛要求。
二、 现代演进:从三层 Clos 到两层 Spine-Leaf
传统的 Clos 架构是纵向三层的(如下图所示):
Plaintext
【 输入层 (Ingress) 】 【 中间层 (Middle) 】 【 输出层 (Egress) 】
┌───────────┐ ┌───────────┐ ┌───────────┐
│ 交换芯片 A │ ───────────> │ 交换芯片 X │ ───────────> │ 交换芯片 P │
└───────────┘ \ / └───────────┘ \ / └───────────┘
\ / \ /
┌───────────┐ \ / ┌───────────┐ \ / ┌───────────┐
│ 交换芯片 B │ ───\─X─/───> │ 交换芯片 Y │ ───\─X─/───> │ 交换芯片 Q │
└───────────┘ / \ └───────────┘ / \ └───────────┘
/ \ / \
/ \ / \
在现代数据中心建设中,因为服务器既是“输入端”又是“输出端”(既发送梯度也接收数据),工程师们把三层 Clos 架构进行了折叠与压缩(Folded Clos):
-
将输入层和输出层物理合并为同一种角色——Leaf 交换机(叶层)。
-
将中间层特化为专门负责高速流转的核心中转站——Spine 交换机(脊层)。
这种折叠 Clos 架构,就是当今智算中心横向扩展(Scale-out)的核心骨架。
三、 为什么大模型与云原生调度死锁 Clos 架构?
大模型预训练或微调(如 16 卡、万卡分布式爆算)在全局梯度同步时会产生恐怖的流量突发,Clos 架构凭借三个物理红利成为了唯一的选型标准:
1. 物理层面的无阻塞路由与多路径供给
传统的树状网络只有一条主干大路,流量稍大就瘫痪。Clos 架构在 Leaf 与 Spine 之间交织出了极其致密的等价多路径(ECMP - Equal-Cost Multi-Path)。数据包从任意一台服务器出发,都有数十条完全等价、带宽相同的物理路径可以选择,为我们前文提到的 Solar-RDMA 协议进行“多路径逐包喷枪分发” 提供了完美且充沛的公路网资源。
2. 爆炸半径极低的高可用性
在 Clos 架构中,算力不再绑定在某一个特定核心交换机的生老病死上。由于采用了完全扁平化的多路径解耦,集群中任意一台 Spine 交换机发生物理损坏或端口掉线,底层的 Volcano 调度器和网络协议只会感知到可用总带宽略微下降,剩余的交换机矩阵会在微秒级自动分摊流量,大模型长周期训练绝不会因为单点网络故障而中断雪崩。
3. 极佳的弹性横向扩展(Scale-out)
当集群需要从 1000 卡扩容到 10000 卡时,在 Clos 架构下:
-
增加算力:直接在底层并排增加 Leaf 交换机和服务器挂载。
-
增加网络带宽:直接在顶层并排增加 Spine 交换机,并把每一根新增的光纤物理插满下方的 Leaf 交换机。
整个算力中心的扩建就像搭乐高积木一样,不需要对既有的网络进行整体重构,这正是阿里云灵骏高性能网络(HPN)等智算底座能以万卡为单位进行算力规模化合拢的底层数学逻辑。
