Cluster_monitor
我们直接采用顶尖智算中心的“四层立体监控蓝图 (4-Layer Monitoring Blueprint)”。这也是你接下来构建 AIOps 平台的绝对主线。你可以把这看作是你接下来几周的“打怪升级”路线图:
第一层:裸金属与 GPU 硬件层 (底盘)
这是整个 AI 算力的发动机。上一节我们聊的 SM 就在这一层。
-
监控目标: 机器别烧了、算力别闲着。
-
核心组件:
-
node_exporter:抓取宿主机的 CPU、内存、普通网卡流量。 -
dcgm-exporter(英伟达提供):抓取我们刚才聊的 SM 活跃度、显存带宽、NVLink 流量、核心温度和降频警告。 -
IPMI / Redfish:带外管理,监控主板电压、风扇转速。
第二层:高性能网络与存储层 (大动脉)
在分布式大模型训练中,GPU 往往不是瓶颈,网络和存储才是。
-
监控目标: 绝不让 GPU 停下来等数据。
-
核心组件:
-
RDMA/RoCE 网络监控: 重点抓取网卡的
PFC 暂停帧 (Pause Frames)和丢包率。一旦出现 PFC 风暴,整个集群的算力会瞬间瘫痪。 -
存储 I/O 监控: 结合我们最初聊的 NVMe 硬盘,监控
IOPS、吞吐量 (Throughput)和最致命的I/O 读写延迟 (Latency)。
第三层:K8s 容器编排层 (调度中心)
K8s 把底层硬件切碎了分给不同的业务,你需要知道是谁在占用资源。
-
监控目标: 抓出“占着茅坑不拉屎”的僵尸任务,确保调度公平。
-
核心组件:
-
kube-state-metrics:监控 K8s 本身的状态,比如有多少个 Pod 一直处于 Pending(排队)状态没分到 GPU。 -
cAdvisor:精确监控每一个运行中容器的 CPU 和内存消耗,防止发生 OOM (Out of Memory) 导致训练崩溃。
第四层:AI 框架与业务应用层 (大脑)
底层的硬件跑得再欢,如果算法工程师写的代码很烂,也是白搭。
-
监控目标: 衡量真实的“业务产出”。
-
核心组件 (通过代码埋点埋入 Prometheus):
-
大模型推理阶段: 监控
首字延迟 (TTFT)和每秒生成词数 (Tokens/s)。 -
强化学习 (RL) 阶段: 监控 Actor 的
采样吞吐量 (Samples/s)和 Learner 的梯度同步延迟。 -
终极指标 MFU (模型算力利用率): 这是大厂老板最看重的指标,衡量这台几百万的服务器,到底有多少算力真正用在了模型参数的更新上。
你的实战技术栈组合拳
为了把这四层数据串联起来,你只需要在集群里拉起这套“黄金三角”基础设施:
- Prometheus (普罗米修斯): 负责去上面提到的各个 Exporter 那里定时“拉取”数据,存入它的时序数据库。
- Grafana: 负责把 Prometheus 里的枯燥数据变成极其酷炫的可视化大屏。
- Loki / ELK: 负责收集 K8s 里的文本报错日志(供你的 AIOps 大模型进行文本分析)。
这份四层蓝图里,你目前最想先从哪一层开始动手实操搭建?
