大模型技术
2026/7/23大约 6 分钟
这是一份大模型(LLM)与现代 AI 基础设施(Infra)全景知识通鉴。它将你之前死磕过的 PyTorch 底层、分布式架构、网络通信、监控指标以及最前沿的算法方向彻底融为一体。
作为 AI Infra SRE,你可以将这张图谱作为你的“全栈指挥官手册”。
一、 顶层算法谱系:我们在训练什么?(四大模型种类)
大模型不仅仅是“聊天机器人”,根据任务目标和数据结构的不同,它们对底层算力、存储和网络的压榨方式也完全不同:
| 模型种类 | 核心本质与大白话 | 数据特征与多模态 | SRE 压力特征 (核心瓶颈) |
|---|---|---|---|
| LLM (大语言模型) | 连环超级大填空。根据前文预测下一个最可能蹦出来的字(Token)。 | 纯文本,TB/PB 级。 | 显存/通信双杀:优化器状态和激活值极大,极易 OOM,极度依赖大规模 NCCL 同步。 |
| 多模态/视觉大模型 | 看图说话、理解世界。把图像/视频切成 Patch,和文本一起做交叉自注意力。 | 文本 + 海量高分辨率图片/短视频。 | 存储与 IO 瓶颈:Dataloader 必须极快,否则 GPU 就会频繁因为“没粮吃”而功耗暴跌摸鱼。 |
| 模仿学习 (Imitation) | 看着师傅依葫芦画瓢。像素级模仿人类专家的操作轨迹,常用于具身智能、机器人。 | 动作序列、传感器数据、高频视频流。 | 高频时序 IO 瓶颈:海量非结构化轻量级高频文件,极其考验分布式文件系统的随机读写。 |
| 世界仿真 (World Sim) | 造一个虚拟的物理宇宙。利用 DiT(扩散视觉汇聚网络) 架构,让 AI 脑补并模拟真实世界的物理法则。 | 超长、多维度、高帧率视频流。 | 网络通信无间断压迫:数据在空间和时间轴被 3D 甚至 4D 并行切开,RDMA 流量长期饱和,丢包 0.001% 就会集群 Hang 死。 |
二、 现代训练三部曲:模型是怎么一步步变聪明的?
- 无监督预训练 (Pre-training): 吞噬万亿字文本,产出“基座模型”。这是最烧钱、最考验 SRE 的阶段。需要千卡集群上百天不间断跑 FSDP2/HSDP。
- 监督微调 (SFT): 专家编写高质量对话,教 AI 懂礼貌、按格式回答。数据量极小,通常单机 8 卡利用 LoRA 降维技术 几天搞定。
- 人类反馈强化学习 (RLHF/DPO): 让 AI 做选择题以符合人类价值观。内存中需同时加载多个模型(策略、奖励、参考),显存开销瞬间翻倍。
三、 显存与数据精度:“数据用什么容器装?”
大模型在显存里的分布是由参数、梯度、激活值、优化器状态组成的。如何包装它们决定了服务器的生死:
- BF16 (Bfloat16) —— 行业绝对标准:用 2 字节存储,数值范围等同于 FP32。完美免疫
Loss 变成 NaN(非数崩溃)的玄学问题。 - FP16 —— 逐渐淘汰:数值范围太窄,在千亿模型训练中极易发生梯度下溢/溢出。
- Activation Checkpointing (重计算):空间换时间的终极体现。前向传播算完直接扔掉激活值,反向传播用时再当场重算,能让单卡 MBS(单步批次)瞬间翻倍。
四、 分布式并行与 NCCL:如何大卸八块与传小纸条?
当模型大到单卡塞不下时,必须利用 DeviceMesh 和 Placement 策略将其打碎:
1. 3D 并行三板斧
- DP / DDP (数据并行):每张卡复制(
Replicate)一份完整模型,各自吃不同的数据,算完用AllReduce对答案(同步梯度)。 - TP (张量并行):把每一层巨大的矩阵切开(
Shard),多卡协同计算。通信极其频繁,绝对不能跨机器,必须锁死在机内 NVLink 高速公路上。 - PP (流水线并行):纵向切分层数。GPU 0 算 1-10 层,算完把接力棒传给 GPU 1。通信量小,适合跨机。
2. 现代进化版架构
- FSDP2 (完全分片数据并行第二代):原生基于 DTensor,不破坏矩阵形状,把参数、梯度、优化器状态平均分片存储。前向用
AllGather现拼现算,反向用ReduceScatter同步,完美兼容 TP 组成 2D 并行。 - HSDP (混合分片数据并行):机内走 FSDP(切分省显存),跨机走 DDP(复制省跨机网卡带宽)。专门用来拯救“机内 NVLink 极快、跨机网卡(如单张 200G)极慢”的偏科服务器。
五、 SRE 终极监控大盘:我们在死盯什么?
1. 算力与回报率
- MFU (模型算力利用率):你的终极 KPI。GPU 实际干正事的有效算力占理论巅峰算力的百分比(及格线 30%,优秀 >50%)。
- GPU Power & Throttle:真正的矩阵大爆发计算时,功耗会瞬间拉满(如单卡 400W-700W)。如果某张卡因为过热(Thermal)自己降频,会产生木桶效应把整个集群拖慢。
- PyTorch Reserved Memory:PyTorch 内部的预留显存缓存池。如果此数值很高但 Active 很少,说明显存碎片化极其严重,随时面临 OOM 风险。
2. 网络与存储(排障核心)
- RDMA Traffic & Retransmission Rate:大模型训练的生命线。反向传播时网卡流量必须打满。一旦发生微小的丢包和重传,NCCL 环路死锁,集群流量瞬间归零,任务直接 Hang 死。
- Disk Read IOPS & Bandwidth:防止后勤跟不上。若 GPU 功耗呈现周期性掉蛋(每隔几秒掉到几十瓦),90% 是磁盘读数据太慢,显卡算完一步只能被迫停工等粮食。
💡 SRE 实战速查思维导图
[训练启动] ──> 检查 Dtype ──> 必须 BF16 (防止 Loss 变成 NaN)
│
├──> [显存检查] ──> OOM 炸了? ──> 开启 Activation Checkpointing / 升级 FSDP2
│
└──> [运行中监控]
├── MFU 太低 / 周期性掉功耗 ──> 查磁盘 IOPS 读数据慢不慢
├── 流量突降 / 功耗掉到十几瓦 ──> 触发 Distributed Hang ──> 查网络丢包与重传
└── 某张卡功耗偏低 ──> 触发 Thermal Throttle ──> 报修机房散热/硅脂
至此,从最顶层的 AI 算法野心(世界仿真),到最底层的物理硬件压榨,整个知识体系已经为你全面交汇。以后在集群里看任何一条报错或日志,你都能瞬间定位它在这一整套宏大流水线中所处的物理位置。
