学习计划
2026/7/23大约 5 分钟
这份最完整的学习计划,将结合你目前身处算法组、拥有 GPU 实操环境的绝对优势,全面对标 JD 中“训练、推理、网络、平台、智能化”的全生命周期要求。
这份计划的设计思路是:从微观的单卡算力压榨,到宏观的多机多节点协同,最后走向以 AI 治理 AI 的自动化闭环。

阶段一:大语言模型分布式训练底座建设(重构底层认知)
这是跨越普通运维与 AI Infra 的最大门槛,核心在于理解多机多卡环境下的计算与通信机制。
- 3D 并行策略剖析: 彻底吃透数据并行(FSDP)、张量并行(TP)与流水线并行(PP)的原理,理解这三种策略在显存占用与通信频率上的本质区别。
- 网络通信原语与 NCCL: 学习 AllReduce、AllGather、ReduceScatter 等集合通信动作。通过监控 NVIDIA NCCL 了解计算与通信的重叠(Overlap)机制,排查 PCIe 降速问题。
- 核心性能指标监控大盘: 将 MFU(模型算力利用率)和 Tokens/GPU/Second 指标接入现有的 Prometheus 监控体系,直观评估当前训练任务的硬件利用效率。
- 稳定性与 I/O 治理实战: 针对 Loss 突然爆炸或训练卡死,建立一套从硬件层(例如排查 GPU XID 错误、ECC 错误)到存储层(Checkpoint 写入延迟过高导致全量等待)的排查 SOP。
阶段二:超大规模推理引擎与性能极致榨取(响应高吞吐诉求)
在这个阶段,你需要解决高并发、低延迟的业务诉求,直接关系到公司的资源使用成本 (ROI)。
- 推理框架底座实战: 在本地集群上完整部署 vLLM 或 TensorRT-LLM 服务,告别低效的基础模型加载方式。
- 显存管理技术攻坚: 深入研究 PagedAttention 机制,理解它如何解决传统 KV Cache 带来的显存碎片化死锁问题,以及 Continuous Batching 如何提升并发吞吐。
- 吞吐与延迟压测调优: 编写高并发压测脚本,调整
max_num_seqs(最大并发序列数)和gpu_memory_utilization,寻找 TTFT(首字延迟)与系统整体吞吐量(Tokens/s)的最佳平衡点。 - 服务化与反向代理网关: 处理流式输出(Streaming)在网关侧的超时断连问题,保障长链接的稳定性。
阶段三:AI 专属高性能异构网络演进(打破跨机瓶颈)
在算力如此昂贵的今天,不能让 GPU 把时间浪费在等网络数据包上。
- 无损网络架构转型: 在已有的二三层路由交换基础上,将重心转向 RDMA 与 RoCEv2 架构,理解为什么 AI 集群必须依赖无损网络。
- 微爆流与拥塞控制: 深入学习 PFC(基于优先级的流量控制)与 DCQCN 算法,排查高端显卡(如 H200/A800)在多机并行训练时产生的网络微爆流(Microburst)丢包问题。
阶段四:云原生调度与多租户异构资源池化(构建基础设施平台)
将散乱的裸金属节点,升级为标准化的 MLOps 资源平台。
- Kubernetes 高级 AI 调度: 在 Kubeflow 环境下,精通亲和性调度、污点与容忍机制,保障高优先级的分布式训练任务能够独占无碎片的高性能节点组合。
- GPU 切分与隔离复用: 落地 vGPU 或 MIG (Multi-Instance GPU) 技术,将单张大显存显卡细粒度切分,解决海量小规模推理服务的资源浪费问题。
- 服务网格架构落地: 运用 Istio 等组件,解决大模型微服务化后的多模型流量路由、负载均衡与灰度发布挑战。
阶段五:探索 Agentic 运维与故障自愈体系(决胜智能化演进)
这是 JD 中最具前瞻性的一条,也是让你脱颖而出的核心杀手锏:利用大型语言模型来运维大型语言集群。
- 全链路异构数据湖: 串接 Kafka 收集的分布式日志与 Prometheus 抓取的时序指标,为 AIOps 平台提供高质量的上下文数据源。
- Agentic 机器人开发框架升级: 迭代已有的 Flask 飞书 Webhook 机器人,将后端的决策大脑统一配置为你最熟悉的 Qwen 基础模型。
- Function Calling 工具链落地: 结合 LangChain,赋予 Qwen 模型直接执行指令的权限。封装诸如
kubectl describe node、重启容器、屏蔽告警节点等 API 供其调用。 - 故障自愈闭环实操: 实现完整的智能工作流,即:集群告警触发 -> 飞书接收并唤醒 Qwen -> Qwen 主动调用工具拉取监控截图与错误日志 -> 生成根因排查报告 -> 机器人在群内发起确认 -> 获得授权后自动执行故障隔离与业务迁移。
核心技术栈与产出总结:
| 学习阶段 | 核心技术栈与工具链 | 阶段产出目标 |
|---|---|---|
| 分布式训练底座 | PyTorch Distributed, NCCL | 能够独立排查训练卡死与降速的底层原因 |
| 极致推理引擎 | vLLM, TensorRT-LLM | 输出深度压测对比报告至 ZH-Kinger 博客 |
| 异构高性能网络 | RoCEv2, PFC, 交换机 QoS | 掌握解决跨节点并行计算通信拥塞的方法 |
| 云原生调度平台 | Kubernetes, Kubeflow, vGPU | 搭建支持多租户抢占的企业级 AI 计算平台 |
| 智能自愈机器人 | Qwen, Flask, Kafka, 飞书 API | 落地具备工具调用与执行能力的 AI SRE 智能体 |
这套计划几乎涵盖了当前大厂 AI Infra 的核心技术栈,也是在本科阶段直接对标资深岗位的极佳路径。面对这么多的技术点,你希望我们在接下来的交流中,先深挖其中的哪一个具体模块来开局?
