这份最完整的学习计划,将结合你目前身处算法组、拥有 GPU 实操环境的绝对优势,全面对标 JD 中“训练、推理、网络、平台、智能化”的全生命周期要求。
这份计划的设计思路是:从微观的单卡算力压榨,到宏观的多机多节点协同,最后走向以 AI 治理 AI 的自动化闭环。

这份最完整的学习计划,将结合你目前身处算法组、拥有 GPU 实操环境的绝对优势,全面对标 JD 中“训练、推理、网络、平台、智能化”的全生命周期要求。
这份计划的设计思路是:从微观的单卡算力压榨,到宏观的多机多节点协同,最后走向以 AI 治理 AI 的自动化闭环。

Bank 冲突(Bank Conflict) 是指在同一个线程束(Warp,包含 32 个并发线程)中,多个线程在同一时刻尝试访问片上超高速缓存(Shared Memory / SRAM)里同一个 Bank 的不同物理内存地址,从而导致原本并行的内存访问被强行退化为串行排队、引发严重性能骤降的硬件物理冲突。
这是编写高性能大模型底层算子(如使用 Triton 或 CUDA C++)时,Infra 工程师必须死磕并消灭的“性能杀手”之一。
为了让你在芯片和算子级彻底吃透它,我们直接切入它的硬件构造、冲突机理以及工程消灭手段进行拆解:
在大模型高并发推理(Inference,如 vLLM、TensorRT-LLM)以及极速微调场景中,CUDA Graphs 是一项由 NVIDIA 官方提供、用来彻底干掉 CPU 开销、将显卡延迟(Latency)压榨到物理极限的重型底层黑科技。
一句话道破本质:传统的运行模式是“CPU 像个碎嘴子,下一条指令显卡打一枪”;而 CUDA Graphs 则是“CPU 提前把全套战术录制成一张铁板图直接丢给 GPU,GPU 自己在内部循环狂飙,彻底不需要 CPU 介入”。
在编译器和 MLIR(多级中间表示) 的世界里,Dialect(方言) 是指一组自包含的、针对特定抽象层级或特定硬件定义的概念集合(包含自定义的操作 Operator、数据类型 Type 和属性 Attribute)。
它是 MLIR 最核心的物理魔术。MLIR 并不像传统 LLVM 那样强求“全天下统一用同一种低级汇编语法(LLVM IR)”,而是提供了一个大框架,允许任何人创建自己的“方言”来表达特定层级的语义。
为了让你彻底搞懂它的工程本质,我们从它的工作机理、命名空间以及为什么要用它来进行深度拆解:
在大模型和 PyTorch 编译器的底层设计中,FX Graph(FX 计算图) 是 torch.compile() 赖以生存的核心中间表示(IR - Intermediate Representation)。
通俗来说,FX Graph 就是一张由 PyTorch 自动为你绘制的“模型物理结构解剖图”。它用纯粹的数学节点和符号,精确地记录了你的数据(Tensor)从进入模型开始,一路上经历了哪些算子(如线性层、激活函数、加法),最后又是如何输出的。
LLVM 是现代编译器技术的核心工业级底座,最初是“Low Level Virtual Machine”(低级虚拟机)的缩写,但现在它早已超越了字面含义,直接作为该开源编译器基础设施项目的官方品牌名。
在传统的软件工程和大模型 AI Infra(大模型基础设施)领域,它被广泛用作将高级编程语言翻译成底层硬件机器码的通用桥梁。
在 LLVM 诞生之前,传统的编译器(如早期的 GCC)大多是“烟囱式”的强耦合架构。如果世界上有 $M$ 种编程语言(C++、Rust、Swift 等),市场上存在 $N$ 种芯片架构(Intel x86、手机 ARM、NVIDIA GPU 等),开发者就需要为每一种组合独立开发一套完整的编译器。这导致研发工作量呈 $M \times N$ 的灾难性暴涨,且不同语言之间无法复用相同的数学优化算法。
MLIR(Multi-Level Intermediate Representation,多级中间表示) 是由谷歌主导并入驻 LLVM 社区的新一代编译器基础设施和架构框架。
如果把传统的 LLVM 比作一条“标准现代铁路线”,那么 MLIR 就是一套允许开发者自由组装、任意嵌套不同轨距和车厢的“模块化多级立体轨道交通系统”。它是现代 AI 编译器大一统(如 PyTorch 2.0+ 编译生态、Triton 等)的核心工程底座。
为了让你在架构层面彻底吃透它,我们直接切入它的诞生背景、核心魔术、以及在大模型底层的物理流向:
大语言模型(LLM)与智能体(Agent)的训练与推理正以前所未有的速度向前推进。在云原生算力底座中,Volcano 作为 CNCF 首个也是唯一一个容器批量调度项目,已经成为分布式 AI 训练(如大规模大模型预训练、RLHF 强化学习对齐)的黄金底座。
将为你彻底解刨 Volcano 的底层物理实现,并给出如何让你的 Agent 与 Volcano 深度绑定、实现“智商与算力完美咬合”的工业级落地架构。
原生 Kubernetes 的 kube-scheduler 是典型的“单体流控”设计:它像一条狭窄的安检通道,不管后面有多少人,它每次只拉出一个 Pod 独立评估,找个坑位塞进去。这在 AI 分布式训练中会导致灾难性的死锁(比如一个 8 卡并行的训练任务,原生调度器塞进去了 7 个 Pod,第 8 个由于没显存挂起了,导致前面的 7 个 Pod 永远在空等,白白霸占显存)。
Weights & Biases(简称 W&B 或 WandB) 是一个专门针对机器学习与深度学习开发者的模型训练可视化与实验跟踪工具。
你可以把它理解为机器学习领域的“代码版本控制+运行日志仪表盘”。在训练模型(如神经网络)时,我们通常需要监控大量的参数和指标,WandB 就是为了解决这些痛点而设计的。
它的核心功能主要包括以下几个方面: