训练中的一些参数
2026/7/23大约 4 分钟
在大模型和深度学习训练的控制面板上,这五个词是出现频率最高的核心物理量指标。它们共同组成了监控模型是否在“好好学习”的仪表盘。
为了让你闭眼都能理清它们的关系,我们可以把大模型训练直接比作“一位高考生(模型)刷一本厚达 10 万道题的巨型复习题集(数据集)”:
1. Epoch (轮次 / 彻底刷完一遍题集)
- 物理含义:模型把训练集里所有的样本全部完整地看了一遍(前向传播 + 反向传播更新),这就叫完成了一个 Epoch。
- 高考比喻:高考生把这本 10 万道题的巨型复习题集,从第一页完整地刷到了最后一页。如果训练配置
epochs = 3,意味着这个学生要把这本题集来来回回死磕刷 3 遍。
2. Step (步数 / 迭代轮次 / 挪动一次参数)
- 物理含义:训练过程中参数物理更新(优化器迈出一步)的最基本工程单元。每吃完一个 Batch Size(批次)的数据,并完成一次梯度更新,Step 计数器就 $+1$。
- 高考比喻:学生不可能一口气吞掉整本书,他必须一页一页地刷。假设他每天看 100 道题(Batch Size = 100),看完这 100 道题并对答案纠错一次,这就叫完成了一个 Step。刷完这本 10 万道题的 Epoch,他一共需要走 $100,000 / 100 = 1000$ 个 Steps。
3. Action (动作 / 大模型作出的预测输出)
- 物理含义:在上文我们讨论的 Agent / 强化学习(RLHF / PPO) 语境下,Action 是大模型基于当前环境输入,自主作出的决策或吐出的文本/参数 Token。
- 高考比喻:这就是学生针对当前这道题目,在答题纸上写下的具体答案。这个答案(Action)对不对,后续会被交给物理外设去执行(或者交给判卷老师打分),产生环境反馈。
4. Loss (损失值 / 错误率的物理量化)
- 物理含义:一个数学标量,用来绝对量化模型当前的预测输出(Action)与真实正确答案(Label)之间的“惨烈差距”。Loss 越接近 0,说明模型越聪明、学得越准。
- 高考比喻:就是对答案时扣掉的分数。如果学生把题做错了,判卷老师会给出很高的扣分(High Loss);随着小伙子越刷越熟练,做错的题越来越少,每次对答案被扣的分数(Loss 曲线)就会一路稳健下滑。
5. Lr (Learning Rate - 学习率 / 修正错误的步长)
- 物理含义:控制模型在根据错误(Loss)调整自身参数时,迈出的步子到底有多大。它是一个通常介于 $10^{-3}$ 到 $10^{-6}$ 之间的微小系数。
- 高考比喻:就是这个学生根据错题“修正自己固有观念的激进程度”:
- Lr 太大(步子扯太大):看了一眼错题解析,当场把自己的整个知识体系全部推翻重来。结果导致思想极度不稳定,考试直接跑飞崩溃(在代码里表现为 Loss 变成
NaN)。 - Lr 太小(唯唯诺诺):看到了错题,却只打算把概念极其微弱地改个标点符号。这会导致他学得巨慢无比(系统收敛极慢),显卡烧了半个月,他还没开窍。
⚙️ 仪表盘联动总结:
我们在监控大模型训练时,脑子里跑的物理画面是这样的:
在这个 Epoch(刷第几遍书) 里,显卡以每秒几十个 Step(每秒对几次答案) 的速度狂飙。大模型每走一步,就吐出一个 Action(作出一场预测),系统立刻计算出 Loss(被扣了多少分)。随后,优化器高频参考 Lr(设定的修正步长),顺着梯度的反方向物理挪动模型的参数,直到 Loss 曲线被压成一条贴近地面的平线——大模型,宣告神功大成。
