Temperature
2026/7/23大约 4 分钟
在大模型(LLM)推理与文本生成中,Temperature(温度) 是控制模型输出“创造力”与“确定性”最核心的概率分布平滑系数。
它的物理任务是在模型即将吐出下一个 Token 之前,直接插手改变全量词表中所有候选词的概率差距。
一、 它的底层数学与物理本质
在神经网络的最后一层(分类层),模型输出的是每个词的原始得分,被称为 Logits。通常,我们需要通过 Softmax 函数将这些 Logits 转化为相加等于 100% 的概率分布。
Temperature ($T$) 就是插入到 Softmax 公式分母里的一个调节因子:
$$
\text{P}(w_i) = \frac{e^{\frac{L_i}{T}}}{\sum_{j} e^{\frac{L_j}{T}}}
$$
(其中 $L_i$ 是第 $i$ 个词的原始得分 Logits,$T$ 就是温度)
通过调节这个分母 $T$,会产生极为硬核的物理数学物理形变:
1. 当温度调低时($T \to 0$,强者更强,弱者归零)
- 数学变化:当 $T$ 小于 1 时,原本 Logits 分数最高的那个词,经过指数运算后会膨胀得极其巨大,从而拉大与其他词的绝对差距。
- 物理结果:概率分布变得极其“尖锐(Sharp)”。原本第一名概率是 50%,第二名是 30%;当温度降到 0.1 时,第一名的概率会被放大到 99.9%,其余词的概率无限趋近于 0。
- 极致情况($T = 0$):等同于贪婪搜索(Greedy Search)。完全抹杀随机性,大模型退化为确定性的复读机,同样的 Prompt 无论你测多少次,吐出的答案一字不差。
2. 当温度调高时($T > 1$,劫富济贫,众生平等)
- 数学变化:当 $T$ 远大于 1 时,分数会被严重稀释(分母变大),导致每个词算出来的指数值变得非常接近,原本的得分差距被强行抹平。
- 物理结果:概率分布变得极其“平坦(Flat/Uniform)”。原本领先的词失去了绝对优势,原本排名靠后、极其罕见的冷门词(长尾词)的概率被显著抬高。
- 极致情况($T \to \infty$):模型将彻底失去逻辑,变成一个纯粹的“随机乱码生成器”,开始胡言乱语、答非所问。
二、 工业界调优指南
在手写 Agent 或者是配置大模型(MaaS API / vLLM 引擎)时,根据具体任务的属性,温度的调节策略遵循明确的物理对齐准则:
1. 业务场景对齐矩阵
| 温度设置区间 | 代表参数 | 适用业务场景 | 调优逻辑 |
|---|---|---|---|
| 冰点(绝对理性) | 0.0 |
代码编写、SQL生成、数学推导、数据清洗(ETL提取)、严格结构化 JSON 输出 | 这类任务不需要大模型发挥任何想象力,差一个字符就是编译错误。必须锁死最高概率,确保输出的绝对稳定和严谨。 |
| 低迷区(稳健克制) | **0.2 ~ 0.5** |
企业知识库问答(RAG)、公文摘要、事实性客服、合同条款条款检索 | 任务要求在“基于客观事实”的前提下,语气能够自然流畅。适当给一点点温度让话术不呆板,但绝不允许它瞎编乱造。 |
| 甜点位(标准日常) | **0.7 ~ 0.8** |
通用聊天(General Chat)、邮件撰写、方案大纲润色、翻译 | 绝大多数云厂商大模型 API 的默认推荐温度。在逻辑条理与语言丰富度之间取得了完美的物理平衡。 |
| 高热区(灵感狂飙) | **0.9 ~ 1.2** |
广告营销文案头脑风暴、科幻小说续写、游戏 NPC 角色扮演(Roleplay) | 此时需要打破陈词滥调(套话)。拔高温度可以让一些极具创意、意想不到的低频词跳进候选池,激发模型的“文采”与发散思维。 |
三、 采样铁三角的流式顺序
在实际的推理管道中,Temperature 必须在 top_k 和 top_p 之前首先执行。 它的调优会直接牵一发而动全身:
- Temperature 负责“改变地形”:先通过温度拉大或缩小词语之间的概率贫富差距。
top_k负责“划定边界”:在改变后的地形上,粗暴砍掉排名靠后的词。top_p负责“水位的自适应动态截断”:从上往下累加概率。
- 联动陷阱:如果你把温度调得极高(如
1.5),概率分布被彻底抹平,这时候top_p=0.9组成的候选池会瞬间扩容得极大,包含大量垃圾词;反之,若温度接近 0,top_p无论设置多少都会瞬间收拢,因为第一个词的概率就已经顶天了。
最佳调优建议:在微调或调试 Prompt 效果时,强烈建议每次只微调这三个参数中的一个(优先固定 top_k / top_p 调 Temperature),否则多个概率过滤器在底层同时掐架,会导致模型的输出质量变得极难预测。
