模型精度
2026/7/23大约 3 分钟
既然咱们刚才已经钻进硅片底层,看过了比特位是怎么分配的,现在咱们就把视角拉回到AI Infra 的宏观工业流水线上。
在真实的生产环境中,大模型的一生(从在超级计算机里被训练出来,到最后塞进你的手机里)会经历不同的阶段。“模型精度”不仅决定了显存不炸,更决定了你到底是在搞“研发训练”,还是在搞“商业部署”。
一句话概括不同精度的核心使命:精度越高的,用来做研发(训练模型);精度越低的,用来做服务(推理部署)。
为了让你直观感受到不同精度在机房里的真实体感,我为你做了一个“大模型显存与精度用途推演器”。
假设我们现在有一个 7B(70亿参数) 的模型,你可以通过切换不同的精度,亲眼看看它对显存的吞吐压榨,以及它在工业界到底被拿去干什么了:





工业界的全链路精度图谱(SRE 视角)
从大模型诞生到落地的生命周期来看,工业界对精度的降级使用是一条极其严密的单行道:
阶段一:炼丹炉里的轰鸣 —— 训练侧 (Training)
这是你在 8 卡服务器上死磕的领域。模型需要疯狂地计算梯度、更新权重,数字的细微变化决定了模型能不能学到知识。
- 主力武器:
BF16(16位大脑浮点) - 前沿黑科技:
FP8(8位浮点) - SRE 揭秘: 最新的英伟达 H100 显卡主推的就是 FP8 训练。它极其硬核,因为 8 个比特实在太小了,容易溢出,所以底层会在计算前动态缩放数值,算完再缩放回去。这极其考验 SRE 的底层排障能力,但换来的是算力翻倍。
阶段二:服务器上的接客 —— 云端推理 (Cloud Inference)
模型训练完了,变成了一个固定参数的“成品”。此时它不需要再算梯度了(不需要向后倒车),它只需要进行前向传播来生成文本。
- 主力武器:
BF16或INT8(8位整数量化) - SRE 揭秘: 为了让一台机器同时接待更多的用户(提高并发 QPS),我们会把模型的 BF16 权重“强行四舍五入”成 INT8 整数。这叫 PTQ(训练后量化)。虽然模型稍微变笨了大概 0.5%,但显存省了一半,单台机器的盈利能力直接翻倍。
阶段三:飞入寻常百姓家 —— 端侧部署 (Edge/Local)
要把一个 70B 的大模型塞进只有 16GB 内存的 Mac 笔记本或者手机里。
- 主力武器:
INT4(4位整数量化) - SRE 揭秘: 采用极其暴力的压缩算法(如 GPTQ、AWQ),把原本需要 2 个字节的数字,硬生生砸进半个字节里。在这个精度下,模型不再需要庞大的机房,你可以直接在本地不联网地运行专属 AI Agent。
总结一条 SRE 黄金铁律:
只要你的目的是“微调/训练(让模型学知识)”,底线就是 BF16;只要你的目的是“部署/聊天(让模型干活)”,你就疯狂往 INT8 甚至 INT4 去压缩榨干硬件!
