NIR(Near-Infrared,近红外)
2026/7/23大约 3 分钟
在我们之前探讨的机器人视觉、深度相机(如你提到的奥比中光)以及多模态数据管线的语境下,NIR(Near-Infrared,近红外) 并不是指像 int、float 或 string 那样的软件编程数据类型,而是指一种极其重要的物理传感器模态(Sensor Modality)。
在底层的张量(Tensor)和文件系统中,NIR 数据通常是以单通道灰度图像矩阵(通常为 uint8 8位或 uint16 16位无符号整型)的形式存在的,形状通常为 [H, W, 1]。
为了让你从架构师和 SRE 的视角瞬间看透 NIR 在具身智能数据管线中的核心战略价值,我为你搭建了这个“多模态视觉传感器抗干扰测试台”。你可以试着关掉房间的灯光,看看为什么 AI 大厂在采集数据时,一定要把 NIR 留存下来:
💡 架构师深度解剖:NIR 数据的底层逻辑
在你的数据集中,如果有一路叫 nir_head.csv 或对应的 .mp4 文件,你必须明白它和 RGB、Depth 之间的物理因果关系:
1. NIR 是 Depth 的“母亲”
很多刚接触具身智能的人以为深度相机是直接“拍”出深度图的。其实不然(特别是结构光和双目主动立体相机):
- 相机前面有一个红外发射器(IR Projector),它像手电筒一样,把成千上万个肉眼看不见的 NIR 散斑(光点)打在挂锁和桌子上。
- 相机里的 NIR 传感器(近红外摄像头) 拍下了这些散斑的图像(这就是 NIR 数据)。
- 相机内部的 ASIC 硬件芯片,通过比对这些散斑的变形程度,利用三角测距算法,瞬间计算出了深度图(Depth)。
- 结论:没有 NIR 原始画面,就没有深度图。
2. 为什么要把 NIR 喂给大模型?(抗干扰与材质感知)
在真实世界(ITW)操作中,RGB 极其脆弱:
- 光照鲁棒性: 就像模拟器里演示的,遇到强烈的逆光、阴影、或者突然断电关灯,RGB 画面会瞬间崩溃。但 NIR 依靠的是相机自己的主动打光,它能提供极度稳定的、不受环境光干扰的物体轮廓和纹理。
- 物理材质探测器: 这是 SRE 和数据工程师经常踩的坑。某些材质(比如极其黑的吸光塑料、透明玻璃、或者极度反光的金属挂锁)会吸收或漫反射近红外光。
- 表现为:在这个物体的区域,NIR 拍出来是一团死黑,导致深度图在这里破了个“黑洞”。
- 如果你的大模型(VLA)同时吃进了 RGB 和 NIR 数据,它就能学到一种高级物理常识:“虽然 RGB 看着像个杯子,但 NIR 这里是黑洞,说明这是个高反光的金属材质或者透明玻璃,抓取的时候必须小心滑动”。
数据管线落地建议
在用 LeRobot 打包数据时,如果你有 NIR 这一路数据:
- 不要丢弃它: 把它当做一种独立的视觉模态(像 RGB 一样压成高码率的视频,或者存成单通道的张量)。
- 它的尺寸: 通常形状是
[Batch, 1, H, W],数据类型转换为float32并在输入神经网络前做归一化。 - 融合策略: 可以在神经网络的早期,将 NIR 和 RGB 在通道(Channel)维度拼接起来(变成 4 通道图像),让 Transformer 自己去学习如何在光线不好的时候,自动把注意力(Attention)转移到稳如老狗的 NIR 数据上。
