模态(Modality)
太棒了!你刚才看到的那份数据清单,其实就是一个顶级的具身智能(Embodied AI)机器人感知系统的完整切面。
在 AI 的语境里,“模态(Modality)” 其实就是指“感知物理世界的不同感官通道”。就像人类有视觉、听觉、触觉和前庭平衡觉一样,我们要让机器人去物理世界干活(比如开挂锁、炒菜),就必须给它装上各种传感器。
站在 AI 架构师和算法工程师的视角,我为你把这 7 个采样模态扒开,看看它们在底层到底在干什么:
1. RGB(彩色视觉图像)—— 机器人的“视网膜”
- 是什么: 就是最普通的彩色视频/照片(红绿蓝三通道)。通常采集频率是 30fps 或 60fps。
- 核心作用: 提取语义和纹理信息。有了 RGB,AI 才能认出“这是一个铜色的挂锁”,或者“桌子上有一滩水”(点云很难识别水渍)。它是视觉大模型(如 CLIP 模块)最基础的输入。
2. Depth(深度图 / 点云)—— 机器人的“立体空间感”
- 是什么: 记录画面中每一个像素点距离相机镜头的绝对物理距离(比如 32.5 毫米)。通常由红外结构光或 dToF 传感器生成。
- 核心作用: 纯 RGB 只是平面的画,机器人如果只看 RGB,会把一张印着挂锁的 A4 纸当成真锁去插。有了 Depth,RGB 画面就膨胀成了 3D 点云,机器人才能精确计算机械臂需要往前伸多少厘米。
3. IMU(惯性测量单元)—— 机器人的“内耳前庭”
- 是什么: 包含加速度计和陀螺仪的微小芯片。采集频率极高,通常在 200Hz 到 1000Hz 之间。
- 核心作用: 填补视觉的盲区。相机一秒钟只拍 30 张照片,中间有 33 毫秒的空白。如果在这 33 毫秒内发生了剧烈碰撞或微小颤抖,相机是看不见的,但高频的 IMU 瞬间就能记录下这些 3D 空间里的加速度和角速度突变。
4. Audio(音频)—— 接触式操作的“状态机”
- 是什么: 麦克风录制的环境声音。
- 核心作用: 在很多极其精密的物理操作中(比如插钥匙、拉拉链、扣按扣),视觉是会被手挡住的。此时,声音是确认任务成功的唯一标准。听到“咔哒”一声,AI 就会在底层状态机中确认“插入到位”,然后切换到“开始旋转”的动作。
5. 头部 6DoF(六自由度位姿)—— 空间锚点与第一人称
- 是什么: 6DoF = 3 个空间位置(X, Y, Z)+ 3 个旋转姿态(Roll 翻滚, Pitch 俯仰, Yaw 偏航)。
- 核心作用: 它是整个数据集的“原点”。人类戴着采集头盔晃动时,这套数据能反向推算出人类头部在房间里的绝对轨迹,确保视觉画面和手部动作有一个稳定的三维参考系,不至于天旋地转。
6. 手部 3D Keypoints(三维骨骼关键点)—— 灵巧操作的密码
- 是什么: 通过算法或数据手套,将人手的 21 个关节(每个指关节)的空间 3D 坐标精确提取出来。
- 核心作用: 这是用来做 动作重定向 (Retargeting) 的。人手有 5 根手指,但机械狗或机械臂往往只有两根手指的夹爪。你必须把人类关节的微小张合角度,通过数学映射,翻译成夹爪电机的开合度。
7. 相机/IMU 标定(Calibration)—— 融合万物的“时间与空间胶水”
-
是什么: 一堆极其复杂的数学矩阵文件(如内参、外参、时间偏移量)。
-
核心作用:****这是 SRE 和数据工程师的命根子。 * 内参 (Intrinsics): 消除镜头的鱼眼畸变,把弯曲的现实拉平。
-
外参 (Extrinsics): RGB 镜头和 Depth 镜头在物理电路板上可能隔了 2 厘米。外参矩阵能把这 2 厘米的视差在数学上完美抹平,让彩色像素和深度点云严丝合缝地贴在一起。
-
时间同步: 确保 IMU 的震动和画面的刷新在微秒级别绝对对齐。
如果把这 7 个模态单独拿出来,大模型是无法理解物理世界的。具身智能最难的地方叫做 “多模态传感器融合 (Sensor Fusion)”。
为了让你直观感受到,为什么缺少任何一个模态,机器人都无法完成“开锁”这个动作,我为你做了一个“多模态传感器融合解剖仪”。你可以试着开启或关闭这些模态,看看机器人眼中的世界会发生什么崩坏:
-1.png)
总结:大模型是怎么吃掉这些数据的?
当你手里有了这 7 个模态完美对齐的数据,你就可以训练 VLA 模型了。
它会在底层把 RGB 和 Depth 压扁成视觉特征向量,把 Audio 和 IMU 变成一维序列信号,然后和你的自然语言文本融合在一起。最终,网络另一头的输出端,直接吐出那一刻手部应该处于的 3D Keypoints 坐标,指挥电机转动。
这就是数据驱动的具身智能(Data-driven Embodied AI)的绝对基石!
