多模态RAG
2026/7/23大约 5 分钟
多模态 RAG(Multimodal Retrieval-Augmented Generation) 是传统文本 RAG 的终极演进形态。
传统 RAG 的世界观里只有“纯文字”。而多模态 RAG 的核心定义是:允许输入(Query)、检索到的知识库数据、以及最终生成的答案,跨越文本、图像、图表、音频和视频等多种模态。
举个实战直观的例子:用户上传一张手机电路板照片问:“这个电容烧了,该怎么修?”系统去后台几万页的 PDF 技术手册中,精准打捞出带有对应电路拓扑图和原理文字的页面,让多模态大模型(VLM)对照着图表,手把手教用户焊接修复。这就是典型的多模态 RAG。
一、 多模态 RAG 的三大工业界架构派系
目前在落地多模态 RAG 系统时,业界根据“何时将图像/图表打碎翻译”,分成了三种完全不同的物理架构路线:
派系 1:文本桥梁模式(Text-to-Text Bridge)
这是开发成本最低、最传统的做法(即我们前文讨论复杂 PDF 时的处理策略)。
- 物理流向:在数据入库(Ingestion)阶段,使用多模态小模型把图片、图表全部强制翻译成纯文本描述(Caption)。
- 存储与检索:只使用传统的纯文本 Embedding 模型和纯文本向量库。
- 优缺点:架构完全沿用老一套文本 RAG,极省成本。但缺点是语义损失灾难性。如果用户问“哪个元器件的位置在角落”,Caption 的纯文本很难精确描述出复杂的空间几何坐标和像素细节。
派系 2:多向量混部模式(Multi-Vector Store)
这是 LangChain、LlamaIndex 等现代框架官方非常推崇的实用模式。
- 物理流向:文档中的纯文本归纯文本。文档里的图片抽出来,通过多模态大模型生成一份文本 Summary(摘要)。
- 存储与检索:在向量库里,让图片的“纯文本摘要”和“原始图片物理路径”通过同一个 Key 绑定在多向量检索器(Multi-Vector Retriever)中。检索时,通过文字摘要把图片 ID 捞出来。
- 最终生成:在生成阶段,系统不把图片摘要喂给模型,而是把原始图片文件(Raw Image Base64)直接和文本 Context 一起灌进多模态大模型(如 GPT-4o、Claude 3.5 Sonnet)。让多模态模型用原生视觉直接去肉眼看图表,生成高质量答案。
派系 3:原生跨模态空间对齐模式(Native Multimodal Embedding)
这是最硬核、体验最丝滑,也代表未来的前沿架构。
- 物理流向:彻底干掉任何中间层的 Caption 翻译。
- 核心引擎:引入真正的多模态向量化模型(如英伟达的 NeVA、OpenAI 的 CLIP、Google 的 Vertex Multimodal Embedding)。这类模型能将图片像素和文本字符,直接投影到同一个大一统的高维几何空间(Shared Embedding Space)中。
- 物理操作:
- “一句话”对应的向量,和“一张架构图”对应的向量,维度完全一致。
- 如果一句话描述的内容正好和一张图表达的意思高度吻合,它们在空间中的余弦相似度会无限接近 1。
- 检索超能力:系统不仅支持输入文字找图,更支持“输入图片找图片”、“输入图片找相关文字段落”。
二、 多模态 RAG 的核心工程痛点
当模态变多之后,系统的复杂度呈指数级上升,开发时有三个物理级深水坑必须提防:
- 多模态文本块跨页切分(Cross-page Splitting):
一张系统流程图往往跨越了 PDF 的第 12 页到第 13 页,而正文解释文字在第 14 页。如果你的 Chunk 策略只按固定字数切,会导致图、表、文在空间上彻底脱节,检索时无法协同。必须采用逻辑页面合并(Layout-based Anchoring)将它们锁在一个逻辑块内。 - 向量数据库的异构混合检索效率:
原生多模态 Embedding 虽然美妙,但目前在小文本和特定工业领域专有名词上的检索锐利度,依然比不上传统关键词(BM25)。因此在多模态 RAG 中,多路并发检索 + RRF 融合算子依然是标配——文字路用 BM25+BGE,图像路用 CLIP+原生多模态向量。 - 多模态重排(Multimodal Reranker)的匮乏:
传统的 Reranker(如 BGE-Reranker)只认文本。当向量库吐出 10 张相似的拓扑图时,如何在上游对这 10 张图的视觉细节相关性进行二次精准重排,是目前全行业 Infra 团队正在集中攻坚的领域。
三、 经典应用场景
- 智能工业维修与车载 ADAS 手册:通过摄像头拍下故障机械部件,自动匹配维修白皮书里的拆解工程 3D 图。
- 多模态财报/证券研报分析:大批量吞噬财报中的 K 线图、饼状图、折线表,自动归纳宏观经济周期。
- 医疗多模态影像辅助判读:结合患者的病历文本描述,去 RAG 检索海量的历史医学 CT/MRI 图像库,辅助医生判断罕见病灶。
