中文

RGBX-R1:引导多模态 grounding 的视觉模态链路思维强化学习

计算机视觉与模式识别 2026-02-03 v1

摘要

多模态大语言模型 (Multimodal Large Language Model, MLLM) 主要在 RGB 模态上进行预训练,从而限制其在其他模态(如红外、深度和事件数据)上的性能,这些数据在复杂场景中至关重要。为此,我们提出了 RGBX-R1,一个增强 MLLM 在各种 X 视觉模态感知与推理能力的框架。具体而言,我们采用 Understand-Associate-Validate (UAV) 提示策略构建视觉模态链路思维 (Visual Modality Chain-of-Thought, VM-CoT),旨在将 MLLM 的 RGB 理解能力扩展到 X 模态。为逐步提升推理能力,我们引入两阶段训练范式:冷启动监督微调 (Cold-Start Supervised Fine-Tuning, CS-SFT) 和时空强化微调 (Spatio-Temporal Reinforcement Fine-Tuning, ST-RFT)。CS-SFT 依据 VM-CoT 的指导监督推理过程,使 MLLM 具备基本的模态认知能力。基于 GRPO,ST-RFT 采用模态理解时空 (Modality-understanding Spatio-Temporal, MuST) 奖励机制强化模态推理。值得注意的是,我们构建了首个 RGBX-Grounding 基准数据集,广泛实验验证了我们在多模态理解和空间感知方面的优势, 在三个 RGBX grounding 任务中均显著优于基线模型,提升幅度达 22.71%。

关键词

引用

@article{arxiv.2602.00504,
  title  = {RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding},
  author = {Jiahe Wu and Bing Cao and Qilong Wang and Qinghua Hu and Dongdong Li and Pengfei Zhu},
  journal= {arXiv preprint arXiv:2602.00504},
  year   = {2026}
}