中文

DUALVISION:基于 RGB-红外多模态大语言模型的稳健视觉推理

计算机视觉与模式识别 2026-04-22 v1

摘要

多模态大语言模型 (MLLM) 已在 RGB 图像上实现了惊人的视觉感知和推理性能,但在常见退化条件下如雾、模糊或低光条件下仍不稳健。红外 (IR) 成像作为 RGB 的成熟补充,在这些条件下具有内在鲁棒性,但其集成到 MLLM 中仍未得到充分探索。为弥合这一差距,我们提出了 DUALVISION,一个轻量级融合模块,通过 patch 级别的局部交叉注意力高效地将 IR-RGB 信息整合到 MLLM 中。为支持训练和评估并促进未来研究,我们还引入了 DV-204K 数据集,包含约 25K 个公开可获取的对齐 IR-RGB 图像对,以及 204K 个模态特定 QA 注释,以及 DV-500,一个包含 500 个 IR-RGB 图像对及其 500 对 QA 的基准,专用于评估跨模态推理。利用这些数据集,我们对 both open- and closed-source MLLMs 进行基准测试,表明 DUALVISION 在 wide range of视觉退化条件下实现了强大的实证性能。我们的代码和数据集可在 https://abrarmajeedi.github.io/dualvision 提供。

关键词

引用

@article{arxiv.2604.18829,
  title  = {DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning},
  author = {Abrar Majeedi and Zhiyuan Ruan and Ziyi Zhao and Hongcheng Wang and Jianglin Lu and Yin Li},
  journal= {arXiv preprint arXiv:2604.18829},
  year   = {2026}
}

备注

Accepted at CVPR Findings 2026