中文

MambaTrans:基于大语言模型先验的多模态融合图像翻译

计算机视觉与模式识别 2025-08-12 v1

摘要

多模态图像融合的目标是从红外和可见图像中整合互补信息,生成用于下游任务的多模态融合图像。现有的下游预训练模型通常仅基于可见图像进行训练。然而,红外图像与多模态融合图像之间的显著像素分布差异会降低下游任务性能,甚至可能低于仅使用可见图像的性能。本文探索了将显著模态差异的多模态融合图像适配到以可见图像为训练基础的对象检测和语义分割模型中的方法。为此,我们提出MambaTrans——一种新型的多模态融合图像模态翻译器。MambaTrans以多模态大语言模型的描述和语义分割模型的掩码作为输入。其核心组件——多模型时序模块(Multi-Model State Space Block),结合了掩码-图像-文本跨注意力机制和3D选择扫描模块,增强了纯视觉能力。通过利用对象检测先验知识,MambaTrans在训练期间最小化检测损失,捕获文本、掩码和图像之间的长期依赖关系。这使得在不调整下游模型参数的前提下,能够获得理想的下游任务结果。在公开数据集上的实验表明,MambaTrans有效地提高了多模态图像在下游任务中的性能。

关键词

引用

@article{arxiv.2508.07803,
  title  = {MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks},
  author = {Yushen Xu and Xiaosong Li and Zhenyu Kuang and Xiaoqi Cheng and Haishu Tan and Huafeng Li},
  journal= {arXiv preprint arXiv:2508.07803},
  year   = {2025}
}