IVGF:面向红外和可见光的融合引导通用框架
计算机视觉与模式识别
2024-09-17 v2
摘要
红外和可见光双模态任务,如语义分割和目标检测,能够通过融合互补信息,在极端场景下实现稳健性能。目前大多数方法设计了针对特定任务的框架,导致其在跨多个任务上的泛化性受限。本文提出了一种融合引导的红外和可见光通用框架IVGF,可轻松扩展到许多高层视觉任务。首先,我们采用最先进的红外和可见光基础模型来提取通用表征。然后,为丰富这些通用表征在高层视觉任务中的语义信息,我们设计了针对特征图的特征增强模块和针对标记的标记增强模块。此外,本文提出了注意力引导的融合模块,通过探索两种模态的互补信息来有效融合。我们还采用cutout&mix数据增强策略进行数据增强,进一步提高模型挖掘两种模态区域互补性的能力。大量实验表明,IVGF在语义分割和目标检测任务中超越了最先进的双模态方法。详细的消融实验表明了每个模块的有效性,另一项实验探讨了该方法在双模态语义分割任务中的抗缺失模态能力。
引用
@article{arxiv.2409.00973,
title = {IVGF: The Fusion-Guided Infrared and Visible General Framework},
author = {Fangcen Liu and Chenqiang Gao and Fang Chen and Pengcheng Li and Junjie Guo and Deyu Meng},
journal= {arXiv preprint arXiv:2409.00973},
year = {2024}
}
备注
11 pages, 8 figures