中文

CrossFuse:基于跨传感器 Top-K 视觉对齐的红外-可见图像融合

计算机视觉与模式识别 2025-02-21 v1 机器学习

摘要

红外和可见图像融合(IVIF)正日益应用于视频监控和自动驾驶系统等关键领域。虽然已取得显著进展,但深度学习方法常在现实应用中遇到 out-of-distribution(OOD)场景,严重影响其性能和可靠性。因此,解决 OOD 数据挑战对于在开放环境中安全部署这些模型至关重要。与现有研究不同,我们关注现实应用中 OOD 数据所带来的挑战,并提升模型的鲁棒性和泛化能力。本文提出一种基于 Multi-View Augmentation 的红外-可见图像融合框架。对于外部数据增强,采用 Top-k Selective Vision Alignment 以 RGB 位转换方式对可见图像进行处理,以缓解数据集之间的分布偏移。此策略有效引入增强样本,增强模型对复杂现实场景的适应性。此外,对于内部数据增强,建立基于 Weak-Aggressive Augmentation 的自监督学习。这使模型在融合过程中能够学习更具鲁棒性和泛化性的特征,从而提升鲁棒性和泛化能力。大量实验表明,所提方法在 various 条件和环境下表现出优越性能和鲁棒性。我们的做法显著增强了 IVIF 任务在实际应用中的可靠性和稳定性。

关键词

引用

@article{arxiv.2502.14493,
  title  = {CrossFuse: Learning Infrared and Visible Image Fusion by Cross-Sensor Top-K Vision Alignment and Beyond},
  author = {Yukai Shi and Cidan Shi and Zhipeng Weng and Yin Tian and Xiaoyu Xian and Liang Lin},
  journal= {arXiv preprint arXiv:2502.14493},
  year   = {2025}
}

备注

IEEE T-CSVT. We mainly discuss the out-of-distribution challenges in infrared and visible image fusion