全天候多模态图像融合:统一框架与 100k 基准数据集
计算机视觉与模式识别
2026-03-17 v3
摘要
多模态图像融合 (MMIF) 结合了不同图像模态的互补信息,以提供对场景的全面且客观的解读。然而,现有的融合方法无法抵抗真实场景中的不同天气干扰,限制了其实际适用性。为弥补这一差距,我们提出了一种端到端的全天候统一 MMIF 模型。我们的方法不仅关注像素级恢复,更强调通过联合特征融合与恢复最大化关键场景信息的表征。具体而言,我们首先将图像分解为低秩和稀疏分量,以实现有效的特征分离,从而增强多模态感知。在特征恢复过程中,我们引入了一个物理感知的清晰特征预测模块,通过光照和反射率推断光传输的变化。网络生成的清晰特征用于增强显著信息的表征。我们还构建了一个包含 100,000 对图像的大规模 MMIF 数据集,全面覆盖雨、雾和雪条件,以及不同的退化水平和多样化的场景。真实场景和合成场景的实验结果表明,所提出的方法在图像融合以及目标检测、语义分割和深度估计等下游任务中表现出色。代码可在 https://github.com/ixilai/AWFusion 获取。
引用
@article{arxiv.2402.02090,
title = {All-weather Multi-Modality Image Fusion: Unified Framework and 100k Benchmark},
author = {Xilai Li and Wuyang Liu and Xiaosong Li and Fuqiang Zhou and Huafeng Li and Feiping Nie},
journal= {arXiv preprint arXiv:2402.02090},
year = {2026}
}