中文

重新思考多模态图像融合的归一化策略与卷积核

计算机视觉与模式识别 2025-12-12 v2 人工智能

摘要

多模态图像融合(MMIF)整合不同模态的信息以获得综合图像,辅助下游任务。然而,现有研究侧重于互补信息融合和训练策略,忽视了归一化和卷积核等底层架构组件的关键作用。我们重新评估了用于端到端 MMIF 的 UNet 架构,发现广泛使用的批归一化通过平滑关键稀疏特征而限制了性能。为解决此问题,我们提出实例归一化和组归一化的混合策略,以保持样本独立性并增强内在特征相关性。关键在于,该策略促进了更丰富的特征图,使大核卷积能充分利用其感受野,增强细节保留。此外,所提多路径自适应融合模块动态校准来自不同尺度和感受野的特征,确保有效的信息传递。我们的方法在 MSRS、M3^3FD、TNO 和 Harvard 数据集上达到 SOTA 客观性能,生成视觉上更清晰的显著目标和病变区域。值得注意的是,与红外图像相比,MSRS 分割 mIoU 提高了 8.1%。这种性能源于归一化与卷积核的协同设计,保留了关键稀疏特征。代码可在 https://github.com/HeDan-11/LKC-FUNet 获取。

关键词

引用

@article{arxiv.2411.10036,
  title  = {Rethinking Normalization Strategies and Convolutional Kernels for Multimodal Image Fusion},
  author = {Dan He and Guofen Wang and Weisheng Li and Yucheng Shu and Wenbo Li and Lijian Yang and Yuping Huang and Feiyan Li},
  journal= {arXiv preprint arXiv:2411.10036},
  year   = {2025}
}