提高多模态图像分割的早期融合策略再思考
计算机视觉与模式识别
2025-01-22 v1
摘要
RGB和热成像图像的融合在低照明条件下具有展现改进语义分割潜力的前景。现有方法通常采用双分支编码器框架进行多模态特征提取,并设计复杂的特征融合策略以实现多模态语义分割的特征提取和融合。然而,这些方法在特征提取和融合过程中需要大量参数更新和计算资源。为此,我们提出一种基于早期融合策略和简单但有效特征聚类的新型多模态融合网络(EFNet),用于高效训练RGB-T语义分割。此外,我们还提出一种基于欧几里得距离的轻量级高效多尺度特征聚合解码器。我们在不同数据集上验证了方法的有效性,并以更少的参数和计算资源超越了以往的领先方法。
引用
@article{arxiv.2501.10958,
title = {Rethinking Early-Fusion Strategies for Improved Multimodal Image Segmentation},
author = {Zhengwen Shen and Yulian Li and Han Zhang and Yuchen Weng and Jun Wang},
journal= {arXiv preprint arXiv:2501.10958},
year = {2025}
}
备注
Accepted by ICASSP 2025