MAFS: 用于红外-可见光图像融合与语义分割的掩码自编码器
计算机视觉与模式识别
2025-09-16 v1
摘要
红外-可见光图像融合方法旨在生成具有良好视觉质量的融合图像,同时也促进高级任务的性能。现有的语义驱动方法确实考虑了下游应用中的语义信息注入。然而,它们都没有从宏观任务层面研究像素级图像融合与跨模态特征融合感知任务之间相互促进的潜力。为解决这一局限,我们提出了一种用于图像融合与语义分割的统一网络。MAFS是一种并行结构,包含一个融合子网络和一个分割子网络。一方面,我们设计了一种异构特征融合策略以增强图像融合的语义感知能力。另一方面,通过级联融合子网络和分割骨干网络,分割相关知识被传递以促进基于特征级融合的分割。在该框架中,我们设计了一种新型的多阶段Transformer解码器以高效聚合细粒度的多尺度融合特征。此外,引入了一个基于最大-最小公平分配原则的动态因子,以生成两个任务的自适应权重并保证多任务训练的平滑性。大量实验表明,我们的方法与最先进方法相比取得了具有竞争力的结果。代码可在 https://github.com/Abraham-Einstein/MAFS/ 获取。
引用
@article{arxiv.2509.11817,
title = {MAFS: Masked Autoencoder for Infrared-Visible Image Fusion and Semantic Segmentation},
author = {Liying Wang and Xiaoli Zhang and Chuanmin Jia and Siwei Ma},
journal= {arXiv preprint arXiv:2509.11817},
year = {2025}
}
备注
Accepted by TIP 2025