TSJNet:一种多模态目标与语义感知联合驱动的图像融合网络
计算机视觉与模式识别
2026-02-10 v2
摘要
本研究旨在解决单模态图像在语义分割和目标检测任务中信息不完整的问题。现有的多模态融合方法在对多尺度语义结构和显著目标区域的判别性建模方面能力有限,这进一步限制了跨模态任务相关语义细节和目标信息的有效融合。为应对这些挑战,本文提出了一种名为 TSJNet 的新型融合网络,该网络以联合方式利用高层任务输出的语义信息来引导融合过程。具体而言,我们设计了一个具有双并行分支的多维特征提取模块,以捕获多尺度和显著性特征。同时,嵌入在解码器中的一个数据无关的空间注意力模块动态校准了不同数据域上的注意力分配,显著增强了模型的泛化能力。为了同时优化融合和高级视觉任务,我们通过结合融合损失与语义损失来平衡性能。此外,我们开发了一个覆盖多种场景的多模态无人机(UAV)数据集(UMS)。大量实验表明,TSJNet 在五个公开数据集(MSRS、M³FD、RoadScene、LLVIP 和 TNO)以及我们的 UMS 数据集上均取得了卓越的性能。生成的融合结果展现出良好的视觉效果,并且与最先进的方法相比,目标检测的平均精度均值([email protected])和分割的平均交并比(mIoU)分别提高了 7.97% 和 10.88%。代码和数据集已公开发布于 https://github.com/XylonXu01/TSJNet。
引用
@article{arxiv.2402.01212,
title = {TSJNet: A Multi-modality Target and Semantic Awareness Joint-driven Image Fusion Network},
author = {Yuchan Jie and Yushen Xu and Xiaosong Li and Huafeng Li and Haishu Tan and Feiping Nie},
journal= {arXiv preprint arXiv:2402.01212},
year = {2026}
}