TeSG:用于红外和可见图像融合的文本语义指导
计算机视觉与模式识别
2025-06-23 v1
摘要
红外和可见图像融合(IVF)旨在结合两幅图像模态的互补信息,生成更具信息性和全面性的输出。最近,受文本引导的IVF因其灵活性和多样性而显示出巨大的潜力。然而,有效地集成和利用文本语义信息的研究仍不足。为应对这些挑战,我们在两个层面引入文本语义:掩码语义层和文本语义层,两者均来自由大型视觉语言模型(VLM)提取的文本描述。基于此,我们提出了一种用于红外和可见图像融合的文本语义指导方法,称为TeSG,该方法以针对检测和分割等下游任务进行优化的方式引导图像合成过程。具体而言,TeSG由三个核心组件构成:语义信息生成器(SIG)、掩码引导的交叉注意力(MGCA)模块和文本驱动的注意力融合(TDAF)模块。SIG根据文本描述生成掩码和文本语义。MGCA模块利用掩码语义对红外和可见图像的视觉特征进行初始注意力融合。最后,TDAF模块利用由文本语义驱动的门控注意力来细化融合过程。大量实验表明,我们的方法在与现有最先进方法相比时表现出竞争力,特别是在下游任务性能方面。
引用
@article{arxiv.2506.16730,
title = {TeSG: Textual Semantic Guidance for Infrared and Visible Image Fusion},
author = {Mingrui Zhu and Xiru Chen and Xin Wei and Nannan Wang and Xinbo Gao},
journal= {arXiv preprint arXiv:2506.16730},
year = {2025}
}
备注
11 pages, 6 figures