从文本到像素:一种面向红外与可见光图像融合的上下文感知语义协同解决方案
计算机视觉与模式识别
2024-01-02 v1
摘要
随着深度学习技术的快速发展,多模态图像融合在目标检测任务中变得越来越普遍。尽管其备受关注,但不同信息源在描绘场景内容时的固有差异使得融合成为一个具有挑战性的问题。现有的融合方法识别两种模态间的共享特征,并使用迭代优化或深度学习架构将它们整合到该共享域中,这往往忽略了模态之间复杂的语义关系,导致对模态间连接的理解较为肤浅,进而导致融合结果次优。为了解决这一问题,我们引入了一种文本引导的多模态图像融合方法,该方法利用来自文本描述的高层语义来整合红外和可见光图像的语义。该方法利用了不同模态的互补特性,增强了目标检测的准确性和鲁棒性。利用码本增强对融合的域内与跨域动态的简明刻画,并针对检测任务中的最优性能进行微调。我们提出了一种双层优化策略,建立了融合与检测联合问题之间的联系,同时优化这两个过程。此外,我们引入了第一个附带文本提示的成对红外与可见光图像数据集,为未来的研究铺平了道路。在多个数据集上的大量实验表明,我们的方法不仅产生了视觉上更优的融合结果,而且在现有方法上实现了更高的检测 mAP,取得了 state-of-the-art 的结果。
引用
@article{arxiv.2401.00421,
title = {From Text to Pixels: A Context-Aware Semantic Synergy Solution for Infrared and Visible Image Fusion},
author = {Xingyuan Li and Yang Zou and Jinyuan Liu and Zhiying Jiang and Long Ma and Xin Fan and Risheng Liu},
journal= {arXiv preprint arXiv:2401.00421},
year = {2024}
}
备注
10 pages, 12 figures, 3 tables, conference