中文

Text-IF:利用语义文本引导实现退化感知与交互式图像融合

计算机视觉与模式识别 2024-03-26 v1

摘要

图像融合旨在结合不同源图像的信息,以创建一幅具有全面代表性的图像。现有的融合方法通常无法处理低质量源图像中的退化问题,并且对多种主观和客观需求缺乏交互性。为解决这些问题,我们引入了一种新颖的方法,利用语义文本引导图像融合模型来实现退化感知和交互式图像融合任务,称为Text-IF。它创新性地将经典图像融合扩展到文本引导的图像融合,同时具备在融合过程中协调处理退化和交互问题的能力。通过文本语义编码器和语义交互融合解码器,Text-IF能够实现一体化的红外与可见光图像退化感知处理以及交互式灵活融合结果。通过这种方式,Text-IF不仅实现了多模态图像融合,还实现了多模态信息融合。大量实验证明,我们提出的文本引导图像融合策略在图像融合性能和退化处理方面相较于SOTA方法具有明显优势。代码可在https://github.com/XunpengYi/Text-IF获取。

关键词

引用

@article{arxiv.2403.16387,
  title  = {Text-IF: Leveraging Semantic Text Guidance for Degradation-Aware and Interactive Image Fusion},
  author = {Xunpeng Yi and Han Xu and Hao Zhang and Linfeng Tang and Jiayi Ma},
  journal= {arXiv preprint arXiv:2403.16387},
  year   = {2024}
}

备注

Accepted by CVPR 2024