中文

TextFusion:揭示文本语义在可控图像融合中的力量

计算机视觉与模式识别 2024-02-09 v2

摘要

先进的图像融合方法致力于通过聚合源图像传达的互补信息来生成融合结果。然而,成像场景内容在特定源表现上的差异,使得设计鲁棒且可控的融合过程变得困难。我们认为,借助文本模态传达的更高层次语义可以缓解这一问题,这应使我们能够以可控的方式为不同目的(如可视化和下游任务)生成融合图像。这是通过利用视觉-语言模型在文本和图像信号之间建立由粗到细的关联机制来实现的。在关联图的引导下,仿射融合单元被嵌入到 Transformer 网络中,以在特征层面融合文本和视觉模态。作为本工作的另一要素,我们提出使用文本注意力来使图像质量评估适应融合任务。为了促进所提出的文本引导融合范式的实施及其在更广泛研究社区中的采用,我们发布了文本标注的图像融合数据集 IVT。大量实验表明,我们的方法在性能上持续优于传统的基于外观的融合方法。我们的代码和数据集将在 https://github.com/AWCXV/TextFusion 公开。

关键词

引用

@article{arxiv.2312.14209,
  title  = {TextFusion: Unveiling the Power of Textual Semantics for Controllable Image Fusion},
  author = {Chunyang Cheng and Tianyang Xu and Xiao-Jun Wu and Hui Li and Xi Li and Zhangyong Tang and Josef Kittler},
  journal= {arXiv preprint arXiv:2312.14209},
  year   = {2024}
}

备注

v2 version, 13 pages, 16 figures, with the code repository link