CLIP嵌入空间中语言驱动损失的红外与可见光图像融合
计算机视觉与模式识别
2025-12-01 v3
摘要
红外-可见光图像融合(IVIF)由于两种图像模态的高度互补特性而备受关注。由于缺乏真实融合图像,当前基于深度学习方法融合输出严重依赖于数学定义的损失函数。由于在没有真实图像的情况下难以用数学明确定义融合图像,现有融合方法的性能受到限制。在本文中,我们提出使用自然语言来表达IVIF的目标,这可以避免当前损失中对融合输出的显式数学建模,并充分利用语言表达的优势来提高融合性能。为此,我们提出了一个全面的语言表达融合目标,并使用CLIP将相关文本编码到多模态嵌入空间中。然后,通过建立表示融合目标和输入图像模态的嵌入向量之间的关系,在嵌入空间中构建语言驱动融合模型。最后,推导出语言驱动损失,通过监督训练使实际IVIF与嵌入的语言驱动融合模型对齐。实验表明,我们的方法可以获得比现有技术更好的融合结果。代码可在https://github.com/wyhlaowang/LDFusion获取。
引用
@article{arxiv.2402.16267,
title = {Infrared and Visible Image Fusion with Language-Driven Loss in CLIP Embedding Space},
author = {Yuhao Wang and Lingjuan Miao and Zhiqiang Zhou and Lei Zhang and Yajun Qiao},
journal= {arXiv preprint arXiv:2402.16267},
year = {2025}
}
备注
Accepted by ACM MM 2025