中文

将多模态大语言模型引入红外-可见光图像融合质量评估

计算机视觉与模式识别 2026-05-12 v2

摘要

红外-可见光图像融合(IVIF)旨在将热信息与详细的空间结构整合到单幅融合图像中以增强感知。然而,现有的评估方法倾向于过度优化手工制作的无参考统计指标和将源图像视为伪真值的全参考指标。近期的 IVIF 奖励建模工作从人类评分中学习,但对聚合分数使用标量回归,既未利用多模态大语言模型(MLLMs)的推理能力,也未在其监督中编码每张图像的感知模糊性,而简单地将具有离散 one-hot 监督的 MLLMs 引入同样会将相似质量的融合图像坍缩至不同的评级水平。为解决此问题,我们引入了 FuScore,它利用 MLLM 通过产生连续的质量分数(而非离散的级别预测)来模仿人类视觉感知,从而实现对相似质量融合图像的细粒度区分。我们利用四个 IVIF 特定子维度之间的一致性来构建每图像软标签,其锐度反映了整体判断的共识程度。我们进一步引入了一个三方目标,结合了每图像分布监督、用于方法级排序的源图像对内 Thurstone 保真度,以及用于跨场景级排序的跨源图像对 Thurstone 保真度。大量实验表明,FuScore 实现了与人类视觉偏好的最先进相关性。

关键词

引用

@article{arxiv.2605.06969,
  title  = {Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment},
  author = {Yuchen Guo and Junli Gong and Yao Lu and Xintong Xu and Yiuming Cheung and Weifeng Su},
  journal= {arXiv preprint arXiv:2605.06969},
  year   = {2026}
}