中文

桥接人类评估至红外和可见图像融合

计算机视觉与模式识别 2026-03-05 v1

摘要

红外和可见图像融合 (Infrared and Visible Image Fusion, IVIF) 将补充的模态集成以增强场景感知。当前方法主要聚焦于优化手工损失和客观指标,往往导致融合结果不符合人类视觉偏好。这种挑战因 IVIF 的 ill-posed 本性而进一步加剧,这严重限制了其在安全监视和驾驶辅助系统等人类感知环境中的有效性。为缓解这些限制,我们提出了一个将人类评估桥接至红外和可见图像融合的反馈强化框架。为解决缺乏以人类为中心评估指标和数据的問題,我们引入首个大规模人类反馈 IVIF 数据集,包含多维主观评分和伪影注释,并通过专家审阅微调的大型语言模型进行丰富化。基于该数据集,我们设计特定领域的奖励函数并训练奖励模型以量化感知质量。受该奖励指引,我们通过 Group Relative Policy Optimization 对融合网络进行微调,实现了引领潮流的性能,更贴合人类审美。代码地址:https://github.com/ALKA-Wind/EVAFusion。

关键词

引用

@article{arxiv.2603.03871,
  title  = {Bridging Human Evaluation to Infrared and Visible Image Fusion},
  author = {Jinyuan Liu and Xingyuan Li and Qingyun Mei and Haoyuan Xu and Zhiying Jiang and Long Ma and Risheng Liu and Xin Fan},
  journal= {arXiv preprint arXiv:2603.03871},
  year   = {2026}
}