中文

CtrlFuse:掩码提示引导的可控红外与可见光图像融合

计算机视觉与模式识别 2026-01-14 v1

摘要

红外与可见光图像融合通过结合互补模态生成具备全天候感知能力的图像,从而增强智能无人系统的环境感知能力。现有方法要么侧重于像素级融合而忽视下游任务适应性,要么通过级联的检测/分割模型隐式学习刚性语义,无法交互式地应对多样的语义目标感知需求。我们提出 CtrlFuse,一个实现掩码提示引导的交互式动态融合的可控图像融合框架。该模型集成了多模态特征提取器、参考提示编码器(RPE)和提示语义融合模块(PSFM)。RPE 通过在输入掩码引导下微调预训练分割模型,动态编码特定任务的语义提示,而 PSFM 将这些语义显式注入融合特征中。通过并行分割与融合分支的协同优化,我们的方法实现了任务性能与融合质量的相互增强。实验表明,该方法在融合可控性和分割准确性上均取得了 state-of-the-art 的结果,适配后的任务分支甚至优于原始分割模型。

关键词

引用

@article{arxiv.2601.08619,
  title  = {CtrlFuse: Mask-Prompt Guided Controllable Infrared and Visible Image Fusion},
  author = {Yiming Sun and Yuan Ruan and Qinghua Hu and Pengfei Zhu},
  journal= {arXiv preprint arXiv:2601.08619},
  year   = {2026}
}

备注

18 pages,22 figures,published to AAAI 2026