MagicFuse:基于单图融合的视觉与语义强化
计算机视觉与模式识别
2026-05-22 v2
摘要
本文聚焦于一个极具实际应用价值的场景:在仅依赖可见光成像传感器的情况下,如何继续从多模态图像融合中获益。为实现此目标,我们提出了一种新颖的单图融合概念,将传统的数据级融合扩展至知识层面。具体而言,我们开发了MagicFuse——一个能够从单张低质量可见光图像中推导出综合性跨光谱场景表征的新型单图融合框架。MagicFuse首先引入基于扩散模型的类内光谱知识强化分支和跨光谱知识生成分支,分别挖掘可见光谱中被遮蔽的场景信息,并学习从红外光谱迁移到的热辐射分布模式。基于此,我们设计了多域知识融合分支,将这两个分支的扩散流中的概率性噪声进行整合,经历多次采样后即可获得跨光谱场景表征。随后,我们施加视觉约束与语义约束,以确保该场景表征既能满足人类观察,又能支持下游语义决策。大量实验表明,尽管仅依赖单张降质可见光图像,MagicFuse在视觉与语义表征性能上,已可与或超过多模态输入的前沿融合方法,实现了相当甚至更好的性能。代码已公开于 https://github.com/zhayanping/MagicFuse。
引用
@article{arxiv.2602.01760,
title = {MagicFuse: Single Image Fusion for Visual and Semantic Reinforcement},
author = {Hao Zhang and Yanping Zha and Zizhuo Li and Meiqi Gong and Jiayi Ma},
journal= {arXiv preprint arXiv:2602.01760},
year = {2026}
}
备注
Accepted by CVPR 2026