中文

用于动态图像融合的局部到全局专家多模态门控混合模型

计算机视觉与模式识别 2023-03-24 v2

摘要

红外与可见光图像融合旨在整合多源的综合信息,以在检测等各种实际任务上取得优于单一模态的性能。然而,大多数现有方法直接组合不同模态的纹理细节与目标对比度,忽略了现实中的动态变化,导致在良好光照条件下可见光纹理减弱、在低光照条件下红外对比度减弱。为填补这一空白,我们提出一种具有局部到全局专家多模态门控混合的动态图像融合框架,称为MoE-Fusion,以从各模态中动态提取有效且综合的信息。我们的模型由局部专家混合(MoLE)和在多模态门控引导下的全局专家混合(MoGE)组成。MoLE对多模态局部特征进行专门学习,促使融合图像以样本自适应方式保留局部信息,而MoGE关注全局信息,以整体纹理细节与对比度补充融合图像。大量实验表明,我们的MoE-Fusion通过局部到全局动态学习范式在保留多模态图像纹理与对比度上优于SOTA方法,并在检测任务上取得优越性能。我们的代码将公开:https://github.com/SunYM2020/MoE-Fusion。

关键词

引用

@article{arxiv.2302.01392,
  title  = {Multi-modal Gated Mixture of Local-to-Global Experts for Dynamic Image Fusion},
  author = {Yiming Sun and Bing Cao and Pengfei Zhu and Qinghua Hu},
  journal= {arXiv preprint arXiv:2302.01392},
  year   = {2023}
}