中文

MMDRFuse:基于动态刷新的蒸馏迷你模型用于多模态图像融合

计算机视觉与模式识别 2024-08-29 v1

摘要

近年来,多模态图像融合(MMIF)已被应用于众多领域,吸引了众多学者致力于提高融合性能。然而,当前关注主要集中在架构设计,而非训练策略。作为低层视觉任务,图像融合应快速提供观察和支持下游任务的输出图像。因此,应避免不必要的计算和存储开销。本文提出一种轻量级的蒸馏迷你模型,搭配动态刷新策略(MMDRFuse),以实现此目标。为追求模型简洁性,通过三个仔细设计的监督项获得总计113个可训练参数(0.44 KB)的极小卷积网络。首先,通过强调外部空间特征一致性构建可消化的蒸馈,为目标网络提供软监督,实现细节和显著性的平衡。其次,我们开发了综合损失函数,在源图像中平衡像素、梯度和感知线索。第三,采用创新的动态刷新训练策略协同历史参数和当前监督进行训练,同时配合自适应调整函数优化融合网络。针对几个公共数据集进行大量实验,表明该方法在模型效率和复杂度方面表现出有前景的优势,在多种图像融合任务和下游行人检测应用中性能卓越。该工作的代码已公开于https://github.com/yanglinDeng/MMDRFuse。

关键词

引用

@article{arxiv.2408.15641,
  title  = {MMDRFuse: Distilled Mini-Model with Dynamic Refresh for Multi-Modality Image Fusion},
  author = {Yanglin Deng and Tianyang Xu and Chunyang Cheng and Xiao-Jun Wu and Josef Kittler},
  journal= {arXiv preprint arXiv:2408.15641},
  year   = {2024}
}

备注

10 pages, 8 figures, accpeted by ACM International Conference on Multimedia 2024(Oral)