中文

DAE-Fuse:一种用于多模态图像融合的自适应判别自编码器

计算机视觉与模式识别 2025-05-27 v3 人工智能

摘要

在夜间或低能见度环境等极端场景下,实现可靠的感知对于自动驾驶、机器人和监控等应用至关重要。多模态图像融合,特别是红外成像的集成,通过结合来自不同模态的互补信息来增强场景理解和决策制定,提供了一种稳健的解决方案。然而,当前方法面临显著的局限性:基于 GAN 的方法通常会产生缺乏细粒度细节的模糊图像,而基于 AE 的方法可能会引入对特定模态的偏置,导致不自然的融合结果。为了应对这些挑战,我们提出了 DAE-Fuse,一种新颖的两阶段判别自编码器框架,能够生成清晰且自然的融合图像。此外,我们开创性地将图像融合技术从静态图像扩展到视频领域,同时保持跨帧的时间一致性,从而推进了自主导航所需的感知能力。在公开数据集上的大量实验表明,DAE-Fuse 在多个基准测试上取得了 SOTA 性能,并对医学图像融合等任务具有出色的泛化能力。

关键词

引用

@article{arxiv.2409.10080,
  title  = {DAE-Fuse: An Adaptive Discriminative Autoencoder for Multi-Modality Image Fusion},
  author = {Yuchen Guo and Ruoxiang Xu and Rongcheng Li and Weifeng Su},
  journal= {arXiv preprint arXiv:2409.10080},
  year   = {2025}
}