DAE-Fuse:一种用于多模态图像融合的自适应判别自编码器
计算机视觉与模式识别
2025-05-27 v3 人工智能
摘要
在夜间或低能见度环境等极端场景下,实现可靠的感知对于自动驾驶、机器人和监控等应用至关重要。多模态图像融合,特别是红外成像的集成,通过结合来自不同模态的互补信息来增强场景理解和决策制定,提供了一种稳健的解决方案。然而,当前方法面临显著的局限性:基于 GAN 的方法通常会产生缺乏细粒度细节的模糊图像,而基于 AE 的方法可能会引入对特定模态的偏置,导致不自然的融合结果。为了应对这些挑战,我们提出了 DAE-Fuse,一种新颖的两阶段判别自编码器框架,能够生成清晰且自然的融合图像。此外,我们开创性地将图像融合技术从静态图像扩展到视频领域,同时保持跨帧的时间一致性,从而推进了自主导航所需的感知能力。在公开数据集上的大量实验表明,DAE-Fuse 在多个基准测试上取得了 SOTA 性能,并对医学图像融合等任务具有出色的泛化能力。
引用
@article{arxiv.2409.10080,
title = {DAE-Fuse: An Adaptive Discriminative Autoencoder for Multi-Modality Image Fusion},
author = {Yuchen Guo and Ruoxiang Xu and Rongcheng Li and Weifeng Su},
journal= {arXiv preprint arXiv:2409.10080},
year = {2025}
}