ModalFormer:用于低光图像增强的多模态 Transformer
计算机视觉与模式识别
2025-07-29 v1
摘要
低光图像增强 (LLIE) 是一个基础且具有挑战性的任务,因为在光线不足的条件下捕获的图像存在噪声、细节丢失和对比度较差的问题。最近的方法通常仅依赖 RGB 图像的像素级变换,忽略了来自多个视觉模态的丰富上下文信息。在本文中,我们提出了 ModalFormer,这是第一个大规模多模态框架,用于 LLIE 完全利用九个辅助模态以实现最先进的性能。我们的模型包括两个主要组件:一个设计用于恢复被破坏图像并无缝集成多模态信息的 Cross-modal Transformer (CM-T),以及多个专为多模态特征重建而设计的辅助子网络。CM-T 的核心是我们新颖的 Cross-modal Multi-headed Self-Attention 机制 (CM-MSA),有效地将 RGB 数据与模态特定特征融合——包括深度特征嵌入、分段信息、几何线索和颜色信息——以生成信息丰富的混合注意力图。在多个基准数据集上的大量实验表明,ModalFormer 在 LLIE 中取得了最先进的性能。预训练模型和结果已在 https://github.com/albrateanu/ModalFormer 上提供。
关键词
引用
@article{arxiv.2507.20388,
title = {ModalFormer: Multimodal Transformer for Low-Light Image Enhancement},
author = {Alexandru Brateanu and Raul Balmez and Ciprian Orhei and Codruta Ancuti and Cosmin Ancuti},
journal= {arXiv preprint arXiv:2507.20388},
year = {2025}
}