中文

自然语言监督的低光照图像增强

计算机视觉与模式识别 2025-01-14 v1 人工智能

摘要

随着深度学习的发展,众多低光照图像增强(LLIE)方法已展现出卓越性能。主流的LLIE方法通常基于低光照与正常光照图像对学习端到端映射。然而,不同光照条件下的正常光照图像作为参考图像,使得定义“完美”参考图像变得困难,这导致了面向度量指标与视觉友好结果之间的权衡挑战。近期,许多跨模态研究发现,来自其他相关模态的辅助信息可以引导视觉表示学习。基于此,我们引入了一种自然语言监督(NLS)策略,该策略从与图像对应的文本中学习特征图,为描述不同光照下的图像提供了通用且灵活的接口。然而,以文本描述为条件的图像分布具有高度多模态性,这给训练带来了困难。为解决此问题,我们设计了一种文本引导条件机制(TCM),该机制融合了图像区域与句子词汇之间的关联,增强了捕获图像与文本细粒度跨模态线索的能力。该策略不仅利用了更广泛的监督源,还为基于视觉与文本特征对齐的LLIE提供了新范式。为了有效识别并融合来自不同层次图像与文本信息的特征,我们设计了一个信息融合注意力(IFA)模块,以在不同层次上增强不同区域。我们将所提出的TCM和IFA集成到一个用于LLIE的自然语言监督网络中,命名为NaLSuper。最后,大量实验证明了我们提出的NaLSuper的鲁棒性和优越有效性。

关键词

引用

@article{arxiv.2501.06546,
  title  = {Natural Language Supervision for Low-light Image Enhancement},
  author = {Jiahui Tang and Kaihua Zhou and Zhijian Luo and Yueen Hou},
  journal= {arXiv preprint arXiv:2501.06546},
  year   = {2025}
}

备注

12 pages, 10 figures