中文

Enlighten-Your-Voice:当多模态遇见零样本低光照图像增强

计算机视觉与模式识别 2024-02-05 v2 人工智能

摘要

低光照图像增强是一项关键的视觉任务,许多无监督方法往往忽略低光照场景中可见信息的退化,这不利于互补信息的融合,并阻碍了满意结果的生成。为解决此问题,我们的研究引入了“Enlighten-Your-Voice”,一种通过语音和文本指令创新性地丰富用户交互的多模态增强框架。该方法不仅代表技术飞跃,也体现了用户参与方式的范式转变。我们的模型配备了双协同注意力模块(DCAM),精心处理不同的内容和颜色差异,从而实现细微的增强。作为补充,我们引入了语义特征融合(SFM)即插即用模块,将语义上下文与低光照增强操作协同,提升算法效能。关键的是,“Enlighten-Your-Voice”在无监督零样本场景中展现了卓越的泛化能力。源代码可从https://github.com/zhangbaijin/Enlighten-Your-Voice获取。

关键词

引用

@article{arxiv.2312.10109,
  title  = {Enlighten-Your-Voice: When Multimodal Meets Zero-shot Low-light Image Enhancement},
  author = {Xiaofeng Zhang and Zishan Xu and Hao Tang and Chaochen Gu and Wei Chen and Shanying Zhu and Xinping Guan},
  journal= {arXiv preprint arXiv:2312.10109},
  year   = {2024}
}

备注

It needs revised