Enlighten-Your-Voice:当多模态遇见零样本低光照图像增强
计算机视觉与模式识别
2024-02-05 v2 人工智能
摘要
低光照图像增强是一项关键的视觉任务,许多无监督方法往往忽略低光照场景中可见信息的退化,这不利于互补信息的融合,并阻碍了满意结果的生成。为解决此问题,我们的研究引入了“Enlighten-Your-Voice”,一种通过语音和文本指令创新性地丰富用户交互的多模态增强框架。该方法不仅代表技术飞跃,也体现了用户参与方式的范式转变。我们的模型配备了双协同注意力模块(DCAM),精心处理不同的内容和颜色差异,从而实现细微的增强。作为补充,我们引入了语义特征融合(SFM)即插即用模块,将语义上下文与低光照增强操作协同,提升算法效能。关键的是,“Enlighten-Your-Voice”在无监督零样本场景中展现了卓越的泛化能力。源代码可从https://github.com/zhangbaijin/Enlighten-Your-Voice获取。
引用
@article{arxiv.2312.10109,
title = {Enlighten-Your-Voice: When Multimodal Meets Zero-shot Low-light Image Enhancement},
author = {Xiaofeng Zhang and Zishan Xu and Hao Tang and Chaochen Gu and Wei Chen and Shanying Zhu and Xinping Guan},
journal= {arXiv preprint arXiv:2312.10109},
year = {2024}
}
备注
It needs revised